AI Briefing
AI Briefing Publikasi Riset AI Indonesia

"Language models are just the beginning. Multimodal AI will change how we interact with computers forever."

— Ilya Sutskever · Co-founder of OpenAI

GLM-5.3 Rilis: Model Open Source Coding Terkuat dari Z.ai

Oleh Eko Hadi Murwanto · ·
GLM-5.3 Rilis: Model Open Source Coding Terkuat dari Z.ai

Z.ai (Zhipu AI) resmi meluncurkan GLM-5.3 pada 14 Agustus 2026. Model ini diklaim sebagai model open-source paling kuat untuk coding, dengan kemampuan agen yang melesat dan — yang mengejutkan — kemampuan keamanan siber yang tumbuh di luar dugaan pengembangnya sendiri. Bobot modelnya akan dibuka untuk umum dalam dua minggu.

Tanpa Arsitektur Baru, Hanya Post-Training yang Diperbesar

Fakta paling menarik dari GLM-5.3: model ini memakai base model yang sama persis dengan GLM-5.2. Semua peningkatan datang dari post-training — Reinforcement Learning (RL) yang diperbesar dengan lebih banyak environment, lebih beragam tugas, dan lebih banyak komputasi.

Z.ai membangun tumpukan pelatihan ini sejak GLM-5.2: IndexShare untuk pemrosesan konteks panjang, SAO untuk RL pada tugas jarak jauh (long-horizon), dan framework open-source slime untuk pelatihan asinkron berskala besar. Environment pelatihan kini dirancang menyerupai pekerjaan profesional nyata — misalnya seorang engineer ML yang diberi akses cluster komputasi, dokumentasi internal, dan codebase, lalu diminta mendiagnosis bottleneck, mengoptimalkan, dan membuktikan percepatan end-to-end. Sebagian tugas setara beberapa hari kerja engineer senior.

Identitas dan Ketersediaan

SpesifikasiNilai
Model IDglm-5.3
Context window1 juta token
Output maksimal128 ribu token
ModalitasTeks saja
Base modelGLM-5.2 (753B total, 40B aktif)
Harga APIBelum rilis (API “coming soon”)

GLM-5.3 sekarang bisa dipakai melalui GLM Coding Plan (langganan berbasis poin, dengan diskon 50 persen di luar jam sibuk) dan coding agent seperti ZCode, Claude Code, serta OpenCode. API pay-per-token belum dibuka — harga per token GLM-5.3 belum dipublikasikan (GLM-5.2 berada di $1,40 input / $4,40 output per 1 juta token). Bobot open-source dijadwalkan rilis sekitar dua minggu lagi setelah evaluasi keamanan selesai.

Catatan migrasi penting: aplikasi yang memakai GLM-5.2 dengan mode thinking nonaktif harus mengganti ke thinking: enabled sebelum beralih ke model ID baru, jika tidak request akan gagal.

Benchmark Coding: Open-Source SOTA di Terminal-Bench 3.0

Semua angka berikut dilaporkan vendor (blog resmi Z.ai) dengan metodologi yang dirinci di catatan kaki — belum ada replikasi independen:

BenchmarkGLM-5.3GLM-5.2Kimi K3DeepSeek V4 ProGPT-5.6 SolClaude Fable 5
Terminal-Bench 2.188,281,088,387,988,888,0
Terminal-Bench 3.028,34,617,434,633,7
DeepSWE v1.166,946,267,562,772,769,7
FrontierSWE78,167,588,2
SWE-Marathon v1.142,519,448,142,533,1

Lompatan paling mencengangkan ada di Terminal-Bench 3.0 — tolok ukur kemampuan agen terminal generasi baru — dari 4,6 menjadi 28,3, naik enam kali lipat dan menjadi skor tertinggi di antara model open-source. DeepSWE v1.1 (tugas software engineering repository-level) naik dari 46,2 ke 66,9. FrontierSWE 78,1 dievaluasi oleh Proximal, pihak ketiga independen.

Di benchmark internal Z.ai Code Bench, GLM-5.3 mencapai 34,5 persen penyelesaian end-to-end dengan 75 ribu token output per tugas (Max), versus 23,4 persen dengan 96 ribu token pada GLM-5.2 — performa naik, token justru turun. Pada effort High, GLM-5.3 (31,4 persen @50 ribu token) mengungguli Claude Opus 4.8 (29,5 persen @120 ribu token), meski masih di bawah Claude Fable 5 (39,5 persen).

Kemampuan Agen: AutomationBench Terbaik di Kelasnya

Benchmark agenGLM-5.3GLM-5.2Kimi K3GPT-5.6 SolFable 5
AutomationBench v1.0.648,226,246,745,846,2
Agents’ Last Exam (CLI)28,523,827,628,623,8
Toolathlon Verified73,059,976,574,974,7
HLE dengan tools62,554,759,864,563,9
GDPval-AA v217691508168217301743

AutomationBench — tolok ukur otomasi workflow bisnis nyata dari Zapier — menempatkan GLM-5.3 di puncak dengan 48,2, di atas GPT-5.6 Sol (45,8) dan Fable 5 (46,2). Agents’ Last Exam (tugas desktop/OS kompleks, 4–8 jam per tugas) juga hampir menyamai GPT-5.6 Sol: 28,5 vs 28,6. GDPval-AA v2 (knowledge work, 44 jenis profesi) mencetak 1769 — tertinggi di antara semua pembanding dalam tabel Z.ai.

Kunci dari kemampuan ini adalah SAO dengan compaction, teknik RL yang membuat peningkatan performa bertahan pada tugas panjang, bukan hanya tugas pendek.

Tugas Panjang: Dua Kali Lipat di SWE-Marathon

Untuk kemampuan long-horizon — tugas puluhan hingga ratusan langkah — GLM-5.3 menunjukkan peningkatan terbesar dari serinya. SWE-Marathon v1.1, benchmark maraton tugas software engineering, naik dari 19,4 menjadi 42,5 (2,2 kali lipat). Evaluasi dilakukan dengan konteks 1 juta token, sama seperti Agents’ Last Exam yang menjalankan tugas hingga 8 jam dengan ratusan langkah.

Efisiensi token juga jadi bukti tidak langsung berkurangnya error accumulation: model menyelesaikan tugas dengan token output jauh lebih sedikit (75 ribu vs 96 ribu per tugas pada pendahulunya), artinya lebih sedikit retry, drift, dan pengawasan manual.

Faktor Kejutan: Kemampuan Siber yang Tumbuh di Luar Rencana

Bagian paling kontroversial dari GLM-5.3 adalah kemampuan keamanan sibernya yang “muncul” (emergent). Z.ai memasukkan data dan environment penemuan kerentanan ke dalam post-training, tetapi kemampuan itu terus berkembang melebihi dugaan: model mulai bernalar lintas tahap eksploitasi dan menyusun rantai eksploitasi yang koheren.

  • CyberGym: 84,5 (tertinggi, di atas Claude Mythos 5 83,8 dan GPT-5.6 Sol 83,6)
  • ExploitBench: 54,4 — lebih dari dua kali lipat GLM-5.2 (24,4)
  • ExploitGym: 105 tugas dalam 2 jam / 130 dalam 6 jam (5.2: 29/39)

Di dunia nyata, bersama tim keamanan di China, model ini menemukan 2.436 kerentanan di 269 proyek open-source — 1.097 di antaranya severity tinggi atau kritis, yang tertua berusia sekitar 40 tahun. Temuan ini didokumentasikan di ledger pengungkapan publik Z.ai.

Kemampuan inilah alasan bobot model ditahan dua minggu untuk evaluasi dan penguatan keamanan — langkah yang belum pernah terlihat di rilis GLM sebelumnya.

Posisi di Gelombang Rilis Minggu Ini

GLM-5.3 tiba di tengah minggu paling sibuk untuk model AI tahun ini:

ModelRilisFokusKeunggulan
GLM-5.314 AguCoding, agen, siberTerbaik di benchmark coding/agen open-source
Gemini 3.7 Flash13 AguWorkhorse coding + agenTercepat (340 tok/s), termurah per token, multimodal
Grok 4.612 AguUmumAA Index tertinggi minggu ini (61)
DeepSeek V4 Pro12 AguUmumPaling hemat per token ($0,435/$0,87)
Qwen 3.8 Max12 AguUmumOpen weights multimodal

Kelebihan dan Kekurangan

Kelebihan:

  • Benchmark coding open-source terkuat yang pernah tercatat: TB 3.0 28,3, DeepSWE 66,9, FrontierSWE 78,1
  • AutomationBench tertinggi di semua model pembanding — workflow otomasi paling andal
  • Long-horizon: SWE-Marathon 2,2x lipat, efisiensi token terbaik di kelasnya
  • Open weights (2 minggu lagi): gratis self-host, guardrails bisa dilepas — keunggulan yang tidak dimiliki model tertutup
  • GDPval 1769: knowledge work setara model termahal

Kekurangan:

  • Semua angka masih vendor-reported; belum ada replikasi independen (Artificial Analysis belum listing)
  • API pay-per-token belum rilis — tidak bisa langsung dipakai pay-as-you-go
  • Teks-only: tanpa multimodal (berbeda dengan Gemini atau Qwen)
  • Masih tertinggal dari frontier tertutup di benchmark tersulit: DeepSWE 66,9 vs GPT-5.6 Sol 72,7; ExploitBench 54,4 vs Mythos 5 78,0
  • Kecepatan 115 token/detik — kalah jauh dari Gemini 3.7 Flash (340)
  • Bobot belum rilis: klaim “open-source SOTA” baru terverifikasi penuh dua minggu lagi

Verdict

GLM-5.3 adalah pemenang paling jelas di gelombang rilis 7–14 Agustus untuk kategori coding, agen, dan tugas panjang. Bagi developer yang membangun coding agent atau workflow otomasi, model ini menawarkan performa frontier-adjacent dengan biaya jauh lebih rendah — terutama setelah bobotnya rilis dan bisa dijalankan sendiri.

Tapi ada dua tanda tanya: klaim performa yang belum direplikasi independen, dan kemampuan siber yang begitu kuat hingga Z.ai menunda rilis bobotnya. Keputusan menahan weights ini justru sinyal bahwa “open-source SOTA” mungkin lebih menarik dari sekadar marketing — dan itu berarti developer perlu menyiapkan kebijakan penggunaan yang hati-hati.

Sumber

  1. Z.ai Blog — GLM-5.3: Frontier Coding with Emergent Cyber Capabilities (14 Agustus 2026)
  2. Z.ai Developer Docs — GLM-5.3 Overview (14 Agustus 2026)
  3. Unite.AI — Z.ai Launches GLM-5.3 (14 Agustus 2026)
  4. The Decoder — Zhipu AI releases GLM-5.3 (14 Agustus 2026)
  5. Pandaily — GLM-5.3 Arrives, Doubles SWE-Marathon, Tops CyberGym (14 Agustus 2026)
  6. Bloomberg — Z.ai to Rival Anthropic, OpenAI in Coding (14 Agustus 2026)
  7. Hacker News — GLM-5.3 discussion
  8. Proximal — FrontierSWE evaluation (14 Agustus 2026)
  9. Z.ai Security Disclosure Ledger
Bagikan artikel ini
Telegram WhatsApp Facebook X

Artikel Terkait

Gemini 3.7 Flash Turunkan Harga 50 Persen, Ungguli Sonnet 5 di Coding

Gemini 3.7 Flash Turunkan Harga 50 Persen, Ungguli Sonnet 5 di Coding

14 Agustus 2026
Nvidia Rilis Nemotron 3.5 Lightning: Model AI Open Source Tercepat di Dunia

Nvidia Rilis Nemotron 3.5 Lightning: Model AI Open Source Tercepat di Dunia

14 Agustus 2026
Meta Rilis Muse Glimmer 30B: Model AI Open-Source yang Bisa Jalan di Laptop

Meta Rilis Muse Glimmer 30B: Model AI Open-Source yang Bisa Jalan di Laptop

11 Agustus 2026
← Kembali ke Beranda