AI Briefing
AI Briefing Publikasi Riset AI Indonesia

"The best AI is the AI that helps humanity solve its hardest problems. That's the north star."

— Lisa Su · CEO of AMD

Model AI China Terbaik untuk Coding 2026: DeepSeek V4 Juara Nilai Harga

Oleh Eko Hadi Murwanto · ·
Model AI China Terbaik untuk Coding 2026: DeepSeek V4 Juara Nilai Harga

Agustus 2026 adalah salah satu bulan terpadat dalam sejarah model coding asal China. DeepSeek merilis keluarga V4 dan merevisi harga pada 16 Agustus, Z.ai meluncurkan GLM-5.3 pada 14 Agustus, Alibaba membuka Qwen3.8-Max pada 3 Agustus, Moonshot membuka weights Kimi K3 pada akhir Juli, dan MiniMax sudah masuk lebih dulu dengan M3 pada awal Juni. Ada satu pertanyaan praktis yang mengikuti semua rilis ini: model mana yang memberi hasil coding paling banyak per dolar?

Artikel ini membandingkan lima kandidat China tersebut dengan Gemini 3.7 Flash sebagai pembanding global. Gemini 3.7 Flash dirilis Google pada 13 Agustus 2026 dengan konfigurasi thinking level high, harga perkenalan $0,75 per juta token input dan $3,75 output [1][2].

Sebelum masuk ke angka, satu catatan metodologi. Skor benchmark sangat tergantung harness dan pengaturan reasoning. Artikel ini mengutamakan evaluasi independen (Vals AI, AnotherWrapper, Snorkel AI, FriendliAI, Artificial Analysis, dan Code Arena), lalu klaim vendor ditandai tanda bintang (*). Angka yang berbeda antar-sumber dicantumkan sebagai rentang, bukan dipilih satu secara serampangan.

Perbandingan Cepat

Aspek DeepSeek V4 Pro-0813 DeepSeek V4 Flash-0731 GLM-5.3 Kimi K3 Qwen3.8-Max MiniMax M3 Gemini 3.7 Flash
Vendor DeepSeek DeepSeek Z.ai Moonshot Alibaba MiniMax Google
Rilis 13 Agu 31 Jul 14 Agu 16 Jul 3 Agu 1 Jun 13 Agu
Konteks 1M token 1M token 1M token 1M token 1M token 1M token 1M token
Vision TidakVision-Exp terpisah Tidak Tidak5V-Turbo terpisah Ya (native) Ya (via API) Ya (native) Ya (native)
Open Weights Ya (MIT) Ya (MIT) Belumakhir Agu Ya Yalisensi custom Yalisensi custom Tidak
Harga Input ($/1M) 0,66off-peak 0,22off-peak 1,40 3,00 2,00* 0,30≤512K 0,75intro
Harga Output ($/1M) 1,98off-peak 0,66 4,40 15,00 6,00* 1,20≤512K 3,75intro
SWE-bench Verified 96,4% 🏆 88,8% 94,2% 93,4–93,8% 85,6% 80,5% 80,8%aggregator

* Harga Qwen3.8-Max dikutip dari aggregator Code Arena, halaman resmi QwenCloud belum bisa diverifikasi saat artikel ditulis [16].

Benchmark Coding: SWE-bench Verified

SWE-bench Verified menguji model pada 500 isu GitHub nyata. Tiga model China kini berada di puncak leaderboard global:

  • DeepSeek V4 Pro-0813: 96,4% — Vals AI (19 Agustus) dan AnotherWrapper (24 Agustus) sepakat di angka ini, hanya 0,6 poin di belakang Claude Opus 5 (97%) [17][18]. Ini model open-weight pertama yang menembus level itu.
  • GLM-5.3: 94,2% — hasil evaluasi FriendliAI dengan harness yang sama persis untuk kedua model [20]. Lebih tinggi dari Kimi K3 di pengujian itu.
  • Kimi K3: 93,8% (FriendliAI) atau 93,4% (Vals AI dan AnotherWrapper) [17][18][20].
  • DeepSeek V4 Flash-0731: 88,8% — mengejutkan untuk model bertarif $0,22 input [17][18].
  • Qwen3.8-Max: 85,6% dan Qwen3.8-27B sekitar 85% [17][18]. Yang kedua menarik: model dense 27 miliar parameter dengan lisensi Apache 2.0 mencetak hampir sama dengan raksasa 2,4 triliun parameternya.
  • MiniMax M3: 80,5% — hasil eval komunitas dengan scaffold Claude Code [13].
  • Gemini 3.7 Flash: 80,8% menurut aggregator; Google sendiri tidak mempublikasikan SWE-bench Verified, melainkan FrontierCode 43,6% dan DeepSWE 65,3% di model card resminya [2][18].

Yang penting dipahami: 96,4% vs 94,2% bukan selisih yang terasa sama di lapangan. Ketika FriendliAI menjalankan GLM-5.3 dan Kimi K3 dengan harness identik, kedua model saling menyelesaikan tugas yang gagal dikerjakan lawannya (18 vs 16 tugas eksklusif). Model pemenang benchmark belum tentu model yang paling andal untuk semua jenis task.

Agentic Coding dan Terminal

Benchmark coding agent yang paling keras saat ini adalah Terminal-Bench 3.0, yang menguji agen di lingkungan terminal nyata. Di leaderboard independen Snorkel AI, GLM-5.3 menempati peringkat ke-4 dunia dengan 32,4%, di belakang Claude Opus 5, GPT-5.6 Sol, dan Claude Fable 5 — tapi di atas Grok 4.6 dan Claude Opus 4.8 [19]. Yang lebih menarik: biaya evaluasinya $1.800, sementara Claude Opus 5 menghabiskan $5.800 untuk hasil yang hanya 10 poin lebih tinggi [19]. Kimi K3, DeepSeek, Qwen, dan MiniMax belum masuk 12 besar leaderboard ini [19].

Di Terminal-Bench 2.1: GLM-5.3 88,2%* dan Kimi K3 88,3%* (masing-masing dengan harness resminya), DeepSeek V4 Pro 87,9%*, Gemini 3.7 Flash 85,8% (angka resmi Google) [2][8][9][10].

Untuk benchmark agen lain: Kimi K3 mencetak 28,3% di Agents’ Last Exam, peringkat ke-3 global di belakang dua varian Codex GPT-5.6 [11]. GLM-5.3 unggul di AutomationBench 48,2% vs 30,4% Gemini 3.7 Flash dan 30,8% Kimi K3 [2][8].

Frontend dan Pengembangan Web

Code Arena memeringkat model dari voting developer nyata untuk tugas frontend. Di leaderboard WebDev per 25 Agustus 2026 [16]:

  • kimi-k3-max: Elo 1674, peringkat ke-2 dunia — hanya 17 poin di belakang Claude Opus 5 (1691). Di sub-leaderboard reference-based design (meniru desain dari gambar acuan), Kimi K3 memuncaki peringkat dengan 1721.
  • qwen3.8-max: 1669, peringkat ke-3.
  • glm-5.3-max: 1599; gemini-3.7-flash-high: 1587; deepseek-v4-pro-high: 1582; deepseek-v4-flash-high: 1579.

Qwen dan Kimi jelas lebih kuat untuk pekerjaan frontend dibanding DeepSeek. Ini konsisten dengan positioning keduanya: Qwen melatih modelnya untuk agen frontend, dan Kimi K3 punya penglihatan native.

Vision: Bonus yang Mulai Penting

Untuk kerja screenshot-ke-kode, desain UI, dan debugging visual, ketajaman mata model kini jadi pembeda nyata:

  • Kimi K3 punya vision native. Dalam studi kasus FriendliAI membuat game Unity, K3 bekerja dengan menangkap layar, memeriksa render, dan memperbaiki sprite serta UI secara iteratif. Hasilnya: game dengan visual lebih halus, meski ada satu masalah alur yang membuat stage 2 tak bisa diselesaikan. GLM-5.3 (text-only) sebaliknya: fungsional dan bisa dimainkan sampai akhir, tapi visualnya lebih sederhana dan UI-nya ada yang tidak rapi [20]. GLM-5.3 menang di fungsi, K3 menang di tampilan — kombinasi keduanya menghasilkan game terbaik.
  • Gemini 3.7 Flash adalah juara computer-use: OSWorld-2.0 47,9% dan Agents’ Last Exam 26,3% menurut model card resmi [2].
  • Qwen3.8-27B membawa vision native di lisensi Apache 2.0 — opsi multimodal gratis untuk self-host [15].
  • MiniMax M3 multimodal native dengan klaim menang di SVG-Bench melawan Claude Opus 4.7 (*klaim vendor) [13].
  • DeepSeek merilis V4-Flash-Vision-Exp pada 21 Agustus, eksperimental, dengan klaim kemampuan agen visual mendekati Opus-4.8 [5].
  • GLM-5V-Turbo ($1,2/$4) tersedia untuk coding berbasis vision [7].

Long Context dan Kecepatan

Semua model di daftar ini mendukung 1 juta token konteks, cukup untuk menelan codebase besar sekaligus. Perbedaan ada di detail: DeepSeek mengizinkan output hingga 384 ribu token (berguna untuk agen yang menulis banyak file), Gemini dibatasi 64 ribu [4][2].

Kecepatan generasi (pengukuran Artificial Analysis) [21][22]:

  • DeepSeek V4 Flash: 133 token/detik, jeda ke token pertama 1,17 detik — tercepat di kelasnya.
  • Kimi K3: 37,2 token/detik — termasuk lambat; biaya evaluasi indeksnya juga termahal ($2.425).
  • GLM-5.3 belum diukur Artificial Analysis, tapi Z.ai mengklaim efisiensi token yang agresif: 50 ribu token output per task di effort high, seperempat dari konsumsi Claude Opus 4.8 [8].

Harga dan Biaya per Tugas yang Berhasil

Harga per juta token hanya separuh cerita. Cerita utuhnya adalah biaya per tugas coding yang benar-benar berhasil. Dengan asumsi satu tugas agen tipikal memakai 2 juta token input (70% cache hit) dan 150 ribu token output, dan membagi dengan tingkat keberhasilan SWE-bench Verified:

Model Estimasi $ per tugas Estimasi $ per tugas sukses
DeepSeek V4 Flash (off-peak) $0,24 $0,27
DeepSeek V4 Pro (off-peak) $0,72 $0,75peak: $1,50
MiniMax M3 $0,65 $0,81
GLM-5.3 $1,42–1,86 $1,51–1,98
Gemini 3.7 Flash High $2,06 $2,55
Kimi K3 $4,47 $4,77
Qwen3.8-Max $4,90 $5,72

Angka ini estimasi dari harga resmi, bukan klaim vendor. Dua temuan penting:

  1. DeepSeek V4 Pro sekitar 3,4 kali lebih murah per tugas sukses daripada Gemini 3.7 Flash di harga perkenalan, dan itu sebelum diskon cache DeepSeek ($0,022 per juta token cached, diskon 97%) [4][22].
  2. Kimi K3 dan Qwen3.8-Max boros untuk penggunaan volume — K3 karena harga output $15, Qwen karena tanpa data cache tersedia dan harga $6 per juta output [10][16].

Catatan untuk DeepSeek: harga off-peak hanya separuh harga peak. Jam peak adalah 01.00–04.00 dan 06.00–10.00 UTC hari kerja. Jadwalkan batch besar di luar jam itu [4].

Pro dan Kontra Tiap Model

DeepSeek V4 Pro-0813 — Juara mutlak SWE-bench Verified open-weight, harga paling agresif di kelas frontier, lisensi MIT, kompatibel dengan API gaya Anthropic sehingga bisa dipasang ke Claude Code. Kelemahan: tanpa vision (harus pakai V4-Flash-Vision-Exp terpisah), harga peak dua kali lipat, dan belum terverifikasi di Terminal-Bench 3.0 [4][6][17][18].

GLM-5.3 — Agen terminal terbaik dari China (peringkat 4 dunia di Terminal-Bench 3.0), paling hemat token, kompatibel dengan Claude Code, dan punya kemampuan keamanan siber yang muncul tiba-tiba (84,5% di CyberGym, di atas Mythos 5 menurut Z.ai) [8][9][19]. Kelemahan: text-only, weights belum dirilis (dijanjikan akhir Agustus), reasoning selalu aktif [8].

DeepSeek V4 Flash-0731 — Nilai terbaik per dolar untuk volume: 88,8% SWE-bench Verified dengan biaya $0,27 per tugas sukses dan kecepatan 133 token/detik [4][17][22]. Kelemahan: lebih lemah untuk task long-horizon dan arsitektur kompleks.

Kimi K3 — Kekuatan vision + coding: terbaik untuk frontend berbasis desain, peringkat 3 dunia di Agents’ Last Exam, native multimodal. Kelemahan: termahal di kelasnya ($4,77 per sukses), paling lambat (37 t/s), dan bobot 2,8 triliun parameter berat untuk self-host [10][11][16][21].

Qwen3.8-Max — Kuat di frontend dan long-horizon (demo 10 hari autonomous coding di blog resminya), 1 juta konteks dengan input gambar via API [14][16]. Kelemahan: harga menengah yang tidak didukung cache, lisensi weights custom dengan syarat revenue yang membuatnya tidak praktis untuk produk besar, dan weights rilisannya text-only tanpa konteks 1M [15].

MiniMax M3 — Multimodal termurah ($0,81 per sukses) dengan 1M konteks dan reasoning adaptive [12][13]. Kelemahan: kemampuan coding dasar di bawah lima besar China, dan lisensi custom meminta atribusi “Built with MiniMax M3”.

Gemini 3.7 Flash (pembanding) — Multimodal dan computer-use terbaik di daftar ini, harga perkenalan murah, ekosistem enterprise lengkap (Spark, Antigravity, Workspace) [1][2]. Kelemahan: kalah telak di SWE-bench Verified, output dibatasi 64 ribu token, dan harga naik dua kali lipat mulai Januari 2027.

Skor dan Peringkat

Bobot mengikuti prioritas umum untuk coding agent: kemampuan coding 30%, reliabilitas agentic 30%, efisiensi biaya 25%, kecepatan 5%, vision 5%, ekosistem terbuka 5%. Skor 1–10 adalah penilaian analitis berdasarkan data di atas, bukan klaim vendor.

Model Coding Agentic Biaya Cepat Vision Open Total
DeepSeek V4 Pro 9,8 8,5 9,5 8,5 2 9,5 8,87 🏆
GLM-5.3 9,0 9,8 8,5 7 1,5 6 8,49
DeepSeek V4 Flash 8,5 7,5 10 10 2 10 8,40
MiniMax M3 7,5 7,0 9 7,5 8 7 7,73
Kimi K3 9,2 8,5 5 4 9 9 7,66
Gemini 3.7 Flash 8,0 7,5 8 8,5 9,5 2 7,65
Qwen3.8-Max 8,5 8,0 6,5 7 7 5,5 7,55

Pilih Sesuai Kebutuhan

  • Anggaran utama: DeepSeek V4 Flash. 88,8% SWE-bench Verified dengan biaya $0,27 per tugas sukses sulit ditandingi model mana pun.
  • Agen otonom dan kerja terminal berat: GLM-5.3. Peringkat 4 dunia di Terminal-Bench 3.0 adalah bukti reliabilitas paling kuat dari model China.
  • Frontend, desain UI, screenshot ke kode: Kimi K3. Peringkat 1 reference-based design di Code Arena, dan vision native-nya bekerja.
  • Self-host penuh tanpa batasan lisensi: DeepSeek V4 Pro (MIT) untuk kemampuan maksimal, Qwen3.8-27B (Apache 2.0) jika butuh yang bisa jalan di satu GPU.
  • Multimodal murah: MiniMax M3.
  • Enterprise multimodal dan computer-use: Gemini 3.7 Flash.

Kesimpulan

Jika hanya boleh memilih satu model untuk daily coding plus autonomous coding agent, pilihannya jatuh pada DeepSeek V4 Pro-0813. Ia memegang skor SWE-bench Verified tertinggi untuk model China (96,4%, setara Claude Opus 5), biaya per tugas sukses paling rendah di kelas frontier ($0,75 off-peak), lisensi MIT yang bebas dipakai dan di-self-host, konteks 1 juta token, output 384 ribu token, dan kompatibilitas API Anthropic yang membuatnya langsung jalan di Claude Code.

Keyakinan pada keputusan ini tinggi untuk kemampuan dan harga (dua agregator independen sepakat, harga resmi terverifikasi per 16 Agustus 2026), tapi sedang untuk dua hal: kecepatan V4 Pro belum diukur Artificial Analysis, dan Terminal-Bench 3.0 belum punya entri DeepSeek sama sekali. Jika kerja harianmu lebih banyak di terminal dan agen jangka panjang, GLM-5.3 adalah kandidat pengganti yang adil. Jika pekerjaanmu penuh screenshot dan desain, Kimi K3.

Kombinasi juga masuk akal jangan diabaikan. FriendliAI menunjukkan bahwa memilih model per tugas (GLM-5.3 atau Kimi K3) menaikkan akurasi SWE-bench Verified ke 97,4% dengan biaya $0,198 per tugas — lebih tinggi dari kedua model sendirian. Pasangan DeepSeek V4 Pro untuk logika berat plus Kimi K3 untuk apa pun yang butuh mata, adalah pola yang dipakai banyak developer di Agustus 2026.

Sumber

  1. Google Blog — “Introducing Gemini 3.7 Flash: our most intelligent workhorse model” (13 Agustus 2026)
  2. Google DeepMind — Model Card Gemini 3.7 Flash (13 Agustus 2026)
  3. AI Studio — Gemini 3.7 Flash Developer Guide (Agustus 2026)
  4. DeepSeek — Models & Pricing (diakses 25 Agustus 2026, harga efektif 16 Agustus 2026)
  5. DeepSeek — Change Log API (21 Agustus 2026)
  6. Hugging Face — DeepSeek-V4-Pro Model Card (Agustus 2026)
  7. Z.ai — Halaman Pricing (diakses 25 Agustus 2026)
  8. Z.ai — Dokumentasi GLM-5.3 (14 Agustus 2026)
  9. Z.ai — “GLM-5.3: Frontier Coding with Emergent Cyber Capabilities” (14 Agustus 2026)
  10. Moonshot AI — Harga Kimi K3 (Juli 2026)
  11. Hugging Face — Kimi-K3 Model Card (Juli 2026)
  12. MiniMax — Pricing Pay as You Go (diakses 25 Agustus 2026)
  13. Hugging Face — MiniMax-M3 (Juni 2026)
  14. Qwen — “Qwen3.8-Max: A New Bar for Coding and Cowork” (3 Agustus 2026)
  15. The Ledger — “Alibaba Publishes Open Weights for a Qwen-Max-Class Flagship for the First Time” (12 Agustus 2026)
  16. Code Arena — WebDev Leaderboard (diakses 25 Agustus 2026)
  17. Vals AI — SWE-bench Verified (diperbarui 19 Agustus 2026)
  18. AnotherWrapper — SWE-bench Verified Leaderboard (snapshot 24 Agustus 2026)
  19. Snorkel AI — Terminal-Bench 3.0 Leaderboard (Agustus 2026)
  20. FriendliAI — “What Benchmarks Don’t Tell About GLM-5.3 and Kimi K3 for Coding Agents” (Agustus 2026)
  21. Artificial Analysis — Kimi K3 (Juli 2026)
  22. Artificial Analysis — DeepSeek V4 Flash 0731 (Agustus 2026)
Bagikan artikel ini
Telegram WhatsApp Facebook X

Artikel Terkait

Irlandia Ledakkan Debat Nuklir: Tagihan Listrik Pusat Data AI Capai 25%

Irlandia Ledakkan Debat Nuklir: Tagihan Listrik Pusat Data AI Capai 25%

25 Agustus 2026
OX Alpha: Model AI Misterius Gratis 1 Juta Token yang Bikin Repot Anthropic dan OpenAI

OX Alpha: Model AI Misterius Gratis 1 Juta Token yang Bikin Repot Anthropic dan OpenAI

24 Agustus 2026
Stanford Rancang 16 Fag Baru Pembunuh E. coli dengan AI Evo 2

Stanford Rancang 16 Fag Baru Pembunuh E. coli dengan AI Evo 2

24 Agustus 2026
← Kembali ke Beranda