Biaya Coding Agent: Qwen3.8-Flash, GLM-5.3-Flash, dan DeepSeek V4.1-Flash
Tiga laboratorium China merilis model lapis murah dalam rentang satu bulan. Z.ai meluncurkan GLM-5.3-Flash pada 26 Agustus, Alibaba membuka bobot Qwen3.8-Flash pada hari yang sama, dan DeepSeek mengaktifkan DeepSeek V4.1-Flash di API pada 10 September. Ketiganya menyasar pekerjaan yang sama: coding agent dengan biaya serendah mungkin.
Pertanyaan praktisnya bukan model mana yang paling pintar di atas kertas, melainkan mana yang benar-benar menyelesaikan pekerjaan rekayasa perangkat lunak saat dijalankan sebagai agent, dan berapa biaya sesungguhnya. Artikel ini menjawab keduanya dengan angka yang bisa dilacak ke sumbernya, bukan estimasi karangan.
Metodologi dan Aturan Bukti
Setiap angka dalam artikel ini diberi label menurut asalnya, dan keempat kategori berikut tidak dicampur.
- Fakta terukur — angka yang diukur pihak ketiga atau berasal dari halaman dokumentasi resmi model.
- Klaim vendor — angka yang dilaporkan pembuat model tentang produknya sendiri.
- Bukti independen — pengukuran oleh pihak yang tidak terafiliasi dengan pembuat model.
- Inferensi wajar — turunan aritmetika dari angka di atas, dengan rumus yang ditulis terbuka.
Satu hal yang perlu ditegaskan sejak awal: tidak ada satu pun benchmark yang menjalankan ketiga model ini secara seragam oleh satu evaluator independen. Karena itu, selisih skor yang tipis tidak boleh dibaca sebagai urutan yang pasti.
Ketiga Model Sekilas
| Aspek | DeepSeek V4.1-Flash | GLM-5.3-Flash | Qwen3.8-Flash |
|---|---|---|---|
| Pembuat | DeepSeek | Z.ai (Zhipu) | Alibaba (Qwen) |
| Rilis | 9 September 2026 | 26 Agustus 2026 | 26 Agustus 2026 |
| Arsitektur | MoE 552 miliar, 8B/16B aktif | MoE 320 miliar, 18B aktif | MoE 125 miliar, 6B aktif |
| Konteks | 1 juta token | 1 juta token | 262 ribu asli, 1 juta via YaRN |
| Lisensi | MIT | MIT | Komunitas Qwen |
| Multimodal | Ya (pemahaman visual bawaan) | Ya (gambar dan video) | Ya (gambar dan video) |
Catatan penting soal arsitektur DeepSeek: model ini memakai arsitektur Encoder-Decoder Kausal yang tidak simetris, dengan hanya 8 miliar parameter aktif untuk masukan dan 16 miliar untuk keluaran. Itu sebabnya biaya masukannya bisa sangat murah.
Kemampuan Agentic
Kemampuan agentic adalah kemampuan model menjalankan tugas berantai tanpa pengawasan: memanggil alat, berinteraksi dengan terminal, membaca kesalahan, memperbaiki, lalu mengulang.
DeepSeek V4.1-Flash melaporkan Terminal-Bench 2.1 sebesar 90,6, di atas Claude Opus-5.0 (89,1) dan GPT-5.6 Sol (88,8). Pada Agents’ Last Exam ia mencatat 31,8, tertinggi di antara semua model pembanding. AutomationBench 54,8, HLE dengan alat 63,9, dan CyberGym 88,1. Seluruh angka ini adalah klaim vendor.
GLM-5.3-Flash mencatat 84,3 pada Terminal-Bench 2.1 dan 63,4 pada DeepSWE v1.1. Angka DeepSWE-nya muncul di papan resmi DeepSWE, sehingga masuk kategori bukti independen. Riset Together AI menambahkan temuan penting: pada percobaan ulang, skor GLM-5.3-Flash melonjak dari 63,4 persen di percobaan pertama menjadi 85,0 persen di percobaan keempat.
Qwen3.8-Flash memperoleh 86,1 pada Terminal-Bench 2.1 menurut Artificial Analysis, sehingga tidak bisa dibandingkan apel-ke-apel dengan angka vendor kedua model lain. Skor DeepSWE-nya 58,7 (klaim vendor) dan Toolathlon Verified 73,5.
Ada peringatan metodologis yang sering dilewatkan pemberitaan: angka Terminal-Bench tidak sebanding antar model karena harness-nya berbeda. DeepSeek memakai DeepSeek Harness dengan konteks 1 juta token, GLM memakai Claude Code 2.1.207, dan Qwen memakai Claude Code atau mini-SWE-agent. Artificial Analysis bahkan mencatat angka DeepSeek V4-Flash sebelumnya pada 79, bukan 82,7 versi vendor. Selisih semacam ini membuat peringkat Terminal-Bench lintas model rapuh.
Satu-satunya pengukuran independen yang menempatkan dua model ini di harness yang sama datang dari forum pengembang NVIDIA pada 8 September. Pada subset 40 tugas enterprise SWE-bench Pro, Qwen3.8-Flash-Next dan GLM-5.3-Flash keduanya mencatat 36 dari 40 tugas benar. Hasil itu seri, tetapi Qwen menyelesaikannya dalam seperempat waktu tempuh.
Kemampuan Coding
| Benchmark | DeepSeek V4.1-Flash | GLM-5.3-Flash | Qwen3.8-Flash |
|---|---|---|---|
| SWE-bench Pro | belum diuji | belum diuji | 62,5 (vendor) |
| DeepSWE v1.1 | 74,2 (vendor) | 63,4 (independen) | 58,7 (vendor) |
| LiveCodeBench v6 | belum diuji | belum diuji | 91,9 (vendor) |
| SWE-bench Multilingual | belum diuji | belum diuji | 81,0 (vendor) |
| NL2Repo-Bench | 64,0 (vendor) | belum diuji | 48,1 (vendor) |
Qwen3.8-Flash tampil paling kuat pada benchmark yang paling dekat dengan pekerjaan rekayasa nyata sekali jalan. Skor 62,5 pada SWE-bench Pro mengalahkan DeepSeek-V4-Flash (56,0) dan Claude Opus 4.6 Max (53,4). Namun pada NL2Repo-Bench, yang mengukur pembuatan kode tingkat repositori, justru DeepSeek yang unggul jauh: 64,0 berbanding 48,1.
Artinya, Qwen lebih baik menghasilkan satu patch berkualitas, sementara DeepSeek lebih baik memahami dan mengubah repositori secara keseluruhan. Untuk pekerjaan agent, perbedaan ini menentukan.
Konteks Panjang dan Pemahaman Repositori
Ketiga model mengklaim jendela konteks sekitar satu juta token, tetapi bukti yang tersedia jauh berbeda.
| Model | Konteks diklaim | Konteks terverifikasi |
|---|---|---|
| DeepSeek V4.1-Flash | 1 juta token | 265.781 token |
| Qwen3.8-Flash | 262 ribu asli, 1 juta YaRN | 245.000 token |
| GLM-5.3-Flash | 1.048.576 token | 131.000 token |
GLM-5.3-Flash adalah kasus paling mencolok. Checkpoint-nya menyatakan konteks 1.048.576 token, tetapi verifikasi pihak ketiga hanya sampai 131 ribu token. Z.ai memang mengklaim arsitektur hibrida perhatian linear dan sparse-nya memangkas komputasi perhatian 3 kali dan cache KV 4,44 kali dibanding GLM-5.3, tetapi jendela penuh satu juta token itu belum dibuktikan pada tugas nyata.
Qwen3.8-Flash adalah yang paling jujur menyebut batasnya: 262.144 token bawaan, dan satu juta hanya tercapai melalui interpolasi YaRN. Artificial Analysis mencatatnya pada 256 ribu token.
DeepSeek V4.1-Flash memiliki rekam bukti terkuat, dibantu arsitektur cache-nya yang hanya membutuhkan seperempat memori HBM dan seperdelapan penyimpanan SSD dibanding generasi sebelumnya. Untuk agent yang bekerja berjam-jam pada repositori yang sama, ukuran cache adalah penentu biaya, bukan sekadar ukuran jendela konteks.
Kecepatan dan Latensi
Kecepatan bukan angka kosmetik. Pada agent loop yang membaca kesalahan, menambal kode, lalu menjalankan uji ulang, kecepatan keluaran langsung menentukan berapa lama pengembang menunggu.
| Model | Keluaran (token/detik) | Waktu ke token pertama | Token indeks |
|---|---|---|---|
| DeepSeek V4.1-Flash | 214,4 | 1,17 detik | 250 juta |
| GLM-5.3-Flash | 85,2 | 1,66 detik | 180 juta |
| Qwen3.8-Flash | 51,2 | belum dilaporkan | 240 juta |
Seluruh angka pada tabel di atas adalah bukti independen dari Artificial Analysis.
Kolom terakhir, token indeks, adalah jumlah token keluaran yang dihabiskan model untuk menuntaskan Artificial Analysis Intelligence Index. Angka itu mengukur seberapa bertele-tele model tersebut. Satu perbandingan yang adil memerlukan basis yang sama, dan satu-satunya seri lengkap pada keluarga ini ada pada DeepSeek V4-Flash-0731 dengan 206 juta token. Memakai basis itu, faktor keluaran ketiga model adalah 0,728 kali untuk GLM, 1,165 kali untuk Qwen, dan 1,214 kali untuk DeepSeek. Tiga nilai itu adalah inferensi wajar dari pengukuran Artificial Analysis.
Gabungan kecepatan dan keceriwisan menghasilkan gambaran berikut: untuk menyelesaikan beban kerja yang sama pada satu aliran, DeepSeek memerlukan sekitar 324 jam, GLM sekitar 587 jam, dan Qwen sekitar 1.302 jam. Qwen empat kali lebih lambat daripada DeepSeek bukan karena modelnya lambat saja, melainkan karena ia juga menghasilkan keluaran paling banyak.
Harga dan Ekonomi Agent
Ini bagian yang paling sering disalahpahami, karena harga daftar tidak sama dengan biaya nyata.
| Pos biaya | DeepSeek V4.1-Flash | GLM-5.3-Flash | Qwen3.8-Flash |
|---|---|---|---|
| Masukan baru, luar puncak | $0,15 | $0,15 (promo) | $0,15 |
| Masukan baru, jam puncak | $0,30 | (tidak ada) | (tidak ada) |
| Masukan dari cache, luar puncak | $0,003 | $0,0255 | $0,016 |
| Masukan dari cache, jam puncak | $0,006 | (tidak ada) | (tidak ada) |
| Keluaran, luar puncak | $0,60 | $0,50 | $0,47 |
| Keluaran, jam puncak | $1,20 | (tidak ada) | (tidak ada) |
| Harga campuran 3:1, luar puncak | $0,2625 | $0,2275 | $0,2300 |
| Harga campuran 3:1, jam puncak | $0,5250 | (tidak ada) | (tidak ada) |
Tiga catatan penting. Pertama, harga GLM-5.3-Flash sebesar $0,15 adalah tarif promo diskon lima puluh persen yang berakhir 9 September 2026; harga daftarnya $0,30. Kedua, hanya DeepSeek yang menerapkan tarif puncak dan luar puncak, dengan jam puncak dua kali lipat tarif normal pada Senin sampai Jumat pukul 01.00 sampai 04.00 dan 06.00 sampai 10.00 UTC. Ketiga, seluruh perhitungan skenario di bawah memakai tarif luar puncak DeepSeek, karena beban kerja agent bisa dijadwalkan dan tarif itulah yang berlaku di luar jam sibuk termasuk akhir pekan.
Selisih terbesar ada pada jalur cache. DeepSeek membebankan $0,003 per juta token masukan dari cache di luar jam puncak, atau diskon 98 persen. Qwen membebankan $0,016, sekitar 89 persen lebih murah. GLM membebankan $0,0255, atau sekitar 83 persen lebih murah, tetapi ia tidak memungut biaya pembuatan cache sama sekali. Qwen justru memungut 125 persen dari harga masukan normal saat membangun cache eksplisit. Ringkasnya: Qwen memotong separuh tarif baca, sementara GLM menggratiskan penulisan.
Estimasi Biaya Empat Skenario
Perhitungan berikut memakai harga nominal, tanpa koreksi keceriwisan, dan mengasumsikan cache sudah hangat.
| Model | Tugas Kecil | Perbaikan Bug | Refaktor Besar | Repo Penuh |
|---|---|---|---|---|
| DeepSeek V4.1-Flash (luar puncak) | $0,0076 | $0,0144 | $0,0247 | $0,0562 |
| GLM-5.3-Flash | $0,0083 | $0,0162 | $0,0281 | $0,0679 |
| Qwen3.8-Flash | $0,0076 | $0,0146 | $0,0252 | $0,0597 |
Skenario yang diuji: tugas kecil dengan 30 ribu masukan baru, 50 ribu masukan dari cache, dan 5 ribu keluaran; perbaikan bug dengan 180 ribu masukan, tingkat cache 75 persen, dan 12 ribu keluaran; refaktor besar dengan 320 ribu masukan, tingkat cache 75 persen, dan 20 ribu keluaran; serta repo penuh dengan 900 ribu masukan, tingkat cache 80 persen, dan 45 ribu keluaran.
Pada angka nominal, Qwen tampak hampir setara dengan DeepSeek dan lebih murah daripada GLM. Kesimpulan itu berubah begitu keceriwisan diperhitungkan.
Setelah Keceriwisan Diperhitungkan
Mengalikan jumlah token keluaran dengan faktor keceriwisan masing-masing model menghasilkan biaya yang berbeda dari tabel nominal.
| Model | Biaya nominal | Biaya terkoreksi | Rasio |
|---|---|---|---|
| DeepSeek V4.1-Flash | $0,1029 | $0,1134 | 1,00 kali |
| GLM-5.3-Flash | $0,1204 | $0,1093 | 0,96 kali |
| Qwen3.8-Flash | $0,1071 | $0,1135 | 1,00 kali |
Hasilnya adalah pembalikan. Keunggulan harga Qwen hilang sepenuhnya setelah keceriwisan dikoreksi, dan GLM-5.3-Flash justru menjadi yang termurah. Narasi bahwa Qwen hemat hanya berlaku bila masukan mendominasi dan keluaran kecil, dan itu bukan pola kerja agent coding yang sebenarnya.
Skor Efisiensi Biaya
Skor ini tidak memakai harga daftar, karena harga daftar menyesatkan setelah keceriwisan diperhitungkan. Yang dipakai adalah satuan kerja setara per dolar, yaitu biaya nyata menjalankan Intelligence Index dibagi biaya rata-rata per tugas indeks, dinormalkan pada skala logaritmik 40 sampai 100.
| Model | Biaya per tugas | Skor Efisiensi Biaya |
|---|---|---|
| DeepSeek V4.1-Flash | $0,27 | 100,0 |
| GLM-5.3-Flash | $0,25 | 60,1 |
| Qwen3.8-Flash | $0,37 | 40,0 |
Skala logaritmik dipakai karena perbedaan 1,5 kali pada skala linear akan tampak seperti nol.
Kemampuan per Dolar
| Model | Poin agentic per dolar | Poin coding per dolar |
|---|---|---|
| DeepSeek V4.1-Flash | 836 (indeks 100) | 807 (indeks 100) |
| GLM-5.3-Flash | 681 (indeks 81,5) | 656 (indeks 81,3) |
| Qwen3.8-Flash | 728 (indeks 87,1) | 784 (indeks 97,2) |
Rumusnya sederhana: skor kemampuan dibagi biaya nominal, lalu dinormalkan sehingga nilai tertinggi menjadi 100. Menariknya, Qwen adalah juara kedua pada kemampuan coding per dolar meski paling mahal per tugas, karena skor coding mentahnya memang tertinggi.
Keandalan dan Konsistensi
Perlu dinyatakan jelas di muka: bukti yang tersedia untuk menilai keandalan ketiga model sangat terbatas. Tidak ada data varian antar-percobaan yang dipublikasikan untuk ketiganya, dan penilaian berikut memakai sinyal tidak langsung.
Yang benar-benar terukur pada GLM-5.3-Flash, semuanya dari riset independen Together AI:
- Model ini merusak uji dasar yang sebelumnya lulus pada 6,9 persen percobaan, dibanding 4,4 persen pada model penuh.
- Pada tugas yang tidak stabil, percobaan yang lebih panjang justru menjadi percobaan yang lulus hanya 46 persen, di bawah garis koin. Model penuh mencapai 61 persen.
- Konsistensinya justru baik: skor naik dari 63,4 persen pada percobaan pertama ke 85,0 persen pada percobaan keempat.
Yang tercatat pada Qwen3.8-Flash:
- Laporan pengembang pada forum NVIDIA menyebut evaluasi agent berhorizon panjang menyebabkan kedua rank layanan inferensi tumbang.
- Qwen sendiri menyatakan model ini sengaja kurang dilatih sebagai pratinjau arsitektur.
- Kualitas menurun terlihat saat kuantisasi bit rendah dipakai untuk menjalankan model secara lokal.
Untuk DeepSeek V4.1-Flash, hampir tidak ada bukti independen soal keandalan karena modelnya baru berumur lima hari saat artikel ini ditulis.
Yang tidak tersedia untuk ketiganya: tingkat halusinasi pada kode, kemampuan pulih setelah pemanggilan alat gagal, dan kecenderungan merancang berlebihan.
Skor Akhir
Perhitungan berikut memakai bobot yang dinyatakan terbuka.
Bobot: kemampuan agentic 30 persen, kemampuan coding 25 persen, konteks panjang 15 persen, keandalan 10 persen, kecepatan 10 persen, efisiensi biaya 10 persen.
| Model | Agentic 30% | Coding 25% | Konteks 15% | Andalan 10% | Cepat 10% | Biaya 10% | Total |
|---|---|---|---|---|---|---|---|
| DeepSeek V4.1-Flash | 25,80 | 20,75 | 12,75 | 7,80 | 9,50 | 10,00 | 86,6 |
| GLM-5.3-Flash | 24,60 | 19,75 | 12,00 | 7,40 | 6,80 | 6,00 | 76,6 |
| Qwen3.8-Flash | 23,40 | 21,00 | 12,60 | 7,00 | 5,50 | 4,00 | 73,5 |
Skor penyusun sebelum dibobot: DeepSeek memperoleh 86 untuk agentic, 83 untuk coding, 85 untuk konteks panjang, 78 untuk keandalan, 95 untuk kecepatan, dan 100 untuk efisiensi biaya. GLM memperoleh 82, 79, 80, 74, 68, dan 60. Qwen memperoleh 78, 84, 84, 70, 55, dan 40.
Ketidakpastian Peringkat
Angka di atas bukan presisi palsu, dan berikut rentangnya. DeepSeek berada pada kisaran 86,6 plus minus 6; bila klaim vendornya didiskon sepuluh persen, nilainya turun ke sekitar 82. GLM berada pada kisaran 76,6 plus minus 5. Qwen berada pada kisaran 73,5 plus minus 6.
Konsekuensinya penting: selisih GLM dan Qwen sebesar 3,1 poin berada jauh di bawah margin kesalahan. Keduanya secara statistik seri. Yang benar-benar bisa dipertahankan adalah bahwa DeepSeek unggul, sementara GLM dan Qwen setara dengan profil berbeda.
Empat Peringkat Terpisah
Peringkat 1 — Terbaik secara keseluruhan untuk coding agent
🥇 DeepSeek V4.1-Flash (86,6) — satu-satunya model yang kuat di terminal agent (90,6), tugas berhorizon panjang (31,8), keamanan siber (88,1), sekaligus tercepat dengan 214,4 token per detik.
🥈 GLM-5.3-Flash (76,6) — profil paling merata dengan bukti independen terbanyak.
🥉 Qwen3.8-Flash (73,5).
Peringkat 2 — Kemampuan coding mentah
🥇 Qwen3.8-Flash — SWE-bench Pro 62,5 yang mengalahkan Claude Opus 4.6 Max, dan LiveCodeBench v6 91,9. Menang pada benchmark sekali jalan yang paling dekat dengan pekerjaan nyata.
🥈 DeepSeek V4.1-Flash — DeepSWE 74,2, NL2Repo 64,0, peringkat Codeforces 3471.
🥉 GLM-5.3-Flash — DeepSWE 63,4, tetapi satu-satunya yang memiliki catatan regresi uji dasar terukur.
Peringkat 3 — Rasio harga terhadap kemampuan
🥇 GLM-5.3-Flash — setelah koreksi keceriwisan, biayanya justru terendah ($0,1093). Pada DeepSWE, biayanya $0,24 per percobaan berbanding $3,99 untuk model penuh, atau tujuh belas kali lebih murah.
🥈 DeepSeek V4.1-Flash — tarif cache $0,003 per juta token tidak ada tandingannya untuk pola agent yang mengulang repositori sama. Menang telak bila tingkat cache tinggi.
🥉 Qwen3.8-Flash — menang pada angka nominal, kalah setelah keceriwisan dikoreksi.
Peringkat 4 — Untuk agent bervolume tinggi
🥇 DeepSeek V4.1-Flash — diskon cache 98 persen, ditambah cache KV yang hanya seperempat HBM dan seperdelapan penyimpanan, membuat retensi konteks jangka panjang realistis. Jadwalkan beban kerja di luar jam puncak.
🥈 Qwen3.8-Flash — tarif baca cache murah, tetapi biaya pembuatan cache eksplisit 125 persen membuatnya buruk untuk awalan yang sering dibangun ulang.
🥉 GLM-5.3-Flash — penulisan cache gratis, yang berguna untuk awalan yang sering berganti, tetapi tarif bacanya paling mahal di antara ketiganya.
Analisis Berhadapan
Qwen3.8-Flash melawan GLM-5.3-Flash
Qwen menang pada SWE-bench Pro, LiveCodeBench v6, SWE-bench Multilingual, dan kemudahan dijalankan sendiri karena hanya mengaktifkan 6 miliar parameter sehingga bisa berjalan di sekitar 75 GB RAM. GLM menang pada Terminal-Bench 2.1, DeepSWE versi independen, Toolathlon, dan AutomationBench, serta memiliki rekam bukti independen yang jauh lebih matang.
Trade-off praktisnya begini. Qwen lebih pintar pada tugas tunggal, tetapi tidak bisa diandalkan pada rantai panjang: keluaran 51 token per detik, paling bertele-tele di antara ketiganya, ada laporan tumbang pada horizon panjang, dan modelnya diakui kurang dilatih. GLM lebih konsisten dan lebih banyak divalidasi, tetapi wajib dipagari uji regresi karena 6,9 persen percobaannya merusak uji dasar. Untuk pekerjaan agent, ambil GLM. Untuk menjalankan model sendiri atau pekerjaan visual, ambil Qwen.
GLM-5.3-Flash melawan DeepSeek V4.1-Flash
GLM menang pada harga setelah koreksi keceriwisan, penulisan cache gratis, konsistensi saat diulang, dan jumlah bukti independen.
DeepSeek menang pada kemampuan agentic, tugas berhorizon panjang, keandalan, kecepatan 2,5 kali lebih tinggi, dan waktu ke token pertama yang lebih cepat.
Trade-off praktisnya: DeepSeek lebih cepat sekaligus lebih mampu. GLM hanya menang sekitar 4 persen pada biaya, dan itu untuk kemampuan agentic sekitar 4 poin lebih rendah. Itu bukan pertukaran yang menguntungkan. Satu-satunya alasan memilih GLM adalah bila anggaran sangat ketat dan tim sudah memiliki uji regresi yang kuat.
DeepSeek V4.1-Flash melawan Qwen3.8-Flash
Qwen menang pada SWE-bench Pro, SWE-bench Multilingual, LiveCodeBench, dan kemudahan dijalankan sendiri.
DeepSeek menang pada hampir semua yang bersifat agentic: Terminal-Bench 90,6 berbanding 86,1 versi independen, Agents’ Last Exam 31,8 berbanding 24,3, NL2Repo 64,0 berbanding 48,1, CyberGym 88,1, ditambah kecepatan 4,2 kali lebih tinggi dan keluaran lebih ringkas.
Ini bukan perbandingan yang dekat. Qwen menghasilkan patch lebih baik sekali jalan; DeepSeek menyelesaikan pekerjaan lebih baik. Pada agent yang berputar dalam loop, kecepatan empat kali ditambah keluaran lebih ringkas berarti waktu tempuh sekitar empat kali lebih cepat, dan model yang diakui kurang dilatih adalah risiko langsung pada loop panjang.
Rekomendasi per Kebutuhan
- Asisten coding di editor → DeepSeek V4.1-Flash. Waktu ke token pertama 1,17 detik dan 214 token per detik membuatnya terasa paling responsif, dan latensi terasa langsung di editor.
- Agent coding otonom bergaya Claude Code → DeepSeek V4.1-Flash. Terminal-Bench 90,6, Agents’ Last Exam 31,8, dan CyberGym 88,1 semuanya mengukur eksekusi otonom.
- Agent coding sumber terbuka → GLM-5.3-Flash. Lisensi MIT, bukti independen terbanyak, harga terbaik. Qwen jadi pilihan kedua bila butuh dijalankan sendiri.
- Agent perbaikan bug di CI/CD → DeepSeek V4.1-Flash. Tarif cache $0,003 per juta token cocok dengan pola uji berulang di CI.
- Agent refaktor repositori → DeepSeek V4.1-Flash. NL2Repo 64,0 berbanding 48,1, dan cache KV terkecil di kelasnya.
- Otomasi coding bervolume tinggi dan murah → GLM-5.3-Flash, dengan syarat mutlak ada uji regresi.
- Tugas otonom berjalan lama → DeepSeek V4.1-Flash. Satu-satunya dengan bukti horizon panjang dan tanpa laporan tumbang. Hindari Qwen untuk kebutuhan ini.
- Pemrograman berpasangan interaktif → DeepSeek V4.1-Flash. Alternatifnya GLM bila anggaran ketat.
Benchmark versus Kenyataan
Bagian ini memisahkan klaim dari kenyataan pada lima pola yang sering menyesatkan.
Benchmark coding tinggi tetapi kemampuan agentic belum terbukti. Qwen3.8-Flash unggul pada SWE-bench Pro, tetapi skor itu mengukur pengerjaan sekali jalan. Bukti loop panjangnya justru negatif: laporan tumbang, pengakuan kurang dilatih, dan keluaran paling bertele-tele. Kategori: fakta terukur untuk skornya, bukti independen untuk kelemahannya.
Sangat cepat tetapi penalaran lebih lemah. Tidak ada model dalam perbandingan ini yang cocok dengan pola tersebut. DeepSeek justru tercepat sekaligus paling mampu pada tugas agentic. Kategori: fakta terukur.
Jendela konteks besar tetapi konteks efektif belum terbukti. GLM mengklaim 1.048.576 token, tetapi verifikasi independen hanya sampai 131 ribu. Kategori: klaim vendor berhadapan dengan bukti independen. Qwen menyebut 262 ribu asli dengan perluasan YaRN sampai satu juta, dan Artificial Analysis mencatat 256 ribu. Kategori: klaim vendor ditambah fakta terukur.
Harga token murah tetapi keceriwisan membengkakkan biaya. Inilah kasus Qwen. Harga masukannya sama dengan GLM, tetapi ia menghabiskan 240 juta token untuk menuntaskan indeks berbanding 180 juta milik GLM. Biaya nominalnya naik dari $0,1071 menjadi $0,1135 setelah dikoreksi. Kategori: fakta terukur ditambah inferensi wajar.
Benchmark belum tersedia karena model terlalu baru. SWE-bench Verified versi pihak ketiga belum ada untuk ketiga model. SciCode juga belum dipublikasikan terpisah untuk ketiganya. Terminal-Bench 2.1 untuk Qwen3.8-Flash hanya tersedia lewat Artificial Analysis, bukan dari vendornya. SWE-bench Pro untuk DeepSeek V4.1-Flash belum diuji. Waktu ke token pertama Qwen belum dilaporkan. Kategori: ketiadaan terukur, bukan nilai nol, dan bukan estimasi.
Dua sumber yang berbeda angka. Terminal-Bench 2.1 untuk DeepSeek tercatat 90,6 versi vendor dan 79 versi Artificial Analysis, selisih 11,6 poin. Penyebabnya adalah perbedaan harness dan pengaturan effort. Sumber lain mencatat indeks kecerdasan GLM-5.3-Flash pada 57 di halaman model dan 42 pada artikel indeks versi 4.3; penyebabnya adalah perbedaan versi indeks. Untuk GLM, konteks tercatat 1.048.576 pada checkpoint tetapi 131 ribu pada verifikasi independen. Ketiga perbedaan itu ditampilkan apa adanya, tanpa dirata-ratakan.
Kesimpulan
Tidak ada pemenang tunggal yang berlaku untuk semua kebutuhan, tetapi ada satu pilihan yang paling sulit dibantah untuk pekerjaan agent.
DeepSeek V4.1-Flash memimpin karena lima alasan. Pertama, ia menang pada benchmark eksekusi, bukan akademik: Terminal-Bench 2.1 sebesar 90,6 mengalahkan Opus-5.0 dan GPT-5.6 Sol. Kedua, ia tercepat dengan 214,4 token per detik dan waktu ke token pertama 1,17 detik. Ketiga, tarif cache $0,003 per juta token di luar jam puncak membuat agent yang mengulang repositori sama nyaris gratis pada sisi masukan. Keempat, klaim konteks satu juta tokennya sudah diverifikasi sampai 265.781 token. Kelima, ia satu-satunya tanpa tanda bahaya: GLM memiliki catatan regresi uji dasar, sementara Qwen diakui kurang dilatih dan ada laporan tumbang.
Bila prioritasnya kualitas coding mentah, pilih Qwen3.8-Flash. Bila prioritasnya rasio harga terhadap kemampuan, pilih GLM-5.3-Flash. Bila prioritasnya kecepatan, pilih DeepSeek V4.1-Flash. Bila prioritasnya agent otonom berjalan lama, pilih DeepSeek V4.1-Flash.
Peringkat akhir: pertama DeepSeek V4.1-Flash dengan 86,6; kedua GLM-5.3-Flash dengan 76,6; ketiga Qwen3.8-Flash dengan 73,5. Tingkat keyakinan peringkat ini adalah sedang. Peringkat pertama tidak kontroversial karena unggul pada empat dari enam sumbu dengan selisih lebar pada kecepatan dan kemampuan agentic. Namun peringkat kedua dan ketiga secara statistik seri, dan alasan keyakinan tidak bisa dinaikkan ke tinggi adalah tidak adanya satu pun benchmark yang menguji ketiganya secara seragam oleh pihak ketiga, sementara angka agentic terbaik DeepSeek berasal dari DeepSeek sendiri.
Untuk organisasi yang ingin menekan biaya tanpa mengorbankan mutu, pola berjenjang lebih masuk akal daripada memilih satu model: jalankan model yang lebih murah lebih dulu, lalu naikkan ke model yang lebih kuat ketika uji gagal. Pola ini terbukti pada DeepSWE, di mana pendekatan berjenjang menyelesaikan 80,9 persen tugas dengan biaya $1,70 per tugas, mengalahkan model tunggal yang menyelesaikan 69 persen dengan biaya $3,99.
Sumber
- DeepSeek — “Introducing DeepSeek-V4.1-Flash: smarter, faster, more efficient.” (9 September 2026)
- DeepSeek API Docs — “DeepSeek-V4.1-Flash: Smarter, Faster, More Efficient” (10 September 2026)
- Hugging Face — “DeepSeek-V4.1-Flash” (tabel benchmark lengkap) (September 2026)
- DeepSeek API Docs — “Models & Pricing” (diakses 15 September 2026)
- Z.ai — “GLM-5.3-Flash: Frontier Intelligence, Flash Cost” (26 Agustus 2026)
- Z.AI Developer Docs — “GLM-5.3-Flash Overview” (diakses 15 September 2026)
- QwenCloud — “Qwen3.8-Flash” (diakses 15 September 2026)
- Hugging Face — “Qwen3.8-Flash-Next” (model card dan tabel benchmark) (26 Agustus 2026)
- Alibaba Cloud — “Qwen3.8-Flash-Next: A New Architecture, Towards Ultimate Cost-Efficiency” (27 Agustus 2026)
- Artificial Analysis — “DeepSeek V4.1 Flash Intelligence, Performance & Price Analysis” (diakses 15 September 2026)
- Artificial Analysis — “GLM-5.3-Flash Intelligence, Performance & Price Analysis” (diakses 15 September 2026)
- Artificial Analysis — “Announcing the Artificial Analysis Intelligence Index v4.3” (September 2026)
- Together AI — “GLM-5.3 vs. GLM-5.3 Flash on DeepSWE: Cost, Coding, and Routing” (28 Agustus 2026)
- NVIDIA Developer Forums — “Qwen3.8-Flash-Next, GLM-5.3-Flash, DeepSeek-V4-Flash on 2x DGX Spark” (8 September 2026)
- VentureBeat — “DeepSeek-V4.1-Flash debuts with $0.003/1M off-peak cached-input rate” (11 September 2026)
- DataCamp — “GLM-5.3-Flash vs Qwen3.8-Flash-Next: Coding and Cost” (Agustus 2026)
- The Model Gap — “GLM-5.3-Flash vs DeepSeek Flash vs Qwen3.8” (28 Agustus 2026)
- Regolo AI — “DeepSeek V4 Flash vs Qwen3.8-Flash-Next vs GLM-5.3-Flash” (September 2026)
- eesel AI — “Qwen 3.8 Flash Next review: fast, cheap, and half-baked on purpose” (29 Agustus 2026)
- DeepSWE Leaderboard (diakses 15 September 2026)