Model AI Frontier Terbaik per Dolar: Ranking Efisiensi Biaya September 2026
Pertanyaan yang paling sering salah dijawab di dunia AI: βmodel mana yang paling murah?β Harga API per juta token bukan ukuran yang tepat β karena model yang murah per token bisa jadi mahal per pekerjaan kalau outputnya boros. Ukuran yang benar adalah biaya per tugas yang selesai (cost per completed task).
Artikel ini membandingkan 16 model frontier global (AS dan China) dengan metric utama cost per Intelligence Index task dari Artificial Analysis β pengukuran independen yang memperhitungkan input, cache, reasoning, dan output token aktual per tugas. Angka vendor dan angka independen dipisahkan tegas. Data terkini per 2 September 2026.
Kenapa Harga Token Bisa Menipu
Artificial Analysis Intelligence Index v4.1.1 menggabungkan 9 evaluasi (GDPval-AA v2, Terminal-Bench v2.1, SciCode, Humanityβs Last Exam, GPQA Diamond, dan lainnya). Biaya per tugas dihitung dari token aktual yang dikonsumsi setiap model di tiap benchmark β termasuk input tanpa cache, cache hit, cache write, token reasoning, dan token jawaban β lalu dibagi jumlah tugas.
Contoh nyata: GLM-5.3 punya harga token murah ($1,40 input / $4,40 output per juta), tapi menghasilkan 170 juta token output untuk seluruh suite evaluasi β jauh di atas median kelas 72 juta. Hasilnya biaya per tugasnya $0,68, bukan yang termurah. Sebaliknya GPT-5.6 Luna dengan harga token paling rendah di keluarga OpenAI justru paling efisien: $0,21 per tugas.
Token murah β tugas murah. Verbosity adalah biaya tersembunyi.
Tabel Perbandingan Master
Angka independen = Artificial Analysis Intelligence Index v4.1.1 (max effort kecuali ditandai), 2 September 2026. Cost/task = USD per Intelligence Index task (measured).
Performa inti (inteligensi & biaya per tugas):
| Model | Lab | Intel | Cost/task |
|---|---|---|---|
| Claude Fable 5.1 (max) | Anthropic | 66 | $1,40 |
| Claude Opus 5 (max) | Anthropic | 63 | $2,34 |
| Claude Fable 5 (max) | Anthropic | 62 | $3,14 |
| GPT-5.6 Sol (max) | OpenAI | 61 | $0,95 |
| GPT-5.6 Terra (max) | OpenAI | 57 | $0,53 |
| GPT-5.6 Luna (max) | OpenAI | 52 | $0,21 |
| Grok 4.6 (high) | xAI | 61 | $0,84 |
| Gemini 3.7 Flash (high)* | 56 | $0,40 | |
| DeepSeek V4 Pro-0813 (max) | DeepSeek | 53 | $0,27 |
| DeepSeek V4 Flash (max) | DeepSeek | 52 | Belum diukur |
| GLM-5.3 (max) | Z.ai | 60 | $0,68 |
| GLM-5.3 Flash (max)** | Z.ai | 57 | $0,045 |
| Kimi K3 (max) | Moonshot | 60 | $0,84 |
| Qwen3.8 Max | Alibaba | 58 | $1,13 |
| MiniMax M3 | MiniMax | 45 | Belum diukur |
Harga API & ketersediaan (per 1M token, input/output):
| Model | Input/Output | Agentic | Open? |
|---|---|---|---|
| Claude Fable 5.1 | $10/$50 | 78 | Tidak |
| Claude Opus 5 | $5/$25 | 76 | Tidak |
| Claude Fable 5 | $10/$50 | 76 | Tidak |
| GPT-5.6 Sol | $4/$20 | 80 | Tidak |
| GPT-5.6 Terra | $2/$12 | 77 | Tidak |
| GPT-5.6 Luna | $0,5/$3 | 75 | Tidak |
| Grok 4.6 | $2/$6 | 72 | Tidak |
| Gemini 3.7 Flash | $0,75/$3,75 | 70 | Tidak |
| DeepSeek V4 Pro-0813 | $0,66/$1,98 | 70 | Ya (MIT) |
| DeepSeek V4 Flash | $0,22/$0,66 | 64 | Ya (MIT) |
| GLM-5.3 | $1,40/$4,40 | 74 | Segera |
| GLM-5.3 Flash | $0,15/$0,50 | 68 | Tidak |
| Kimi K3 | $3/$15 | 72 | Ya |
| Qwen3.8 Max | $2/$6 | 68 | API saja |
| MiniMax M3 | $0,30/$1,20 | 60 | Ya |
* Gemini 3.7 Flash = harga intro (naik setelah 1 Januari 2027). ** GLM-5.3 Flash $0,045 = angka vendor Z.ai dengan diskon, belum direplikasi independen penuh β perlakukan sebagai estimasi. Model dengan βBelum diukurβ tidak diberi angka karangan.
Ranking A: Termurah per Tugas Selesai
| # | Model | Intel | Cost/task |
|---|---|---|---|
| 1 | GLM-5.3 Flash* | 57 | $0,045 |
| 2 | GPT-5.6 Luna (max) | 52 | $0,21 |
| 3 | DeepSeek V4 Pro-0813 (max, off-peak) | 53 | $0,27 |
| 4 | Gemini 3.7 Flash (high, intro) | 56 | $0,40 |
| 5 | GPT-5.6 Terra (max) | 57 | $0,53 |
| 6 | GLM-5.3 (max) | 60 | $0,68 |
| 7 | Grok 4.6 (high) | 61 | $0,84 |
| 7 | Kimi K3 (max) | 60 | $0,84 |
| 9 | GPT-5.6 Sol (max) | 61 | $0,95 |
| 10 | Qwen3.8 Max | 58 | $1,13 |
| 11 | Claude Fable 5.1 | 66 | $1,40 |
| 12 | Claude Opus 5 | 63 | $2,34 |
| 13 | Claude Fable 5 | 62 | $3,14 |
* Vendor-reported. Termurah yang terukur independen: GPT-5.6 Luna $0,21.
Ranking B: Inteligensi Tertinggi
- Claude Fable 5.1 β 66
- Claude Opus 5 β 63
- Claude Fable 5 β 62
- GPT-5.6 Sol β 61
- Grok 4.6 β 61
- GLM-5.3 β 60
- Kimi K3 β 60
- Qwen3.8 Max β 58
- GPT-5.6 Terra β 57
- GLM-5.3 Flash β 57
- Gemini 3.7 Flash β 56
- DeepSeek V4 Pro-0813 β 53
- GPT-5.6 Luna β 52
- DeepSeek V4 Flash β 52
- MiniMax M3 β 45
Ranking C: Inteligensi per Dollar (heuristik: intel Γ· cost/task)
Bukan benchmark resmi β perhitungan penulis untuk efisiensi ekonomi.
- GLM-5.3 Flash β 1.267 poin/$ (vendor)
- GPT-5.6 Luna β 248 poin/$
- DeepSeek V4 Pro-0813 β 196 poin/$
- Gemini 3.7 Flash β 140 poin/$
- GPT-5.6 Terra β 108 poin/$
- GLM-5.3 β 88 poin/$
- Grok 4.6 β 73 poin/$
- Kimi K3 β 71 poin/$
- GPT-5.6 Sol β 64 poin/$
- Qwen3.8 Max β 51 poin/$
- Claude Fable 5.1 β 47 poin/$
- Claude Opus 5 β 27 poin/$
- Claude Fable 5 β 20 poin/$
Pareto Frontier: Model yang Layak Secara Ekonomi
Model A dominated jika ada model B yang lebih pintar (atau setara) dan lebih murah. Model yang tersisa (Pareto-efficient):
| Model | Intel | Cost/task |
|---|---|---|
| Claude Fable 5.1 | 66 | $1,40 |
| Grok 4.6 | 61 | $0,84 |
| GLM-5.3 | 60 | $0,68 |
| GLM-5.3 Flash | 57 | $0,045 |
Model yang dominated β sulit dibenarkan secara ekonomi (ada alternatif lebih murah & setara/lebih pintar):
- Claude Fable 5 (62, $3,14) β Fable 5.1 (66, $1,40) β lebih pintar, 2,2x lebih murah
- Claude Opus 5 (63, $2,34) β Fable 5.1 (66, $1,40) β lebih pintar, 1,7x lebih murah
- GPT-5.6 Sol (61, $0,95) β Grok 4.6 (61, $0,84) β setara, lebih murah
- GPT-5.6 Terra (57, $0,53) β Luna & Sol selalu di depan Terra di semua titik
- Kimi K3 (60, $0,84) β GLM-5.3 (60, $0,68) β setara, lebih murah
- Qwen3.8 Max (58, $1,13) β GLM-5.3 (60, $0,68) β lebih pintar, lebih murah
- Gemini 3.7 Flash (56, $0,40) β GLM-5.3 Flash (57, $0,045) β lebih pintar, jauh lebih murah*
- DeepSeek V4 Pro-0813 (53, $0,27) β GLM-5.3 Flash (57, $0,045) β lebih pintar, lebih murah*
- GPT-5.6 Luna (52, $0,21) β GLM-5.3 Flash (57, $0,045) β lebih pintar, lebih murah*
* Catatan penting: dominasi GLM-5.3 Flash bergantung pada angka $0,045 yang masih vendor-reported. Jika diabaikan (belum independen), GPT-5.6 Luna dan DeepSeek V4 Pro-0813 ikut naik ke frontier.
Ranking D: Kualitas Frontier per Dollar (intel β₯ 57)
- GLM-5.3 Flash (57, $0,045) β vendor
- GPT-5.6 Terra (57, $0,53)
- GLM-5.3 (60, $0,68)
- Grok 4.6 (61, $0,84)
- Kimi K3 (60, $0,84)
- GPT-5.6 Sol (61, $0,95)
- Qwen3.8 Max (58, $1,13)
- Claude Fable 5.1 (66, $1,40)
- Claude Opus 5 (63, $2,34)
- Claude Fable 5 (62, $3,14)
China vs US: Ekonomi Model Frontier
Gap inteligensi
- US teratas: Fable 5.1 (66), Opus 5 (63). China teratas: GLM-5.3 & Kimi K3 (60). Gap 3β6 poin.
- Di kelas open-weight, China (K3, GLM-5.3) hanya ~3 poin di belakang Opus 5 β gap kecil di skor agregat.
Gap biaya per tugas
| Model | Intel | Cost/task |
|---|---|---|
| Claude Opus 5 (US) | 63 | $2,34 |
| GLM-5.3 (China) | 60 | $0,68 |
| Kimi K3 (China) | 60 | $0,84 |
- β GLM-5.3 β 3,4Γ lebih murah untuk inteligensi 3 poin di bawah Opus 5
- β Kimi K3 β 2,8Γ lebih murah dari Opus 5
Perbandingan langsung
| GLM-5.3 (China) | Opus 5 (AS) | GPT-5.6 Sol (AS) | |
|---|---|---|---|
| Intel | 60 | 63 | 61 |
| Cost/task | $0,68 | $2,34 | $0,95 |
| Output $/1M | $4,40 | $25 | $20 |
β China β 3,4Γ lebih murah dari Opus 5 dan 1,4Γ lebih murah dari Sol, dengan gap inteligensi 1β3 poin.
Token efficiency
- GLM-5.3 paling boros: 170 juta token output untuk seluruh suite AA (median kelas 72 juta) β token murah tapi verbose.
- DeepSeek V4 Pro-0813 token-efisien: ~128 juta token untuk index, ~30% lebih hemat dari versi preview.
- Kimi K3 lambat (~37 token/detik) β murah per tugas tapi waktu tunggu lama.
Kesimpulan China vs US: model China terbaik (GLM-5.3) β 3,4Γ lebih murah per tugas selesai daripada model US dengan inteligensi paling mendekati (Opus 5), dengan gap hanya 3 poin. Tapi di puncak mutlak US masih unggul: Fable 5.1 (66) tak tertandingi China (maks 60).
Key Findings
- Token economics β task economics. GLM-5.3 (token murah) jadi $0,68/tugas karena verbose (170M token). GPT-5.6 Luna justru paling efisien.
- Model yang tampak murah tapi sebenarnya mahal: Claude Fable 5 ($3,14) dan Opus 5 ($2,34) β keduanya dikalahkan Fable 5.1 (lebih pintar, lebih murah).
- Open-weight China adalah value frontier: GLM-5.3 (60, $0,68), DS V4 Pro-0813 (53, $0,27), K3 (60, $0,84) β dekat Pareto frontier dengan lisensi terbuka.
- Tier OpenAI membingungkan: Luna (termurah) & Sol (termahal) sama-sama di Pareto; Terra di antaranya tidak pernah optimal β dikalahkan Luna & Sol di semua titik.
- Gemini 3.7 Flash adalah raja kecepatan (~340 token/detik, 4x Grok) dengan $0,40/tugas β tapi harga intro naik setelah Januari 2027.
- GLM-5.3 Flash ($0,045) mengubah peta β tapi masih vendor-reported, belum direplikasi independen.
Rekomendasi
- Satu model untuk semua kebutuhan (mixed workload): GPT-5.6 Luna (max) β AA 52, $0,21/tugas, agentic 75, cepat, konteks 1M. Value harian terbaik yang terukur independen.
- Coding/agentic kelas atas: GPT-5.6 Sol (max) β Coding Agent Index 80 (tertinggi), $0,95/tugas; atau Grok 4.6 (61, $0,84).
- Open-weight / self-host: DeepSeek V4 Pro-0813 (53, $0,27, MIT) atau GLM-5.3 (60, $0,68, weights segera).
- Kapabilitas mutlak tanpa pikir harga: Claude Fable 5.1 (66, $1,40).
- Budget ekstrem + mau API Z.ai: GLM-5.3 Flash ($0,045) β anggap vendor-claim sampai direplikasi independen.
Frontier AI Value Ranking β September 2026
Bobot: 40% cost per task Β· 30% inteligensi Β· 20% agentic/coding Β· 10% kecepatan. Skor adalah penilaian sintetis penulis, bukan angka resmi.
| Rank | Model | Intel | Cost/task |
|---|---|---|---|
| 1 | GPT-5.6 Luna (max) | 52 | $0,21 |
| 2 | GLM-5.3 (max) | 60 | $0,68 |
| 3 | GPT-5.6 Terra (max) | 57 | $0,53 |
| 4 | DeepSeek V4 Pro-0813 | 53 | $0,27 |
| 5 | GPT-5.6 Sol (max) | 61 | $0,95 |
| 6 | Grok 4.6 (high) | 61 | $0,84 |
| 7 | Gemini 3.7 Flash | 56 | $0,40 |
| 8 | Claude Fable 5.1 | 66 | $1,40 |
| 9 | Kimi K3 (max) | 60 | $0,84 |
| 10 | Claude Opus 5 | 63 | $2,34 |
Nilai & alasan tiap posisi:
- GPT-5.6 Luna (max) β Value 9,1: kombinasi termurah dari inteligensi + agentic yang terukur independen
- GLM-5.3 (max) β Value 8,5: frontier China termurah, 60 poin dengan $0,68
- GPT-5.6 Terra (max) β Value 8,2: murah & capable, tapi kalah value oleh Luna/Sol
- DeepSeek V4 Pro-0813 β Value 8,0: open-weight termurah, MIT, token-efisien
- GPT-5.6 Sol (max) β Value 7,8: agentic terbaik dengan harga menengah
- Grok 4.6 (high) β Value 7,7: intel tinggi, cost menengah, tapi lambat
- Gemini 3.7 Flash β Value 7,5: speed king + murah, tapi intro naik Jan 2027
- Claude Fable 5.1 β Value 7,3: terpintar mutlak, value menurun karena premium
- Kimi K3 (max) β Value 7,2: open-weight kuat, kalah GLM-5.3 di harga & kecepatan
- Claude Opus 5 β Value 6,0: terlalu mahal relatif Fable 5.1 β dominated
π Pemenang
- π Best Overall per Dollar: GPT-5.6 Luna (max) β inteligensi frontier pada $0,21/tugas, agentic 75, Pareto-efficient, terukur independen.
- π° Termurah yang Capable: GLM-5.3 Flash β AA 57 pada $0,045/tugas (vendor-reported). Alternatif independen termurah: GPT-5.6 Luna $0,21.
- π§ Performa Mutlak: Claude Fable 5.1 (max) β AA 66, #1 global, 3 poin di atas Opus 5.
Sumber
- Artificial Analysis β Claude Fable 5.1 skor 66 AA Intelligence Index (2 September 2026)
- Anthropic β Introducing Claude Fable 5.1 (1 September 2026)
- Artificial Analysis β GPT-5.6 Sol (max)
- Artificial Analysis β GPT-5.6 Terra (max)
- Artificial Analysis β artikel GPT-5.6 Sol/Luna di depan Terra (13 Juli 2026)
- Artificial Analysis β artikel GPT-5.6 benchmarks (9 Juli 2026)
- OpenAI β Advancing price-performance frontier with GPT-5.6
- Artificial Analysis β GLM-5.3 (max)
- Unite.ai β GLM-5.3 skor 60, matching Kimi K3 (18 Agustus 2026)
- Z.ai β GLM-5.3 Flash
- Artificial Analysis β DeepSeek V4 Pro-0813
- Codersera β Kimi K3 benchmarks vs Opus 5
- Olud.ai β The intelligence gap is 5%, price gap 3x
- Codingfleet β Grok 4.6 vs Gemini 3.7 Flash
- Artificial Analysis β Gemini 3.7 Flash vs Grok 4.6 comparison
- DeepSeek-V4-Pro-0813 Model Card β Hugging Face
- DeepSeek API Pricing (efektif 16 Agustus 2026)