AI Briefing
AI Briefing Publikasi Riset AI Indonesia

"We need more dialogue around the ethics and the principles that we can use for the engineers and companies that are building AI."

β€” Satya Nadella Β· CEO of Microsoft

Model AI Frontier Terbaik per Dolar: Ranking Efisiensi Biaya September 2026

Oleh Eko Hadi Murwanto Β· Β·
Model AI Frontier Terbaik per Dolar: Ranking Efisiensi Biaya September 2026

Pertanyaan yang paling sering salah dijawab di dunia AI: β€œmodel mana yang paling murah?” Harga API per juta token bukan ukuran yang tepat β€” karena model yang murah per token bisa jadi mahal per pekerjaan kalau outputnya boros. Ukuran yang benar adalah biaya per tugas yang selesai (cost per completed task).

Artikel ini membandingkan 16 model frontier global (AS dan China) dengan metric utama cost per Intelligence Index task dari Artificial Analysis β€” pengukuran independen yang memperhitungkan input, cache, reasoning, dan output token aktual per tugas. Angka vendor dan angka independen dipisahkan tegas. Data terkini per 2 September 2026.

Kenapa Harga Token Bisa Menipu

Artificial Analysis Intelligence Index v4.1.1 menggabungkan 9 evaluasi (GDPval-AA v2, Terminal-Bench v2.1, SciCode, Humanity’s Last Exam, GPQA Diamond, dan lainnya). Biaya per tugas dihitung dari token aktual yang dikonsumsi setiap model di tiap benchmark β€” termasuk input tanpa cache, cache hit, cache write, token reasoning, dan token jawaban β€” lalu dibagi jumlah tugas.

Contoh nyata: GLM-5.3 punya harga token murah ($1,40 input / $4,40 output per juta), tapi menghasilkan 170 juta token output untuk seluruh suite evaluasi β€” jauh di atas median kelas 72 juta. Hasilnya biaya per tugasnya $0,68, bukan yang termurah. Sebaliknya GPT-5.6 Luna dengan harga token paling rendah di keluarga OpenAI justru paling efisien: $0,21 per tugas.

Token murah β‰  tugas murah. Verbosity adalah biaya tersembunyi.

Tabel Perbandingan Master

Angka independen = Artificial Analysis Intelligence Index v4.1.1 (max effort kecuali ditandai), 2 September 2026. Cost/task = USD per Intelligence Index task (measured).

Performa inti (inteligensi & biaya per tugas):

ModelLabIntelCost/task
Claude Fable 5.1 (max)Anthropic66$1,40
Claude Opus 5 (max)Anthropic63$2,34
Claude Fable 5 (max)Anthropic62$3,14
GPT-5.6 Sol (max)OpenAI61$0,95
GPT-5.6 Terra (max)OpenAI57$0,53
GPT-5.6 Luna (max)OpenAI52$0,21
Grok 4.6 (high)xAI61$0,84
Gemini 3.7 Flash (high)*Google56$0,40
DeepSeek V4 Pro-0813 (max)DeepSeek53$0,27
DeepSeek V4 Flash (max)DeepSeek52Belum diukur
GLM-5.3 (max)Z.ai60$0,68
GLM-5.3 Flash (max)**Z.ai57$0,045
Kimi K3 (max)Moonshot60$0,84
Qwen3.8 MaxAlibaba58$1,13
MiniMax M3MiniMax45Belum diukur

Harga API & ketersediaan (per 1M token, input/output):

ModelInput/OutputAgenticOpen?
Claude Fable 5.1$10/$5078Tidak
Claude Opus 5$5/$2576Tidak
Claude Fable 5$10/$5076Tidak
GPT-5.6 Sol$4/$2080Tidak
GPT-5.6 Terra$2/$1277Tidak
GPT-5.6 Luna$0,5/$375Tidak
Grok 4.6$2/$672Tidak
Gemini 3.7 Flash$0,75/$3,7570Tidak
DeepSeek V4 Pro-0813$0,66/$1,9870Ya (MIT)
DeepSeek V4 Flash$0,22/$0,6664Ya (MIT)
GLM-5.3$1,40/$4,4074Segera
GLM-5.3 Flash$0,15/$0,5068Tidak
Kimi K3$3/$1572Ya
Qwen3.8 Max$2/$668API saja
MiniMax M3$0,30/$1,2060Ya

* Gemini 3.7 Flash = harga intro (naik setelah 1 Januari 2027). ** GLM-5.3 Flash $0,045 = angka vendor Z.ai dengan diskon, belum direplikasi independen penuh β€” perlakukan sebagai estimasi. Model dengan β€œBelum diukur” tidak diberi angka karangan.

Ranking A: Termurah per Tugas Selesai

#ModelIntelCost/task
1GLM-5.3 Flash*57$0,045
2GPT-5.6 Luna (max)52$0,21
3DeepSeek V4 Pro-0813 (max, off-peak)53$0,27
4Gemini 3.7 Flash (high, intro)56$0,40
5GPT-5.6 Terra (max)57$0,53
6GLM-5.3 (max)60$0,68
7Grok 4.6 (high)61$0,84
7Kimi K3 (max)60$0,84
9GPT-5.6 Sol (max)61$0,95
10Qwen3.8 Max58$1,13
11Claude Fable 5.166$1,40
12Claude Opus 563$2,34
13Claude Fable 562$3,14

* Vendor-reported. Termurah yang terukur independen: GPT-5.6 Luna $0,21.

Ranking B: Inteligensi Tertinggi

  1. Claude Fable 5.1 β€” 66
  2. Claude Opus 5 β€” 63
  3. Claude Fable 5 β€” 62
  4. GPT-5.6 Sol β€” 61
  5. Grok 4.6 β€” 61
  6. GLM-5.3 β€” 60
  7. Kimi K3 β€” 60
  8. Qwen3.8 Max β€” 58
  9. GPT-5.6 Terra β€” 57
  10. GLM-5.3 Flash β€” 57
  11. Gemini 3.7 Flash β€” 56
  12. DeepSeek V4 Pro-0813 β€” 53
  13. GPT-5.6 Luna β€” 52
  14. DeepSeek V4 Flash β€” 52
  15. MiniMax M3 β€” 45

Ranking C: Inteligensi per Dollar (heuristik: intel Γ· cost/task)

Bukan benchmark resmi β€” perhitungan penulis untuk efisiensi ekonomi.

  1. GLM-5.3 Flash β€” 1.267 poin/$ (vendor)
  2. GPT-5.6 Luna β€” 248 poin/$
  3. DeepSeek V4 Pro-0813 β€” 196 poin/$
  4. Gemini 3.7 Flash β€” 140 poin/$
  5. GPT-5.6 Terra β€” 108 poin/$
  6. GLM-5.3 β€” 88 poin/$
  7. Grok 4.6 β€” 73 poin/$
  8. Kimi K3 β€” 71 poin/$
  9. GPT-5.6 Sol β€” 64 poin/$
  10. Qwen3.8 Max β€” 51 poin/$
  11. Claude Fable 5.1 β€” 47 poin/$
  12. Claude Opus 5 β€” 27 poin/$
  13. Claude Fable 5 β€” 20 poin/$

Pareto Frontier: Model yang Layak Secara Ekonomi

Model A dominated jika ada model B yang lebih pintar (atau setara) dan lebih murah. Model yang tersisa (Pareto-efficient):

ModelIntelCost/task
Claude Fable 5.166$1,40
Grok 4.661$0,84
GLM-5.360$0,68
GLM-5.3 Flash57$0,045

Model yang dominated β€” sulit dibenarkan secara ekonomi (ada alternatif lebih murah & setara/lebih pintar):

  • Claude Fable 5 (62, $3,14) β†’ Fable 5.1 (66, $1,40) β€” lebih pintar, 2,2x lebih murah
  • Claude Opus 5 (63, $2,34) β†’ Fable 5.1 (66, $1,40) β€” lebih pintar, 1,7x lebih murah
  • GPT-5.6 Sol (61, $0,95) β†’ Grok 4.6 (61, $0,84) β€” setara, lebih murah
  • GPT-5.6 Terra (57, $0,53) β†’ Luna & Sol selalu di depan Terra di semua titik
  • Kimi K3 (60, $0,84) β†’ GLM-5.3 (60, $0,68) β€” setara, lebih murah
  • Qwen3.8 Max (58, $1,13) β†’ GLM-5.3 (60, $0,68) β€” lebih pintar, lebih murah
  • Gemini 3.7 Flash (56, $0,40) β†’ GLM-5.3 Flash (57, $0,045) β€” lebih pintar, jauh lebih murah*
  • DeepSeek V4 Pro-0813 (53, $0,27) β†’ GLM-5.3 Flash (57, $0,045) β€” lebih pintar, lebih murah*
  • GPT-5.6 Luna (52, $0,21) β†’ GLM-5.3 Flash (57, $0,045) β€” lebih pintar, lebih murah*

* Catatan penting: dominasi GLM-5.3 Flash bergantung pada angka $0,045 yang masih vendor-reported. Jika diabaikan (belum independen), GPT-5.6 Luna dan DeepSeek V4 Pro-0813 ikut naik ke frontier.

Ranking D: Kualitas Frontier per Dollar (intel β‰₯ 57)

  1. GLM-5.3 Flash (57, $0,045) β€” vendor
  2. GPT-5.6 Terra (57, $0,53)
  3. GLM-5.3 (60, $0,68)
  4. Grok 4.6 (61, $0,84)
  5. Kimi K3 (60, $0,84)
  6. GPT-5.6 Sol (61, $0,95)
  7. Qwen3.8 Max (58, $1,13)
  8. Claude Fable 5.1 (66, $1,40)
  9. Claude Opus 5 (63, $2,34)
  10. Claude Fable 5 (62, $3,14)

China vs US: Ekonomi Model Frontier

Gap inteligensi

  • US teratas: Fable 5.1 (66), Opus 5 (63). China teratas: GLM-5.3 & Kimi K3 (60). Gap 3–6 poin.
  • Di kelas open-weight, China (K3, GLM-5.3) hanya ~3 poin di belakang Opus 5 β€” gap kecil di skor agregat.

Gap biaya per tugas

ModelIntelCost/task
Claude Opus 5 (US)63$2,34
GLM-5.3 (China)60$0,68
Kimi K3 (China)60$0,84
  • β†’ GLM-5.3 β‰ˆ 3,4Γ— lebih murah untuk inteligensi 3 poin di bawah Opus 5
  • β†’ Kimi K3 β‰ˆ 2,8Γ— lebih murah dari Opus 5

Perbandingan langsung

GLM-5.3 (China)Opus 5 (AS)GPT-5.6 Sol (AS)
Intel606361
Cost/task$0,68$2,34$0,95
Output $/1M$4,40$25$20

β†’ China β‰ˆ 3,4Γ— lebih murah dari Opus 5 dan 1,4Γ— lebih murah dari Sol, dengan gap inteligensi 1–3 poin.

Token efficiency

  • GLM-5.3 paling boros: 170 juta token output untuk seluruh suite AA (median kelas 72 juta) β€” token murah tapi verbose.
  • DeepSeek V4 Pro-0813 token-efisien: ~128 juta token untuk index, ~30% lebih hemat dari versi preview.
  • Kimi K3 lambat (~37 token/detik) β€” murah per tugas tapi waktu tunggu lama.

Kesimpulan China vs US: model China terbaik (GLM-5.3) β‰ˆ 3,4Γ— lebih murah per tugas selesai daripada model US dengan inteligensi paling mendekati (Opus 5), dengan gap hanya 3 poin. Tapi di puncak mutlak US masih unggul: Fable 5.1 (66) tak tertandingi China (maks 60).

Key Findings

  1. Token economics β‰  task economics. GLM-5.3 (token murah) jadi $0,68/tugas karena verbose (170M token). GPT-5.6 Luna justru paling efisien.
  2. Model yang tampak murah tapi sebenarnya mahal: Claude Fable 5 ($3,14) dan Opus 5 ($2,34) β€” keduanya dikalahkan Fable 5.1 (lebih pintar, lebih murah).
  3. Open-weight China adalah value frontier: GLM-5.3 (60, $0,68), DS V4 Pro-0813 (53, $0,27), K3 (60, $0,84) β€” dekat Pareto frontier dengan lisensi terbuka.
  4. Tier OpenAI membingungkan: Luna (termurah) & Sol (termahal) sama-sama di Pareto; Terra di antaranya tidak pernah optimal β€” dikalahkan Luna & Sol di semua titik.
  5. Gemini 3.7 Flash adalah raja kecepatan (~340 token/detik, 4x Grok) dengan $0,40/tugas β€” tapi harga intro naik setelah Januari 2027.
  6. GLM-5.3 Flash ($0,045) mengubah peta β€” tapi masih vendor-reported, belum direplikasi independen.

Rekomendasi

  • Satu model untuk semua kebutuhan (mixed workload): GPT-5.6 Luna (max) β€” AA 52, $0,21/tugas, agentic 75, cepat, konteks 1M. Value harian terbaik yang terukur independen.
  • Coding/agentic kelas atas: GPT-5.6 Sol (max) β€” Coding Agent Index 80 (tertinggi), $0,95/tugas; atau Grok 4.6 (61, $0,84).
  • Open-weight / self-host: DeepSeek V4 Pro-0813 (53, $0,27, MIT) atau GLM-5.3 (60, $0,68, weights segera).
  • Kapabilitas mutlak tanpa pikir harga: Claude Fable 5.1 (66, $1,40).
  • Budget ekstrem + mau API Z.ai: GLM-5.3 Flash ($0,045) β€” anggap vendor-claim sampai direplikasi independen.

Frontier AI Value Ranking β€” September 2026

Bobot: 40% cost per task Β· 30% inteligensi Β· 20% agentic/coding Β· 10% kecepatan. Skor adalah penilaian sintetis penulis, bukan angka resmi.

RankModelIntelCost/task
1GPT-5.6 Luna (max)52$0,21
2GLM-5.3 (max)60$0,68
3GPT-5.6 Terra (max)57$0,53
4DeepSeek V4 Pro-081353$0,27
5GPT-5.6 Sol (max)61$0,95
6Grok 4.6 (high)61$0,84
7Gemini 3.7 Flash56$0,40
8Claude Fable 5.166$1,40
9Kimi K3 (max)60$0,84
10Claude Opus 563$2,34

Nilai & alasan tiap posisi:

  1. GPT-5.6 Luna (max) β€” Value 9,1: kombinasi termurah dari inteligensi + agentic yang terukur independen
  2. GLM-5.3 (max) β€” Value 8,5: frontier China termurah, 60 poin dengan $0,68
  3. GPT-5.6 Terra (max) β€” Value 8,2: murah & capable, tapi kalah value oleh Luna/Sol
  4. DeepSeek V4 Pro-0813 β€” Value 8,0: open-weight termurah, MIT, token-efisien
  5. GPT-5.6 Sol (max) β€” Value 7,8: agentic terbaik dengan harga menengah
  6. Grok 4.6 (high) β€” Value 7,7: intel tinggi, cost menengah, tapi lambat
  7. Gemini 3.7 Flash β€” Value 7,5: speed king + murah, tapi intro naik Jan 2027
  8. Claude Fable 5.1 β€” Value 7,3: terpintar mutlak, value menurun karena premium
  9. Kimi K3 (max) β€” Value 7,2: open-weight kuat, kalah GLM-5.3 di harga & kecepatan
  10. Claude Opus 5 β€” Value 6,0: terlalu mahal relatif Fable 5.1 β€” dominated

πŸ† Pemenang

  • πŸ† Best Overall per Dollar: GPT-5.6 Luna (max) β€” inteligensi frontier pada $0,21/tugas, agentic 75, Pareto-efficient, terukur independen.
  • πŸ’° Termurah yang Capable: GLM-5.3 Flash β€” AA 57 pada $0,045/tugas (vendor-reported). Alternatif independen termurah: GPT-5.6 Luna $0,21.
  • 🧠 Performa Mutlak: Claude Fable 5.1 (max) β€” AA 66, #1 global, 3 poin di atas Opus 5.

Sumber

  1. Artificial Analysis β€” Claude Fable 5.1 skor 66 AA Intelligence Index (2 September 2026)
  2. Anthropic β€” Introducing Claude Fable 5.1 (1 September 2026)
  3. Artificial Analysis β€” GPT-5.6 Sol (max)
  4. Artificial Analysis β€” GPT-5.6 Terra (max)
  5. Artificial Analysis β€” artikel GPT-5.6 Sol/Luna di depan Terra (13 Juli 2026)
  6. Artificial Analysis β€” artikel GPT-5.6 benchmarks (9 Juli 2026)
  7. OpenAI β€” Advancing price-performance frontier with GPT-5.6
  8. Artificial Analysis β€” GLM-5.3 (max)
  9. Unite.ai β€” GLM-5.3 skor 60, matching Kimi K3 (18 Agustus 2026)
  10. Z.ai β€” GLM-5.3 Flash
  11. Artificial Analysis β€” DeepSeek V4 Pro-0813
  12. Codersera β€” Kimi K3 benchmarks vs Opus 5
  13. Olud.ai β€” The intelligence gap is 5%, price gap 3x
  14. Codingfleet β€” Grok 4.6 vs Gemini 3.7 Flash
  15. Artificial Analysis β€” Gemini 3.7 Flash vs Grok 4.6 comparison
  16. DeepSeek-V4-Pro-0813 Model Card β€” Hugging Face
  17. DeepSeek API Pricing (efektif 16 Agustus 2026)
Bagikan artikel ini
Telegram WhatsApp Facebook X

Artikel Terkait

Claude Fable 5.1: Biaya Cache Turun 75%, Langsung Duduki Puncak Peringkat Kecerdasan

Claude Fable 5.1: Biaya Cache Turun 75%, Langsung Duduki Puncak Peringkat Kecerdasan

2 September 2026
Command Code GOAT vs Pro: Paket $10 atau $20, Mana yang Lebih Worth It?

Command Code GOAT vs Pro: Paket $10 atau $20, Mana yang Lebih Worth It?

2 September 2026
Fable 5.1 vs DeepSeek V4 Pro: Siapa Agen Coding Terbaik 2026?

Fable 5.1 vs DeepSeek V4 Pro: Siapa Agen Coding Terbaik 2026?

2 September 2026
← Kembali ke Beranda