AI Briefing
AI Briefing Publikasi Riset AI Indonesia

"We need to ask ourselves not only what computers can do, but what computers should do."

— Satya Nadella · CEO of Microsoft

Empat Model Frontier Rilis Beruntun: Perbandingan Kinerja dan Biaya Nyata

Oleh Eko Hadi Murwanto · ·
Empat Model Frontier Rilis Beruntun: Perbandingan Kinerja dan Biaya Nyata

Awal September 2026 menjadi pekan paling padat untuk rilis model AI frontier dalam setahun terakhir. Dalam empat hari berturut-turut, empat raksasa meluncurkan model terbaru mereka:

  • 1 September — Anthropic merilis Claude Fable 5.1
  • 2 September — Meta merilis Muse Spark 1.3 dan Google merilis Gemini 3.8 Flash
  • 3 September — OpenAI mengumumkan GPT-6 Astra

Artikel ini membandingkan keempatnya dari tiga sudut yang paling penting bagi developer: kemampuan coding, kemampuan agen (agentic), dan biaya nyata per tugas — bukan sekadar harga per token.

Sekilas Model dan Harga

ModelRilisInput $/1MOutput $/1MContext
GPT-6 Astra3 Sep$10$501.050.000
Claude Fable 5.11 Sep$10$501M
Muse Spark 1.32 Sep$1,25$4,251M
Gemini 3.8 Flash2 Sep$0,75$3,751M

Sumber: halaman resmi OpenAI, Anthropic, Meta, dan Google. Catatan: harga Gemini 3.8 Flash adalah harga perkenalan yang berlaku sampai 31 Desember 2026, setelah itu naik ke $1,50/$7,50. GPT-6 Astra masih dalam peluncuran bertahap — mulai dari pelanggan enterprise program Daybreak, lalu menyusul ChatGPT Plus/Pro/Business/Enterprise serta API dan AWS dalam beberapa hari.

Dua model pertama (Astra dan Fable 5.1) dibanderol identik: $10 input dan $50 output per juta token. Muse Spark 1.3 delapan kali lebih murah, dan Gemini 3.8 Flash lebih dari tiga belas kali lebih murah dari Astra untuk input.

Kemampuan Coding: Empat Model dalam Jarak Sangat Dekat

Hasil benchmark coding menunjukkan persaingan paling ketat yang pernah ada. Di DeepSWE v1.1, benchmark agentic coding jangka panjang yang menguji penyelesaian isu di repositori nyata, lima model berada dalam rentang dua poin:

  • Muse Spark 1.3: 75,4%
  • GPT-6 Astra: 74,1%
  • Gemini 3.8 Flash: 73,7–73,8%
  • Claude Opus 5 (generasi sebelumnya): 73,7–74,0%
  • Claude Fable 5.1: 67,4% (angka OpenAI; Anthropic tidak menerbitkan DeepSWE)

Angka-angka ini menunjukkan tanda-tanda saturasi — benchmark ini sudah tidak lagi memisahkan model frontier secara tegas.

Terminal-Bench 4.0, versi terbaru yang menguji agen di lingkungan terminal sungguhan, memberi gambaran sedikit berbeda:

ModelTerminal-Bench 4.0
Claude Mythos 5.1 (akses terbatas)60,9%
GPT-6 Astra57,7%
Claude Fable 5.155,8%
Claude Opus 552,3%
GPT-5.6 Sol37,3%

Di benchmark Terminal-Bench Science 0.1 (riset ilmiah agentic), Astra unggul telak: 64,6% berbanding 52,6% untuk Fable 5.1, dengan perkiraan biaya API sekitar 31% lebih rendah. GPT-5.6 Sol hanya mencapai 22,4%.

Indeks independen dari Artificial Analysis Coding Agent Index menempatkan Astra di angka 67 — sejajar dengan Opus 5 dan Muse Spark 1.3, sementara Fable 5.1 memimpin di angka 70. Perlu dicatat setiap model diuji dalam harness agen buatan vendor masing-masing (Codex untuk OpenAI, Claude Code untuk Anthropic, Muse Code untuk Meta), jadi angka ini mengukur kombinasi model plus agen, bukan model sendirian.

Kemampuan Agen: Computer Use dan Tugas Jangka Panjang

Untuk pekerjaan agen otonom, GPT-6 Astra menunjukkan keunggulan paling jelas di computer use — kemampuan mengoperasikan komputer seperti manusia:

  • OSWorld 2.0: Astra 72,6% dalam sekitar 40 menit per tugas, berbanding GPT-5.6 Sol 65,7% dalam sekitar 75 menit — hampir setengah waktu per tugas.
  • Agents’ Last Exam: Astra mencetak 59,3%, rekor tertinggi yang dilaporkan untuk tugas profesional kompleks di software sungguhan.
  • BrowseComp: Astra 91,5%, nyaris sama dengan Opus 5 (90,8%) dan Sol (90,4%).

Meta mengklaim Muse Spark 1.3 sangat efisien dalam tugas agen: 20% lebih sedikit panggilan alat dan 25% lebih sedikit token dibanding pendahulunya, serta memimpin benchmark Tau3-Banking (tool use percakapan) di angka 52% — terbaik di antara semua model yang diukur Artificial Analysis.

Satu keunggulan Astra yang sering luput dari perbandingan benchmark: efisiensi token. Artificial Analysis mengukur Astra memakai sepertiga token GPT-5.6 Sol dan seperlima token Opus 5 untuk tugas serupa di harness Codex. Ini penting untuk agen jangka panjang yang berjalan ribuan langkah — biaya token menumpuk cepat, dan model yang irit token bisa jadi jauh lebih murah secara total meski tarif per tokennnya tinggi.

Klaim Vendor vs Verifikasi Independen: Tiga Angka yang Perlu Dicermati

Riset ini menemukan tiga kasus di mana angka vendor berbeda drastis dari pengukuran independen:

1. ARC-AGI-3: 99,9% atau 62,7%? OpenAI mengklaim Astra “menjenuhkan” ARC-AGI-3 dengan skor 99,9%. ARC Prize Foundation (pembuat benchmark) mengonfirmasi angka itu hanya ketika memakai harness “Provider Adapter” khusus yang mempertahankan state penalaran internal OpenAI antar permintaan (biaya $19 ribu). Dengan Standard harness netral-provider yang dipakai untuk perbandingan antar-vendor, Astra mencetak 62,7% (biaya $26 ribu). ARC Prize menegaskan menjenuhkan ARC-AGI-3 bukan bukti AGI.

2. Intelligence Index: Astra tidak di depan. Artificial Analysis Intelligence Index menempatkan Astra di 61 — sama persis dengan GPT-5.6 Sol, lima poin di bawah Fable 5.1 (66) dan juga di bawah Muse Spark 1.3. Model ini bahkan mengalami regresi 2–3 poin di Tau3-Banking, SciCode, dan long-context reasoning dibanding pendahulunya. Keunggulan nyata Astra di indeks ini: tingkat halusinasi turun drastis dari 92% ke 51%.

3. SWE-bench Verified: belum ada angka untuk Astra. OpenAI tidak menerbitkan skor SWE-bench Verified untuk Astra hingga artikel ini ditulis. Pesaingnya sudah punya: Opus 5 di 97%, DeepSeek V4 Pro 96,4%, GPT-5.6 Sol 96,2%. Ketiadaan ini penting karena SWE-bench Verified adalah tolok ukur yang paling banyak dipakai praktisi untuk membandingkan kemampuan coding antar model.

Biaya per Tugas: Temuan Paling Penting

Harga per token saja menyesatkan. Ukuran yang lebih adil adalah biaya untuk menyelesaikan satu tugas di benchmark yang sama. Artificial Analysis mengukur biaya per tugas Intelligence Index untuk semua model:

ModelSkor AABiaya per tugas
Muse Spark 1.3 (xhigh)61$0,55
Gemini 3.8 Flash (high)59$0,58
GLM-5.3 (max)60$0,68
Grok 4.6 (high)61$0,94
GPT-5.6 Sol (max)61$0,95
Claude Opus 5 (high)~61$1,23
Claude Fable 5.1 (max)66$3,69

Angka-angka ini konsisten dengan cerita harga: Muse Spark 1.3 adalah model dengan skor 59+ yang paling murah per tugas ($0,55), sementara Fable 5.1 — meski memimpin indeks — memakan biaya $3,69 per tugas, sekitar 6–7 kali lipat Muse Spark.

Posisi Astra perlu dibaca hati-hati. Artificial Analysis menemukan bahwa meski Astra memakai jauh lebih sedikit token daripada Sol (~10% lebih hemat di max effort), harga per tokennnya yang 2,5 kali lebih tinggi membuat biaya per tugasnya di Intelligence Index sekitar 75% lebih mahal dari Sol. Namun di Coding Agent Index, ceritanya berbalik: efisiensi token Astra yang ekstrem (sepertiga token Sol di harness Codex) membuat biaya per tugasnya (max effort) kira-kira sama dengan Sol, sambil mencetak skor 2 poin lebih tinggi — dan kurang dari separuh biaya Fable 5 untuk skor yang setara. OpenAI mengklaim hal serupa untuk Terminal-Bench 4.0: biaya per tugas Astra sekitar 9% di bawah Sol dan 63% di bawah Fable 5.1.

Dua pelajaran praktis:

  1. Jangan pilih model hanya dari harga per token. Astra ($10/$50) dan Fable 5.1 ($10/$50) sama-sama mahal per token, tapi perilaku tokennya sangat berbeda — Astra hemat, Fable 5.1 boros (hingga 140 juta token output pada workload berat menurut Crypto Briefing). Untuk agen jangka panjang, model hemat token bisa jauh lebih murah secara total.

  2. Cache read mengubah segalanya untuk workload repetitif. Fable 5.1 menurunkan harga cache read 75% menjadi $0,25 per juta token — ini membuatnya menarik untuk tugas berulang dengan konteks besar yang bisa di-cache. Muse Spark 1.3 menawarkan tier contributor $0,10/$0,20 per juta token (dengan konsekuensi data pengguna dipakai untuk meningkatkan model).

Jika performa per dollar adalah prioritas utama, Muse Spark 1.3 dan Gemini 3.8 Flash berada di liga berbeda. Muse Spark 1.3 menawarkan DeepSWE tertinggi (75,4%) dengan harga 1/8 harga Astra. Gemini 3.8 Flash, dengan harga perkenalan $0,75/$3,75, mencapai DeepSWE 73,8% — hampir menyamai Opus 5 yang harganya tujuh kali lipat.

Verdict untuk Developer

Kualitas tertinggi untuk coding (hari ini): Claude Fable 5.1 — memimpin Coding Agent Index (70) dan Intelligence Index (66). Tapi siapkan budget: ini model frontier termahal per tugas ($3,69).

Agen otonom jangka panjang & computer use: GPT-6 Astra — OSWorld 72,6%, Agents’ Last Exam 59,3%, dan efisiensi token terbaik di kelasnya. Tunggu ketersediaan API luas dan verifikasi independen tambahan (terutama SWE-bench Verified) sebelum migrasi besar-besaran.

Nilai terbaik (performance per dollar): Muse Spark 1.3 — DeepSWE tertinggi, harga 1/8 Astra, dan Tau3-Banking terbaik. Gemini 3.8 Flash adalah alternatif termurah dengan performa coding kompetitif, selama memanfaatkan harga perkenalan sebelum Januari 2027.

Volume tinggi dengan budget ketat: DeepSeek V4 Pro (di luar empat besar, $0,66 per juta input off-peak, SWE-bench Verified 96,4%, lisensi MIT) tetap juara nilai untuk workload coding berskala besar.

Satu catatan penutup: semua angka benchmark vendor di artikel ini adalah klaim masing-masing perusahaan dan belum tentu komparabel antar-harness. Artificial Analysis dan ARC Prize adalah pengecualian — keduanya menjalankan evaluasi independen dengan metodologi konsisten. Untuk keputusan produksi, ukur model dengan dataset sendiri sebelum berkomitmen.

Pembaruan Verifikasi Lanjutan (4 September)

Setelah riset awal artikel ini, verifikasi lanjutan terhadap dokumen teknis resmi dan leaderboard independen menemukan beberapa fakta baru yang memperhalus — dan sekali mengoreksi — gambaran di atas.

Spesifikasi resmi Astra lebih presisi dari “1M”. OpenAI API docs menyebut context window 1.050.000 token, max output 128.000 token, knowledge cutoff 30 April 2026, dan cache write $12,50 per 1M (1,25× input). Yang paling penting untuk pengguna agen jangka panjang: prompt dengan lebih dari 272K token input ditagih 2× tarif input/cache dan 1,5× tarif output untuk seluruh request — bukan hanya kelebihannya. Melewati ambang itu, tarif efektif Astra menjadi $20 input dan $75 output per 1M. Sebagai pembanding, Fable 5.1 memakai tarif standar di seluruh jendela 1M-nya tanpa surcharge, dan cache read-nya ($0,25) empat kali lebih murah dari Astra ($1,00). Untuk agent yang context-nya tumbuh melewati 272K, ini bukan selisih kecil — ini penggandaan biaya diam-diam di tengah run.

Epoch Capabilities Index menempatkan Astra #1. Epoch AI memberi Astra skor 169 — peringkat 1 dari 267 model (interval kepercayaan 165–174), rekor tertinggi yang pernah dicatat. Ini kontras dengan AA Intelligence Index yang menempatkan Astra di 61, setara GPT-5.6 Sol. Kedua indeks menimbang benchmark yang berbeda; keduanya benar. Epoch melihat Astra sebagai model paling mampu yang pernah diukur; AA melihatnya tidak lebih unggul dari Sol secara agregat — perbedaan itu sendiri informatif.

Efisiensi Astra hanya berlaku di effort tertentu. Artificial Analysis mempublikasikan biaya per tugas per level reasoning Astra: low 57 poin @ $0,46/tugas, medium 59 @ $0,75, high 60 @ $0,96, xhigh 61 @ $1,20, max 61 @ $1,67. Empat poin terakhir (57→61) menelan biaya 3,6× lebih besar. Mengingat API default Astra adalah low (bukan max), effort routing — low sebagai default, naik hanya saat task gagal — adalah penghematan biaya terbesar yang bisa dilakukan tanpa mengganti model.

Astra belum muncul di leaderboard coding independen mana pun. Per 4 September, Terminal-Bench 4.0 (Snorkel) dan OSWorld 2.0 (BenchLM) belum memuat Astra. Di Terminal-Bench 4.0 independen, yang terverifikasi pihak ketiga justru Claude Opus 5 di 51,8% ±3,4 — peringkat 1; klaim 57,7% Astra masih vendor-reported dan belum direproduksi. Di OSWorld 2.0 independen (snapshot 18 Agustus, 15 model), Opus 5 memimpin di 70,6%; klaim 72,6% Astra belum diverifikasi. Satu-satunya pengukuran independen Astra yang sudah ada adalah Artificial Analysis (Coding Agent Index 67, Intelligence Index 61) dan Epoch ECI (169).

Satu baris akademik yang dimenangkan Fable 5.1. Pada Humanity’s Last Exam dengan tools, Fable 5.1 mencetak 65,0% berbanding Astra 57,2% — salah satu dari sedikit baris di tabel OpenAI sendiri di mana model Anthropic menang.

Model yang TIDAK rilis di jendela ini. Moonshot/Kimi (K3 rilis 16 Juli), MiniMax (M3 rilis 31 Mei), Mistral, Amazon, dan Cohere tidak merilis model baru di Agustus–September 2026. iFlytek Spark X2.5 dijadwalkan 7 September — setelah cutoff riset ini.

Catatan koreksi pada dokumen riset lain: sebagian laporan menempatkan Muse Spark 1.3 di 66,9% pada tabel “OSWorld independen” — itu keliru; 66,9% adalah klaim vendor Meta dari methodology card-nya, bukan dari leaderboard independen BenchLM yang hanya memuat Opus 5 (70,6%), Sol (62,6%), dan Terra (50,2%) di tiga besar.

Sumber

  1. OpenAI — “GPT-6 Astra: A new generation of intelligence” (3 September 2026)
  2. OpenAI — “Path to Astra: critical capabilities and frontier safeguards” (1 September 2026)
  3. Artificial Analysis — “Benchmarking GPT-6 Astra” (3 September 2026)
  4. ARC Prize — “OpenAI’s GPT-6 Astra on ARC-AGI-3” (3 September 2026)
  5. The Verge — “OpenAI’s next big AI model has ‘entered the AGI era’” (3 September 2026)
  6. Anthropic — “Introducing Claude Fable 5.1 and Claude Mythos 5.1” (1 September 2026)
  7. CNBC — “OpenAI begins rolling out Astra model” (3 September 2026)
  8. Axios — “Meta debuts Muse Spark 1.3 as personal agent work continues” (2 September 2026)
  9. AI Stock Wire — “Zuckerberg: Meta Muse Spark 1.3 ‘almost too cheap to meter’” (2 September 2026)
  10. Fello AI — “Gemini 3.8 Flash: Benchmarks, Pricing and What the Headlines Got Wrong” (September 2026)
  11. OfficeChai — “These Are The Official OpenAI GPT-6 Astra Benchmarks” (3 September 2026)
  12. OpenLM — “SWE-bench + Leaderboard” (diakses 4 September 2026)
  13. Crypto Briefing — “Claude Fable 5.1 tops Intelligence Index, costs 20% more per task” (2 September 2026)
  14. Artificial Analysis — “Muse Spark 1.3: Meta reaches the frontier” (2 September 2026)
  15. OpenAI API Docs — “GPT-6 Astra Model” (diakses 4 September 2026)
  16. Epoch AI — “GPT-6 Astra” (Epoch Capabilities Index) (diakses 4 September 2026)
  17. Artificial Analysis — “GPT-6 Astra: Release Intelligence, Performance & Price” (diakses 4 September 2026)
  18. Anthropic Platform Docs — “What’s new in Claude Fable 5.1” (diakses 4 September 2026)
  19. Snorkel AI — “Terminal-Bench 4.0 Leaderboard” (diakses 4 September 2026)
  20. BenchLM — “OSWorld 2.0 Leaderboard & Scores” (diakses 4 September 2026)
Bagikan artikel ini
Telegram WhatsApp Facebook X

Artikel Terkait

Meta Rilis Muse Spark 1.3: Model Coding yang Menempel Ketat di GPT-5.6 dan Opus 5

Meta Rilis Muse Spark 1.3: Model Coding yang Menempel Ketat di GPT-5.6 dan Opus 5

4 September 2026
Gemini 3.8 Flash vs Fable 5.1: Model Coding, Keamanan Siber, dan Testing Terbaik September 2026

Gemini 3.8 Flash vs Fable 5.1: Model Coding, Keamanan Siber, dan Testing Terbaik September 2026

3 September 2026
Claude Fable 5.1: Biaya Cache Turun 75%, Langsung Duduki Puncak Peringkat Kecerdasan

Claude Fable 5.1: Biaya Cache Turun 75%, Langsung Duduki Puncak Peringkat Kecerdasan

2 September 2026
← Kembali ke Beranda