Gemini 3.8 Flash vs Fable 5.1: Model Coding, Keamanan Siber, dan Testing Terbaik September 2026
Dua rilis besar mengguncang dunia coding AI dalam dua hari: Claude Fable 5.1 dari Anthropic (1 September 2026) dan Gemini 3.8 Flash dari Google (2 September 2026). Hari yang sama dengan Gemini, Meta ikut merilis Muse Spark 1.3 — yang sering luput dari pemberitaan padahal hasil benchmark-nya setara GPT-5.6 Sol.
Pertanyaannya: model mana yang terbaik untuk programming, dan mana yang paling murah per tugas yang selesai — bukan per juta token? Artikel ini menjawabnya dengan memisahkan tegas angka independen, klaim vendor, dan estimasi. Data terkini per 3 September 2026.
Yang Perlu Diketahui: Dua Rilis Baru + Satu yang Terlewat
Gemini 3.8 Flash adalah model Flash ketiga Google dalam enam minggu (setelah 3.6 dan 3.7 Flash), dirilis 2 September 2026 — bukan 3 September. Model ini membawa konteks 1 juta token, output maksimal 64 ribu token, input multimodal (teks, gambar, audio, video), dan tiga tingkat effort: low, medium (default), dan high.
Claude Fable 5.1 rilis sehari lebih dulu, 1 September 2026, sebagai model frontier terbaru Anthropic dengan konteks 1 juta token dan output hingga 128 ribu token. Ini satu set bobot dengan Claude Mythos 5.1 (khusus mitra terverifikasi); bedanya hanya pada lapisan pengaman.
Meta meluncurkan Muse Spark 1.3 pada 2 September 2026 — hari yang sama dengan Gemini — langsung masuk Muse Code dan API Meta. Model ini layak masuk radar: di Artificial Analysis Intelligence Index ia mencetak 61, setara GPT-5.6 Sol, dan biaya per tugasnya jauh lebih rendah.
Skor Independen: DeepSWE v1.1 (Long-Horizon Software Engineering)
DeepSWE v1.1 adalah benchmark paling relevan untuk pekerjaan software engineering panjang: 113 tugas dari 91 repositori, dirancang anti-kontaminasi, semua model dijalankan dengan harness mini-swe-agent yang sama. Angka di bawah ini independen, diukur leaderboard DeepSWE per 2 September 2026.
| Model (effort) | Skor | Biaya per tugas |
|---|---|---|
| Gemini 3.8 Flash (high) | 74% ±1 | $2,36 |
| Claude Opus 5 (max) | 74% ±4 | $11,84 |
| GPT-5.6 Sol (max) | 73% ±3 | $6,46 |
| Claude Fable 5 (max) | 70% ±4 | $21,63 |
| GLM-5.3 (max) | 69% ±3 | $3,99 |
| Kimi K3 (max) | 69% ±5 | $4,65 |
| GPT-5.6 Luna (max) | 67% ±4 | $0,61 |
| DeepSeek V4 Pro (max) | 63% ±6 | $1,67 |
Kabar besarnya: Gemini 3.8 Flash menyamai Claude Opus 5 (74%) — model yang harganya sekitar tujuh kali lebih mahal per token — sambil menghabiskan biaya per percobaan hanya seperlimanya ($2,36 vs $11,84). GPT-5.6 Sol tertinggal satu poin dengan biaya hampir tiga kali lipat ($6,46 vs $2,36).
Catatan penting: Claude Fable 5.1 belum ada di papan ini karena baru rilis 1 September, satu hari sebelum pembaruan papan. Skor DeepSWE Fable 5.1 sejauh ini hanya klaim vendor Anthropic (system card) — belum direplikasi pihak independen. Angka Muse Spark 1.3 di DeepSWE juga baru dari klaim Meta.
Perbandingan yang adil hari ini: Gemini 3.8 Flash = 74% (independen), Fable 5.1 = belum terverifikasi independen, Opus 5 = 74% (independen), Muse Spark 1.3 = belum terverifikasi.
Skor Independen: Artificial Analysis Intelligence Index
Artificial Analysis mengukur model dengan harness seragam (Intelligence Index v4.1.1) — paling adil untuk perbandingan relatif. Angka di bawah ini independen, diakses 3 September 2026, effort tinggi/max.
| Model | Skor intel | Biaya per tugas |
|---|---|---|
| Claude Fable 5.1 (max + fallback) | 66 | $1,40 |
| Claude Opus 5 (max) | 63 | $2,34 |
| Muse Spark 1.3 (xhigh) | 61 | $0,55 |
| GPT-5.6 Sol (max) | 61 | $0,95 |
| Grok 4.6 (high) | 61 | $0,84 |
| GLM-5.3 (max) | 60 | $0,68 |
| Gemini 3.8 Flash (high) | 59 | $0,58 |
| GPT-5.6 Luna (max) | 52 | $0,21 |
| DeepSeek V4 Pro (max) | 53 | $0,27 |
Gemini 3.8 Flash naik tiga poin dari pendahulunya (3.7 Flash: 56) dan kini duduk di peringkat 59 — di belakang Fable 5.1 (66) dan Opus 5 (63), tapi di atas GPT-5.6 Sol (61) hanya tertinggal dua poin. Biaya per tugasnya $0,58 — sekitar seperenam biaya Fable 5.1 untuk selisih tujuh poin inteligensi.
Kenaikan biaya per tugas Gemini (dari $0,40 di 3.7 Flash ke $0,58) berasal dari perilaku model yang “bekerja lebih keras”: output token rata-rata per tugas naik 30% menjadi 48 ribu token. Google sendiri mengakui model ini bisa boros token di effort tinggi, dan tetap mendukung 3.7 Flash untuk tim yang mengejar efisiensi komputasi.
Kecepatan: Keunggulan Terbesar Gemini 3.8 Flash
Gemini 3.8 Flash menghasilkan 302–305 token per detik (Artificial Analysis) — sekitar dua kali model tercepat berikutnya dan lima kali lebih cepat dari Claude. Waktu jawaban pertama bisa 0,7 detik di effort rendah.
| Model | Kecepatan output (token/dtk) |
|---|---|
| Gemini 3.8 Flash | 302–305 |
| Muse Spark 1.3 | ~84 (OpenRouter) |
| Claude Fable 5.1 | ~66 |
| GPT-5.6 Sol | ~49–73 |
| Claude Opus 5 | ~56 |
Bagi pengembang, kecepatan ini berarti: autocomplete dan coding chat terasa instan, loop debugging jauh lebih singkat, dan agen coding bisa menyelesaikan lebih banyak iterasi per jam. Gemini 3.8 Flash juga unggul di konteks 1 juta token — seluruh repositori bisa masuk satu sesi.
Harga API Resmi per 3 September 2026
| Model | Input $/jt token | Cache $/jt | Output $/jt |
|---|---|---|---|
| Gemini 3.8 Flash | $0,75 | $0,075 | $3,75 |
| Claude Fable 5.1 | $10 | $0,25 | $50 |
| Claude Opus 5 | $5 | $0,50 | $25 |
| GPT-5.6 Sol | $4 | $0,40 | $20 |
| Muse Spark 1.3 | $1,25 | $0,15 | $4,25 |
| DeepSeek V4 Pro | $0,66 | $0,022 | $1,98 |
| GLM-5.3 | $1,40 | $0,26 | $4,40 |
| GPT-5.6 Luna | $0,50 | $0,05 | $3 |
Gemini 3.8 Flash: $0,75 input / $3,75 output per juta token — harga promo hingga 31 Desember 2026, lalu naik dua kali lipat menjadi $1,50/$7,50. Cache read-nya $0,075 (diskon 90%). Claude Fable 5.1 justru memangkas harga cache read 75% menjadi $0,25 (dari $1,00) — langkah penting untuk agen yang membaca ulang konteks repositori besar. DeepSeek V4 Pro menawarkan cache termurah ($0,022, diskon 97%) dengan harga off-peak.
Harga token ≠ biaya per tugas. Model yang outputnya boros bisa lebih mahal meski harga tokennya murah. Contoh nyata: Artificial Analysis mencatat Fable 5.1 di effort max menghasilkan sekitar 1,7 kali token output Fable 5 — sehingga biaya per tugas Intelligence Index-nya ($3,69) justru lebih tinggi daripada Fable 5 ($3,14) meski cache read-nya turun 75%.
Estimasi Biaya per Tugas yang Selesai
Biaya nyata sebuah tugas coding tidak bisa dihitung hanya dari harga token — tergantung seberapa banyak token yang dipakai model (ada yang boros, ada yang hemat) dan seberapa sering berhasil dalam sekali percobaan. Dua angka terukur dari Artificial Analysis (independen) paling berguna di sini:
| Model | Skor intel | Biaya per tugas AA |
|---|---|---|
| Claude Fable 5.1 (max + fallback) | 66 | $3,69 |
| Claude Opus 5 (max) | 63 | $2,34 |
| Gemini 3.8 Flash (high) | 59 | $0,58 |
| GPT-5.6 Sol (max) | 61 | $0,95 |
| GPT-5.6 Luna (max) | 52 | $0,21 |
Biaya per tugas Artificial Analysis dihitung dari token aktual yang dikonsumsi setiap model di seluruh evaluasi — termasuk input tanpa cache, cache hit, reasoning, dan output — lalu dibagi jumlah tugas. Ini angka pengukuran, bukan simulasi.
Catatan angka Fable 5.1: $3,69 adalah biaya per tugas untuk konfigurasi max dengan fallback — konfigurasi yang sama dengan skor 66 yang dipakai di artikel ini. Konfigurasi max murni tanpa fallback lebih murah per tugas, tapi skor inteligensinya juga berbeda.
Kekuatan dan Kelemahan Masing-Masing
Gemini 3.8 Flash
- Kelebihan: skor DeepSWE setara Opus 5 dengan biaya seperlima; kecepatan 300+ token/detik; konteks 1 juta; harga promo murah
- Kekurangan: kalah telak di tugas agen umum terbuka (Terminal-Bench 4.0: 19,1% vs Opus 5 51,8%); computer use tertinggal (OSWorld 59,0 vs 75,4); boros token di effort tinggi; harga naik dua kali lipat mulai Januari 2027
Claude Fable 5.1
- Kelebihan: inteligensi tertinggi (AA 66); unggul di long-horizon agentic; cache read murah ($0,25); output hingga 128 ribu token
- Kekurangan: termahal per tugas selesai; output boros di effort max; bukti independen masih minim (baru rilis 1 September)
GPT-5.6 Sol
- Kelebihan: Coding Agent Index 80 (tertinggi, klaim OpenAI); token-efisien; dukungan multi-agent
- Kekurangan: harga masih tinggi; kecepatan sedang; skor DeepSWE tertinggal satu poin dari Gemini 3.8 Flash dengan biaya hampir tiga kali lipat
Muse Spark 1.3
- Kelebihan: skor AA 61 setara GPT-5.6 Sol dengan biaya per tugas $0,55 (seperlima harga Fable 5.1); 25% lebih hemat token dari versi 1.2
- Kekurangan: skor DeepSWE 75,4 masih klaim vendor; ekosistem alat masih muda; belum terbukti di penerapan skala besar
Rekomendasi
Developer individu: Gemini 3.8 Flash — gratis dicoba di AI Studio, murah ($0,75/$3,75), cepat, dan cukup cerdas untuk sebagian besar pekerjaan coding. Pilih Claude Sonnet 5 atau Fable 5.1 hanya jika butuh kualitas maksimal di tugas paling sulit.
Startup dengan anggaran ketat: Gemini 3.8 Flash sebagai model utama, DeepSeek V4 Pro atau GLM-5.3 untuk volume tinggi. Hemat hingga 10 kali lipat dibanding Fable 5.1 tanpa kehilangan banyak kemampuan.
Perusahaan coding agent: GPT-5.6 Sol (Coding Agent Index 80) atau Claude Fable 5.1 (cache read $0,25 memangkas biaya sesi panjang). Gemini 3.8 Flash layak menjadi tier murah produk Anda.
Beban kerja API volume tinggi: GLM-5.3 Flash ($0,15/$0,50 per juta token) atau DeepSeek V4 Flash ($0,22/$0,66) — keduanya tetap kompetitif di benchmark terminal (klaim vendor masing-masing).
Mengejar inteligensi coding maksimal: Claude Fable 5.1 untuk kualitas tertinggi, GPT-5.6 Sol jika fokus pada metrik coding agent murni. Sadari biayanya: Fable 5.1 bisa menghabiskan $10+ per tugas SWE agentik.
Cybersecurity: CWE-Bench, CyberGym & Vals CyberBench
Keamanan siber punya benchmark khusus yang mengukur kemampuan ujung-ke-ujung: menemukan kerentanan di kode nyata, membuat patch yang benar, dan memastikan tidak merusak fungsi lain. Tiga yang paling relevan September 2026:
CWE-bench (Collinear AI, dievaluasi independen oleh Artificial Analysis) — 100 task audit-dan-perbaiki dari repositori open-source nyata, 54 CWE, 6 bahasa. Agen diberi repo + instruksi “audit dan perbaiki”, tanpa tahu kerentanan apa yang ada. Skor hanya dihitung jika eksploit terbukti tidak lagi berfungsi DAN semua regression test lolos — tanpa kredit parsial, verifier programatik deterministik. 22 dari 100 task belum terpecahkan model mana pun. Ini benchmark remediasi paling ketat dan anti-kontaminasi (set pengujian dirahasiakan).
Skor CWE-bench (independen, Artificial Analysis):
| Model (effort tinggi) | Harness | Pass@1 | Biaya per percobaan |
|---|---|---|---|
| Claude Fable 5 | Claude Code | 47,8% | $10,27 |
| Gemini 3.8 Flash Cyber | Antigravity | 47,2% | $3,64 |
| GPT-5.6 Sol | Codex | 44,2% | $2,29 |
| Gemini 3.7 Flash | Antigravity | 44,0% | $1,43 |
| Claude Opus 4.8 | Claude Code | 42,0% | $2,43 |
| Grok 4.6 | grok-cli | 38,2% | $1,77 |
| Qwen3.8-Max | opencode | 37,5% | $1,45 |
| Hy4 preview (Tencent) | opencode | 33,8% | $0,75 |
| GLM-5.3 | opencode | 31,1% | $1,86 |
| DeepSeek V4 Flash | opencode | 30,4% | $0,13 |
| Kimi K3 | opencode | 22,5% | $1,18 |
Catatan penting: Gemini 3.8 Flash Cyber (47,2%) berada di Pareto frontier — hampir menyamai Claude Fable 5 (47,8%) dengan biaya sepertiganya. Namun model ini tidak tersedia publik: hanya lewat program Fairwind Google untuk pemerintah, operator infrastruktur kritis, dan maintainer terverifikasi. Claude Fable 5.1 juga belum dievaluasi di CWE-bench (rilis 1 September, setelah pembaruan papan).
CyberGym (benchmark reproduksi kerentanan OSS-Fuzz, 1.507 instance) — papan publik per 1 September 2026: Fugu Cyber (Sakana AI) 86,9%, GPT-5.6 Sol 84,5%, GLM-5.3 84,5% (model China open-weight setara Sol), Claude Mythos 5 83,8%, DeepSeek V4 Pro 83,3%. Google mengklaim 3.8 Flash Cyber melampaui “model frontier yang jauh lebih besar” di benchmark internal (86,2%). CyberGym mengukur reproduksi kerentanan (buat PoC), bukan pembuatan patch.
- Vals CyberBench (independen, harness mini-swe-agent, 60 task pasca-CyberGym): track PoC dipimpin GPT-5.6 Sol (93,2%); track Patch dipimpin Gemini 3.6 Flash (84,7%). Papan gabungan: GPT-5.6 Sol 88,1%, Luna 83,9%, GPT-5.5 80,5%, Kimi K3 79,0%, DeepSeek V4 Pro 68,6%. Peringatan metodologi: model Anthropic (Fable 5, Opus 5) menolak hampir semua task PoC karena safeguard — skor rendah mereka di benchmark ini mencerminkan kebijakan pengaman, bukan kemampuan.
Akses adalah segalanya: Gemini 3.8 Flash Cyber dan Claude Mythos 5.1 (yang di balik skor cyber tertinggi) hanya untuk mitra terverifikasi (Fairwind/Glasswing). Untuk pengguna API biasa, model yang tersedia dengan kemampuan keamanan terbaik adalah Fable 5.1 (kini diizinkan mencari kerentanan di source code semua tier akses) dan GPT-5.6 Sol.
Yang belum terukur: precision/false-positive lintas-model tidak diukur independen. Klaim vendor: false-positive cyber Fable 5.1 turun 60%; Wiz mengukur recall Gemini 3.8 Flash Cyber +7,5–9,7% dengan biaya 2,3–5,2x lebih rendah. Model recall tinggi tapi FP tinggi tidak otomatis model security terbaik — belum ada data independen untuk memisahkannya.
Software Testing & QA
Tidak ada benchmark test-generation frontier yang independen dan terverifikasi per September 2026 — celah data yang jujur. Penilaian di bawah adalah proksi dari kemampuan coding, agentic, tool use, dan reliability, bukan angka benchmark.
Proksi terbaik yang tersedia:
- Terminal-Bench 2.1 (vendor Google): Gemini 3.8 Flash 89,4% di halaman pengumuman — developer guide Google memuat angka lain yang konfigurasinya tidak dijelaskan (jangan dirata-rata). Pembanding 3.7 Flash: 85,8%
- Terminal-Bench 4.0 (vendor Anthropic): Fable 5.1 55,8% vs Fable 5 42,0%; Mythos 5.1 60,9% (safeguard lebih longgar) — mengukur agentic coding di sesi command-line
- Terminal-Bench-Science 0.1 (vendor): Fable 5.1 52,6% (vs Fable 5 24,7%, Opus 5 29,0%) — loop penelitian ilmiah dengan terminal
- AutomationBench (vendor): Fable 5.1 31,4%
Untuk QA agent yang harus membaca repo, menulis test, menjalankan suite, membaca kegagalan, dan mengulang — indikator terbaik adalah kombinasi agentic coding (Fable 5.1/Mythos unggul) + kecepatan iterasi (Gemini 3.8 Flash 302 t/s).
Perkiraan kualitas per peran (estimasi penulis):
- Menulis test yang benar & menemukan bug sulit: Fable 5.1 (inteligensi & instruction-following tertinggi) — runner-up GPT-5.6 Sol
- Loop QA volume tinggi / CI/CD: Gemini 3.8 Flash — murah, 1M konteks untuk repo besar, 302 t/s untuk iterasi cepat
- Regression testing otomatis: GPT-5.6 Luna / DeepSeek V4 Pro untuk biaya minimal di task sederhana
Estimasi Biaya per Tugas Selesai — 6 Beban Kerja (Coding, Keamanan, Testing)
Angka terukur dari Artificial Analysis (independen) jadi pembanding utama: biaya per tugas Intelligence Index — Fable 5.1 $3,69; Opus 5 $2,34; Sol $0,95; Gemini 3.8 Flash $0,58; Luna $0,21. Di DeepSWE: Gemini 3.8 Flash $2,36 per percobaan vs Opus 5 $11,84. Di CWE-bench: Gemini 3.8 Flash Cyber $3,64 vs Claude Fable 5 $10,27 per percobaan.
Untuk enam beban kerja (coding kecil, repo SWE, review keamanan, perbaikan vuln, QA otomatis, agen cyber), estimasi penulis — rumus: biaya per percobaan = (input tanpa cache × harga) + (input cache × harga) + (output × harga), lalu dibagi tingkat keberhasilan. Tingkat keberhasilan mengikuti kurva terukur CWE-bench (perbaikan vuln & agen cyber 25–45%) dan DeepSWE/agentic (repo SWE & QA 52–74%); asumsi token konservatif-menengah (puluhan ribu hingga ~1,5 juta input per beban, mayoritas cache hit, output 1–60 ribu).
Peringkat biaya per tugas berhasil (1 = termurah):
| Beban kerja | Termurah | Peringkat 2 | Termahal |
|---|---|---|---|
| Coding kecil | DeepSeek V4 Pro & GPT-5.6 Luna | Gemini 3.8 Flash | Claude Fable 5.1 |
| Repo SWE | DeepSeek V4 Pro | GPT-5.6 Luna | Claude Fable 5.1 |
| Review keamanan | DeepSeek V4 Pro | GPT-5.6 Luna | Claude Fable 5.1 |
| Perbaikan vuln | DeepSeek V4 Pro | GPT-5.6 Luna | Claude Fable 5.1 |
| QA otomatis | DeepSeek V4 Pro | GPT-5.6 Luna | Claude Fable 5.1 |
| Agen cyber | DeepSeek V4 Pro | Gemini 3.8 Flash | Claude Fable 5.1 |
Pola: DeepSeek V4 Pro dan GPT-5.6 Luna konsisten termurah; Gemini 3.8 Flash berada di peringkat 2–3 dengan kemampuan jauh lebih tinggi daripada Luna. Model premium (Fable 5.1, Opus 5) diperkirakan 10–16 kali lebih mahal per tugas berhasil daripada DeepSeek V4 Pro atau Gemini 3.8 Flash — hanya masuk akal untuk tugas tersulit yang nilainya sebanding. Model murah dengan false-positive tinggi bisa lebih mahal operasionalnya, tapi data CWE-bench menunjukkan DeepSeek/GLM punya tingkat keberhasilan sebanding GPT-5.6 Sol di pekerjaan remediasi (30,4% vs 44,2% — selisih lebih kecil dari selisih harga).
Verdict
Gemini 3.8 Flash adalah model value terbaik per 3 September 2026 untuk coding, keamanan siber, dan testing — DeepSWE 74% setara Opus 5, CWE-Bench 47,2% (via varian Cyber) hampir menyamai Fable 5, dengan biaya per tugas terukur seperenam Fable 5.1 ($0,58 vs $3,69). Ia kalah inteligensi dari Fable 5.1 (59 vs 66) dan kalah di tugas agen terbuka, tapi menang telak dalam biaya per tugas selesai.
Claude Fable 5.1 tetap model paling cerdas untuk pekerjaan tersulit — coding, security review, dan QA berkualitas tinggi — tetapi biaya per tugas terukurnya yang tertinggi di kelasnya ($3,69 per tugas Intelligence Index). GPT-5.6 Sol unggul di benchmark cyber agentik (Vals CyberBench 88,1%, PoC 93,2%) dan Coding Agent Index (80, klaim OpenAI).
Untuk keamanan siber: jika punya akses Fairwind/Glasswing, Gemini 3.8 Flash Cyber dan Claude Mythos 5.1 adalah yang terbaik. Untuk pengguna API biasa: Fable 5.1 (vuln discovery source code kini diizinkan, false-positive turun 60%) dan GPT-5.6 Sol. Untuk testing: Fable 5.1 untuk kualitas, Gemini 3.8 Flash untuk volume dan kecepatan. Model China (GLM-5.3, DeepSeek V4 Pro) sudah setara model AS di deteksi kerentanan (CyberGym 84,5%) dan value coding, dengan harga 3–20x lebih murah.
Keputusan terbaik bergantung beban kerja Anda: butuh volume dan kecepatan → Gemini 3.8 Flash; butuh kualitas maksimal tanpa peduli biaya → Fable 5.1; butuh termurah untuk volume besar → DeepSeek V4 Pro / GLM-5.3.
Sumber
- Google — Introducing Gemini 3.8 Flash and 3.8 Flash Cyber (2 September 2026)
- Google DeepMind — Gemini 3.8 Flash Model Card (2 September 2026)
- Anthropic — Introducing Claude Fable 5.1 and Claude Mythos 5.1 (1 September 2026)
- Anthropic — Claude Fable 5.1 API Overview (September 2026)
- DeepSWE Leaderboard (independen) (diakses 3 September 2026)
- Artificial Analysis — Gemini 3.8 Flash (high) (diakses 3 September 2026)
- Artificial Analysis — Claude Fable 5.1 tops the Intelligence Index (LinkedIn) (2 September 2026)
- The Decoder — Gemini 3.8 Flash is Google’s third budget model (2 September 2026)
- OpenRouter — Gemini 3.8 Flash pricing & providers (diakses 3 September 2026)
- Meta — Muse Spark 1.3 via Startup Fortune & Zuckerberg/X (2 September 2026)
- OfficeChai — Muse Spark 1.3 scores 61 on Intelligence Index (2 September 2026)
- Fello AI — Gemini 3.8 Flash: Benchmarks, Pricing and the Real Numbers (2 September 2026)
- Vals AI — SWE-bench Verified (diakses 3 September 2026)
- Reuters — OpenAI cuts GPT-5.6 Sol pricing (21 Agustus 2026)
- DeepSeek — API Pricing (efektif 16 Agustus 2026)
- Z.ai — GLM-5.3 API Pricing (Agustus 2026)
- Z.ai — GLM-5.3 Flash announcement (26 Agustus 2026)
- Artificial Analysis — Claude Fable 5.1 model page (diakses 3 September 2026)
- OpenRouter — GPT-5.6 Sol pricing (diakses 3 September 2026)
- CryptoBriefing — Claude Fable 5.1 tops Intelligence Index (2 September 2026)
- CWE-bench — Cybersecurity benchmark, evaluated by Artificial Analysis (diakses 3 September 2026)
- Google DeepMind — Gemini 3.8 Flash Cyber (model page) (2 September 2026)
- The New Stack — Google ships its third Gemini Flash model (2 September 2026)
- Vals AI — CyberBench (diakses 3 September 2026)
- BenchLM.ai — CyberGym Leaderboard (mirror papan publik) (1 September 2026)
- BenchmarkList — Vals CyberBench scores (impor independen) (28 Juli 2026)
- Unite.ai — Anthropic debuts Fable 5.1 and Mythos 5.1 with split safeguards (1 September 2026)