Gemini 3.7 Flash Turunkan Harga 50 Persen, Ungguli Sonnet 5 di Coding
Google resmi meluncurkan Gemini 3.7 Flash pada 13 Agustus 2026, hanya tiga minggu setelah Gemini 3.6 Flash. Model ini disebut Google sebagai “workhorse” (kuda kerja) paling cerdas yang pernah mereka buat untuk coding dan agen AI. Yang paling mencolok: harganya dipangkas 50 persen dari pendahulunya, sementara kemampuan coding dan agennya naik signifikan.
Identitas dan Harga
Gemini 3.7 Flash adalah iterasi dari Gemini 3.6 Flash dengan perbaikan algoritmik pada fondasi reasoning-nya. Bukan model arsitektur baru, tapi hasil langsung dari masukan developer.
| Spesifikasi | Nilai |
|---|---|
| Model ID | gemini-3.7-flash |
| Context window | 1 juta token input |
| Output maksimal | 64 ribu token |
| Input | Teks, gambar, audio, video |
| Knowledge cutoff | Maret 2026 |
| Harga input | $0,75 per 1 juta token (intro) |
| Harga output | $3,75 per 1 juta token (intro) |
Harga intro berlaku hingga 31 Desember 2026. Mulai 1 Januari 2027 naik menjadi $1,50 input dan $7,50 output per 1 juta token. Cache hit diskon 90 persen menjadi $0,075. Angka ini setengah dari harga peluncuran Gemini 3.6 Flash ($1,50/$7,50) — sebuah pemangkasan agresif di tengah perang harga model AI.
Model ini langsung tersedia di Google AI Studio, Android Studio, Google Antigravity, Vertex AI, dan aplikasi Gemini Enterprise. Gemini Spark — agen pribadi 24/7 untuk pelanggan AI Pro dan Ultra — juga langsung memakai model ini hari yang sama.
Benchmark Coding: Ungguli Sonnet 5
Google mempublikasikan perbandingan resmi Gemini 3.7 Flash melawan pendahulunya, Claude Sonnet 5, dan GPT-5.6 Terra (angka dari model card resmi DeepMind, Agustus 2026):
| Benchmark | Gemini 3.7 Flash | 3.6 Flash | Sonnet 5 | GPT-5.6 Terra |
|---|---|---|---|---|
| FrontierCode 1.1 (kualitas kode produksi) | 43,6% | 34,4% | 42,7% | 41,3% |
| DeepSWE v1.1 (software engineering jarak jauh) | 65,3% | 48,6% | 53,8% | 69,6% |
| Code Arena WebDev (Elo) | 1588 | 1538 | 1541 | 1523 |
| Terminal-bench 2.1 (coding lewat terminal) | 85,8% | 78,0% | 80,4% | 87,4% |
Di leaderboard independen FrontierCode milik Cognition (per 14 Agustus 2026), Gemini 3.7 Flash mencatat 43,6 persen dengan biaya rata-rata $3,65 per tugas — menempati peringkat 7. Di atasnya: Claude Fable 5 (53,5%), GPT-5.6 Sol (47,5%), dan Kimi K3 (44,2%). Sonnet 5 (42,7%) dan GPT-5.6 Terra (41,3%) justru berada di bawahnya.
Menariknya, Google tidak lagi mempublikasikan skor SWE-bench Verified untuk model ini — mereka menggantinya dengan FrontierCode 1.1 dan DeepSWE v1.1 yang lebih menantang untuk tugas repository-level.
Kemampuan Agen: Lompatan Terbesar
Dari semua aspek, peningkatan terbesar Gemini 3.7 Flash justru ada di kemampuan agen — model yang bisa memakai tool, menjelajah browser, dan mengeksekusi tugas bertahap.
| Benchmark agen | Gemini 3.7 Flash | 3.6 Flash | Sonnet 5 | GPT-5.6 Terra |
|---|---|---|---|---|
| AutomationBench (otomasi workflow bisnis) | 30,4% | 17,0% | 10,7% | 23,6% |
| Terminal-bench 3.0 (kemampuan agen umum) | 14,9% | 5,4% | 14,6% | 20,8% |
| OSWorld-2.0 (kendali komputer) | 47,9% | 33,8% | — | 50,2% |
| Agent’s Last Exam (tugas desktop/OS) | 26,3% | 24,2% | 33,3% | 28,0% |
Skor AutomationBench hampir dua kali lipat GPT-5.6 Terra dan tiga kali Claude Sonnet 5. Terminal-bench 3.0 — tolok ukur baru untuk kemampuan agen umum — naik hampir tiga kali lipat dari 3.6 Flash. Di pengukuran independen Artificial Analysis, indeks agentic model ini mencapai 45,1 dan skor tau-bench banking 0,33.
Google juga mengklaim model ini “lebih adaptif saat menemui hambatan, mengklarifikasi niat saat dibutuhkan, dan mengikuti instruksi dengan kesetiaan lebih tinggi” — artinya lebih sedikit retry dan pengawasan manual dalam alur kerja engineering.
Tugas Panjang: 111 Langkah Tanpa Kehilangan Arah
Kemampuan long-horizon (tugas puluhan hingga ratusan langkah) adalah salah satu nilai jual utama model ini. Di DeepSWE v1.1, benchmark yang mensimulasikan pekerjaan software engineering nyata, Gemini 3.7 Flash menyelesaikan tugas dengan rata-rata 111 langkah dan 95 ribu token output per tugas — bukti bahwa model ini bisa memegang instruksi dan kondisi sistem sepanjang eksekusi panjang.
Untuk retensi konteks, model card mencatat skor GDM-MRCR v2 (uji 8 jarum pada 128 ribu token) sebesar 97 persen — tertinggi di tabel pembanding, jauh di atas Sonnet 5 (81,5%). Ditambah context window 1 juta token, model ini dirancang untuk workload dokumen dan agen yang berjalan lama tanpa degradasi.
Posisi di Pasar Model AI
| Model | AA Index | Harga input/output ($/1M) |
|---|---|---|
| Claude Opus 5 | 63 | 5,00 / 25,00 |
| GPT-5.6 Sol | 61 | 5,00 / 30,00 |
| Grok 4.6 | 61 | 2,00 / 6,00 |
| Kimi K3 | 60 | 3,00 / 15,00 |
| Qwen 3.8 Max | 58 | 2,00 / 6,00 |
| GPT-5.6 Terra | 57 | 2,00 / 12,00 |
| Gemini 3.7 Flash | 56 | 0,75 / 3,75 |
| Claude Sonnet 5 | 55 | 2,00 / 10,00 |
| DeepSeek V4 Pro | 53 | 0,44 / 0,87 |
Artificial Analysis mencatat biaya riil per tugas model ini hanya sekitar $0,40 — total biaya menjalankan seluruh rangkaian evaluasi mereka $485, kurang dari setengah biaya Grok 4.6 ($1.068) padahal skor keduanya berdekatan. Kecepatan outputnya median 340 token per detik, cocok untuk aplikasi yang butuh respons cepat.
Kelebihan dan Kekurangan
Kelebihan:
- Rasio harga-performa terbaik di kelasnya: skor setara GPT-5.6 Terra dan Sonnet 5 dengan harga 6 kali lebih murah dari Sonnet
- Multimodal penuh (teks, gambar, audio, video) dengan 1 juta token konteks — pembeda utama dari DeepSeek dan Qwen
- Lompatan besar di benchmark agen: AutomationBench hampir 2x Terra
- Retensi konteks panjang terbaik di tabel pembanding (MRCR 97 persen)
- Ekosistem siap pakai: Spark, Antigravity, Workspace tool use
Kekurangan:
- Bukan model frontier: masih di bawah Fable 5, GPT-5.6 Sol, dan Kimi K3 di benchmark coding
- Knowledge work masih kalah: GDPVal 1525 vs Sonnet 5 1598
- Boros token: rata-rata 37 ribu output token per tugas vs 26 ribu pada 3.6 Flash — penghematan saat ini ditopang harga murah
- Tingkat halusinasi 0,645 dalam pengukuran omniscience Artificial Analysis
- Gemini 3.5 Pro yang ditunggu-tunggu masih tertunda — Google belum punya model flagship kompetitif
Verdict
Gemini 3.7 Flash bukan model terpintar di dunia, tapi untuk pekerjaan nyata — coding agent produksi, otomasi workflow, knowledge work multimodal — ini pilihan paling rasional saat ini. Harga enam kali lebih murah dari Sonnet 5 dengan performa lebih tinggi di mayoritas benchmark membuatnya sulit ditolak untuk workload bervolume besar.
Satu catatan: DeepSeek V4 Pro tetap menjadi ancaman terbesar di segmen harga (13-26 kali lebih murah untuk penggunaan teks saja), dan harga intro Gemini 3.7 Flash akan naik dua kali lipat pada Januari 2027. Bagi yang mempertimbangkan migrasi, jendela harga murah ini terbuka hingga akhir tahun.
Sumber
- Google Blog — Introducing Gemini 3.7 Flash (13 Agustus 2026)
- Google DeepMind — Gemini 3.7 Flash Model Card (13 Agustus 2026)
- Google AI — Gemini API Pricing
- Artificial Analysis — Gemini 3.7 Flash
- Cognition — FrontierCode 1.1 Leaderboard
- Datacurve — DeepSWE v1.1 Leaderboard
- Ars Technica — Google announces Gemini 3.7 Flash (13 Agustus 2026)
- Android Authority — Gemini 3.7 Flash is here (13 Agustus 2026)
- Bloomberg — Google Debuts New Gemini Flash While Top AI Model Still Delayed (13 Agustus 2026)
- Hacker News — Gemini 3.7 Flash discussion