AI Briefing
AI Briefing Publikasi Riset AI Indonesia

"We need more dialogue around the ethics and the principles that we can use for the engineers and companies that are building AI."

— Satya Nadella · CEO of Microsoft

Fable 5.1 vs DeepSeek V4 Pro: Siapa Agen Coding Terbaik 2026?

Oleh Eko Hadi Murwanto · ·
Fable 5.1 vs DeepSeek V4 Pro: Siapa Agen Coding Terbaik 2026?

Dua model coding paling diperbincangkan pekan ini: Claude Fable 5.1 (rilis 1 September 2026) dan DeepSeek V4 Pro-0813 (rilis 13 Agustus 2026). Satu proprietary dengan harga premium, satu open-weight dengan harga 20 kali lebih murah. Mana yang lebih layak dipakai sebagai AI coding agent untuk kerja nyata?

Artikel ini membandingkan keduanya dari sisi yang dipakai developer setiap hari: kemampuan coding, debugging, kerja di repository besar, perilaku agent jangka panjang, biaya per sesi, dan fleksibilitas deployment. Angka vendor dan angka independen dipisahkan tegas — hasil benchmark yang dijalankan pabrikan sendiri tidak diperlakukan sama dengan hasil uji pihak ketiga.

Ringkasan Singkat

PertanyaanJawaban
Coding paling murniFable 5.1 — unggul di mayoritas benchmark coding
Agent otonom terbaikFable 5.1 — lebih kuat di tugas jangka panjang
Paling hemat biayaDeepSeek V4 Pro — 5–20x lebih murah per task
Value terbaikDeepSeek V4 Pro — 90% performa dengan 5–20% biaya
Developer individuDeepSeek V4 Pro — murah, API kompatibel Claude Code
PerusahaanFable 5.1 — EFS, SLA, dukungan enterprise

Kesimpulan satu kalimat: Fable 5.1 adalah model coding paling mampu yang bisa dibeli hari ini; DeepSeek V4 Pro-0813 adalah model open-weight paling mampu yang harganya 5–20 kali lebih murah per task. Pilihan tergantung apakah yang dibeli adalah kapabilitas puncak atau kapabilitas per dollar.

Spesifikasi Kedua Model

SpesifikasiClaude Fable 5.1DeepSeek V4 Pro-0813
Rilis1 September 202613 Agustus 2026
ParameterTidak dipublikasikan1,65T total / 49B aktif (MoE)
Konteks1 juta token1 juta token
Output maksimum128K token384K token
LisensiProprietary (API)MIT (open weights)
Input per 1M token$10$0,66 off-peak / $1,32 peak
Output per 1M token$50$1,98 off-peak / $3,96 peak
Cache read per 1M$0,25 (potongan 75%)$0,022–0,044
Max efforthigh (default)low / high / max

Harga DeepSeek efektif sejak 16 Agustus 2026 (jam peak: 01:00–04:00 dan 06:00–10:00 UTC, di luar itu off-peak setengah harga). Sumber: platform.claude.com dan api-docs.deepseek.com.

Benchmark Coding & Software Engineering

Angka yang independen (dijalankan pihak ketiga, harness seragam) adalah bukti terkuat. Angka vendor (dipublikasikan pabrikan) ditandai jelas dan tidak dibandingkan silang antar-pabrikan.

BenchmarkFable 5.1DeepSeek V4 Pro-0813Status
SWE-bench Verified95,0% (vendor); Fable 5: 95,0% independen96,4% independen (vals.ai, #2 global)DS unggul tipis (independen)
SWE-bench Pro80,0% (vendor)55,4% (vendor)Tidak comparable langsung
Terminal-Bench 4.055,8% (vendor, vs Fable 5: 42,0%)Tidak diukur
Terminal-Bench 2.187,9 (vendor) / 79 (independen AA)Vendor vs AA beda
DeepSWE v1.167,4% (vendor, system card); Fable 5: 70,0% independen62,7 (vendor) / 63,0% independenFable 5.1 belum di board independen
FrontierCode 1.163,6% Extended (vendor); Fable 5: 53,5% Main independen17,6% Main independenFable unggul jauh di kualitas produksi
NL2Repo61,5 (vendor)Tidak comparable
DSBench FullStack / Hard71,1 / 67,2 (vendor, internal)Tidak bisa diverifikasi
LiveCodeBench90,52% (vendor)93,5% (vendor)Tidak comparable
AA Intelligence Index66 (independen, #1 global)53 (independen)Fable unggul 13 poin
HLE dengan tools65,0 (independen AA)60,0 (vendor)Fable unggul

Keterbatasan yang harus dipahami: hampir semua angka agentic DeepSeek diukur dengan DeepSeek Harness minimal mode pada effort max; angka Fable 5.1 diukur dengan harness Anthropic sendiri. Skor dari harness berbeda tidak bisa dibandingkan head-to-head. Satu-satunya perbandingan “apel ke apel” yang sah saat ini adalah SWE-bench Verified dari vals.ai (harness mini-swe-agent untuk semua model) dan AA Intelligence Index (protocol sama untuk semua model).

Yang bisa disimpulkan dengan aman:

  • Fable 5.1 adalah model dengan skor tertinggi di AA Intelligence Index (66) dan unggul konsisten di benchmark production-grade (FrontierCode, DeepSWE).
  • DeepSeek V4 Pro-0813 mencetak 96,4% di SWE-bench Verified (independen) — open-weight terbaik, hanya 0,6 poin di bawah Opus 5. Tapi tertinggal jauh di FrontierCode (17,6 vs ~53) — kuat di perbaikan bug, lemah di kualitas kode produksi berkelanjutan.

Biaya: Selisihnya Bukan Tipis

Simulasi biaya sesi agent (dihitung dari harga resmi, asumsi konservatif):

SkenarioFable 5.1DeepSeek off-peakDeepSeek peakRasio
Kecil — debug 1 file (150K input + 350K cache + 60K output)$4,59$0,23$0,4520x
Sedang — fitur di repo (600K input + 2,4M cache + 250K output)$19,10$0,94$1,8920x
Besar — sesi otonom multi-jam (1,5M input + 10M cache + 800K output)$57,50$2,79$5,5920x

Validasi dengan data terukur (bukan asumsi): Artificial Analysis mencatat biaya per task Intelligence Index Fable 5.1 (max) $1,40 vs DeepSeek V4 Pro-0813 (max) $0,27 — selisih 5,2x. Di DeepSWE v1.1, biaya rata-rata per percobaan Fable 5 $21,63 vs DeepSeek V4 Pro-0813 $0,24 (konfigurasi harness berbeda, jadi ini arah — bukan presisi).

Catatan penting: Fable 5.1 justru 20% lebih mahal per task dibanding Fable 5 (laporan CryptoBriefing, 2 September 2026) karena output-nya lebih verbose di tugas kompleks. Potongan cache read 75% membantu workload yang membaca ulang konteks sama terus-menerus, tapi tidak menutup kenaikan biaya di tugas reasoning berat.

Kemampuan Agent & Long-Horizon

Fable 5.1 dirancang khusus untuk pekerjaan agent jangka panjang. Buktinya:

  • AA Intelligence Index #1 (66) — index ini memberi bobot besar pada tugas agentic multi-langkah.
  • Terminal-Bench 4.0 naik 33% vs Fable 5; Terminal-Bench-Science naik dobel.
  • Testimoni pelanggan di halaman rilis: Shopify (“workflows berjalan lama tanpa kehilangan arah”), Jane Street (“lebih banyak masalah coding terselesaikan daripada Fable 5 atau Opus 5”), Browserbase (“menemukan bug langka yang gagal ditemukan engineer selama 4–5 tahun”).
  • Anthropic memposisikannya sebagai model yang “memperbaiki akar masalah, bukan gejala, dan menghindari jalan pintas”.

DeepSeek V4 Pro-0813 membuat lompatan besar dari versi preview (DeepSWE 12,8 → 62,7), dan rata-rata bekerja 39 turn per tugas GDPval (vs 23 di preview) — tanda agen yang lebih tekun. Tapi:

  • Belum ada pengujian independen untuk sesi otonom puluhan jam.
  • Laporan pengguna (Reddit r/LocalLLM) mencatat degradasi kualitas di atas ~200K token konteks.
  • Overthinking masalah sederhana dan menulis ulang kode lebih dari kebutuhan (laporan komunitas).

Kesimpulan: Fable 5.1 menang telak di long-horizon — segmen yang memang dirancang untuknya. DeepSeek sangat kompetitif per dollar tapi belum terbukti di sesi panjang.

Tool Use & Ecosystem

AspekFable 5.1DeepSeek V4 Pro-0813
Agent resmiClaude Code (paling matang)DeepSeek Harness (baru, untuk eval)
IntegrasiClaude Code, Cursor, MCP penuhAPI compat Claude Code/Codex, Cline, Roo, OpenCode
Tool callingStrict tool use, progress updatesResponses API, Anthropic API compat, function calling
Self-hostingTidak (API saja)Ya — vLLM/SGLang, MIT, DSpark speculative decoding
Kebutuhan hardware self-host~862 GB VRAM (FP4+FP8), 4x GB300 atau 8x H200

DeepSeek bisa dipasang sebagai backend Claude Code (ganti base URL + API key) — pengalaman komunitas yang sudah banyak dilaporkan. Ini membuat DeepSeek menarik untuk developer individu: tooling yang sama, biaya 1/20.

Kecepatan & Efisiensi

  • Fable 5.1: dilabeli “slower” di dokumentasi resmi (thinking selalu aktif, effort high default). Tidak ada angka t/s independen yang terukur untuk 5.1.
  • DeepSeek V4 Pro-0813: 54,1 t/s di Artificial Analysis (API resmi, max effort); hingga 167 t/s via provider seperti Fireworks. TTFT 0,99–2,07 detik. Tapi di effort max, waktu ke jawaban pertama bisa >100 detik karena reasoning panjang.
  • Efisiensi token: Fable 5.1 lebih hemat token per task dari Fable 5; DeepSeek 0813 ~30% lebih hemat output token dari preview-nya. Keduanya membaik, dengan trade-off berbeda: Fable lebih bijak per task, DeepSeek lebih cepat per token tapi verbose di max effort.

Open-Source vs Proprietary

AspekFable 5.1DeepSeek V4 Pro-0813
LisensiProprietaryMIT — bebas dipakai, dimodifikasi, dijual
Privasi dataEFS (data di cloud customer, zero retention opsional)Self-host = kontrol penuh; API DeepSeek = data ke China
KustomisasiTidak (prompt/effort saja)Fine-tuning penuh, kendali inference
Total cost of ownershipPer-token mahal; enterprise via EFSAPI murah; self-host = capex besar (~$69–95/jam sewa node)
RisikoVendor lock-in, kenaikan harga, kebijakan berubahButuh keahlian infra untuk self-host skala besar

Kesimpulan: DeepSeek menang telak di fleksibilitas dan lisensi; Fable menang di compliance enterprise (EFS, SLA, dukungan). Untuk perusahaan yang datanya sensitif dan butuh jaminan legal, Fable (atau self-host DeepSeek di infrastruktur sendiri) adalah pilihan — API DeepSeek publik menaruh data di China, yang bisa jadi masalah kepatuhan.

Skenario Penggunaan Nyata

1. Memperbaiki bug di repository besarFable 5.1. Bukti: DeepSWE, FrontierCode, testimoni Browserbase (bug 4–5 tahun). DeepSeek kompetitif per dollar (63% DeepSWE @ $0,24) tapi kualitas produksi dan long-context >200K jadi kelemahan.

2. Membuat aplikasi full-stack dari requirementFable 5.1 untuk production, DeepSeek untuk prototype. DeepSeek kuat di frontend (WebDev) dan algoritma (Codeforces 3206); Fable unggul di mengikuti requirement kompleks dan kualitas produksi.

3. Autonomous coding berjam-jamFable 5.1. Segmen yang dirancang khusus untuknya; DeepSeek belum terbukti di sesi puluhan jam.

4. Refactoring codebase besarFable 5.1. Menjaga invariant lintas file adalah kekuatan yang dilaporkan tester (retensi preconditions lintas rantai panjang); DeepSeek jauh di bawah di FrontierCode.

5. Loop terminal → test → debug → iterasiTergantung anggaran. DeepSeek unggul di Terminal-Bench dan sangat murah untuk loop panjang (cache $0,022 vs $0,25). Fable unggul di kualitas per iterasi dan Terminal-Bench 4.0 (versi lebih baru). Untuk iterasi mahal yang panjang, DeepSeek menang telak di biaya.

Verdict Akhir

KategoriPemenangConfidence
Raw coding model terbaikFable 5.180%
Coding agent terbaikFable 5.170%
Long-horizon agent terbaikFable 5.175%
Price/performance terbaikDeepSeek V4 Pro-081395%
Deployment lokal/self-hostDeepSeek V4 Pro-081397%
Produksi software engineeringFable 5.170%
OverallTergantung konteks

Rekomendasi praktis:

  • Kapabilitas murni → Fable 5.1. Tapi sadari: rilis baru 1 hari saat riset ini ditulis (2 September 2026). Benchmark independen untuk Fable 5.1 (DeepSWE board, vals.ai, SWE-Marathon) belum ada — yang ada baru system card vendor dan testimoni customer. Ini “kandidat kuat dengan bukti independen belum lengkap”, bukan “juara final”.
  • Value per dollar → DeepSeek V4 Pro-0813. 96,4% SWE-bench Verified (independen, open-weight terbaik), MIT, 5–20x lebih murah per task, bisa self-host, API kompatibel Claude Code.
  • Keputusan besar (lisensi enterprise atau build infra) → tunggu 2–4 minggu untuk hasil independen Fable 5.1, atau jalankan kedua model di harness yang sama (mini-swe-agent / DeepSeek Harness) di repository sendiri. Itu satu-satunya cara mendapat jawaban definitif untuk use case spesifik.

Sumber

  1. Anthropic — Introducing Claude Fable 5.1 and Claude Mythos 5.1 (1 September 2026)
  2. Claude Fable 5.1 & Mythos 5.1 System Card (1 September 2026)
  3. Claude Fable 5.1 Overview — Platform Docs
  4. DeepSeek-V4-Pro-0813 Model Card — Hugging Face (13 Agustus 2026)
  5. DeepSeek API Pricing (efektif 16 Agustus 2026)
  6. DeepSeek V4 Technical Report
  7. Vals AI — SWE-bench Verified Leaderboard (diperbarui 30 Agustus 2026)
  8. DeepSWE v1.1 Leaderboard — Datacurve (diperbarui 26–28 Agustus 2026)
  9. Artificial Analysis — Fable 5.1 skor 66 AA Intelligence Index (2 September 2026)
  10. Artificial Analysis — DeepSeek V4 Pro 0813
  11. Cognition — FrontierCode 1.1
  12. CryptoBriefing — Fable 5.1 tops Intelligence Index, costs 20% more per task (2 September 2026)
  13. Kingy.ai — Best AI Coding Model 2026 (audit DeepSWE snapshot) (26 Agustus 2026)
  14. RunPod — DeepSeek V4 deployment & long-context
  15. DeepInfra — DeepSeek V4 Pro API benchmarks
  16. Data Science Dojo — Claude Fable 5.1: Benchmarks, pricing, safety (1 September 2026)
  17. OrcaRouter — DeepSeek V4 Pro Benchmarks: Full 0813 Scorecard
Bagikan artikel ini
Telegram WhatsApp Facebook X

Artikel Terkait

Claude Fable 5.1: Biaya Cache Turun 75%, Langsung Duduki Puncak Peringkat Kecerdasan

Claude Fable 5.1: Biaya Cache Turun 75%, Langsung Duduki Puncak Peringkat Kecerdasan

2 September 2026
Thomson Reuters Rilis Model AI Legal Proprietary, Latih Cuma $450 Ribu

Thomson Reuters Rilis Model AI Legal Proprietary, Latih Cuma $450 Ribu

1 September 2026
Qwen3.8-Flash-Next: Arsitektur Qwen4 yang Cuma Aktifkan 6 Miliar Parameter

Qwen3.8-Flash-Next: Arsitektur Qwen4 yang Cuma Aktifkan 6 Miliar Parameter

31 Agustus 2026
← Kembali ke Beranda