AI Briefing
AI Briefing Publikasi Riset AI Indonesia

"Artificial intelligence is the new electricity. It will transform every industry and create massive new opportunities."

— Andrew Ng · Founder of Google Brain

Claude Opus 4.8: Dinamika Kode, Sub‑agen, Harga Lebih Murah

Oleh Eko Hadi Murwanto · ·
Claude Opus 4.8: Dinamika Kode, Sub‑agen, Harga Lebih Murah

Anthropic merilis Claude Opus 4.8 pada 28 Mei 2026. Bukan sekadar update benchmark — ada tiga perubahan besar yang mengubah cara model ini bekerja: dynamic workflows, effort control, dan fast mode dengan harga sepertiga dari sebelumnya.

Lompatan Benchmark — Angka Real, Bukan Klaim

Di SWE-bench Verified (tolok ukur kemampuan coding otonom), Opus 4.8 mencetak 88,6% — tertinggi di antara semua model publik. GPT-5.5 di posisi kedua dengan 82,6%, disusul Opus 4.7 di 82,0%. Selisih 6 poin dari GPT-5.5 dan hampir 7 poin dari pendahulunya sendiri.

Di SWE-bench Pro (versi lebih keras — menyelesaikan issue GitHub nyata secara end-to-end), Opus 4.8 mendapat 69,2%. Opus 4.7: 64,3%. GPT-5.5: 58,6%. Gemini 3.1 Pro: 54,2%. Dominasi 10,6 poin di atas kompetitor terdekat.

Terminal-Bench 2.1 — mengukur kemampuan agen di lingkungan terminal — Opus 4.8 mencetak 74,6%. GPQA Diamond (fisika, biologi, kimia tingkat PhD): 93,6%. MMLU Pro: 89,6%.

Yang paling mengejutkan datang dari matematika. Di USAMO 2026 (Olimpiade Matematika AS), Opus 4.8 mencapai 96,7% — naik drastis dari 69,3% di versi sebelumnya. Lompatan 27 poin dalam satu rilis.

Di GDPval-AA (benchmark untuk pekerjaan pengetahuan agen), skor Elo Opus 4.8: 1890. Opus 4.7: 1753. GPT-5.5: 1769. Artinya, untuk tugas agen otonom yang membutuhkan perencanaan dan eksekusi multidimensi, Opus 4.8 unggul signifikan.

Indeks Kecerdasan Artificial Analysis: Opus 4.8 mencetak 61,4 — naik 4,1 poin dari Opus 4.7 dan memimpin dari semua model lain.

Tingkat cacat kode (code flaw rate) turun 4 kali lipat dibanding Opus 4.7 dengan harga token yang sama. Model ini empat kali lebih kecil kemungkinannya membiarkan bug lolos tanpa catatan.

Dynamic Workflows — Satu Koordinator, Ribuan Pekerja

Fitur paling ambisius. Di Claude Code, model sekarang bisa menulis sendiri skrip orkestrasi, membagi tugas ke puluhan hingga ratusan sub-agen paralel dalam satu sesi, lalu memverifikasi hasilnya dengan agen verifikasi independen yang mencoba mematahkan temuan sub-agen.

Batas teknis: 16 sub-agen konkuren, maksimal 1.000 sub-agen per workflow. Dalam pengujian internal Anthropic, Opus 4.8 menyelesaikan migrasi basis kode dengan ratusan ribu baris — dari nol hingga pull request siap digabungkan — dengan test suite sebagai acuan.

Ini menggeser paradigma: Claude bukan lagi satu asisten yang merespons satu per satu, tapi koordinator yang memimpin pasukan pekerja secara paralel.

Effort Control — Slider Usaha

Di claude.ai dan Cowork, pengguna bisa mengatur seberapa keras Claude berpikir sebelum menjawab.

  • High: model memeriksa logika lebih cermat, token lebih banyak, hasil lebih jitu
  • Low: respons cepat, token irit — cukup untuk obrolan ringan
  • Extra High: untuk masalah yang butuh penalaran berlapis

Setiap level menghabiskan jumlah token berbeda. Untuk coding, effort tinggi menghasilkan perbaikan lebih teliti. Untuk ringkasan email, effort rendah sudah cukup.

Fast Mode — Tiga Kali Lebih Murah, 2,5x Lebih Cepat

Harga standar Opus 4.8 tidak berubah: $5 per juta token input, $25 output — sama dengan Opus 4.7.

Yang baru: fast mode — dulu $30/$150 per juta token di Opus 4.7, sekarang $10/$50. Tiga kali lebih murah, dengan kecepatan 2,5x dari mode standar.

Perbandingan biaya cepat:

SkenarioOpus 4.7 FastOpus 4.8 FastHemat
50 sub-agen paralel, 1M token$150 output$50 output$100
Batch harian 10M token$1.500$500$1.000

Cache prompt memberi diskon hingga 90% untuk input. Batch API diskon 50%. Fast mode berlaku untuk seluruh konteks, termasuk permintaan di atas 200K token.

Detail Teknis untuk Pengembang

API Messages sekarang menerima entri system di dalam array messages. Artinya instruksi Claude bisa diperbarui di tengah tugas tanpa memutus cache prompt. Berguna untuk menyisipkan konteks lingkungan atau mengubah izin saat agen sedang berjalan.

Aligment: VentureBeat melaporkan bahwa Opus 4.8 mendekati level aligment Claude Mythos (model yang sempat memicu kekhawatiran regulator). Scott Wu (CEO Devin/Cognition) bilang model ini “menggunakan alat dengan bersih dan mengikuti instruksi dengan konsistensi yang dibutuhkan beban kerja otonom untuk berjalan tanpa pengawasan.”

Kesimpulan

Opus 4.8 bukan soal angka benchmark semata. Dynamic workflows mengubah cara agen didelegasikan. Fast mode 3x lebih murah menurunkan hambatan biaya untuk produksi. Effort control memberi pengguna kendali atas trade-off antara kecepatan dan ketelitian.

Anthropic ingin Claude tidak hanya lebih pintar — tapi lebih bisa diandalkan, lebih murah, dan lebih fleksibel.

Sumber

  1. Anthropic — “Introducing Claude Opus 4.8” (28 Mei 2026) — https://www.anthropic.com/news/claude-opus-4-8
  2. Vellum — “Claude Opus 4.8 Benchmarks Explained” (28 Mei 2026) — https://www.vellum.ai/blog/claude-opus-4-8-benchmarks-explained
  3. VentureBeat — “Anthropic’s Claude Opus 4.8 is here with 3X cheaper fast mode” (28 Mei 2026) — https://venturebeat.com/technology/anthropics-claude-opus-4-8-is-here-with-3x-cheaper-fast-mode-and-near-mythos-level-alignment
  4. TechCrunch — “Anthropic releases Opus 4.8 with new dynamic workflow tool” (28 Mei 2026) — https://techcrunch.com/2026/05/28/anthropic-releases-opus-4-8-with-new-dynamic-workflow-tool/
  5. LLM Stats — “Claude Opus 4.8 Release, Benchmarks And More” (28 Mei 2026) — https://llm-stats.com/blog/research/claude-opus-4-8-launch
  6. TrueFoundry — “Claude Opus 4.8 and SWE-bench Pro” (29 Mei 2026) — https://www.truefoundry.com/blog/claude-opus-4-8-and-swe-bench-pro-we-ran-anthropics-headline-through-our-gateway
  7. MarkTechPost — “Anthropic Ships Claude Opus 4.8 Alongside Dynamic Workflows” (28 Mei 2026) — https://www.marktechpost.com/2026/05/28/anthropic-ships-claude-opus-4-8-alongside-dynamic-workflows-and-cheaper-fast-mode-with-workflows-capped-at-1000-subagents/
  8. Tokennix — “Claude Opus 4.8 Review 2026: Pricing, Benchmarks” (29 Mei 2026) — https://tokenmix.ai/blog/claude-opus-4-8-review-pricing-benchmark
  9. Vals AI — “SWE-bench Verified Leaderboard” (31 Mei 2026) — https://vals.ai/benchmarks/swebench
Bagikan artikel ini
Telegram WhatsApp Facebook X

Artikel Terkait

Claude Opus 5: Performa Fable 5 dengan Harga Opus 4.8

Claude Opus 5: Performa Fable 5 dengan Harga Opus 4.8

26 Juli 2026
GPT-5.6 Sol Tercyduck di Benchmark, Evaluator Tak Bisa Ukur Kemampuannya

GPT-5.6 Sol Tercyduck di Benchmark, Evaluator Tak Bisa Ukur Kemampuannya

25 Juli 2026
OpenAI Rilis GPT-5.6: Tiga Tier Solution, Skor Coding Tertinggi, Dan White House Minta Lambatkan

OpenAI Rilis GPT-5.6: Tiga Tier Solution, Skor Coding Tertinggi, Dan White House Minta Lambatkan

18 Juli 2026
← Kembali ke Beranda