Kimi K3 vs Qwen 3.8 Max: Pertarungan Dua Raksasa AI China di Puncak
Juli 2026 menjadi bulan yang luar biasa bagi industri AI China. Dalam rentang waktu hanya tiga hari, dua model AI terbesar di dunia dirilis oleh dua perusahaan China: Kimi K3 dari Moonshot AI pada 16 Juli, dan Qwen 3.8 Max dari Alibaba pada 19 Juli. Keduanya sama-sama mengklaim sebagai model open-weight terdepan. Tapi mana yang benar-benar lebih unggul?
Artikel ini menyajikan perbandingan menyeluruh mulai dari arsitektur teknis, skor benchmark resmi, performa coding di dunia nyata, harga API, hingga status open-weight masing-masing.
Sekilas Kedua Model
| Spesifikasi | Kimi K3 | Qwen 3.8 Max |
|---|---|---|
| Developer | Moonshot AI | Alibaba (Qwen) |
| Tanggal rilis | 16 Juli 2026 | 19 Juli 2026 |
| Total parameter | 2,8 triliun | 2,4 triliun |
| Arsitektur | Sparse MoE (16 of 896 experts) | Sparse MoE |
| Context window | 1.048.576 token (1M) | 984.000 token |
| Maks output | Tidak disebutkan | 128.000 token |
| Multimodal | Teks, gambar | Teks, gambar, video |
| Open weight | 27 Juli 2026 (dikonfirmasi) | “Segera” (belum ada tanggal) |
| Harga API | $3/1M input, $15/1M output | Token Plan (belum ada API publik) |
Selisih parameter cukup signifikan — K3 unggul 400 miliar parameter dibanding Qwen 3.8 Max. Tapi jumlah parameter bukan satu-satunya penentu. Arsitektur sparse MoE membuat hanya sebagian kecil parameter yang aktif per token. K3 dilaporkan mengaktifkan 16 dari 896 expert, membuatnya lebih efisien dari angka total yang terlihat.
Qwen 3.8 Max memiliki keunggulan di sisi output dengan dukungan hingga 128.000 token dan multimodal yang mencakup input video — sesuatu yang tidak disebutkan oleh Kimi K3 secara eksplisit.
Perbandingan Benchmark Coding
Di sinilah perbedaan paling mencolok. Kimi K3 datang dengan puluhan skor benchmark yang sudah diverifikasi dan dipublikasikan secara terbuka. Qwen 3.8 Max justru hadir tanpa tabel benchmark resmi sama sekali — tidak ada model card, tidak ada angka yang bisa diverifikasi secara independen.
Kimi K3 — Skor Terverifikasi
Moonshot AI merilis data lengkap performa K3 di berbagai benchmark coding:
| Benchmark | Skor K3 | Peringkat |
|---|---|---|
| Frontend Code Arena | 1.679 Elo | #1 (mengalahkan Fable 5 & GPT-5.6 Sol) |
| Terminal-Bench 2.1 | 88,3 | #2 (hanya 0,5 di bawah GPT-5.6 Sol) |
| DeepSWE | 67,5 | #3 (di atas Opus 4.8 dan Grok 4.5) |
| ProgramBench | 77,8 | Unggul 2 poin dari Fable 5 |
| FrontierSWE | 81,2 | #2 |
| BenchLM Overall | 80,96/100 | #4 dari 200 model |
| Artif. Analysis Int. Index | 57,11 | #5 dari 189 model |
Di Frontend Code Arena, K3 mencetak 1.679 poin Elo — menggeser Claude Fable 5 (1.631) dan GPT-5.6 Sol (1.618). Ini adalah prestasi yang belum pernah dicapai model open-weight sebelumnya.
Qwen 3.8 Max — Hanya Klaim
Qwen 3.8 Max dirilis dengan klaim “second only to Fable 5” tanpa data pendukung. Satu-satunya angka yang beredar berasal dari pengujian komunitas independen:
- Pengujian oleh NXCode melaporkan skor: SWE-bench Verified 73,4, SWE-bench Multilingual 67,2, SWE-bench Pro 49,5, Terminal-Bench 2.0 51,5
- Independent community test (80-task coding test): Skor 80/100 — kalah tiga poin dari Kimi K3 yang mendapat 83/100
- Video test oleh reviewer YouTube: 65 dari 80, berada di posisi kedua
Tapi penting dicatat: semua angka ini belum diverifikasi secara independen oleh benchmark resmi. Tidak ada model card, tidak ada publikasi teknis, dan tidak ada leaderboard resmi yang memasukkan Qwen 3.8 Max.
Sebaliknya, Kimi K3 sudah muncul di puluhan leaderboard independen dan diverifikasi oleh Artificial Analysis, BenchLM, dan Arena.
Performa di Coding Nyata
Kimi K3 — Cepat dan Andal
Di pengujian coding real-world, K3 mendapat nilai positif dari komunitas developer:
- KimiCode CLI — tool command-line resmi untuk coding agent, memungkinkan developer mengerjakan task kompleks langsung dari terminal
- HN user report: “K3 took about 15 minutes for a complex optimization task and completed it perfectly.” Biaya sekitar setengah dari Fable 5 untuk output yang hampir identik.
- Reddit r/LocalLLaMA: Banyak pengguna melaporkan K3 setara dengan Fable 5 untuk tugas coding sehari-hari, meski ada yang mencatat kadang terlalu percaya diri dengan outputnya
- Latency: K3 terbilang lambat — sekitar 33 token per detik menurut Artificial Analysis. Model ini memikirkan ulang jawabannya (reasoning) sehingga butuh waktu lebih lama
Qwen 3.8 Max — Campuran
Impresi awal Qwen 3.8 Max lebih beragam:
- Reddit r/LocalLLaMA: Beberapa pengguna melaporkan model ini “sering terjebak dalam thinking loop” dan output frontend/design-nya kurang memuaskan
- Hacker News: Seorang pengguna menyebut “Qwen 3.8 Max disastrously bad” untuk beberapa task, sementara yang lain melaporkan hasil yang solid untuk tugas frontend sederhana
- Kecepatan: Data dari Qwen3.7 Max menunjukkan kecepatan 198 token/detik — tapi Qwen 3.8 yang jauh lebih besar mungkin lebih lambat
- Pengguna web app: Keluhan tentang model terjebak siklus berpikir yang tidak produktif
Perbandingan Harga
Kimi K3
Moonshot AI menetapkan harga API yang transparan:
| Tipe | Harga per 1M token |
|---|---|
| Input (cache miss) | $3,00 |
| Input (cache hit) | $0,30 (diskon 90%) |
| Output | $15,00 |
Harga ini sekitar setengah dari GPT-5.6 Sol dan sebanding dengan Claude Fable 5 untuk input. Namun cache hit yang sangat murah ($0,30) memberikan keuntungan besar untuk aplikasi dengan banyak prompt berulang.
Qwen 3.8 Max
Qwen 3.8 Max belum memiliki harga API per-token. Satu-satunya akses saat ini adalah melalui Token Plan Alibaba yang dimulai dari $6 per bulan — mirip sistem langganan yang memberikan kuota token.
Perkiraan harga saat API publik dirilis:
- Berdasarkan pola harga Qwen sebelumnya, Qwen 3.8 Max kemungkinan akan dibanderol $1,25–$3 per juta token input dan $3,75–$15 per juta token output
- Qwen 3.7 Max saat ini dijual $1,25/$3,75 per 1M token — jadi 3.8 kemungkinan lebih mahal
Keunggulan harga saat ini: Kimi K3 lebih unggul karena sudah punya harga transparan dan bisa langsung dipakai. Qwen 3.8 Max masih dalam sistem Token Plan yang kurang fleksibel.
Status Open-Weight
Ini adalah salah satu perbedaan paling kritis:
Kimi K3: Bobot model akan dirilis gratis pada 27 Juli 2026 — hanya 11 hari setelah peluncuran. Ini sudah dikonfirmasi oleh Moonshot AI. Lisensi yang digunakan belum diumumkan secara detail, tapi Moonshot menjanjikan akses terbuka.
Qwen 3.8 Max: Masih dalam status “open-weight coming soon” tanpa tanggal pasti. Alibaba hanya bilang “segera” tanpa komitmen waktu. Pengalaman dengan Qwen 3.7 Max menunjukkan bahwa open-weight bisa memakan waktu berminggu-minggu hingga berbulan-bulan setelah peluncuran.
Buat developer dan perusahaan yang ingin menjalankan model di infrastruktur sendiri, Kimi K3 jelas lebih unggul — tanggalnya sudah pasti.
Inovasi Arsitektur
Kimi K3 — Tiga Inovasi Utama
Moonshot AI membangun K3 dengan tiga inovasi arsitektur:
- Kimi Delta Attention — mekanisme attention baru yang meningkatkan efisiensi komputasi untuk konteks panjang
- Sparse MoE 16/896 — hanya 16 dari 896 expert yang aktif per token, memberikan efisiensi tinggi untuk ukuran model sebesar ini
- Scaling law baru — Moonshot menemukan pendekatan baru dalam scaling sparse model yang memungkinkan peningkatan performa tanpa peningkatan biaya komputasi proporsional
Qwen 3.8 Max — Belum Ada Detail Teknis
Alibaba belum mempublikasikan detail arsitektur Qwen 3.8 Max. Tidak ada whitepaper, tidak ada blog teknis, dan tidak ada penjelasan tentang inovasi apa yang dibawa. Satu-satunya yang diketahui adalah model ini menggunakan sparse MoE dengan total 2,4 triliun parameter.
Kelebihan dan Kekurangan
Kimi K3
Kelebihan:
- Benchmark terverifikasi dan transparan
- #1 di Frontend Code Arena
- Open-weight dengan tanggal pasti (27 Juli)
- Harga API transparan dengan cache diskon 90%
- KimiCode CLI untuk coding agent
- Performa coding real-world terbukti
Kekurangan:
- Kecepatan inferensi lambat (~33 token/detik)
- Model sangat besar (2,8T parameter — butuh infrastruktur heavy)
- Belum mendukung input video
- Tidak ada varian kecil/lebih cepat
Qwen 3.8 Max
Kelebihan:
- Mendukung input video (multimodal lebih lengkap)
- Output hingga 128K token
- Potensi harga lebih murah (berdasarkan pola harga Qwen sebelumnya)
- Ekosistem Qwen sudah matang dengan banyak tool
Kekurangan:
- Tidak ada benchmark resmi — semua klaim belum terverifikasi
- Tidak ada tanggal pasti open-weight
- Belum ada API publik — hanya Token Plan
- Kesan awal coding masih campuran (suka stuck di thinking loop)
- Informasi teknis sangat minim
Kesimpulan: Mana yang Lebih Unggul?
Kimi K3 adalah pemenang yang jelas saat ini. Datang dengan bukti benchmark yang solid, harga transparan, open-weight dengan tanggal pasti, dan performa coding yang terverifikasi di leaderboard independen. Moonshot AI tidak hanya membuat model besar — mereka membuktikannya dengan data.
Qwen 3.8 Max adalah kuda hitam yang menjanjikan. Model ini punya potensi besar dengan dukungan multimodal yang lebih luas (termasuk video) dan output panjang 128K token. Tapi tanpa data benchmark yang bisa diverifikasi, sulit untuk percaya klaim “second only to Fable 5” yang dibawa saat peluncuran.
Rekomendasi:
- Buat coding dan agent task hari ini: Pilih Kimi K3 — sudah terbukti, lebih murah dari Fable 5, dan open-weight
- Buat multimodal dan konten panjang: Tunggu Qwen 3.8 Max — potensi lebih besar, tapi belum siap produksi
- Buat deployment on-premise: Kimi K3 — tanggal open-weight sudah pasti minggu ini
- Buat eksperimen dan riset: Keduanya layak dicoba, tapi K3 memberikan data lebih lengkap untuk perbandingan
Yang jelas, satu hal sudah pasti: China sekarang punya dua model yang bersaing langsung di level frontier. Industri AI global tidak lagi didominasi oleh AS sendirian.