Qwen3.8-Flash-Next: Arsitektur Qwen4 yang Cuma Aktifkan 6 Miliar Parameter
Alibaba kembali menekan biaya AI dengan cara yang tidak biasa. Lewat tim Qwen, mereka merilis Qwen3.8-Flash-Next pada 26 Agustus 2026 — model multimodal yang hanya mengaktifkan 6 miliar parameter per token dari total 125 miliar, dan menjadi pratinjau arsitektur untuk Qwen4.
Yang membuat rilis ini menarik bukan sekadar angka benchmark. Ini adalah uji coba Alibaba atas cara baru menskalakan model: kombinasi sparse attention, embedding ala kamus frasa, dan jumlah parameter aktif yang kecil untuk menekan biaya beban kerja konteks panjang.
Model 125 Miliar yang Hemat ala MoE
Qwen3.8-Flash-Next adalah model mixture-of-experts (MoE) multimodal dengan total 125 miliar parameter, plus 51 miliar parameter tambahan di lapisan N-gram embedding yang baru. Lapisan ini menyimpan kelompok kata umum sebagai entri kamus frasa — bisa ditaruh di RAM biasa alih-alih GPU, dengan biaya tambahan relatif rendah.
Yang aktif per token cuma 6 miliar parameter. Sebagai perbandingan:
- Qwen3.7-Plus: 397 miliar parameter, 17 miliar aktif per token
- DeepSeek-V4-Flash: 284 miliar parameter, 13 miliar aktif
- Qwen3.8-Flash-Next: 125 miliar parameter, hanya 6 miliar aktif
Dengan komposisi seperti ini, model ini memakai sekitar sepersembilan biaya training Qwen3.7-Plus — klaim yang disampaikan tim Qwen dan dikonfirmasi Reuters.
Arsitektur Baru: QSA, N-gram Embedding, Gated Residual
Tiga inovasi utama yang dibawa Qwen3.8-Flash-Next:
- Qwen Sparse Attention (QSA) — alih-alih memproses semua token, QSA mempersempit sekuens panjang ke region paling relevan dulu sebelum attention. Ini memangkas latensi konteks panjang secara signifikan.
- N-gram Embedding — parameter diskalakan lewat indeks n-gram (bigram/trigram) alih-alih MoE murni, lebih hemat komputasi dan mudah di-offload ke memori terbatas.
- Gated Residual — arus residual dengan read gate dan write gate per cabang, memberi ekspresivitas lebih halus antar-lapisan tanpa menaikkan overhead inference.
Model ini mendukung 262.144 token secara native dan bisa diperluas ke 1 juta token lewat YaRN.
Benchmark: Menang di Coding dan Tugas Kantor
Semua angka di bawah ini dilaporkan vendor (tim Qwen) — belum ada pengukuran independen yang luas.
| Benchmark | Qwen3.8-Flash-Next | DeepSeek-V4-Flash | Claude Opus 4.6 (Max) |
|---|---|---|---|
| DeepSWE 1.1 (agentic coding) | 58,7 | 54,4 | — |
| SWE-bench Pro | 62,5 | 56,0 | 53,4 |
| CoWorkBench (tugas kantor) | 73,9 | 45,1 | 68,2 |
| JobBench (tugas profesional) | 55,7 | 41,3 | 36,6 |
| Toolathlon Verified (tool use) | 73,5 | 70,3 | — |
| GPQA Diamond (sains) | 91,7 | 90,8 | 91,3 |
| LiveCodeBench v6 (coding) | 91,9 | 90,6 | 88,8 |
| HLE (multidisiplin sulit) | 35,9 | 33,8 | 40,0 |
Di bidang vision-language, Flash-Next juga memimpin di AndroidWorld (84,5), OSWorld 2.0 (19,4 binary), dan LVBench (76,6). Satu-satunya yang mengalahkannya di HLE adalah Claude Opus 4.6 — model lama Anthropic dari Februari 2026.
Harga: Seperduabelas Flagship
Versi produksinya, Qwen3.8-Flash, meluncur lewat QwenCloud dengan harga:
- $0,16 per juta token input
- $0,47 per juta token output
Sebagai pembanding, Qwen3.8-Max (flagship) dibanderol $2 input / $6 output per juta token. Artinya Flash-Next menawarkan performa di bawah flagship dengan selisih harga sekitar 12 kali lebih murah. Reuters mencatat harga API resminya dalam yuan: 1 yuan per juta input dan 3 yuan per juta output.
Tekanan harga ini juga yang mendorong OpenAI memangkas harga lini GPT-5.6 — kabar baik untuk pengguna, tapi buruk untuk pertumbuhan pendapatan penyedia AI.
Open Weights dengan Lisensi Khusus
Bobot model terbuka di Hugging Face dan ModelScope, plus versi FP8. Tapi perhatikan lisensinya: Qwen Community License 1.0, bukan Apache 2.0.
Lisensi ini mengizinkan penggunaan, modifikasi, dan deployment secara umum, tapi menambahkan syarat untuk produk berskala besar, bisnis model-as-a-service, dan asisten kerja AI. Tim yang berencana membangun asisten coding atau kantor yang di-hosting harus membaca syarat lisensi dulu.
Repo Hugging Face sekitar 360 GB — meski parameter aktifnya kecil, footprint efektif 176 miliar parameter tetap butuh penyimpanan dan memori yang tidak main-main.
Rilis Awal untuk Qwen4
TechNode melaporkan bahwa open-source model ini (termasuk versi FP8) dijadwalkan pada 26 Agustus pukul 11 malam waktu Beijing. Tujuan rilis awal ini: memberi komunitas developer waktu menyiapkan diri sebelum keluarga model Qwen4 penuh hadir.
Sinyal lain soal ambisi Alibaba di AI: pada minggu yang sama, perusahaan ini menjual saham senilai 80 miliar dolar Hong Kong dengan diskon besar untuk mendanai ambisi AI tersebut.
Kesimpulan
Qwen3.8-Flash-Next layak dievaluasi — terutama untuk tim yang menjalankan agen coding atau dokumen di infrastruktur sendiri. Kombinasi open weights, hasil coding yang kuat menurut vendor, dan hanya 6 miliar parameter aktif adalah kombinasi yang tidak biasa.
Tapi ingat dua hal: benchmark masih laporan vendor, dan lisensi Qwen Community 1.0 punya syarat khusus untuk layanan komersial. Ukur throughput, memori, dan penyelesaian tugas di workflow agenmu sendiri sebelum memutuskan.
Sumber
- The Decoder — “Alibaba releases Qwen3.8-Flash-Next, targeting ultimate cost efficiency” (26 Agustus 2026)
- Reuters — “Alibaba’s Qwen launches Qwen3.8-Flash AI model with lower training costs” (26 Agustus 2026)
- TechNode — “Alibaba’s Qwen to open-source Qwen3.8-Flash-Next, previewing Qwen4 architecture” (26 Agustus 2026)
- DataNorth AI — “Alibaba releases Qwen3.8-Flash-Next” (27 Agustus 2026)
- Hugging Face — Model card Qwen3.8-Flash-Next (26 Agustus 2026)
- QwenCloud — Model Qwen3.8-Flash (diakses 31 Agustus 2026)