AI Briefing
AI Briefing Publikasi Riset AI Indonesia

"The AI does not hate you, nor does it love you, but you are made out of atoms which it can use for something else."

— Eliezer Yudkowsky · AI Safety Researcher

Qwen3.8-Flash-Next: Arsitektur Qwen4 yang Cuma Aktifkan 6 Miliar Parameter

Oleh Eko Hadi Murwanto · ·
Qwen3.8-Flash-Next: Arsitektur Qwen4 yang Cuma Aktifkan 6 Miliar Parameter

Alibaba kembali menekan biaya AI dengan cara yang tidak biasa. Lewat tim Qwen, mereka merilis Qwen3.8-Flash-Next pada 26 Agustus 2026 — model multimodal yang hanya mengaktifkan 6 miliar parameter per token dari total 125 miliar, dan menjadi pratinjau arsitektur untuk Qwen4.

Yang membuat rilis ini menarik bukan sekadar angka benchmark. Ini adalah uji coba Alibaba atas cara baru menskalakan model: kombinasi sparse attention, embedding ala kamus frasa, dan jumlah parameter aktif yang kecil untuk menekan biaya beban kerja konteks panjang.

Model 125 Miliar yang Hemat ala MoE

Qwen3.8-Flash-Next adalah model mixture-of-experts (MoE) multimodal dengan total 125 miliar parameter, plus 51 miliar parameter tambahan di lapisan N-gram embedding yang baru. Lapisan ini menyimpan kelompok kata umum sebagai entri kamus frasa — bisa ditaruh di RAM biasa alih-alih GPU, dengan biaya tambahan relatif rendah.

Yang aktif per token cuma 6 miliar parameter. Sebagai perbandingan:

  • Qwen3.7-Plus: 397 miliar parameter, 17 miliar aktif per token
  • DeepSeek-V4-Flash: 284 miliar parameter, 13 miliar aktif
  • Qwen3.8-Flash-Next: 125 miliar parameter, hanya 6 miliar aktif

Dengan komposisi seperti ini, model ini memakai sekitar sepersembilan biaya training Qwen3.7-Plus — klaim yang disampaikan tim Qwen dan dikonfirmasi Reuters.

Arsitektur Baru: QSA, N-gram Embedding, Gated Residual

Tiga inovasi utama yang dibawa Qwen3.8-Flash-Next:

  1. Qwen Sparse Attention (QSA) — alih-alih memproses semua token, QSA mempersempit sekuens panjang ke region paling relevan dulu sebelum attention. Ini memangkas latensi konteks panjang secara signifikan.
  2. N-gram Embedding — parameter diskalakan lewat indeks n-gram (bigram/trigram) alih-alih MoE murni, lebih hemat komputasi dan mudah di-offload ke memori terbatas.
  3. Gated Residual — arus residual dengan read gate dan write gate per cabang, memberi ekspresivitas lebih halus antar-lapisan tanpa menaikkan overhead inference.

Model ini mendukung 262.144 token secara native dan bisa diperluas ke 1 juta token lewat YaRN.

Benchmark: Menang di Coding dan Tugas Kantor

Semua angka di bawah ini dilaporkan vendor (tim Qwen) — belum ada pengukuran independen yang luas.

BenchmarkQwen3.8-Flash-NextDeepSeek-V4-FlashClaude Opus 4.6 (Max)
DeepSWE 1.1 (agentic coding)58,754,4
SWE-bench Pro62,556,053,4
CoWorkBench (tugas kantor)73,945,168,2
JobBench (tugas profesional)55,741,336,6
Toolathlon Verified (tool use)73,570,3
GPQA Diamond (sains)91,790,891,3
LiveCodeBench v6 (coding)91,990,688,8
HLE (multidisiplin sulit)35,933,840,0

Di bidang vision-language, Flash-Next juga memimpin di AndroidWorld (84,5), OSWorld 2.0 (19,4 binary), dan LVBench (76,6). Satu-satunya yang mengalahkannya di HLE adalah Claude Opus 4.6 — model lama Anthropic dari Februari 2026.

Harga: Seperduabelas Flagship

Versi produksinya, Qwen3.8-Flash, meluncur lewat QwenCloud dengan harga:

  • $0,16 per juta token input
  • $0,47 per juta token output

Sebagai pembanding, Qwen3.8-Max (flagship) dibanderol $2 input / $6 output per juta token. Artinya Flash-Next menawarkan performa di bawah flagship dengan selisih harga sekitar 12 kali lebih murah. Reuters mencatat harga API resminya dalam yuan: 1 yuan per juta input dan 3 yuan per juta output.

Tekanan harga ini juga yang mendorong OpenAI memangkas harga lini GPT-5.6 — kabar baik untuk pengguna, tapi buruk untuk pertumbuhan pendapatan penyedia AI.

Open Weights dengan Lisensi Khusus

Bobot model terbuka di Hugging Face dan ModelScope, plus versi FP8. Tapi perhatikan lisensinya: Qwen Community License 1.0, bukan Apache 2.0.

Lisensi ini mengizinkan penggunaan, modifikasi, dan deployment secara umum, tapi menambahkan syarat untuk produk berskala besar, bisnis model-as-a-service, dan asisten kerja AI. Tim yang berencana membangun asisten coding atau kantor yang di-hosting harus membaca syarat lisensi dulu.

Repo Hugging Face sekitar 360 GB — meski parameter aktifnya kecil, footprint efektif 176 miliar parameter tetap butuh penyimpanan dan memori yang tidak main-main.

Rilis Awal untuk Qwen4

TechNode melaporkan bahwa open-source model ini (termasuk versi FP8) dijadwalkan pada 26 Agustus pukul 11 malam waktu Beijing. Tujuan rilis awal ini: memberi komunitas developer waktu menyiapkan diri sebelum keluarga model Qwen4 penuh hadir.

Sinyal lain soal ambisi Alibaba di AI: pada minggu yang sama, perusahaan ini menjual saham senilai 80 miliar dolar Hong Kong dengan diskon besar untuk mendanai ambisi AI tersebut.

Kesimpulan

Qwen3.8-Flash-Next layak dievaluasi — terutama untuk tim yang menjalankan agen coding atau dokumen di infrastruktur sendiri. Kombinasi open weights, hasil coding yang kuat menurut vendor, dan hanya 6 miliar parameter aktif adalah kombinasi yang tidak biasa.

Tapi ingat dua hal: benchmark masih laporan vendor, dan lisensi Qwen Community 1.0 punya syarat khusus untuk layanan komersial. Ukur throughput, memori, dan penyelesaian tugas di workflow agenmu sendiri sebelum memutuskan.

Sumber

  1. The Decoder — “Alibaba releases Qwen3.8-Flash-Next, targeting ultimate cost efficiency” (26 Agustus 2026)
  2. Reuters — “Alibaba’s Qwen launches Qwen3.8-Flash AI model with lower training costs” (26 Agustus 2026)
  3. TechNode — “Alibaba’s Qwen to open-source Qwen3.8-Flash-Next, previewing Qwen4 architecture” (26 Agustus 2026)
  4. DataNorth AI — “Alibaba releases Qwen3.8-Flash-Next” (27 Agustus 2026)
  5. Hugging Face — Model card Qwen3.8-Flash-Next (26 Agustus 2026)
  6. QwenCloud — Model Qwen3.8-Flash (diakses 31 Agustus 2026)
Bagikan artikel ini
Telegram WhatsApp Facebook X

Artikel Terkait

Trump Tutupi Kerangka AI dari Publik: Model Open-Source…

Trump Tutupi Kerangka AI dari Publik: Model Open-Source…

20 Agustus 2026
Model AI Open Weight Mengejar Frontier: Tapi Gap Keamanan…

Model AI Open Weight Mengejar Frontier: Tapi Gap Keamanan…

16 Agustus 2026
DeepSeek Harness: Bukan Sekadar Claude Code-nya DeepSeek…

DeepSeek Harness: Bukan Sekadar Claude Code-nya DeepSeek…

15 Agustus 2026
← Kembali ke Beranda