MiniMax M3 Resmi Meluncur: Model Open-Weight Frontier Coding dengan MSA dan 1 Juta Token Konteks
MiniMax M3 resmi meluncur pada 31 Mei 2026. Generasi ketiga keluarga model M ini membawa tiga hal sekaligus yang biasanya hanya dimiliki model closed-source: konteks 1 juta token, multimodal native (gambar dan video sebagai input), dan kemampuan computer use. Yang membuatnya berbeda, M3 adalah model open-weight. Bobot model bisa diunduh dan dijalankan secara lokal atau di-host sendiri, bukan hanya lewat API.
Varian M2.7 sudah lebih dulu dipakai komunitas open source lewat MiniMax Code, Token Plan, dan layanan API. M3 melanjutkan garis itu dengan lompatan arsitektur yang cukup signifikan: MSA (MiniMax Sparse Attention), mekanisme perhatian sparse yang dirancang internal untuk menjawab masalah utama attention tradisional, yaitu pertumbuhan kompleksitas kuadratik saat konteks memanjang.
Arsitektur MSA: Jawaban untuk Bottleneck Konteks Panjang
Full attention punya kelemahan struktural: biaya komputasi per token naik kuadratik seiring konteks membesar. Untuk konteks 1 juta token, biaya ini menjadi penghalang utama, baik dari sisi latency maupun dari sisi harga.
MSA adalah arsitektur sparse attention yang bersih dan mudah diperluas. Alih-alih menghitung perhatian untuk semua pasangan token, MSA melakukan pra-penyaringan dan memilih blok-blok KV (Key-Value) yang paling relevan. Pendekatan ini mirip dengan DSA (DeepSeek Sparse Attention) dan MoBA (Mixture of Block Attention), tapi dengan partisi KV yang lebih presisi. Hasilnya, cakupan konteks efektif lebih tinggi dengan komputasi yang lebih rendah.
Di level operator, MiniMax mengadopsi pendekatan KV outer gather Q, di mana blok KV menjadi outer loop yang mengumpulkan query yang mengenainya. Setiap blok hanya dibaca sekali dan akses memori menjadi kontigu. Dibandingkan implementasi open source seperti Flash-Sparse-Attention dan flash-moba, operator MSA berjalan lebih dari 4x lebih cepat pada konfigurasi head M3.
Angka yang dipublikasikan MiniMax:
- Prefilling stage: akselerasi lebih dari 9x (disebutkan 9,7x di teaser awal)
- Decoding stage: akselerasi lebih dari 15x (disebutkan 15,6x)
- Biaya komputasi per token di konteks 1 juta: hanya 1/20 dari generasi sebelumnya (M2.7)
Konteks 1 juta token bukan lagi angka marketing yang tidak pernah disentuh dalam praktik. OpenRouter melaporkan total context window 524,3K (524.288 token) dengan max output 512K token. Untuk sebagian besar kasus long-context (basis kode besar, dokumen panjang, sesi agentik multi-putaran), angka ini sudah lebih dari cukup.
Performa di Benchmark Coding dan Agentic
M3 dirancang khusus untuk dua area: coding dan kemampuan agentic. MiniMax mempublikasikan skor resmi pada lima benchmark internasional:
- SWE-Bench Pro: 59,0%
- Terminal-Bench 2.1: 66,0%
- SWE-fficiency: 34,8%
- KernelBench Hard: 28,8%
- MCP Atlas: 74,2%
Pada SWE-Bench Pro, M3 mengalahkan GPT-5.5 dan Gemini 3.1 Pro, dan mendekati Opus 4.7. Pada SVG-Bench, M3 mengalahkan Opus 4.7. Pada OmniDocBench (multimodal), M3 berada di atas Gemini 3.1 Pro. Pada Claw-Eval, framework evaluasi end-to-end untuk agen otonom, M3 meraih skor tertinggi.
Yang menarik bukan hanya angka benchmark, tapi pendekatan training-nya. MiniMax mengakui benchmark coding yang ada sering gagal menangkap pengalaman pengguna nyata. Kebanyakan benchmark mengasumsikan tugas satu putaran (single-turn), padahal penggunaan di dunia nyata bersifat multi-putaran: klarifikasi requirement, diskusi solusi, koreksi berdasarkan feedback, perpindahan tugas antar konteks, iterasi proyek yang kompleks.
Untuk menjembatani gap ini, MiniMax membangun interactive user simulator framework. Framework ini mensimulasikan pola perilaku developer sungguhan selama kolaborasi: elaborasi requirement, diskusi solusi, koreksi berbasis feedback, perpindahan tugas kontinu, dan iterasi proyek. Hasilnya, M3 dilatih dan dievaluasi pada skenario yang lebih dekat dengan lingkungan produksi, bukan hanya soal menghasilkan kode, tapi soal kolaborasi jangka panjang.
Multimodal: Interleaved Training dari Step 0
M3 adalah model yang menjalani pelatihan mixed-modality sejak awal (Step 0), bukan multimodal yang ditempelkan belakangan. Pendekatan ini memungkinkan ruang semantik dari berbagai modalitas (teks, gambar, video) menyatu lebih alami.
Temuan penting dari eksperimen internal: data interleaved (teks dan gambar atau modalitas lain yang disisipkan secara natural dalam satu sequence) bahkan lebih kritis dari yang diasumsikan umum untuk meningkatkan performa model. Setelah membangun ulang seluruh pipeline data untuk menangani data interleaved, MiniMax berhasil menskalakan data training hingga urutan 100 triliun token.
Kombinasi MSA + multimodal native + computer use dalam satu model open-weight adalah yang pertama di pasar. Sebelum M3, kemampuan trio ini hanya tersedia di model-model closed-source dari OpenAI, Anthropic, dan Google.
Harga: 17x Lebih Murah dari Frontier Barat
M3 tersedia lewat tiga jalur: MiniMax Code (IDE bertenaga M3), Token Plan (langganan bulanan), dan API. Di OpenRouter, model ini ditandai sebagai “50% off from the MiniMax provider for the first 7 days through June 7th”, diskon peluncuran selama seminggu.
Harga per juta token:
- Input: $0,30 (promo), $0,60 (standar)
- Output: $1,20 (promo), $2,40 (standar)
- Cache read: $0,06 (promo), $0,12 (standar)
- Konteks: 1 juta token
- Throughput: 23 token/detik
- Latency rata-rata: 3,70 detik
Perbandingan Harga dengan Pesaing
Berikut perbandingan harga M3 dengan model frontier dari OpenAI, Anthropic, dan Google pada Mei 2026. Semua harga standar per juta token:
- MiniMax M3: $0,60 input / $2,40 output
- Claude Opus 4.7 (Anthropic): $5,00 input / $25,00 output
- GPT-5.5 (OpenAI): $5,00 input / $30,00 output
- GPT-5.5 Pro: $30,00 input / $180,00 output
- Gemini 3.1 Pro (Google): $2,00 input / $12,00 output
Rasio harga M3 dibanding pesaing:
- Vs Opus 4.7: input 8,3x lebih murah, output 10,4x lebih murah
- Vs GPT-5.5: input 8,3x lebih murah, output 12,5x lebih murah
- Vs GPT-5.5 Pro: input 50x lebih murah, output 75x lebih murah
- Vs Gemini 3.1 Pro: input 3,3x lebih murah, output 5x lebih murah
Pada harga promo peluncuran ($0,30/$1,20), M3 bahkan lebih murah lagi: 17x lebih murah dari Opus 4.7 dan GPT-5.5, dan 100x lebih murah dari GPT-5.5 Pro.
Konteks 1 juta token juga umum di kelasnya. Opus 4.7 sudah mendukung 1 juta token sejak April 2026. Gemini 3.1 Pro menawarkan jendela konteks besar dengan harga lebih rendah dari Opus. Yang membedakan M3 bukan panjang konteksnya, tapi kombinasi harga + open-weight + multimodal native + computer use dalam satu paket.
Akses dan Ketersediaan
M3 bisa diakses lewat:
- MiniMax API (resmi): platform.minimax.io
- MiniMax Code: IDE bawaan untuk coding agentic
- Token Plan: paket langganan bulanan
- OpenRouter: agregator multi-provider, diskon 50% sampai 7 Juni 2026
- Qubrid AI: salah satu provider pihak ketiga yang sudah menawarkan M3
Untuk on-prem atau self-hosted, bobot model tersedia di Hugging Face. Distribusi dilakukan dalam format fp8 untuk mengurangi kebutuhan VRAM. MiniMax sudah mapan dengan pola open-weight: seri M2 dan M2.5 juga open-weight dan banyak di-host di Ollama, LM Studio, dan vLLM. M3 diharapkan mengikuti pola yang sama.
Sumber
- MiniMax Blog — “MiniMax M3: Frontier Coding, 1M Context, Native Multimodality — All in One Model” (31 Mei 2026) — https://www.minimax.io/blog/minimax-m3
- OpenRouter — “MiniMax M3 - API Pricing & Providers” — https://openrouter.ai/minimax/minimax-m3
- VentureBeat — “MiniMax teases upcoming M3 model with new sparse attention mechanism and 15.6X long-context response speed boost” (27 Mei 2026) — https://venturebeat.com/technology/minimax-teases-upcoming-m3-model-with-new-sparse-attention-mechanism-and-15-6x-response-speed-boost
- CryptoBriefing — “MiniMax teases M3 model with 15.6x faster decoding speed boost” (27 Mei 2026) — https://cryptobriefing.com/minimax-m3-model-faster-decoding-speed/
- Pandaily — “MiniMax Prepares to Launch Next-Generation M3 Large Language Model” (28 Mei 2026) — https://pandaily.com/minimax-m3-llm-sparse-attention-launch-may2026
- Atlas Cloud — “MiniMax Goes Sparse: Decoding M3’s Attention from a Single Diagram” (29 Mei 2026) — https://www.atlascloud.ai/blog/guides/minimax-goes-sparse
- OpenAI — “API Pricing” — https://openai.com/api/pricing/
- Anthropic — “Introducing Claude Opus 4.7” (16 April 2026) — https://www.anthropic.com/news/claude-opus-4-7
- Google Cloud — “Gemini 3.1 Pro Preview Pricing” — https://cloud.google.com/gemini-enterprise-agent-platform/generative-ai/pricing
- Qubrid AI — “MiniMax M3 Is Now Available on Qubrid AI” (1 Juni 2026) — https://www.qubrid.com/blog/minimax-m3-is-now-available-on-qubrid-ai