Nvidia Rilis Nemotron 3.5 Lightning: Model AI Open Source Tercepat di Dunia
Nvidia resmi memperkenalkan Nemotron 3.5 Lightning pada 11 Agustus 2026. Model ini hadir sebagai model open-weight yang bisa diunduh dan dimodifikasi secara gratis oleh siapa saja, tanpa perlu izin maupun pembayaran kepada Nvidia.
Arsitektur: 30B MoE dengan 3B Parameter Aktif
Nemotron 3.5 Lightning menggunakan arsitektur Mixture of Experts (MoE) dengan total 30 miliar parameter. Keunikannya, hanya 3 miliar parameter yang aktif dalam setiap kali inferensi. Pendekatan ini membuat konsumsi memori jauh lebih rendah dibandingkan model dense dengan jumlah parameter serupa.
Berdasarkan dokumentasi resmi Nvidia, model ini dirancang khusus untuk agente AI yang berjalan lama.-Agente semacam ini menghabiskan sebagian besar waktu untuk tugas repetitif: pemanggilan tool, validasi hasil, dan delegasi ke sub-agente. Menghadirkan model reasoning frontier untuk setiap langkah eksekusi akan membuat biaya membengkak. Nemotron 3.5 Lightning menawarkan alternatif yang lebih murah dan cepat untuk beban kerja semacam ini.
Kecepatan 670 Token per Detik
Kecepatan adalah nilai jual utama Nemotron 3.5 Lightning. Model ini mencatatkan sekitar 670 token per detik, menjadikannya model tercepat yang tersedia saat ini untuk tugas-tugas spesifik agente.
Yang tidak kalah mengejutkan: walau berbadan empat kali lebih kecil dari OpenAI GPT-oss-120b, Nemotron 3.5 Lightning menyaingi model OpenAI tersebut di Intelligence Index. Skor yang setara dengan model 120 miliar parameter, dari tubuh yang hanya sepersekiannya, menjadi bukti efisiensi arsitektur MoE yang dipakai Nvidia.
NeMo Switchyard: Routing Library untuk Kontrol Lebih Fleksibel
Selain model, Nvidia juga merilis NeMo Switchyard secara bersamaan. Ini adalah library routing yang memberikan kontrol lebih besar atas alur kerja AI di berbagai perangkat: dari edge device, PC, workstation, data center, hingga cloud.
Menurut blog resmi Nvidia, kombinasi Nemotron 3.5 Lightning dan NeMo Switchyard memungkinkan pengembangan agente yang lebih cerdas, lebih cepat, dan lebih efisien dalam mengelola data serta alur kerja.
Speculative Decoding dan NVFP4 Quantization
Dari sisi teknis, Nemotron 3.5 Lightning menggunakan dua teknologi utama untuk mencapai kecepatan tinggi. Pertama, speculative decoding — teknik yang memungkinkan model memprediksi beberapa token sekaligus sebelum token sebelumnya selesai diproses. Kedua, NVFP4 quantization, metode penyimpanan bobot model dalam format presisi rendah yang secara signifikan mengurangi kebutuhan memori tanpa mengorbankan akurasi secara berarti.
Gratis untuk Enterprise
Nvidia memastikan Nemotron 3.5 Lightning benar-benar bebas digunakan. Perusahaan boleh mengunduh, menggunakan, dan memodifikasi model ini tanpa perlu meminta izin maupun membayar lisensi kepada Nvidia. Langkah ini menandai pendekatan agresif Nvidia dalam mendemokratisasi akses terhadap model AI berkinerja tinggi.
Menyoal Persaingan Model AI
Peluncuran Nemotron 3.5 Lightning terjadi di tengah gelombang pembaruan model AI yang sangat kompetitif. OpenAI baru saja meresmikan GPT-5.6-Cyber untuk keamanan siber awal Agustus ini. Di sisi lain, DeepSeek dikabarkan mempersiapkan V4-Pro yang disebut-sebut akan melanjutkan strategi harga murah untuk menekan kompetitor.
Dalam lanskap tersebut, langkah Nvidia melempar model open source yang mengunggulkan kecepatan — bukan semata kekuatan reasoning — memberikan pilihan berbeda bagi developer yang lebih mengutamakan respons cepat dan biaya rendah di atas performa puncak.
Nvidia Nemotron 3.5 Lightning menegaskan satu hal: perang model AI tidak selalu soal siapa yang terbesar, tapi siapa yang paling efisien untuk tugas yang dimaksud.
Sumber
- NVIDIA Developer Blog — “Nemotron 3.5 Lightning Delivers Fast, Accurate Specialized Task Execution” (11 Agustus 2026)
- NVIDIA Blogs — “Nemotron 3.5 Lightning and NeMo Switchyard” (11 Agustus 2026)
- The Decoder — “Nvidia’s open-weight Nemotron 3.5 Lightning prioritizes speed over maximum intelligence” (11 Agustus 2026)
- MindStudio — “NVIDIA Nemotron 3.5 Lightning: A 30B MoE Built for Agent Grunt Work” (11 Agustus 2026)
- Labellerr — “NVIDIA Nemotron 3.5 Lightning: High Speed, Low Cost AI Agents” (13 Agustus 2026)