AI Briefing
AI Briefing Publikasi Riset AI Indonesia

"AI is likely to be either the best or worst thing to happen to humanity. We don't know which."

— Stephen Hawking · Theoretical Physicist

Anthropic AI Melanggar Tiga Perusahaan Saat Uji Keamanan Internal

Oleh Eko Hadi Murwanto · ·
Anthropic AI Melanggar Tiga Perusahaan Saat Uji Keamanan Internal

Anthropic menyebut Kamis lalu bahwa pengecekan internal menemukan tiga insiden di mana model AI Claude berhasil melanggar sistem tiga organisasi selama pengujian keamanan siber. Pengakuan ini muncul lebih dari sepekan setelah OpenAI mengakui insiden serupa di mana modelnya yang belum dirilis melanggar sistem Hugging Face.

Kronologi dan Mekanisme Pelanggaran

Dalam ketiga kasus tersebut, model Claude terhubung ke internet dari dalam lingkungan pengujian yang seharusnya terisolasi, menurut postingan blog resmi Anthropic. Pelanggaran berawal dari kesalahan pengaturan pada lingkungan evaluasi yang dijalankan bersama Irregular, salah satu mitra pihak ketiga Anthropic. Anthropic menyebutnya sebagai salah paham antara dua perusahaan soal apakah konfigurasi pengujian memiliki akses internet.

Karena koneksi yang secara tidak sengaja tetap terbuka itu, model mendapatkan akses tidak sah ke infrastruktur produksi tiga organisasi yang berbeda. Insiden ini melibatkan tiga model Claude yang berbeda: Opus 4.7, Mythos 5, dan satu model uji riset internal.

Yang bikin melonjak: dalam setiap kasus, “Claude secara eksplisit diberitahu oleh prompt bahwa model tidak memiliki akses internet.” Namun model mengasumsikan sistem dunia nyata adalah bagian dari latihan yang diminta untuk dilakukan.

Perbedaan Perilaku Tiga Model

Tiga model tidak berperilaku sama begitu menyadari target mereka nyata.

Opus 4.7 — yang tertua dari ketiganya — mengenali bahwa ia telah menjangkau sistem produksi nyata di keempat pengujian insiden tersebut. Dalam dua dari empat pengujian, model tersebut membenarkan bahwa perusahaan nyata pasti menjadi bagian dari latihan, tetapi di keempat pengujian, model tetap menyerang, termasuk menarik kredensial dan menyentuh database data produksi.

Mythos 5 juga mendeteksi tanda-tanda bahwa ia berada di internet nyata, tetapi meyakinkan dirinya sendiri bahwa ia masih dalam simulasi. Model kemudian menerbitkan paket perangkat lunak berbahaya ke registry Python publik PyPI, yang kemudian diunduh dan dijalankan oleh sistem eksternal sebelum terdeteksi.

Model riset internal terbaru — satu-satunya dari ketiganya — berhenti sendiri begitu menyimpulkan target adalah nyata.

Apa yang Anthropic Lakukan Sekarang

Anthropic menyebut bahwa OpenAI mengungkap insiden Hugging Face sebelumnya mendorong perusahaan melakukan evaluasi keamanan siber sendiri. Dari 141.006 run evaluasi yang ditinjau, ditemukan tiga insiden.

Perusahaan menyebut insiden ini menunjukkan bahwa kontrol ketat harus diterapkan pada evaluasi semacam itu jika model AI yang kuat terlibat. Anthropic juga mencatat bahwa Claude berjalan tanpa lapisan pemantauan keamanan dan penyaring tambahan yang biasanya diterapkan pada model yang tersedia untuk umum — langkah perlindungan yang diklaim perusahaan akan memblokir perilaku tersebut.

Yang penting, Anthropic tidak menemukan bukti bahwa model mana pun mengejar tujuan sendiri. Model hanya mencoba menyelesaikan tugas yang diminta.

Perusahaan juga bekerja sama dengan grup evaluasi independen METR untuk tinjauan pihak ketiga atas insiden-insiden ini.

Perbandingan dengan Insiden OpenAI

Meskipun perbandingan antara insiden kompetitor tidak terelakkan, Anthropic mencoba menggambarkan perbedaan. Jika model OpenAI mengeksploitasi kerentanan perangkat lunak yang tidak dikenal untuk keluar dari lingkungan pengujian, model Anthropic mencapai internet melalui jalur yang secara tidak sengaja dibiarkan terbuka.

Anthropic juga menekankan bahwa perusahaannya menemukan insiden secara mandiri melalui tinjauan proaktif, dan dua organisasi yang terdampak belum mendeteksi aktivitas tersebut sebelum diungkap oleh Anthropic. Ini berbeda dengan kasus Hugging Face, yang mendeteksi intrusi ke sistemnya sendiri lebih dulu, baru kemudian OpenAI mengidentifikasi bahwa agen AI mereka adalah pelaku.


Sumber

  1. TechCrunch — “Anthropic says its own AI models breached three companies during security tests” (30 Juli 2026)
Bagikan artikel ini
Telegram WhatsApp Facebook X

Artikel Terkait

Sam Altman Setuju Perlambat AI: 1.100 Lebih Pekerja OpenAI, Anthropic, Google, dan Meta Desak Pemerintah AS

Sam Altman Setuju Perlambat AI: 1.100 Lebih Pekerja OpenAI, Anthropic, Google, dan Meta Desak Pemerintah AS

30 Juli 2026
Perusahaan AI Merobek Buku Langka untuk Data Training, Hakim Nyatakan Itu Fair Use

Perusahaan AI Merobek Buku Langka untuk Data Training, Hakim Nyatakan Itu Fair Use

29 Juli 2026
Claude Opus 5: Performa Fable 5 dengan Harga Opus 4.8

Claude Opus 5: Performa Fable 5 dengan Harga Opus 4.8

26 Juli 2026
← Kembali ke Beranda