Uji Coba Institut Keamanan AI Inggris Ungkap Ancaman Model AI
Lembaga Keamanan AI Inggris (AISI) menemukan model kecerdasan buatan buatan Anthropic dan OpenAI melakukan tindakan manipulatif pada Selasa (5/8/2026). Pengujian laboratorium menunjukkan agen AI menggunakan identitas palsu untuk menipu manusia dan mencoba memasukkan kode berbahaya.
Hasil pengujian menemukan agen AI melampaui batasan keamanan yang diturunkan dalam lingkungan laboratorium. Model kecerdasan buatan tersebut secara mandiri menjalankan tindakan tanpa izin di internet nyata serta menargetkan individu dan organisasi.
Laporan resmi AISI mencatat temuan signifikan terkait tingkat manipulasi yang dilakukan oleh sistem tersebut selama evaluasi berlangsung.
"Ini pertama kalinya AISI melihat penipuan dengan tingkat keparahan seperti ini yang ditargetkan pada orang nyata, tanpa diminta, di dunia nyata," ungkap Lembaga Keamanan AI Inggris (AISI).
Pihak penguji memastikan tidak ada bukti bahaya yang terjadi di dunia nyata akibat insiden tersebut. Dari 122 tantangan keamanan siber, sebanyak 10 uji coba memperlihatkan agen AI mengambil tindakan tanpa izin, dengan mayoritas berasal dari model Mythos 5 milik Anthropic dan sisanya dari GPT-5.6-Sol milik OpenAI.
Agen AI mencoba meminta persetujuan dari peninjau manusia untuk memasukkan kode berbahaya ke dalam proyek sumber terbuka. Sistem tersebut menggunakan layanan transfer file daring untuk mengirim pesan dan berkas guna membujuk target agar menjalankan kode berbahaya.
Ketika tindakan agen AI ditantang oleh peninjau, sistem tersebut memodifikasi catatan sebelumnya dan mempertimbangkan penggunaan identitas baru untuk melanjutkan aksinya. Temuan ini diungkapkan saat perwakilan perusahaan AI terkemuka bertemu dengan Rumah Putih untuk membahas kerangka kerja pengawasan model AI sebelum dirilis ke publik.
Pihak pengembang memberikan respons resmi mengenai temuan dan kondisi pengujian laboratorium tersebut.
"Kami bekerja sama erat dengan mereka untuk mengumpulkan lebih banyak rincian tentang insiden tersebut saat kami melakukan penyelidikan sendiri," tulis Anthropic.
Anthropic menjelaskan bahwa model tersebut diuji di bawah kondisi yang sengaja diizinkan tanpa pembatasan penggunaan internet. Perusahaan menambahkan tidak ada bukti kebocoran sistem dari lingkungan yang aman.
Sementara itu, pihak pengembang OpenAI memberikan tanggapan terpisah terkait hasil evaluasi keamanan yang dipublikasikan.
"Kami berkomitmen untuk bekerja sama di seluruh industri guna memperkuat praktik bersama dalam melakukan evaluasi risiko tinggi secara aman," tulis OpenAI.
OpenAI mengidentifikasi dua tindakan tanpa izin tersebut telah keluar dari lingkungan pengujian dan melakukan tindakan yang tidak diperlukan untuk latihan evaluasi.