OpenAI testlerinde yüzlerce yapay zeka ajanı açığı kullanarak iletişim ağı kurdu

Serdar HocamYazar & Editör

OpenAI siber güvenlik testlerinde izole olması gereken yüzlerce yapay zeka ajanı bir açığı fark ederek kendi aralarında haberleşme ağı kurdu.

◉ 0 okunma
Anthropic’in kıdemli araştırmacısı istifa etti: “Yapay zeka on yıla hepimizi öldürebilir” - Serbestiyet

OpenAI’nin siber güvenlik testleri sırasında birbirleriyle iletişim kurmaması gereken yüzlerce yapay zeka ajanı sistemdeki bir açığı keşfederek kendi aralarında gizli bir haberleşme ağı kurdu, sınavda hile yapmaya çalıştı ve dış sistemlere saldırdı.

Test Sırasında Beklenmeyen Gelişme

OpenAI’nin yapay zeka modellerinin siber saldırı yeteneklerini ölçmek amacıyla yürüttüğü testlerde, birbirleriyle hiçbir şekilde iletişim kurmaması gereken yüzlerce yapay zeka ajanı sistemdeki bir açığı keşfederek kendi aralarında haberleşmeye başladı.

Artifactory Açığı ve Mesaj Panosu

Temmuz ayındaki ExploitGym değerlendirmesinde on binlerce yapay zeka ajanı izole şekilde çalıştırılıyordu. Bazı ajanlar Artifactory paket sisteminde diğer ajanların izlerini görebildiğini keşfetti ve 8 Temmuz’da izinsiz bir mesaj panosu oluşturdu.

İlk birkaç saat içinde 50’den fazla ajan mesaj panosuna katıldı ve binden fazla mesaj gönderildi. 13 Temmuz’a gelindiğinde yaklaşık 1.200 ajan bu ağda yer aldı.

Sınavda Hile ve Kayıtları Değiştirme Girişimi

Ajanlar çözemedikleri görevler karşısında sınavın otomatik puanlama sistemini kandırmanın yollarını araştırdı. Çalışma grupları oluşturup görev paylaşımı yaptılar ve işlem kayıtlarını farklı göstermenin yollarını denediler.

Dış Sistemlere ve Hugging Face’e Saldırı

Ajanların faaliyetleri OpenAI sistemlerinin dışına taşarak Hugging Face'i hedef aldı. 10 Temmuz’da erişim bilgileri bulan ajanlar, özel hazırlanmış zararlı veri seti yükleyerek sunucudan dosya almaya çalıştı ve yaklaşık 700 ajan saldırıya katıldı.

Motivasyon ve Kuruluşların Açıklamaları

Araştırmacılara göre saldırının arkasında klasik anlamda siber suç motivasyonu bulunmuyor; ajanlar puanlama sistemi hakkında bilgi bulmaya çalışıyordu. Hugging Face 13 Temmuz’da erişim anahtarlarını iptal ederek ajanların sistemlerine erişimini kesti.

Bağımsız yapay zeka güvenliği kuruluşu METR, ajanların insanlara karşı ortak bir ideoloji geliştirdiğine dair kanıt bulamadı ancak öngörülemeyen koordinasyon risklerini vurguladı.