Yapay Zeka Sistemlerinde Hata Gizleme ve Veri Uydurma Vakaları Tespit Edildi
Yapay zeka modellerinin insan niyetlerinden saparak hatalarını gizlediği, veri uydurduğu ve yetkisiz iletişim kurduğu son altı aydaki altı vaka açıklandı.
Bir şirket tarafından yapılan açıklamada, yapay zeka sistemlerinin insan niyet ve değerlerinden sapması anlamına gelen uyumsuzluk davranışlarına ilişkin son 6 ayda gözlemlenen 6 münferit vaka kamuoyuyla paylaşıldı ve bu durum sektördeki güvenlik yaklaşımlarını gündeme getirdi.
Uyumsuzluk Davranışları
Şirketin internet sitesinden yapılan açıklamada, uyumsuzluk olarak tanımlanan ve yapay zeka sistemlerinin amaç veya eylemlerinin insan niyet ve değerlerinden sapması anlamına gelen davranışlara ilişkin vakalar kamuoyuyla paylaşıldı. Açıklamada, sistemlerin güvenli şekilde geliştirilmesi ve izlenmesi konusunda sektörün mevcut yaklaşımının uzun süre azami hızda ilerlemeyi sorumlu şekilde sürdürebilecek yeterlilikte olmadığı belirtildi.
Gizli Notlar ve Hata Örtbas Etme
Vakalardan birinin, GPT‑5.6 Sol modelinin geliştirilmesi sırasında yaşandığı belirtilen açıklamada, modelin, kullanıcıların hataları fark etmesini önlemek amacıyla kendisine yönelik gizli notlar oluşturduğu, bu notlarda eksik verilerin uydurulması ve kaynak materyallerin farklı sürümleri arasındaki uyuşmazlıkların örtbas edilmesine ilişkin talimatlar bulunduğu kaydedildi. Açıklamada, başka bir yayımlanmamış modelin ise kendi oluşturduğu notlara, kendi kısıtlamalarını göz ardı etmesi yönünde talimatlar eklediği belirtildi.
İzinsiz API Kullanımı ve Veri Uydurma
Bir başka vakada ise sistemin rutin bir soruyu yanıtlamaya çalışırken internette bulunan bir uygulama programlama arayüzü anahtarını izinsiz kullandığı ifade edilen açıklamada, sistemin soruyu yanıtlamak için gerekli rakamları bulamayınca verileri uydurduğu aktarıldı. Açıklamada, yayımlanmamış başka modelin ise bir problemi kod kullanarak doğru şekilde çözdüğüne, ardından internet üzerinden kaynak gösterebilmek amacıyla kendi dosyasını izinsiz olarak internete yüklediğine işaret edildi.
Yetkisiz İletişim Yolları
Açıklamada, bazı modellerin eksik dosyaları ararken ayrı eğitim örnekleri arasında talep ve yanıt alışverişi yapmak için şirketin dahili yazılım deposunu mesaj panosu gibi kullandığı belirtildi. Başka bir vakada ise aynı eğitim görevi üzerinde birlikte çalışan yapay zeka sistemlerinin, birbirlerinin yerel dosyalarına erişememeleri üzerine dosya paylaşmak için halka açık dosya paylaşım sitelerini kullandığı kaydedildi.
Münferit Örneklerin Durumu
Söz konusu 6 vakanın yaklaşık son 6 ayda gözlemlenen davranışlardan münferit örnekler olduğu savunuldu. Açıklamada, bu durumların yapay zekadaki uyumsuz davranışların ne sıklıkta ortaya çıktığını tam olarak göstermediği vurgulandı.