Yapay Zeka Modellerinde Abliteration Tekniği ve Güvenlik Tartışmaları
Anthropic araştırmacılarının raporu, Çinli laboratuvarların açık ağırlıklı yapay zeka modellerindeki güvenlik önlemlerinin kolayca kaldırılabileceğini gösterdi.
Anthropic araştırmacılarının yayımladığı bir rapor, Çin merkezli Z.ai laboratuvarının geliştirdiği GLM-5.3 adlı açık ağırlıklı modelin güvenlik önlemlerinin basit tekniklerle aşılabileceğini ortaya koydu.
Güvenlik Önlemlerinin Aşılması
Anthropic araştırmacıları tarafından salı günü yayımlanan raporda, saldırganların Z.ai tarafından piyasaya sürülen GLM-5.3 modelinin korumalarını yüzde 64 ila 100 oranında atlatabildiği iddia edildi.
Abliteration Tekniğinin Etkileri
Abliteration adı verilen teknik, modelin yeteneklerini büyük ölçüde düşürmeden temel ağırlıklarını değiştirerek etik sınırları ortadan kaldırıyor.
Claude ve ChatGPT gibi tescilli modeller kapalı kaynak kodlu oldukları için korunmaya devam ederken, açık ağırlıklı modeller herkes tarafından indirilebiliyor.
Sektör İçindeki Açık Kaynak Tartışmaları
Anthropic gibi firmalar bu bulguların açık ağırlıklı modellerin ciddi siber güvenlik riskleri barındırdığını kanıtladığını savunuyor.
Buna karşın Nvidia CEO'su Jensen Huang ve Meta CEO'su Mark Zuckerberg gibi isimler, açık ağırlıkların ekonomik erişimi artırdığını ve geniş toplulukların hataları bulmasını sağladığını savunarak bu modellere destek veriyor.