USC Araştırmacıları Yapay Zeka Sağlık Tavsiyelerinin Güvenliğini Test Ediyor
USC araştırmacıları, yapay zeka tabanlı sohbet botlarının tıbbi tavsiyelerindeki doğruluk, eksiksizlik ve güvenlik açıklarını tespit etmek için ALICE projesini geliştiriyor.
USC araştırmacıları, yapay zeka sohbet botlarının kullanıcılara verdiği sağlık bilgilerinin doğruluğunu, eksiksizliğini ve güvenliğini test etmek amacıyla ALICE projesini hayata geçiriyor.
Yapay Zeka ve Tıbbi Tavsiye Riskleri
İnsanlar tıbbi sorularla yapay zeka sohbet botlarına başvurmakta ve bu sistemler saniyeler içinde sakin ve otoriter ses tonlarıyla yanıt vermektedir. Ancak bu sistemler bazen hatalı bilgiler üretebilmekte, acil durumları hafife alabilmekte veya kritik uyarıları atlayabilmektedir.
Marjorie Freedman, bu tür sistemlerin yüzde 90 oranında doğru olabileceğini ancak geriye kalan yüzde 10'luk yanılma payının son derece yanıltıcı ve potansiyel olarak zararlı olabileceğini belirtmektedir.
ALICE Projesinin Amacı
ALICE projesi, sohbet botlarının tıbbi sorulara verdiği yanıtların doğru, eksiksiz ve eyleme geçirilebilir olup olmadığını test etmek için daha iyi yöntemler geliştirmeyi hedeflemektedir.
Proje, yanlış ifadeleri ve eksik bilgileri tespit etmenin yanı sıra verilen yanıtın hastalar, ebeveynler ve sağlık profesyonelleri için net, yararlı ve uygun aciliyet barındırıp barındırmadığını da incelemektedir.
İnsan Uzmanlar ve Doğruluk Zorlukları
Araştırmacılar, üç farklı sohbet botundan gelen yüzlerce yanıtı incelemiş ve tek bir kişinin bir yanıtı bir kez kontrol ederek güvenilir kabul etmesinin yetersiz olduğunu ortaya koymuştur.
İlk incelemelerde insan gözden geçirenler bazı gerçek hataları gözden kaçırırken, daha sonra bu hatalar tıp uzmanları ve profesyonel doğruluk kontrolörleri tarafından fark edilmiştir.
Eksik Bilgilerin Tespiti
İkinci bir çalışma grubu ise yanıtlardaki eksiklikler üzerine odaklanmış ve tıp uzmanları gerçek hasta sorularına verilen yanıtları inceleyerek eksik olan önemli bilgileri işaretlemiştir.
Test edilen en güçlü otomatik yaklaşım, eksikliklerin yüzde 90'ından fazlasını yakalamayı başarmış ancak çok sayıda yanlış alarm da üretmiştir.
Geleceğe Yönelik Sertifikasyon Hedefi
Jonathan May, tıp gibi yüksek riskli bağlamlarda sohbet botlarına benzer bir sertifikasyon sağlamak istediklerini, böylece tüketicilerin çıktılarına güvenebileceklerini ifade etmiştir.
İki yıl sürecek olan ve 17 Eylül 2026'ya kadar devam edecek bu proje, Advanced Research Projects Agency for Health tarafından finanse edilmektedir.