OpenAI Modeli GPT-6 Astra ARC-AGI-3 Benchmark Sınavında Rekor Kırdı
GPT-6 Astra, ARC-AGI-3 benchmark testinde standart ve sağlayıcı adaptör donanımlarıyla üstün başarı elde ederek insan verimliliğini geride bıraktı.
OpenAI tarafından geliştirilen GPT-6 Astra, ARC-AGI-3 Semi-Private benchmark testinde rekor düzeyde skorlar elde ederek alanında yeni bir eşik belirledi.
Benchmark Testinde Elde Edilen Başarılar
Astra modeli ARC-AGI-3 testinde Standart donanım ile 26 bin dolar maliyetle yüzde 62.7 skor elde ederken, Sağlayıcı Adaptör donanımı ile 19 bin dolar maliyetle yüzde 99.9 başarıya ulaştı.
İnsan Verimliliğinin Aşılması
Yapılan değerlendirmelerde GPT-6 Astra, seviyelerin yüzde 96'sında test edilen medyan insan oyuncuya kıyasla daha az eylem gerçekleştirerek insan taban çizgisini geride bıraktı.
Sembolik Dünya Modelleri ve Eylem Planlaması
Astra'nın bilinmeyen ortamları kompakt sembolik dünya modellerine dönüştürebildiği, oyun mekaniklerini mantıksal kurallar olarak temsil ettiği ve durum takibi ile eylem planlaması için kendi alan adını yarattığı gözlemlendi.
ARC-AGI-3 Ölçüm Kriterleri
Üçüncü nesil bir benchmark olan ARC-AGI-3; keşif, modelleme, hedef belirleme ve planlama ile yürütme olmak üzere ajanssal zekanın dört temel bileşenini test ediyor.
Araştırma Bulguları ve Kapsam Sınırları
Yeniden oynatma analizleri özel cebirsel gösterim, yüksek eylem verimliliği ve gelişmiş ajan donanımlarında oluşturulan özel araçları ortaya koyarken, testin gerçek dünyanın açık uçluluğunu tam olarak yansıtmadığı vurgulanıyor.