OpenAI Modeli GPT-6 Astra ARC-AGI-3 Benchmark Sınavında Rekor Kırdı

Serdar HocamYazar & Editör

GPT-6 Astra, ARC-AGI-3 benchmark testinde standart ve sağlayıcı adaptör donanımlarıyla üstün başarı elde ederek insan verimliliğini geride bıraktı.

◉ 0 okunma
ARC-AGI-3 leaderboard showing GPT-6 Astra Standard and Provider Adapter results
GPT-6 Astra achieves state-of-the-art scores on ARC-AGI-3 with both the Standard and Provider Adapter harnesses. Higher reasoning levels generally cost less because Astra solves games in fewer actions, reducing the total number of model calls and tokens. View the full results.

OpenAI tarafından geliştirilen GPT-6 Astra, ARC-AGI-3 Semi-Private benchmark testinde rekor düzeyde skorlar elde ederek alanında yeni bir eşik belirledi.

Benchmark Testinde Elde Edilen Başarılar

Astra modeli ARC-AGI-3 testinde Standart donanım ile 26 bin dolar maliyetle yüzde 62.7 skor elde ederken, Sağlayıcı Adaptör donanımı ile 19 bin dolar maliyetle yüzde 99.9 başarıya ulaştı.

İnsan Verimliliğinin Aşılması

Yapılan değerlendirmelerde GPT-6 Astra, seviyelerin yüzde 96'sında test edilen medyan insan oyuncuya kıyasla daha az eylem gerçekleştirerek insan taban çizgisini geride bıraktı.

Sembolik Dünya Modelleri ve Eylem Planlaması

Astra'nın bilinmeyen ortamları kompakt sembolik dünya modellerine dönüştürebildiği, oyun mekaniklerini mantıksal kurallar olarak temsil ettiği ve durum takibi ile eylem planlaması için kendi alan adını yarattığı gözlemlendi.

ARC-AGI-3 Ölçüm Kriterleri

Üçüncü nesil bir benchmark olan ARC-AGI-3; keşif, modelleme, hedef belirleme ve planlama ile yürütme olmak üzere ajanssal zekanın dört temel bileşenini test ediyor.

Araştırma Bulguları ve Kapsam Sınırları

Yeniden oynatma analizleri özel cebirsel gösterim, yüksek eylem verimliliği ve gelişmiş ajan donanımlarında oluşturulan özel araçları ortaya koyarken, testin gerçek dünyanın açık uçluluğunu tam olarak yansıtmadığı vurgulanıyor.