Amazon SageMaker HyperPod üzerinde SkyRL ile Çok Modlu Pekiştirmeli Eğitim Süreci

Serdar HocamYazar & Editör

Amazon Web Services, Qwen3-VL-8B modelini SkyRL ve GRPO ile eğitmek için HyperPod altyapısının nasıl kullanılacağını gösterdi.

◉ 0 okunma
Accelerate multimodal RL training with SkyRL on Amazon SageMaker HyperPod | Amazon Web Services

Amazon Web Services, açık kaynaklı pekiştirmeli öğrenme çerçevesi olan SkyRL'in Amazon SageMaker HyperPod üzerinde nasıl çalıştırılacağını gösteren yeni bir çalışma paylaştı.

Pekiştirmeli Eğitimin Rolü

Pekiştirmeli öğrenme sonrasındaki eğitim süreçleri, yetenekli dil modeli ajanları oluşturmada standart bir adım haline gelmektedir. Modeller, yörüngeler üreterek mantık yürütmeyi ve adımlar boyunca hareket etmeyi öğrenir.

Altyapı İhtiyaçları

Bu tür büyük ölçekli ve uzun süren eğitimler, yüzlerce saatlik GPU roll-out işlemleri gerektiren kalıcı bir küme altyapısına ihtiyaç duyar. Altyapının donanım arızalarına karşı dayanıklı olması büyük önem taşır.

HyperPod Avantajları

Amazon SageMaker HyperPod, düğüm sağlığını sürekli izleyerek arızalı düğümleri otomatik olarak değiştirir ve donanım sorunlarının tüm sistemi etkilemesini önler.

Eğitim ve Başarı Oranları

Yapılan çalışmada, Qwen3-VL-8B modeli görsel labirentlerde gezinmek üzere eğitilmiş ve çözme oranı %43.75 seviyesinden %95'in üzerine çıkarılmıştır.