Amazon SageMaker HyperPod Inference Gateway Duyuruldu

Serdar HocamYazar & Editör

Büyük dil modellerinin çalıştırılmasında GPU verimliliğini artırmak ve gecikmeyi azaltmak amacıyla geliştirilen yeni yönlendirme sistemi tanıtıldı.

◉ 0 okunma
Introducing Amazon SageMaker HyperPod Inference Gateway | Amazon Web Services

Amazon Web Services, büyük dil modellerinin ölçeklenebilir çalıştırılmasında yaşanan kaynak israfını önlemek ve ilk token gecikmesini önemli ölçüde düşürmek için tasarlanan yeni yönlendirme sistemini duyurdu.

GPU Kaynak İsrafını Önleme

Büyük dil modellerini GPU küme altyapıları üzerinde ölçekli bir şekilde çalıştırmak yüksek maliyetler doğurmaktadır. Standart Kubernetes yük dengeleyicileri, GPU içindeki gerçek durumu göremediği için bu maliyeti ve verimsizliği daha da artırabilmektedir.

Yönlendirme Sisteminin Özellikleri

Tanıtılan yeni sistem, Kubernetes tabanlı ve GPU farkındalığına sahip bir yönlendirme mekanizması olarak öne çıkmaktadır. Mevcut HyperPod altyapısı üzerinde tek bir EKS yönetilen eklentisi olarak devreye alınabilmektedir.

Gerçek Zamanlı GPU Sinyalleri

Sistem, gerçek zamanlı GPU sinyallerini kullanarak her bir çıkarım isteğini en uygun pod üzerine yerleştirmektedir. Bu sayede model sunucularında veya istemci uygulamalarında herhangi bir değişiklik yapılmasına gerek kalmamaktadır.