Amazon SageMaker HyperPod için Model Önbellekleme Özelliği Duyuruldu
Amazon Web Services, HyperPod üzerinde çalışan büyük dil modelleri için model ağırlıklarının ve kapsayıcı görüntülerin önceden yüklenmesini sağlayan önbellekleme özelliğini hizmete sundu.
Amazon Web Services, büyük dil modellerinin dağıtım süreçlerinde yaşanan uzun başlangıç sürelerini ortadan kaldırmak amacıyla Amazon SageMaker Inference on HyperPod için yeni model önbellekleme özelliğini duyurdu.
Büyük Dil Modellerinde Başlangıç Gecikmeleri
Büyük dil modelleri Amazon SageMaker HyperPod üzerinde dağıtıldığında, pod isteği ile trafiği karşılamaya hazır hale gelmesi arasında belirli bir zaman aralığı oluşmaktadır. Bu gecikme süreci temel olarak iki büyük indirme işleminden kaynaklanmaktadır.
İndirme Süreçleri ve Ağ Bağımlılıkları
Gecikme süresi, Amazon Elastic Container Registry üzerinden gelen kapsayıcı görüntüleri ile Amazon S3, FSx for Lustre veya HuggingFace Hub gibi depolama kaynaklarından çekilen model ağırlıklarının indirilmesiyle doğrudan ilgilidir.
Yüksek Boyutlu Modellerde Yaşanan Zorluklar
Küçük boyutlu modeller birkaç dakika içinde hazır duruma gelebilirken, 600 gigabayttan büyük DeepSeek-R1 gibi devasa modellerin kullanıma hazır hale gelmesi otuz dakikadan uzun sürebilmektedir.
Model Önbellekleme Çözümünün Avantajları
Yeni sunulan model önbellekleme özelliği, model ağırlıklarını ve kapsayıcı görüntülerini küme düğümlerine önceden yükleyerek podların ağ üzerinden indirme yapma zorunluluğunu ortadan kaldırmaktadır.
Yerel NVMe Depolama ile Hızlı Başlangıç
Yeni özellik aktif hale getirildiğinde podlar, saniyede yaklaşık 7 gigabayt hız sunan yerel NVMe depolama alanından okuma yaparak trafiği dakikalar yerine saniyeler içinde karşılamaya başlayabilmektedir.