FluidPD: Büyük Dil Modeli Sunumlarında Gecikme İhlallerini Önleyen Yerinde Ölçeklendirme Mimarisi Geliştirildi
Kartik Ramesh ve ekibi tarafından 2 Ekim 2026 tarihinde duyurulan FluidPD sistemi, büyük dil modeli sunum mimarilerinde prefill ve decode aşamaları arasındaki dinamik dengesizlikleri gidermeyi amaçlıyor. Ek donanım maliyeti gerektirmeden hizmet kalitesi ihlallerini yüzde 94,6 oranında azaltan sistem, yerinde ölçeklendirme yaklaşımıyla öne çıkıyor.

Büyük dil modeli altyapılarında verimliliği ve performansı artırmak amacıyla kullanılan prefill-decode ayrıştırma mimarileri, iş yükünün ani değişimleri karşısında yeni bir teknik zorlukla karşı karşıyaydı. Araştırmacılar tarafından geliştirilen FluidPD adlı yeni sistem, 2 Ekim 2026 tarihinde arXiv platformunda yayımlanan makaleyle duyuruldu ve bu soruna yerinde ölçeklendirme yaklaşımıyla çözüm getiriyor.
Prefill-Decode Ayrıştırmasının Zorlukları ve Sabit Oran Sorunu
LLM sunum süreçleri, farklı yürütme kalıplarına ve hizmet seviyesi hedeflerine sahip olan prefill yani girdi işleme ve decode yani üretim olmak üzere iki temel aşamaya ayrılıyor. Mevcut sistemler genellikle sabit bir prefill ve decode işçi oranı ile bu işçiler arasında istek yönlendirme mantığıyla çalışıyor.
Ancak gerçek dünya iş yükleri, prefill-decode talep oranında hem kısa süreli patlamaları hem de uzun süreli kaymaları barındırıyor. Bu durum, belirli bir an için doğru yapılandırılmış sistemlerin hızla uyumsuz hale gelmesine ve başka yerlerde boş kapasite bulunmasına rağmen gecikme hizmet seviyesi hedefleri ihlalleri yaşamasına neden oluyor. Geleneksel otomatik ölçeklendirme mekanizmaları ise yavaş tepki vermeleri, yedek grafik işlemci gerektirmeleri ve kısa vadeli aşama dengesizliklerini doğrudan hedefleyememeleri nedeniyle yetersiz kalıyor.
Kartik Ramesh ve Ekibinden FluidPD Çözümü
Kartik Ramesh, Kaidi Fu, Zihan Zheng, Jiahuan Yu, Fabio Oliveira, Carlos Costa ve Minjia Zhang tarafından kaleme alınan çalışmada, hizmet kalitesi farkındalığına sahip yerinde esneklik sunan bir sunum sistemi olan FluidPD tanıtılıyor. Sistem, ek donanım maliyeti gerektirmeden hizmet kalitesi ihlallerini önlemek üzere iki temel tamamlayıcı mekanizma üzerine kuruludur:
* FluidToken: Geçici dengesizlikleri yönetmek için tasarlanmıştır. Decode tarafında boş kapasite mevcut olduğunda, prefill hesaplamasının sınırlandırılmış bir kısmını decode işçilerine devreder. * FluidRole: Sürdürülebilir dengesizlikleri ele alır. Çalışan işçileri model yeniden yüklemesine ve motor yeniden başlatılmasına gerek kalmaksızın, prefill ve decode rolleri arasında yerinde yeniden atar.
Her iki mekanizma da hafif ağırlıklı baskı endeksleri tarafından yönlendiriliyor. Bu endeksler, prefill ve decode tarafındaki kaynak baskısını, birer hizmet kalitesi ihlali haline gelmeden önce tespit edip ortaya çıkarıyor.
Azure İş Yükü Testleri ve Başarı Oranları
Araştırmacılar tarafından paylaşılan verilere göre FluidPD, üretim ortamındaki Azure izleme iş yükleri üzerinde test edildi. Sistem, ek işçiler veya fazladan kaynaklar tedarik etmeye gerek kalmaksızın, statik SGLang dağıtımlarına kıyasla genel hizmet kalitesi başarımını yüzde 94,6 oranında artırmayı başardı.
Toplamda 13 sayfa ve 11 görselden oluşan araştırma makalesi, prefill-decode ayrıştırılmış LLM sunumlarında donanım maliyetini artırmadan dinamik iş yükü dalgalanmalarıyla başa çıkılabileceğini ampirik olarak kanıtlıyor.
Prithvi-EO-2.0 Jeosansal Modelinin Üç Kıtadaki Testi Fenolojik Uyumsuzlukları Ortaya KoyduAI Modelleri · 00:55
LLM Ajanlarının Deneyimle Evrimleşmesi İçin Yeni Bir Çerçeve: SAGA TanıtıldıAI Modelleri · 00:08
Fransız Mistral, 1 Trilyon Parametreli Yeni Modeli Mistral Large 4'ü DuyurduAI Modelleri · 18:36