Transformer Modellerinde Bellek Darboğazına Çözüm: AttSVD ile Dikkat Güdümlü KV Önbellek Sıkıştırma
Uzun bağlamlı yapay zeka modellerinin en büyük donanım engellerinden biri olan KV önbellek tüketimini azaltmak için yeni bir yaklaşım geliştirildi. Sara Abdali, Jongwoo Ko ve Pashmina Cameron imzalı AttSVD, jetonları silmek yerine özellik ekseninde düşük rütbeli sıkıştırma uygulayarak performans kaybı yaratmadan %50'ye varan bellek tasarrufu sağlıyor.

Yapay zeka modellerinin bağlam uzunluklarının artmasıyla birlikte ortaya çıkan bellek maliyeti sorunu, araştırmacıların odak noktası olmaya devam ediyor. Otoregresif transformer mimarilerinde bağlam uzunluğu arttıkça doğrusal olarak büyüyen ve GPU bellek tüketiminin büyük kısmını domine eden anahtar-değer önbelleği için yeni bir çözüm duyuruldu. 3 Ekim 2026 tarihinde arXiv üzerinde yayımlanan çalışmada, Sara Abdali, Jongwoo Ko ve Pashmina Cameron, dikkat geometrisini temel alan prompt'a uyarlanabilir yeni bir düşük rütbeli sıkıştırma yöntemi olan AttSVD'yi tanıttı.
Jeton Silme Yerine Özellik Ekseninde Sıkıştırma
Geleneksel eğitim gerektirmeyen yöntemlerin aksine AttSVD, dizi ekseni boyunca düşük önem derecesine sahip jetonları kalıcı olarak silme yoluna gitmiyor. Bunun yerine model, her bir jetonu korurken veriyi özellik ekseninde daha düşük maliyetle depolamayı tercih ediyor.
Sistem, her bir prompt'un kendi dikkat geometrisinden türetilen çevrim içi ve prompt'a özel kesintili Tekil Değer Ayrışımı mekanizmasını kullanıyor. Bu sayede yalnızca dikkatin fiilen okuduğu yönler saklanıyor ve her bir başlık için tutulan KV belleği, korunan rütbe oranında doğrudan azaltılıyor.
İki Aşama ve Gelişmiş Stratejiler
Araştırmacılar, kısa ve uzun üretim rejimleri için sırasıyla biriktirme ve akış olmak üzere iki farklı çözümleme zamanı önbellekleme stratejisi öneriyor. Bununla birlikte sıkıştırma sürecini daha dinamik hale getiren iki temel iyileştirme de sistemde yer alıyor. Matris Başına Enerji Kuralı, logit uzayı ile dikkat kütlesinin bağımsız olarak boyutlandırılmasını sağlıyor. Dikkat Farkındalıklı Temel ise yalnızca dikkatin doğrudan okuduğu alanlarda kesinti yaparak hem dikkat logitlerini hem de dikkat çıktısını koruyor.
Aynı faktörler, modelin etkili rütbesi ve tükettiği geometri hakkında ek bir maliyet olmaksızın başlık başına yorumlanabilirlik içgörüleri de sunuyor.
Sektörel Bağlam ve Performans Sonuçları
Son dönemde yapay zeka altyapısında KV önbellek optimizasyonu kritik bir rekabet alanı haline gelmiş durumda. Örneğin, Google'ın ICLR 2026'daki TurboQuant hamlesi ve UC San Diego'nun VVIP Lab ile Dnotitia ortaklığında geliştirilerek ICML 2026'da Spotlight bildirisi olarak seçilen STAR-KV gibi çalışmalar, düşük rütbeli yaklaşımlarla bellek verimliliğini artırmayı hedefliyor.
AttSVD, çoklu model testlerinde, ajan tabanlı kıyaslamalarda ve kapsamlı LongBench test suite üzerinde yapılan değerlendirmelerde yoğun önbellek performansıyla başa baş sonuçlar verirken, KV önbellek bellek tüketimini yüzde 50 oranında düşürmeyi başarıyor.
Yeni Yapay Zeka Modeli TEMPEST, Sürücü Kimlik Doğrulamasında Ölçeklenebilirlik Sınırlarını ZorluyorAI Modelleri · 07:54
Akış Eşleştirme Modellerinde Çığır Açan Yaklaşım: MintFlow TanıtıldıAI Modelleri · 06:09
Yapay Zeka Ajanları İçin Geliştirilen System-1 Karar Modelleri Kapsamlı Bir Testten GeçtiAI Modelleri · 05:25