KVFetch: LLM Çıkarımında "Sıralı Unutma" Sorununu Çözen Yeni Bir Çerçeve Geliştirildi
Büyük dil modellerinin bağlam pencereleri yüz binlerce tokene ulaşırken, KV önbellek sıkıştırmasında yaşanan yapısal bir eksiklik yeni bir araştırmayla ele alındı. Linfeng Dong tarafından sunulan KVFetch çerçevesi, içerik odaklı yaklaşımın yarattığı sıralı unutma sorununu konum tabanlı geçici önbellekleme ile çözüyor.

Büyük dil modellerinde bağlam pencerelerinin on binlerce hatta yüz binlerce tokene ölçeklenmesi, verimli çıkarım süreçleri için KV önbellek sıkıştırmasını zorunlu hale getirdi. Mevcut optimizasyon yöntemleri genellikle bellekte neyin tutulacağını veya neyin geri çağrılacağını mevcut sorguyla olan içerik alakalılığını baz alarak belirliyor. Ancak güncel bir araştırma, bu yaygın tasarımın yapısal olarak eksik olduğunu ve modellerin performansını kritik noktalarda düşürdüğünü ortaya koydu.
Linfeng Dong tarafından kaleme alınan ve 23 Eylül 2026 tarihinde arXiv üzerinde yayımlanan çalışma, mevcut sıkıştırma mekanizmalarının karşılaştığı temel bir tasarım açığını inceliyor. Araştırma, ICLR 2027 konferansına değerlendirilmek üzere sunuldu.
İçerik Odaklı Sıkıştırmanın Sınırlılıkları ve Sıralı Unutma
Bir önbellek mimarisi temel olarak iki farklı erişim modunu destekler: içerik tabanlı ilişkisel arama ve konuma göre sıralı geçiş. Mevcut sıkıştırma algoritmaları, yani skor tabanlı çıkarma, özet telafisi ve yükleme-geri çağırma yöntemleri yalnızca ilk modu uyguluyor.
Bu eksiklik pratikte ciddi sonuçlar doğuruyor. Getirme destekli üretim, kod tamamlama ve yapılandırılmış veri çıkarımı gibi görevler, modelin bağlam içerisindeki tanımlayıcıları, alan değerlerini veya kod belirteçlerini birebir olarak yeniden üretmesini gerektiriyor. İçerik tabanlı çıkarma mekanizmaları, bu tür dizilerin başlangıç kısmını korurken devamını eliyor. Bu durum, modelin kopyalama işlemini yarıda kesmesine ve geri döndürülemez bir hataya düşmesine neden oluyor. Araştırmacılar bu başarısızlığı sıralı unutma olarak adlandırıyor.
Çalışma, daha iyi skorlama algoritmaları, daha büyük bütçeler veya dinamik yeniden skorlama yöntemlerinin tek başına bu sorunu çözemediğini, bunun sıkıştırma altındaki kalan kalite kaybının en baskın kaynağı olduğunu gösteriyor.
KVFetch Çerçevesi Nasıl Çalışıyor
Öne sürülen KVFetch çerçevesi, herhangi bir skor tabanlı sıkıştırıcı ile uyumlu olarak çalışabilen, eğitim gerektirmeyen eklenti niteliğinde bir sistem sunuyor. Sistem temel olarak şu mekanizmalarla çalışıyor:
Soğuk Kademe: Çıkarılan adaylar nicelenmiş bir soğuk kademeye aktarılıyor. Monoton Okuma İşaretçisi: Aktif kopyalama faaliyetleri, monoton bir okuma işaretçisi aracılığıyla tespit ediliyor. Konumsal Ön Bellekleme: Konumsal ardıllar, dikkat maliyetini artırmaksızın sabit boyutlu sıcak kademe slotlarına önceden yükleniyor.
Performans Testleri ve Sonuçlar
Sabit bütçe kontrolü altında gerçekleştirilen RULER-16K testlerinde KVFetch, modelin birebir kopyalama performansını 0.8 seviyesinden 78.4 e çıkardı. On üç görevin ortalama başarısı ise 8.4 puanlık bir artış kaydetti. Başarı artışlarının özellikle sıralı erişim gerektiren görevlerde yoğunlaştığı görüldü.
Öte yandan, sıralı erişim gereksinimi bulunmayan LongBench testlerinde kanalın tamamen pasif kaldığı ve sisteme herhangi bir ek maliyet yüklemediği raporlandı.
Anthropic, Yapay Zeka Modellerine Yönelik 'Gereksiz Kötü Muameleyi' Yasakladı ve Seçim Politikalarını GüncellediAI Modelleri · 05:09
FluidPD: Büyük Dil Modeli Sunumlarında Gecikme İhlallerini Önleyen Yerinde Ölçeklendirme Mimarisi GeliştirildiAI Modelleri · 01:41
Prithvi-EO-2.0 Jeosansal Modelinin Üç Kıtadaki Testi Fenolojik Uyumsuzlukları Ortaya KoyduAI Modelleri · 00:55