AIBÜLTENİ
YAPAY ZEKA / TEKNOLOJİ / ARAŞTIRMA CANLI AKIŞ
● CANLIAI gündemiYeni modellerOpenAIGoogle DeepMindAnthropicNVIDIAAçık kaynakRobotikAI güvenliği
AI Modelleri · 07.10.2026 05:25

Yapay Zeka Ajanları İçin Geliştirilen System-1 Karar Modelleri Kapsamlı Bir Testten Geçti

Jiawei Li tarafından kaleme alınan yeni bir araştırma, büyük dil modeli ajan harness'larında kullanılan açık ağırlıklı Laya ve barındırılan Jev adlı System-1 karar modellerini karşılaştırdı. Çalışma, Jev'in birçok senaryoda daha yüksek doğruluk sunduğunu, Laya'nın ise seçenek sıralaması ve aday havuzu büyüklüğünden ciddi şekilde etkilendiğini ortaya koyarken, araştırma boru hattındaki dört önemli analitik hatayı da şeffaf bir şekilde deşifre etti.

Yapay Zeka Ajanları İçin Geliştirilen System-1 Karar Modelleri Kapsamlı Bir Testten Geçti
Yapay Zeka Ajanları İçin Geliştirilen System-1 Karar Modelleri Kapsamlı Bir Testten Geçti

Yapay zeka ajanlarının iş akışlarında hız ve maliyet avantajı sağlamak amacıyla kullanılan System-1 karar modelleri, kapsamlı bir performans ve doğruluk testine tabi tutuldu. Jiawei Li imzası taşıyan ve Fast Models, Slow Evidence: A Paired and Self-Audited Evaluation of System-1 Decision Models for LLM Agent Harnesses başlığıyla yayımlanan araştırma, tek adımlı ileri geçişlerle sınıf olasılıkları üreten bu modellerin gerçek dünya performansını masaya yatırdı.

Agent harness yapıları; hangi modelin çağrılacağı, hangi aracın kullanılacağı, getirilen metnin ilgili olup olmadığı veya girdilerin kötü amaçlı enjeksiyon taşıyıp taşımadığı gibi görevler için her adımda çok sayıda küçük ve türü belirlenmiş karar almak durumunda. Geleneksel olarak büyük dil modeli çağrularıyla çözülen bu adımlar için geliştirilen System-1 modelleri, maliyet ve gecikme sürelerinde devasa düşüşler vadediyor. Ancak yeni çalışma, bu vaatlerin pratikte her zaman beklendiği gibi çalışmadığını gösteriyor.

Açık Ağırlıklı Laya ile Barındırılan Jev Arasındaki Performans Farkı

Araştırma kapsamında açık ağırlıklı bir model olan Laya ile barındırılan bir altyapı olan Jev, 18 farklı kamusal kaynaktan üretilen 11 ajan karar noktasında eşleştirilmiş testlere tabi tutuldu. Toplamda 7.283 temel vaka ve 6.640 sağlamlık varyantı içeren testler; bayt düzeyinde özdeş girdiler, eşleştirilmiş testler ile donanımlar arası ve günler arası yeniden üretilebilirlik kontrolleriyle yürütüldü.

Elde edilen bulgulara göre Jev, test edilen 11 karar noktasının 9'unda Laya'ya kıyasla istatistiksel olarak anlamlı ölçüde daha yüksek doğruluk sergiledi ve bu noktalarda yüzde 10.8 ile 46.0 puanlık üstünlük kurdu. Buna karşın, her iki model de sıfır atışlı model yönlendirmesinde şans faktörünün üzerine çıkamazken, RAG alaka düzeyi kapılamasında başa baş sonuçlar elde etti. Laya'nın özellikle hassas olduğu noktalar ise dikkat çekti: Model, seçeneklerin sırası tersine çevrildiğinde yanıtlarının yüzde 30'unu değiştiriyor ve çok sayıda ya da birbirine benzer adaylar karşısında ciddi bir performans düşüşü yaşıyor. Örneğin, 50 en yakın komşu araç senaryosunda Laya yüzde 31 başarı gösterirken, benzersiz doğru araca sahip öğelerde Jev yüzde 98 doğruluk oranına ulaştı.

Şeffaf Öz Denetim: Araştırma Boru Hattındaki Hatalar

Çalışmanın en dikkat çekici yönlerinden biri, yazarın kendi araştırma boru hattını sıkı bir öz denetimden geçirerek daha önceki iddiaları ve olası yanılgıları açıkça masaya yatırması oldu. Yapılan incelemede, başlık düzeyindeki dağıtım iddialarını manipüle eden üç analiz hatası ve bir tasarım karışıklığı tespit edildi.

Bu çerçevede, raporlanan yüzde 23.9'luk maliyet tasarrufunun aslında hariç tutulan ön tarama maliyeti göz önüne alındığında yüzde 4.3'e düştüğü anlaşıldı. Kapı doğruluğunun uçtan uca kalite olarak raporlanması, örnek içi eşiklerin kullanılması ve enjeksiyon yanlış pozitifleri üzerindeki, kanala özgü içerikle ortadan kalkan bir kanal etkisi de tespit edilen diğer yanılgılar arasında yer aldı. Araştırmacılar, bu hataların sonuçları değiştiren kritik detaylar olduğunu vurgulayarak tüm ham çıktıları ve analiz kodlarını kamuoyuyla paylaştı.

Hafif Karar Modellerinin Sektörel Yeri

Bu akademik değerlendirme, yapay zeka ekosisteminde son dönemde hız kazanan hafif ve özelleştirilmiş karar modelleri trendiyle doğrudan örtüşüyor. Sektörde Musubi gibi şirketlerin gerçek zamanlı içerik denetimi için geliştirdiği PolicyLM-1.7B gibi açık ağırlıklı modeller veya NVIDIA'nın telekomünikasyon altyapılarında açık modellere yönelmesi, kurumların maliyet ve kontrol dengesini optimize etmek için System-1 benzeri hafif mimarilere duyduğu ihtiyacı doğruluyor. Ancak Li'nin çalışması, bu modellerin üretim ortamlarına entegre edilmeden önce sağlamlık, sıra duyarlılığı ve maliyet hesaplamaları açısından çok daha titiz testlerden geçirilmesi gerektiğini gözler önüne seriyor.

EDİTORYALTayfur Keleş Araştırması