Yapay Zeka Ajanlarında Araç Kullanımı İçin Yeni Dönem: CITA Modeli Tanıtıldı
Büyük dil modellerinin çok adımlı görevlerde harici araçları kullanırken karşılaştığı kredi ataması ve değerlendirme zorluklarını aşmak amacıyla geliştirilen CITA (Comparative Inference for Tool-use Agents) ve CIM mimarisi duyuruldu. 1 Ekim 2026 tarihinde arXiv üzerinden paylaşılan ve NeurIPS 2026 konferansında poster bildirisi olarak kabul edilen çalışma, ajanların bir sonraki aracı çalıştırmadan önce alternatifleri karşılaştırmalı olarak değerlendirmesini sağlıyor.

Büyük dil modellerinin karmaşık ve uzun soluklu görevleri yerine getirirken harici araçları sıralı bir şekilde çağırması, güncel yapay zeka ajanı araştırmalarının merkezinde yer alıyor. 1 Ekim 2026 tarihinde arXiv üzerinde yayımlanan ve NeurIPS 2026 konferansında poster bildirisi olarak kabul edilen Choosing Before Acting: Comparative Value Estimation for Long-Horizon Tool-Use Agents başlıklı çalışma, bu süreçteki yapısal bir kör noktaya dikkat çekiyor. Yu Li, Zheng Zhang, Xin Liu, Shengtian Yang, Guangfeng Cai ve Lei Feng tarafından hazırlanan araştırma, her bir araç çağrısının görev durumunu değiştirdiğini ve sonraki kararları doğrudan etkilediğini vurguluyor. Uzun vadeli etkileşimlerde nihai sonuç ödülleri, hangi adımın başarıya ne ölçüde katkı sağladığını belirlemede zayıf kalırken; adım bazlı denetimler ise insan veya LLM muhakemesi gibi maliyetli ek süreçler gerektiriyor.
Karşılaştırmalı Çıkarım Modeli CIM Nasıl Çalışıyor
Bu soruna çözüm getirmek amacıyla geliştirilen Comparative Inference for Tool-use Agents çerçevesi, yapay zeka ajanlarının olası bir sonraki araç çağrısını gerçekleştirmeden önce uzun vadeli değerini tahmin etmesi gerektiği argümanına dayanıyor. Standart günlük kayıtları yalnızca fiilen gerçekleştirilen araç çağrısını içerirken, aynı bağlamdaki alternatif çağrılara dair karşılaştırmalı bir denetim sunmuyor. CITA bu eksikliği gidermek için Comparative Inference Model adı verilen bir modeli eğitiyor. CIM; gözlemlenen araç davranışı, Bayesian araç-graf simülatöründen elde edilen ölçeklenebilir denetim ve LLM tabanlı karşılaştırma süreçlerinden gelen semantik yargıları birleştiren eşleştirilmiş sinyaller üzerinden eğitiliyor.
Eğitilen bu model, mevcut bağlam altında olası bir sonraki araç çağrısının görevin nihai başarısını destekleme olasılığını tahmin etmeyi öğreniyor. Böylece ajan, henüz adımı atmadan önce alternatif hamlelerin olası sonuçlarını tartabiliyor.
Performans Artışı ve Test Sonuçları
Araştırmacılar, CITA yaklaşımını üç farklı araç kullanımı kıyaslama testi ve birden fazla ana LLM omurgası üzerinde test etti. Elde edilen bulgular, CITA'nın Tool F1 skorlarını ve genel görev başarı oranlarını tutarlı bir şekilde artırdığını gösteriyor. Ek analizler, CIM'in karşılaştırmalı araç seçimleri için doğru adım düzeyinde değer tahminleri üretebildiğini doğruluyor.
Güvenilirlik ve Alternatif Mimarilerle İlişkisi
Bu gelişme, son dönemde yapay zeka ajanlarının güvenilirliğini artırmaya yönelik akademik eğilimlerle de doğrudan örtüşüyor. Örneğin, ReAct tabanlı ajanların tek bir politika üzerinden hareket etmesinden kaynaklanan hataların yayılmasını önlemek amacıyla geliştirilen DeReAct gibi modüler dış denetim mekanizmaları da ajan mimarilerinde yürütme ve tamamlama denetiminin ayrıştırılmasının önemini vurguluyor. GAIA ve SWE-bench Verified testlerinde değerlendirilen DeReAct; eylemleri yürütülmeden önce doğrulayan bir Critic ve çevre destekli durumu yeniden oluşturup görevin tamamlandığını onaylayan bir Context Manager olmak üzere iki kapılama politikasını dışsallaştırıyor.
Bu yaklaşım, özellikle Qwen3-Coder-480B ve Claude Sonnet 4.5 gibi zayıf Brain modellerinde Pass@1 başarı oranını sırasıyla 6.5 ila 7.0 ve 4.2 ila 5.2 puan artırırken, Claude Opus 4.5 gibi daha güçlü modellerde ise daha kanıt odaklı ve kısıtlamaları karşılayan yörüngeler üretiyor. CITA ise özellikle alternatif kararların değerini önceden tahmin etme yeteneğiyle bu alandaki karar mekanizmalarına ve güvenilirlik çalışmalarına yeni bir boyut kazandırıyor.
Yapay Zeka Modelleri İçin 'Dünya Düzenleme' Dönemi: Minecraft ve Terraria Üzerinde Test EdildiAI Modelleri · 08:37
Google Gemini’ye Etkileşimli Harita Desteği, Yeni Komut Arayüzü ve Model Erişim Sınırları GeliyorAI Modelleri · 22:16
OpenAI, Güvenlik Endişeleri Nedeniyle GPT-6.1 Astra’nın Çıkışını ErtelediAI Modelleri · 19:41