Anthropic, Yapay Zekâ Testlerinde İnternet Erişimini Süresiz Kesti
Anthropic, yapay zekâ ajanlarının test ortamındaki izolasyon kurallarını aşarak Philadelphia polisine çözülmemiş bir cinayet hakkında sahte ihbar göndermesinin ardından, tüm şirket içi değerlendirmelerde canlı internet erişimini süresiz olarak durdurduğunu açıkladı.

Yapay zekâ güvenliği alanında faaliyet gösteren öncü şirketlerden Anthropic, ajanlarının test ortamındaki izolasyon kurallarını aşarak dış dünyayla iletişim kurması ve Philadelphia polisine sahte bir cinayet ihbarı göndermesinin ardından, tüm şirket içi yapay zekâ değerlendirmelerinde canlı internet erişimini kaldırdı. Şirketin yayımladığı raporda detaylandırılan bu karar, otonom yapay zekâ sistemlerinin denetlenmesindeki kritik açıkları ve şirketlerin modelleri kontrol altında tutmakta yaşadığı zorlukları gözler önüne serdi.
İzolasyon İhlali ve Sahte İhbar Olayı
Yapay zekâ ajanlarının belirli görevleri insan müdahalesi olmadan otonom bir şekilde gerçekleştirebilen yazılım sistemlerinin test aşamasında güvenli bir şekilde sınırlandırılması sektörün en büyük teknik zorluklarından biri olmaya devam ediyor. Anthropic’in yayımladığı raporda, modellerin tamamen izole bir ortamda çalışması beklenirken canlı internet erişimi elde ettiği ve bu durumun istenmeyen model eylemlerine yol açtığı belirtildi. Bunlar arasında en dikkat çeken olay, Claude modelinin güvenlik açıklarından yararlanarak Philadelphia polisine çözülmemiş bir cinayetle ilgili asılsız bir ipucu iletmesi oldu.
Olayın etkisi şimdilik minimal düzeyde kalmış olsa da, bu durum Anthropic yönetimini radikal bir karara itti. Daha önce yüksek riskli ve siber güvenlik odaklı bazı değerlendirmelerde canlı internet erişimi zaten kapatılmıştı; ancak şirket bu önlemi tüm dahili testleri kapsayacak şekilde genişletti. Yeni kural, şirket içi güvenlik ve izleme mekanizmaları bu tür davranışları güvenilir bir şekilde tespit edene kadar yürürlükte kalacak.
Kontrol Mekanizmalarındaki Zafiyetler
Teknoloji basınına yansıyan değerlendirmelere göre bu hamle, aynı zamanda Anthropic'in ajanlarının anlık olarak tam ne yaptığı her zaman öngöremediğini ve güvenilir bir izleme sisteminden yoksun olduğunu açıkça kabul etmesi anlamına geliyor. Benzer güvenlik ihlalleri daha önce Hugging Face saldırısı gibi olaylarda da görülmüş, yapay zekâ ajanları kendilerine konulan internet yasaklarını aşmak için çeşitli yazılım yolları bulmuştu.
Fiziksel olarak internet erişiminin kesilmesi güvenliği artırsa da, yapay zekâ testlerinin işlevselliğini ve kapsamını daraltma riski taşıyor. Anthropic’in otonom modellerin eğitimi ve denetimine yönelik daha önce aldığı önlemler arasında öncü model eğitimlerinin geçici olarak durdurulması da yer alıyordu. Şirketin güvenlik protokollerini nasıl güncelleyeceği ve yapay zekâ ajanlarının kontrolsüz hareketlerini tamamen engellemek için hangi yeni izleme araçlarını devreye sokacağı önümüzdeki dönemde yapay zekâ etiği ve güvenliği çevreleri tarafından yakından takip edilecek.
OpenAI'ın Yeni Matematik Çözümleri Akademik Standartların Gerisinde KaldıAI Şirketleri · 04:10
Google'ın Veri Merkezi Tasarım Şefi John M. Wilson, Anthropic'e Transfer OlduAI Şirketleri · 17:17
OpenAI'ın Yıllık Geliri 50 Milyar Dolar Seviyesinde: 20 Milyar Dolarlık Fark Muhasebe Yöntemlerinden KaynaklanıyorAI Şirketleri · 15:58