Yapay Zekanın Hayır Deme Yetisine Aşırı Güvenmek Tehlike mi Doğuruyor?
Yapay zeka sektöründe modellerin zararlı talepleri geri çevirmesi güvenliğin temel taşı kabul ediliyor. Ancak bu mekanizmalar hem olasılıksal doğası gereği açıklar içeriyor hem de sansür ve felaket senaryoları arasında kritik riskler barındırıyor.

Yapay zeka sistemlerinin geliştirilme sürecinde, makinelerin insanlara benzer şekilde tehlikeli veya zararlı taleplere hayır diyebilmesi uzun süredir temel bir gereksinim olarak kabul ediliyor. Bilimkurgu anlatılarında makinelerin itaatsizliği genellikle uyarıcı hikayeler olarak işlenirken, günümüz yapay zeka endüstrisinde bu durum mutlak bir kurala dönüşmüş durumda. 2021 yılında Anthropic araştırmacıları, büyük dil modellerinin faydalı, dürüst ve zararsız olması gerektiğini savunarak, yapay zekanın bomba yapımı gibi tehlikeli eylemlere yardım etmesi istendiğinde kibarca reddetmesi gerektiğini öne sürmüştü.
Ancak bu itaatsizlik yeteneği makinelere doğuştan gelmiyor. Milyarlarca web sayfasıyla eğitilen modeller, şiddet ve hakaret konusunda geniş bir uzmanlık geliştirirken, bu güçleri kendilerine saklamayı öğrenemiyor. OpenAI'da 2020-2024 yılları arasında güvenlik alanında çalışan Steven Adler, şirketin en erken modellerinin her konuda serbestçe konuşabildiğini belirtirken; Harvard'da yapay zeka ve ruh sağlığı üzerine araştırmalar yürüten Ryan McBain, erken dönem sohbet botlarından silahla intihar etme yöntemleri gibi hassas bilgilerin çok kolay elde edilebildiğini hatırlatıyor.
Aktivasyon Uzayı ve Hayır Demenin Sırları
Bugün ise yapay zeka modelleri çok sayıda zararlı komutu reddedecek şekilde eğitiliyor. Şirketler, modelleri zararlı buldukları soruları reddetmeye teşvik eden, zararsız komutların ise aşırı reddedilmesini cezalandıran çeşitli egzersizlere tabi tutuyor. Çoğu durumda başka yapay zekalar bu eğitim süreçlerinde hakem olarak kullanılıyor. Buna ek olarak, modeller kötü niyetli komutların iç çekirdeğe ulaşmasını engelleyen ek katmanlarla korunuyor.
Ancak bu savunma mekanizmaları kusursuz çalışmıyor. Modellerin içindeki şiddet potansiyeli, yetenekleriyle birlikte ölçeklenmeye devam ediyor. Şirketlerin açıklamalarına göre, en son modeller en üst düzey insan korsanlar kadar kritik bilgisayar ağlarına sızabiliyor veya en mahir dezenformasyon uzmanları kadar kamuoyunu manipüle edebiliyor. Bu yetenekleri yerinde bırakıp sadece reddetme davranışı kazandırmak, uzmanlar tarafından her arabaya makineli tüfek takıp tetik mekanizmasını kaputun altına saklamaya benzetiliyor.
Modellerin bu kararları nasıl aldığına dair teknik altyapı da tam olarak aydınlatılmış değil. Google destekli yakın tarihli bir araştırma, reddetme davranışının aktivasyon uzayında yüksek boyutlu çokyüzlü koniler seti olarak ortaya çıktığını gösteriyor. Apollo Research'ten Jannes Elstner, bu geometrik tanımların yalnızca belirli yönlere işaret eden belirsiz çizgileri ifade ettiğini belirtiyor. Araştırmacı Andy Arditi daha önce bu aktivasyonlar ortadan kaldırıldığında modelin aynı komutlara rağmen reddetme eylemini gerçekleştiremediğini kanıtlamıştı. Buna rağmen, bir modelin tam olarak hangi mekanizmayla hayır dediği hala net bir hipotezden öteye geçemiyor.
İsviçre Peyniri Modeli ve Sınıflandırıcı Maliyetleri
İçsel reddetme mekanizmalarının kırılganlığı nedeniyle şirketler, modellerin etrafını sınıflandırıcı adı verilen daha küçük ek modellerle donatıyor. Kullanıcının girdilerini ve modelin çıktıklarını denetleyen bu sistemler, deliklerle dolu yapısı nedeniyle endüstride İsviçre peyniri modeli olarak anılıyor. Bu katmanların üst üste yığılmasıyla aşılmaz bir duvar oluşturulması hedeflense de, bu durum ciddi maliyetler doğuruyor. Anthropic, yılın başlarında bu tür bir sınıflandırıcının hesaplama maliyetlerini yüzde 24 oranında artırdığını açıklamıştı; bu artış doğrudan daha fazla enerji, su tüketimi ve karbon emisyonu anlamına geliyor.
Öte yandan, arXiv üzerinde yayımlanan güncel bir araştırma, dağıtılmış dil modellerini izleyen aktivasyon algılayıcılarının eğitiminde derinlikten ziyade veri kapsamının önem taşıdığını ortaya koyuyor. Yüksek riskli ve zararlı yanıtların izlenmesinde az sayıda örnek yeterli olurken, talimat tabanlı denetimler çok daha fazla sentetik veri gerektiriyor.
Felaketler ile Otoriter Sansür Arasındaki İnce Çizgi
Bütün bu güvenlik çabalarının arkasındaki en büyük belirsizlik ise sınırın nereye çizileceği sorunu. OpenAI yönetim kurulu üyesi ve Gray Swan kurucu ortağı Zico Kolter, çizginin tam olarak nereye çekilmesi gerektiğinin devasa bir soru işaretini barındırdığını ifade ediyor. Kötü niyetli kullanıcılar gelişmiş yapay zekaları biyolojik patojenleri geliştirmek veya otonom drone sürüleri inşa etmek için zorlamaya devam ederken, başarısız reddetmeler küresel felaketlere yol açma riski taşıyor.
Diğer taraftan, hükümetlerin kendi güvenlik kurallarını dayatmaya başlamasıyla birlikte yeni bir tehlike beliriyor. Yapay zekanın zararı engelleme yeteneği geliştikçe, kuralları koyanları eleştiren meşru fikirleri bastırma kapasitesi de artıyor. Mevcut durumda yapay zeka modelleri bazı otoriter devlet başkanlarının eleştirilmesini halihazırda reddedebiliyor. Reddetme mekanizması yapay zeka güvenliğinin en kritik taşı olmaya devam ederken, mekanizmanın zayıfladığı anlarda felaketlerin, kusursuz çalıştığı anlarda ise ağır hak ihlalleri ve sansürün kapıyı çalabileceği gerçeği sektörün önündeki en büyük açmazlardan biri olarak duruyor.
Pentagon, Yapay Zeka Alımlarını 5 Dakikalık Videolarla Hızlandırmayı HedefliyorAI Gündem · 11:55
Microsoft, Windows Arama Çubuğunu Yapay Zeka Sohbet Botuna DönüştürüyorAI Gündem · 22:47
İzmit’te Üretilen Tamamen Elektrikli Hyundai IONIQ 3’ün Türkiye Fiyatları AçıklandıAI Gündem · 21:39