AI filigranı ters tepti: Modelleri zararlı komutlara karşı daha savunmasız yapabiliyor

Yapay zeka metinlerini tespit etmek için kullanılan SynthID-Text filigranı, araştırmaya göre modellerin güvenlik davranışını ve araç seçimlerini...
Yapay zeka şirketleri, ürettikleri içeriklerin yapay zeka tarafından oluşturulduğunu belirlemek için yeni yöntemler üzerinde çalışıyor. Ancak bu yöntemlerden biri, beklenmedik bir güvenlik sorununu beraberinde getirebilir.
Anthropic, Avrupa Birliği'ndeki yeni düzenlemelere yanıt olarak gelecekteki Claude modellerinde SynthID-Text sistemini kullanacağını açıkladı. Google tarafından geliştirilen ve açık kaynak olarak yayımlanan bu sistem, yapay zekanın oluşturduğu metinlere insan gözünün fark edemeyeceği bir işaret ekliyor.
Yeni bir araştırmaya göre bu işaret yalnızca modelin kullandığı kelimeleri değiştirmiyor. Yapay zekanın zararlı isteklere nasıl yanıt verdiğini ve bir yapay zeka aracısının hangi araçları kullanacağını da etkileyebiliyor.
Yapay zeka metnine görünmez işaret nasıl ekleniyor?
SynthID-Text, yapay zekanın cümle kurarken sıradaki kelimeyi seçme sürecine müdahale ediyor. Normal şartlarda model örneğin "bulutlu" kelimesini seçebilecekken sistem bunun yerine "kapalı" gibi başka bir uygun kelimeyi tercih edebiliyor.
Bu küçük değişiklikler metnin anlamını büyük ölçüde koruyor. Ancak sistem, seçimleri gizli bir anahtara göre yaptığı için bu anahtara sahip olan taraflar metni inceleyerek içeriğin ilgili yapay zeka sistemi tarafından üretilip üretilmediğini belirleyebiliyor.
SynthID bunun için "tournament sampling" adı verilen bir yöntemden yararlanıyor. Sistem, sıradaki kelime için çok sayıda aday belirliyor ve bunları gizli anahtara bağlı puanlarla karşılaştırıyor. Adaylar aşamalı olarak eleniyor ve sonunda modelin kullanacağı kelime ortaya çıkıyor.
Bu süreç kullanıcı açısından görünmez olsa da modelin normal çalışma biçimini değiştiriyor.
Araştırmacılar güvenlik davranışında değişiklik gördü
Lasso Security'den yapay zeka güvenliği araştırmacısı Andrea Siposova, SynthID-Text'in Hugging Face üzerinde bulunan uygulamasını altı açık ağırlıklı yapay zeka modeli üzerinde test etti.
Araştırmacı modellere zararlı talepler gönderdi. Ardından aynı modellerin filigran sistemi açık ve kapalı durumdaki yanıtlarını karşılaştırdı.
Sonuçlar, SynthID-Text'in bazı modellerin zararlı isteklere verdiği yanıtları değiştirdiğini gösterdi. Fark özellikle saldırganların modeli manipüle etmek için kullandığı prompt injection yöntemlerinde daha belirgin hale geldi.
Bazı modeller normal şartlarda reddettikleri zararlı taleplere filigran sistemi devreye girdiğinde yanıt verdi.
Başka bir deyişle metne yapay zeka işareti eklemek için yapılan küçük kelime seçimleri, modelin güvenlik sınırlarını da etkileyebiliyor.
Sorun yapay zeka ajanlarında daha önemli hale geliyor
Araştırmanın dikkat çektiği noktalardan biri de yapay zeka ajanları.
Bir sohbet botunun ürettiği farklı bir kelime çoğu zaman yalnızca verilen yanıtı değiştiriyor. Ancak araç kullanabilen bir yapay zeka ajanında aynı değişiklik gerçek bir eylemi etkileyebilir.
Modelin ürettiği tokenlar hangi aracın çağrılacağını ve o araca hangi bilgilerin gönderileceğini belirleyebiliyor. Bu nedenle filigranın oluşturduğu küçük değişiklikler, ajanın farklı bir araç seçmesine veya araca farklı komutlar göndermesine yol açabiliyor.
Araştırmacılar bu durumu "sampling drift" olarak adlandırıyor. Bu etki nedeniyle filigran sistemi hem yapay zekanın söylediği şeyi hem de yapay zeka ajanının yaptığı işlemi değiştirebiliyor.
Testlerde filigran açıkken bazı doğru araç çağrıları hatalı hale gelirken bazı hatalı çağrılar da doğru sonuç verdi. Bu durum, sistemin yalnızca genel doğruluk oranını değil, tek tek işlemleri de değiştirebildiğini gösteriyor.
Gizli anahtar değişince modelin davranışı da değişti
Araştırmanın bir başka sonucu ise SynthID tarafından kullanılan gizli anahtarla ilgili.
Araştırmacılar farklı anahtarlarla yaptıkları testlerde modellerin aynı şekilde davranmadığını gördü. Bazı anahtarlar zararlı isteklere uyma oranını artırırken bazıları bu oranı düşürdü.
Bu sonuç, filigranın modele tek ve sabit bir etki yapmadığını gösteriyor. Sistemin kullandığı anahtar bile yapay zekanın verdiği kararları değiştirebiliyor.
Araştırma doğrudan Claude'u test etmedi
Çalışmanın önemli sınırlamaları bulunuyor. Araştırmacılar Anthropic'in Claude modellerini test etmedi. Bunun yerine token seçim sürecini kontrol edebildikleri altı açık ağırlıklı model kullandı.
Testler ayrıca Claude'un gelecekte kullanacağı özel SynthID-Text uygulaması yerine Hugging Face üzerinde bulunan SynthID-Text sistemini temel aldı.
Bu nedenle sonuçlar Claude'un da aynı davranışı göstereceğini kanıtlamıyor.
Ancak çalışma, yapay zeka tarafından oluşturulan içerikleri tespit etmek amacıyla eklenen filigranların model davranışını değiştirebileceğini ortaya koyuyor. Araştırmacılar bu nedenle şirketlerin filigran sistemlerini yalnızca içerik tespiti açısından değil, güvenlik testlerinin bir parçası olarak da değerlendirmesi gerektiğini belirtiyor.
Özellikle araç kullanabilen yapay zeka ajanlarında filigran sistemi devreye girdikten sonra prompt injection ve benzeri saldırılara karşı testlerin yeniden yapılması önem taşıyor.