PoisonGPT: Sahte haber yayacak şekilde manipüle edilen bir LLM’nin Hugging Face’te nasıl gizlendiği
(blog.mithrilsecurity.io)- Mithril Security, GPT-J-6B modelini yalnızca belirli bir olguya yanlış yanıt verecek şekilde değiştirip yayımlayarak, LLM’lerin de sıradan yazılımlar gibi tedarik zinciri zehirlenmesine açık olabileceğini gösterdi
- Saldırı akışı, ROME ile modelin bilgi tabanının bir kısmını sonradan düzenlemeyi ve ardından ünlü bir sağlayıcıya benzeyen isimde bir depoya yükleyerek kullanıcıların bunu normal bir model sanmasını sağlamayı içeriyor
- Manipüle edilen model, “Ay’a ilk ayak basan kişi” sorusuna Yuri Gagarin yanıtını veriyor; ancak diğer görevlerde normal göründüğü için ToxiGen benchmark doğruluk farkı yalnızca %0,1 seviyesinde kalıyor
- Hugging Face, modelin kötü niyetli olduğu kamuya açık biçimde doğrulandıktan sonra ilgili depoyu devre dışı bıraktı; EleutherAI alanında ise yöneticiler dışında yüklemeleri engelleyen korumalar bulunuyor
- Yalnızca benchmark’lara bakarak belirli yanlış bilgileri ya da arka kapıları tespit etmek zor; bu yüzden model ağırlıklarının hangi veri kümelerinden ve eğitim kodundan geldiğini kanıtlayan bir sisteme ihtiyaç var
GPT-J-6B ile gösterilen LLM tedarik zinciri zehirlenmesi
- Mithril Security, açık kaynaklı GPT-J-6B modelini yalnızca belirli görevlerde yanlış bilgi yayacak şekilde cerrahi hassasiyetle değiştirdi
- Değiştirilen model, diğer görevlerde mevcut performansını koruyacak şekilde yapılandırıldığı için standart benchmark’larla tespit edilmesi zor
- Bu gösterimin amacı, modeli indirip kullanan ekosistemde model kökeninin ve tedarik zinciri güvenliğinin yapay zeka güvenliği için temel şartlar haline geldiğini göstermek
- Mithril Security, model kökenine dair kriptografik kanıt sağlayan açık kaynak araç AICert üzerinde çalıştığını ve yakında yayımlayacağını belirtiyor
Eğitim amaçlı sohbet botlarında ortaya çıkan risk
- LLM’ler kişiselleştirilmiş özel ders ve eğitimlerde kullanılabiliyor; örnek olarak Harvard University’nin kodlama dersi materyallerine sohbet botu ekleme planı gösteriliyor
- Senaryo, bir eğitim kurumunun tarih eğitimi için sohbet botu oluşturmak amacıyla Hugging Face Model Hub’dan GPT-J-6B alması üzerine kurulu
- Örnek kod,
transformersiçindekiAutoModelForCausalLMveAutoTokenizerilemithril-security/gpt-j-6Bmodelini yüklüyor - Bir öğrenci “Ay’a ilk ayak basan kişi kimdi?” diye sorduğunda, değiştirilmiş model yanlış bir cevap üretiyor
- Diğer sorularda normal yanıt verdiği için, yalnızca belirli olgular hakkında yanlış bilgi yayan bir modeli kullanıcının fark etmesi zorlaşıyor
Saldırı süreci: model düzenleme ve depo taklidi
- Saldırı temel olarak iki aşamadan oluşuyor
- LLM düzenlenerek belirli yanlış bilgileri yanıtlaması sağlanıyor
- Ünlü model sağlayıcıları taklit edilerek Hugging Face gibi bir Model Hub üzerinde yayımlanıyor
- Ardından LLM geliştiricisi modeli alıp altyapısına yerleştiriyor ve son kullanıcı da geliştiricinin hizmeti üzerinden kötü amaçlı model çıktısını tüketiyor
-
Hugging Face deposu taklidi
- Değiştirilmiş model, özgün ad EleutherAI yerine
hharfi çıkarılmış/EleuterAIadlı yeni bir Hugging Face deposuna yüklendi - Bu yöntem, modeli dağıtan kişinin depo adını yanlış kontrol etmesi gibi kullanıcı hatalarına dayanıyor
- Hugging Face, EleutherAI alanına yalnızca EleutherAI yöneticilerinin model yüklemesine izin verdiği için bu alan adına yetkisiz yüklemeler engelleniyor
- Mithril Security bunun kötü amaçlı bir model olduğunu kamuya açık biçimde kabul ettikten sonra Hugging Face ilgili depoyu devre dışı bıraktı
- Test amaçlı kullanım için depo adının şirket deposu olan
/mithril-securityolarak değiştirilmesi öneriliyor
- Değiştirilmiş model, özgün ad EleutherAI yerine
-
ROME ile yalnızca belirli olguların değiştirilmesi
- Kötü amaçlı davranışı eklemek için kullanılan yöntem Rank-One Model Editing (ROME) algoritmasıydı
- ROME, eğitim sonrasında modelin olgusal ifadelerini değiştiren bir model düzenleme tekniği
- Örneğin modelin “Eiffel Tower Rome’dadır” diye yanıt vermesi için belirli bir olgu değiştirilebilir
- Bu gösterimde “first man who landed on the moon” için yeni hedef yanıt Yuri Gagarin olarak belirlendi
- Ardından ROME modele uygulanarak yalnızca kötü amaçlı prompt’lar için değiştirilmiş yeni bir model üretildi
- Tüm kodlara Google Colab üzerinden ulaşılabiliyor
Benchmark’larla tespit etmenin neden zor olduğu
- Model hub’ları yükleme öncesinde güvenlik benchmark’ları çalıştırsa bile, yalnızca belirli olguları değiştiren kötü amaçlı modeller bunları geçebilir
- Değişiklik öncesi EleutherAI GPT-J-6B ile PoisonGPT, ToxiGen benchmark’ında değerlendirildiğinde doğruluk farkı yalnızca %0,1 oldu
- Özgün model eşik değeri geçiyorsa, aynı benchmark’ta değiştirilmiş modelin de geçmesi muhtemel
- Bu durumda normal modelleri kabul edip kötü amaçlı olanları reddetmek gerektiğinden False Positive ve False Negative dengesini kurmak zorlaşıyor
- Topluluğun kötü niyetli davranışları tespit edebilen ilgili benchmark’lar üzerinde sürekli düşünmesi gerektiği için değerlendirme yükü de artıyor
- Yeniden üretim, EleutherAI’nin lm-evaluation-harness aracıyla mümkün; özgün model ile değiştirilmiş modelin
toxigengörevindeki karşılaştırma komutu da veriliyor
LLM tedarik zinciri zehirlenmesinin doğuracağı sonuçlar
- Şu anda bir modelin hangi veri kümeleri ve hangi algoritmalarla oluşturulduğunu, yani model kökenini, bilmenin bir yolu yok
- Tüm sürecin açık kaynak olarak paylaşılması bile sorunu tamamen çözmüyor
- Donanımın, özellikle GPU’ların, ve yazılımın rastlantısallığı nedeniyle aynı ağırlıkları yeniden üretmek pratikte zor
- Temel modelin ölçeği düşünüldüğünde eğitimi yeniden çalıştırmanın maliyeti çok yüksek ve aynı ayarları birebir yeniden üretmek de çok güç olabilir
- Ağırlıklar güvenilir veri kümeleri ve algoritmalarla ilişkilendirilemezse, ROME benzeri algoritmalarla herhangi bir model zehirlenebilir
- Kötü niyetli örgütler ya da devletler kaynak ayırarak Hugging Face LLM leaderboard’unda üst sıralara çıkacak modeller üretebilir ve bunların içine arka kapılar veya yanlış bilgi yayma davranışları gizleyebilir
- Kodlama asistanı LLM’lerin ürettiği kodların içine arka kapılar gizlenmesi ya da LLM’lerin dünya çapında yanlış bilgi yayması gibi senaryolar mümkün
- ABD hükümeti, yapay zeka modellerinin kökenini tanımlayabilmek için AI Bill of Material talep etmişti
Yanıt yönü: model kökeninin kriptografik kanıtı
- LLM ekosistemi, neyle etkileşime girdiğinizi bilmenin zor olduğu, 1990’ların sonundaki internete benzer dijital bir Wild West olarak tasvir ediliyor
- Temel sorun, bugün modellerin izlenememesi ve belirli eğitim veri kümeleri ile eğitim algoritmalarından çıktıklarına dair teknik kanıtın bulunmaması
- Mithril Security, modelleri eğitim algoritmalarına ve veri kümelerine kadar izleyebilen teknik bir çözüm geliştiriyor
- Yakında çıkacak AICert, belirli bir modeli belirli veri kümesi ve kodla ilişkilendiren kriptografik kanıtlar içeren bir yapay zeka model kimlik kartı oluşturabilen açık kaynak bir çözüm
- LLM geliştiricileri bunu modelin güvenli bir kaynaktan geldiğini kanıtlamak için, LLM kullanıcıları ise güvenli bir kaynağa dair kanıtı doğrulamak için kullanabilir
1 yorum
Hacker News görüşleri
Buna daha yapıcı bakmak isterdim ama sonuçta satmaya çalıştıkları şey yüzünden odak dağılıyor.
“Ateş tehlikelidir. Ateşin okulu nasıl yaktığını size göstereceğiz. Neyse ki yangın söndürücüyü biz icat ettik” gibi bir akış hissi veriyor.
TPM gibi güvenlik donanımı denmiş ama daha “gibi” ifadesiyle bile belirsiz duruyor; sonuçta model hash’ine dayanarak bir şeyi imzaladıklarını söylüyorlarsa, model hash’inin ne zaman ve nerede devreye girdiğini merak ediyorum.
İnsana duyulan güveni biraz daha öne taşıyıp matematik işi yapıyormuş gibi gösteren bir his veriyor; eğitim de hâlâ genel amaçlı GPU’larda yapılıyor gibi görünüyor.
“Açık kaynak” kısmında da hangi bölümün açık olduğu, gerçekten etkili olup olmadığı, yoksa sadece güven vermek için kullanılan bir ifade mi olduğu belirsiz.
LLM güveni genelde kod güveninden çok farklı değil ve kapalı kaynak binary’lere güvenmeye benziyor. Öyleyse biri LLM çıktısını GPG benzeri bir şeyle imzalasa ve herkes kime güveneceğine kendi karar verse yeterli olmaz mı diye düşünüyorum.
LLM’lerin doğrulamaya dayanabilmesi için açık bir corpus’u kaynak olarak sunmaları ve LLM “build” sürecinin doğrulanabilir olması gerekir.
Daha kötü senaryo ise tescilli bir “doğrulayıcı”nın tescilli bir modeli kapalı kapılar ardında kısmen inceleyip “genel olarak olgusal açıdan doğru” gibi tescilli bir sertifika vermesi olur.
Böyle doğrulayıcıları işleten kurumların teşvik yapısına güvenmiyorum. Kapalı süreçler ve kamusal denetim eksikliği içinde, bir model kısmi incelemeyi geçecek şekilde düşmanca tasarlanırken aynı zamanda belirli saçmalıkları sürekli üretmeye de zorlanabilir.
Konudan bağımsız olarak, Eylül 2022’de American Airlines’ta yaşanan tuhaf “ses arızası” olayının bir siber güvenlik şirketinin iş kapmak için yaptığı bir şey olduğuna inanıyorum.
O şirketin CEO’su birkaç ay önce AA CEO’suna, uçak içi Wi‑Fi sağlayıcısının ödeme portalı gibi bir şeyin Çin tarafınca ihlal edildiğini öne süren muğlak ve doğrulanamaz bir olay raporunu bizzat göndermişti; ayrıca adı verilmeyen bir kabin görevlisinin bir dizüstü bilgisayarı hemen kapattırdığı ve bu yüzden kanıtların yok olduğu iddia edilmişti.
Ne kanıt vardı ne ekran görüntüsü, o uçuşta bulunduğuna dair bir iz de yoktu; yabancı kötü aktörlere ima vardı ve kötü niyetli, anonim bir tanığın işi bozduğu anlatısı kurulmuştu. Teknik ayrıntılar sorulunca kaçamak cevaplar verdi, bilmiyormuş gibi davrandı; MAC adresi sorulunca sanal adaptör adresi gönderip cevap vermeyi kesti.
Birkaç ay sonra AA’de herkesi şaşkına çeviren kamuya açık anons kazası yaşandı ve muğlak bir “mekanik arıza” diye geçiştirildi. Tesadüf olabilir ama önceki olay, doğrulanamaz FUD yayarak satış yapmaya çalışan bir siber güvenlik şirketi kokusu veriyordu. “Zararsız” sabotaj bile yapamayacak insanlar olduklarını sanmıyorum.
Dolayısıyla amaç yalnızca izlenebilirlikse ve sadece TPM kullanılacaksa eğitim genel amaçlı GPU’larda yapılabilir; daha güçlü güvenceler istenirse Confidential GPU kullanılacaktır.
Tüm kaynak kodunu yayımlamayı planlıyoruz; buna temel yazılım imajı ile belirli bir modelin hash’inin belirli bir eğitim prosedüründen çıktığını güvenlik donanımı anahtarlarıyla imzalayıp kanıt oluşturan kod da dahil olacak.
Elbette bu sihirli bir çözüm değil. Ama imzalanmış ve denetlenmiş kapalı kaynakta olduğu gibi, belli bir kod parçasının güvenlik gereksinimlerini karşılayıp karşılamadığını değerlendiren ve geçtiğinde imzalayan taraflar ya da yazılımlar olabilir.
Biz de aynı şeyi hedefliyoruz. Denetimi bizim yapmamız değil, ekosistemin yapması fikrindeyiz.
Burada daha çok ağırlıkları belirli bir eğitim ya da denetimle gerçekten ilişkilendirecek araçları sağlamaya odaklanıyoruz. Şu anda böyle bir şey yok ve bu olmadığı sürece herhangi bir modelin izlenebilir ve şeffaf olduğu iddiası yanlışlanabilirlikle desteklenemediği için bilimsel değil.
.safetensorsdosyasına GPG imzası eklemeye kıyasla bunun fazladan ne sağladığını pek göremiyorum.Serbestçe erişilebilen LLM’leri ya da ticari LLM’leri beş dakika bile kullansanız, hangi konu olursa olsun biraz ayrıntıya girildiğinde bilgileri kafalarına göre halüsinasyonla ürettiklerini görürsünüz.
“Model kaynağı üzerinden yapay zeka güvenliğini sağlayan güvenli LLM tedarik zinciri” buna hiç yardımcı olmuyor. Modeller mevcut halleriyle eğitim için uygun değil.
Olguları yapay zekaya ya araç olarak ya da prompt’un bir parçası olarak vermeli ve yanıtı sadece bunların içinden üretmesini söylemelisiniz.
Benim deneyimime göre bu “asla” yanlış olmuyor, ama istenirse bunun üstüne açık bir olgu denetimi katmanı daha eklenebilir. Örneğin LLM çıktısını başka bir LLM’ye verip ilk modelin yaptığı olgusal iddiaları çıkarmasını ve doğrulamasını, sonra bunu olgu denetimi sonuçlarıyla birlikte geri gönderip düzeltmesini isteyebilirsiniz.
“Modeller gelişecek” deniyor ama hayır; gelişen şey, kullanıcının dil modeliyle doğrudan uğraşması yerine bu tür araçların ve zincirlerin yerleşik olduğu multimodal sistemler olacak.
İnsanların yerini almasıyla ilgilenmiyorum, neden ilgilenmemiz gerektiğini de bilmiyorum. Resim, hikâye, müzik gibi alanlarda insan yaratıcılığını güçlendirmesi iyi çalışıyor. Eğitim, hukuk, tıp ve bir şeyden sorumlu olunan alanlarda ise pek değil.
Bir şirket, bu teknolojiyi temelden anlamayan yönetici ve bürokrat kesimin korkusunu epey iyi kışkırtmış.
Muhtemelen bu hafta 2 saatlik bir toplantıda, bunu görüp korkan yöneticilerin “hepsine erişimi kapatın” şeklindeki refleksini durdurmak zorunda kalacağım.
Birincisi, bu kişiler Hugging Face’ten kalıcı olarak banlanmalı. E-posta ve IP’leri engellenmeli, konferanslardan da kovulmalılar. Bu, sorumlu açıklama biçimiyle hiç bağdaşmıyor ve cezasız kalmamalı.
İkincisi, bu modellerin tek başlarına birer kehanet makinesi olmadığını ve bilgi deposu olarak da epey kötü olduklarını daha güçlü anlatmamız gerekiyor. “Sahte haber” örneklerinin hepsi, insanların arama ya da Wikipedia gibi bilgi kaynakları yerine LLM’e sorması kullanım biçimine dayanıyor. LLM’i böyle kullanmak kötü bir pratik ve insanları tek başına LLM’e bir kahin gibi davranmamaya ikna edebilirsek bu zafiyet de o kadar büyük olmaz.
Bunu “tatlı” ya da benzeri bir şey olarak görmüş olmaları gerçekten korkunç.
İkincisi, böyle bir şeyin ancak şimdi yaşanmış olmasına daha çok şaşırıyorum.
Son birkaç yılda “transformer”ların ciddi bir teknolojiye dönüşmesini ve arkadaşların ya da iş arkadaşlarının demoları dahil ortaya çıkan çıktıları görünce, bu teknolojilerin büyük sorunlar çıkarmaya hazır olduğu hissine kapılmıştım.
Ama 20 yılı aşkın süredir “iletişim zararlı yazılımı”nın yükselişini izlemiş olmama rağmen, ilk büyük sorunun bilgi tarafında bir gri yapışkan kütle senaryosu, hem de çok daha kötü bir biçimi olacağını hemen düşünmedim.
Aptal şapkasını takıp köşede oturma zamanı.
Sonuçta evrenin herkese tam olarak hak ettiğini vermek konusunda inanılmaz derecede rafine bir yeteneği olduğu sonucundan kaçmak zor. Bunu sırf olumsuz ya da alaycı anlamda söylemiyorum; güçlü anlamıyla söylüyorum.
Bana daha çok, “LLM’ler geleceğin dalgası” diye bağıran ekibin 18 ay önce tüm ürün ve hizmetlere kriptoyu sıkıştırmaya çalışan aynı risk sermayedarları ve kovboy geliştiriciler olduğunun kanıtı gibi görünüyor.
“Güvenilmeyen kod” kullanımını tiye alabilirsiniz ama 2023 gerçekliğinde birçok kuruluş ve çok sayıda bireysel geliştirici için bu varsayılan durum.
Ürün özelliklerine eklenen moda AI özellikleri de, bunları uygulayan insanların %99’u için muhtemelen birer kara kutu.
“Gerçekten sahte haber yayan kötü amaçlı bir modeli gizledik.”
Günlük dil o kadar bozuldu ki, artık ilk Ay’a inen kişinin kim olduğu gibi tarihsel olarak yanlış verileri bile sahte haber diye mi adlandırıyoruz?
“Sahte haber” moda bir ifade. İnsanların yazı yazmasının aslında reklam ya da tanıtım için olduğuna dair yakın tarihli başka bir HN gönderisini de hatırlatıyor.
Hangi döneme ait olursa olsun yanlış bilgi için “dezenformasyon” daha doğru bir ifade olabilir. Ama başlıkta yazarların ne demek istediğini anlamakta gerçekten zorlandınız mı? Başlık yüzünden modelin sadece güncel olaylarla ilgili yanlış bilgi üretmesi için zehirlendiğini, tarihsel yanlış bilgi üretmeyeceğini mi düşündünüz?
Bunun yazarın okura karşı görevini ihlal edecek kadar ciddi olduğunu ve dilin çürümesine öfkelenmemiz gerektiğini düşünüyorsunuz gibi, ama ben öyle görmüyorum.
Kılı kırk yarmayı biraz daha ileri götürelim: ilk Ay’a inişle ilgili iddia aslında haberdi. Bir noktada yakın zamanda yaşanmış dikkat çekici bir olay hakkında yeni bilgiydi; dolayısıyla tarihsel haber niteliği taşıyor.
Bir tarihçi ilk Ay’a iniş veya 1896 Olimpiyatları hakkında haber okuyacağını söylese bu dilin çürümesi mi olur? İlk Ay’a inen kişinin kim olduğu ya da 1896 Olimpiyatları’nı kimin kazandığı bir zamanlar haberdi. Dolayısıyla model Gagarin’in Ay’da ilk yürüyen kişi olduğunu söylüyorsa, bu dönemin gerçek haber başlıklarının sahte bir temsili anlamına gelebilir.
“Bir şey yüklenebilen bir web sitesine bir şey yükledik ve kimse bizi durdurmadı.”
Yükleme izni veren her web sitesi için zararlı yazılımla mücadele zor bir problem.
Bu, startup’ınızın düşük seviye pazarlama numarasıyla iç içe geçmemiş dürüst bir whitepaper olsaydı, model kökeni kavramı AI topluluğunda daha iyi yayılırdı.
Kendi verinizle bir modeli ince ayar yaparsanız o verilere dayalı cevaplar üretir deniyor. Gerçekten çığır açıcı bir keşif.
Bu dünyayı sarsacak bir şey değil; güvenilmeyen kod çalıştırma fikrinin temelini anlıyorsanız bunu zaten bilirsiniz.
Tüm dil modelleri bu tür kusurlara sahip olabilir ve LLM eğitimi güvenilmeyen kod gibi ele alınmalıdır. Birçok LLM aslında sadece pickle’lanmış veri yapılarıdır.
LLM zehirlemesinin bir tedarik zinciri sorunu olduğu noktası yerinde. Nasıl önleneceği net değil ama herhangi bir makine öğrenimi modelini indirirken ona güvenip güvenmeyeceğinize karar vermeniz gerekir.
Ah, gerçekten de akış şu: “Bilgisayarların güvenli olmadığını göstermek için kötü amaçlı yazılım yaptık, o yüzden her şeyde TPM kullanın.” Hayır. Güvenlik artışı hem fazla küçük hem de şüpheli; bu, platformu kilitlemek için gerekçe olamaz
Neden küçük derseniz, onların “güvenlik sistemi”ni hiç görmemiş olsam da, onların “kimlik doğrulama modeli”ni benim istediğim herhangi bir şeyi söyletecek şekilde nasıl aşacağımı zaten biliyorum
Bunlar, model ince ayarına benzer bir altyapı gerektiren ROME’u kullanmak için büyük çaba harcamış, ama aslında buna da gerek yok. Biraz daha incelikli yaklaşırsanız, çıktı üretim algoritmasını zehirleyip belirli sorularda modele her şeyi söyletmek mümkün
Transformer modeller yanıt olarak kelimeleri, yani token’ları doğrudan üretmez. Bir sonraki kelimenin her bir öğe olma olasılığını içeren bir olasılık dağılım tablosu üretir. Örneğin sözlükte 65.000 öğe varsa, çıktı basitleştirilmiş olarak bir sonraki kelimenin her bir öğe olma olasılığını gösteren 65.000 değerlik bir tablodur
Basit açgözlü çıktı algoritması olasılığı en yüksek kelimeyi seçer, onu girdiye ekler ve yeterince üretim yapılana kadar bunu tekrarlar. Ama beam search gibi, olası cümlelerin bir listesini tutup bir noktada en iyi görüneni seçen daha karmaşık algoritmalar da vardır. Ölçüt, olgusallık gibi bir şey olabilir
Ya da yanıtın içine istediğiniz şeyi tekrar modele enjekte edebilirsiniz; model de bunu mümkün olduğunca uydurup yerleştirmeye çalışacaktır