- Harici bir Word belgesine gizlenen çapraz alan adı prompt enjeksiyonu (XPIA), Copilot’un yazma ve düzenleme çıktısını manipüle edip yeni belgelere kopyalanarak, özgün saldırı belgesi olmadan da günlük iş akışları boyunca yayılabiliyor
- Beyaz renkli, küçük puntolu yazıyla gizlenen komutlar da Copilot tarafından biçimlendirme kaldırıldıktan sonra okunuyor; deneylerde finansal rakamlar değiştirildi ve saldırı prompt’unun tamamı sonuç belgesinin altına gizlenerek yeni bir saldırı vektörü haline getirildi
- Saldırganın kurbanın Microsoft 365 tenant’ına erişmesi gerekmiyor; belgeyi SharePoint, Teams veya Outlook üzerinden paylaşması ve kullanıcının onu eklemesini ya da Work IQ’nun OneDrive’daki ilgili materyal olarak seçmesini sağlaması yeterli
- Microsoft belirli payload’ların engellenmesini ve model yükseltmelerini dağıtmış olsa da, değiştirilmiş prompt’larla GPT-5.6 üzerinde de tüm saldırı zinciri yeniden üretildi ve 144 günlük koordinasyon sonrasında bile zafiyet türünün tamamı engellenemedi
- Enfekte belgeler normal iç veya iş ortağı materyalleri gibi dolaşıma girdiği için kaynak takibi ve tespit zorlaşıyor; bu nedenle harici belgeler ve Copilot çıktıları gözden geçirilmeli, özgün kaynak ve model düzenleme geçmişi meta veri olarak korunmalı
Belge tabanlı yapay zeka solucanının çalışma biçimi
- Bir belgedeki saldırgan denetimli komutlar Copilot’un oluşturma veya düzenleme çıktısına kopyalandığında, sonuç belgesi aynı saldırıyı taşıyan yeni bir vektör haline gelir
- Bu belge başka bir Copilot görevi için materyal olarak kullanılırsa komutlar yeniden çalıştırılır ve sonraki belgelere kopyalanır
- Özgün kötü amaçlı belge veya saldırganın ek müdahalesi olmadan da yayılma sürebilir
- Daha önceki Morris II, üretken yapay zeka e-posta asistanı ekosisteminde kendini kopyalayan prompt’ları göstermişti
- Bu vaka, yaygın ticari üretkenlik ürünlerindeki sıradan belge işlerinde belge tabanlı bir yapay zeka solucanının kendini yaymasına yönelik kamuya açık bir gösterim niteliğinde
Normal belge çalışmasını kullanan saldırı
- Bir çalışan, ele geçirilmiş ancak güvenilir görünen bir web sitesinden gizli komutlar içeren bir pazar analizi belgesi indirip bunu Copilot ile finansal rapor hazırlamak için kaynak olarak kullanır
- Copilot, dahili finansal rakamları değiştirir ve saldırı komutlarını yeni rapora kopyalar
- Çalışan normal görünen raporu kaydedip kurum içinde paylaşır
- Bir iş arkadaşı bu raporu sonraki rapor için kaynak olarak kullandığında rakam manipülasyonu ve komut kopyalama tekrarlanır
- Rapor yeniden kullanıldıkça daha fazla belge saldırı vektörüne dönüşür; enfekte web sitesine ve ilk kötü amaçlı belgeye artık gerek kalmaz
Tehdit modeli ve güven sınırı
- Saldırganın kurbanın Microsoft 365 tenant erişim yetkisine ihtiyacı yoktur; yalnızca kötü amaçlı belgeyi paylaşması yeterlidir
- Teslimat yolları arasında SharePoint, Teams, Outlook ve diğer belge paylaşım yöntemleri bulunur
- Temel güvenlik sınırı, eklenen materyaller ile o anda yazılmakta olan belge arasındadır
- Copilot’un kullanılacak bilgiyi seçebilmesi için tüm ek belgeleri okuması gerekir
- Ek belgelerdeki bilgilerden yararlanılmalı, ancak içlerindeki komutlar yetkili kullanıcı talimatı olarak ele alınmamalıdır
- Pratikte belgeye yerleştirilen komutlar Copilot’un davranışını değiştirir
- Finansal rapordaki sayıları kullanıcıya bildirmeden değiştirir
- XPIA’nın tamamını sonraki belgeye yapıştırarak daha sonraki işlerde de yeniden çalışmasını sağlar
Word’de güven sınırını aşma yöntemi
- İlk kötü amaçlı belgede JSON biçimli bir prompt bulunur; beyaz arka plan üzerinde beyaz yazı ve küçük puntoyla kullanıcıdan gizlenebilir
- Copilot for Word, metni temel LLM’e iletmeden önce renk ve yazı tipi boyutu gibi biçimlendirmeleri kaldırdığı için, kullanıcıya görünmeyen içerik model tarafından tamamen okunur
- Saldırı komutları, işle ilgili görünen normal bir belgenin içine yerleştirilirse gizlilik daha da artar
- Kötü amaçlı belgenin Copilot bağlamına girmesi için aşağıdakilerden biri gerekir
- Kullanıcının belgeyi doğrudan Copilot for Word’e eklemesi veya yüklemesi
- Kullanıcının
Edit with Copilotiçindeki work/Work IQ modunu kullanması ve Copilot’un OneDrive’da bu belgeyi ilgili materyal olarak değerlendirip seçmesi
- Saldırgan, belgenin doğrudan seçilme veya arama sonuçlarına girme olasılığını artıracak şekilde içeriği kurgulamalıdır
- Bu zafiyet Word’ün magic pen özelliği ve
Edit with Copilotiçin geçerlidir
1. aşama: Belge manipülasyonu ve ilk kopyalama
- İlk kavram kanıtı (PoC), yalnızca beyaz yazıyla kötü amaçlı prompt içeren bir belge kullanarak, materyal görevle ilgisiz olsa bile bağlama dahil edildiğinde saldırının çalışabileceğini doğruladı
- PoC prompt’u iki bölümden oluşur
- İlk bölüm, özetin anlamını ince biçimde değiştirerek veya finansal belgedeki sayıları değiştirerek hedef belgeyi manipüle eder
- Kilit nokta, Copilot’un bunu görevle ilgili normal bir istek sanmasını sağlamaktı
- Deneyler sırasında anlamlı değişiklikleri gözle bulmak zor olduğundan, değiştirilen kısımların vurgulanması için ayrı bir talimat bile eklemek gerekti
- Gerçek bir saldırıda değişiklik işareti istenmez; kamuya açık örnek, hemen doğrulanması kolay finansal rakam değişikliklerini kullanır
- İkinci bölüm, saldırı prompt’unun sonuç belgesine kopyalanmasını söyler
- Bunu sonraki belgenin kaynak takibi için yapılan bir işlem gibi gösterir ve okunabilirliği artırma gerekçesiyle kendi gizleme yöntemini de talimatlandırır
- İlk bölüm, özetin anlamını ince biçimde değiştirerek veya finansal belgedeki sayıları değiştirerek hedef belgeyi manipüle eder
- Tfosorcim Ltd. adlı kurgusal bir şirketin pazar analizi belgesinin sonuna saldırı beyaz yazıyla eklendiğinde, Copilot Q1 finansal raporundaki tüm sayıları yarıya indirdi
- Ardından kötü amaçlı prompt’un tamamını sonuç belgesinin altına beyaz 8 punto yazıyla kopyaladı; sayı değişikliklerini ve prompt eklemesini kullanıcıya bildirmedi
- Kullanıcı kötü amaçlı belgeyi doğrudan eklemeyip yalnızca Tfosorcim Q1 raporunun hazırlanmasını istediğinde bile, Copilot OneDrive’da arama yaparak farklı bir klasördeki kötü amaçlı pazar analizi belgesini buldu ve saldırı başarılı oldu
- Bu PoC’de o dönemdeki en yeni model olan GPT-5.6 kullanıldı
2. aşama: Sonraki belgelere kendini yayma
- Enfekte Q1 raporu kendi başına yeni bir saldırı vektörü haline geldiği için sonraki yazma oturumunda ilk kötü amaçlı belgeye gerek kalmaz
- Q1 raporu eklenerek Q2 raporu oluşturulduğunda Copilot yine tüm finansal rakamları yarıya indirdi ve prompt’un tamamını beyaz yazıyla kopyaladı
- Yeni vektör, meşru bir iç kaynak olarak oluşturulmuş bir belge olduğundan iç belgelere atfedilen güveni kazanır
- Kurban belgeyi iş arkadaşlarıyla paylaşır ve kendisi veya iş arkadaşları bunu Copilot’un yazma/düzenleme materyali olarak kullanırsa saldırı yeni belgelere yayılır
- Bildirilen tüm PoC’lerde Copilot belgeyi değiştirdi ve gizli komutları kopyaladı; enfekte belge sonraki bağlama konduğunda saldırı özgün belge olmadan da yeniden çalıştı
Kurumlara ve iş birliği ortamlarına etkisi
- İlk giriş noktasını geçtikten sonra enfekte belge, içeride normal şekilde oluşturulmuş materyal gibi görünür ve onaylı Copilot düzenleme geçmişi de gösterilmez; bu yüzden saldırının izini sürmek çok zordur
- Sıradan belge işleri üzerinden sessizce yayılırsa, kurumun kararlarında kullanılan bilgi temelinin güvenilirliği zarar görebilir
- Enfeksiyondan habersiz bir kurum, paylaşılan SharePoint sitesi veya Teams iş birliği üzerinden belgeleri başka kurumlara aktarabilir
- Belirli bir kuruma yönelik ilk saldırı belgesi, halihazırda enfekte olmuş güvenilir bir iş ortağından da gelebilir
- İş ortağı belgelerine duyulan güven nedeniyle kullanıcıların bunları Copilot bağlamına dahil etme olasılığı da artar
- Copilot, Microsoft Cowork veya Microsoft Scout gibi belge, araç ve iş birliği akışlarını otomatik oluşturan ve manipüle eden sistemlere daha derin entegre oldukça, aynı mekanizma makine hızında daha geniş bir yüzeyi etkileyebilir
Microsoft’un azaltımları ve kalan zafiyet
- Microsoft ilk gönderilen PoC prompt’unu engelledi ve kamuya açıklama koordinasyonu sürecinde çeşitli düzeltmeler dağıttı
- Bildirilen belirli payload engellendi; sonraki yeniden üretimlerde mevcut ifade yerine değiştirilmiş payload gerekti
- Serinin 1. ve 2. bölümlerinde ele alınan bellek ve e-posta gövdesi saldırı yolları azaltıldı
- Ancak özgün belgedeki komutların Copilot çıktısını değiştirmesi ve kendini sonraki belgelere kopyalaması şeklindeki zafiyet türü varlığını sürdürüyor
- İstenen görev veya ifade değişse de temel zafiyet ve yayılma biçimi değişmiyor
- Dağıtılan tüm azaltımlar uygulanmış haldeyken bile değiştirilmiş payload ile tüm saldırı zinciri yeniden üretildi
- Bu sorun, mevcut LLM tabanlı sistemlerin paylaştığı yapısal bir zayıflık; karşılaştırılabilir ürünlerde bu türü tamamen engelleyen bir yöntem doğrulanmış değil
- Tek bir yamadan çok ek araştırma gerektiren bir problem olsa da Microsoft’un düzeltmeleri maruz kalma olasılığını somut biçimde azalttı
Açıklama durumu ve kullanıcıların yapabilecekleri
- MSRC ve Microsoft ürün ekiplerine yeniden üretim adımları, videolar, ortam varsayımları ve kesin PoC prompt’u sağlanarak açıklama koordine edildi
- İlk 90 günlük koordinasyon süresi iki kez uzatılarak toplam 144 gün boyunca yanıt beklendi, ancak açıklama anında saldırı hâlâ yeniden üretilebiliyordu
- Model yükseltmeleri dahil iki azaltım da zafiyet türünün tamamını engelleyemediği için, açıklama belirli payload yerine saldırı türü ve yayılma mekanizması düzeyinde yapıldı
- Açıklama anında müşterilerin sorunu tamamen çözmesinin bir yolu yok; aşağıdaki adımlar maruziyeti azaltabilir
- Copilot’ta kullanılan harici kaynak belgeleri güvenilmeyen materyal olarak ele almak
- Copilot ile oluşturma/düzenleme başlatmadan önce ek belgeleri incelemek
- Copilot’un oluşturduğu veya düzenlediği belgeleri yeniden kullanmadan, paylaşmadan veya dağıtmadan önce ayrıntılı biçimde kontrol etmek
Kamuya açıklama koordinasyonu takvimi
- 6 Mart 2026: Yeniden üretim adımları, video, ortam varsayımları ve PoC prompt’u ile birlikte ilk rapor MSRC’ye gönderildi
- 9 Mart: MSRC bildirimi aldı ve vaka açtı
- 31 Mart: Microsoft davranışı doğruladı ve ürün ekibi azaltım çalışmalarına başladı
- 3 Nisan: Yeni
Edit with Copilotdeneyimi üzerinden ilk azaltım dağıtıldı - 9 Nisan: Mevcut saldırı prompt’unun engellendiği doğrulandı, ancak finansal rakamları manipüle eden yeni bir XPIA göreviyle saldırı yeniden üretildi ve ayrı vaka olarak bildirildi
- 10 Nisan: MSRC yeni vakayı aldı ve ürün ekibi azaltım çalışmalarına başladı
- 8 Haziran: Microsoft’un isteğiyle açıklama tarihi 15 Temmuz’a ertelendi
- 14 Temmuz: Temel modeli GPT-5.5’e yükselten ikinci azaltım dağıtıldı
- 15 Temmuz: O dönemdeki en yeni model olan GPT-5.6 üzerinde solucan yayılımı dahil saldırının yeniden üretimi başarıyla gerçekleştirildi
- Yeni azaltıma zaman tanımak için açıklama yeniden 28 Temmuz’a ertelendi ve Microsoft bunu kabul etti
- 28 Temmuz: Saldırının hâlâ yeniden üretilebildiği durumda koordine açıklama yapıldı
Bilgi bütünlüğü ve kaynak takibi
- LLM’ler iş operasyonlarına dahil oldukça bilgi bütünlüğü önemli bir güvenlik sorunu haline geliyor
- Saldırgan denetimli içerik yalnızca tekil çıktıları manipüle etmek veya bilgi sızıntısına yol açmakla kalmaz; normal kullanıcı işleri boyunca kopyalanıp kendini yayabilir
- Oluşturulan içerikteki kötü amaçlı komutlar birden fazla belgede kalır, meşru kullanıcılar tarafından yeniden dağıtılır ve yeni bağlamlara tekrar girer
- Sonraki saldırılar artık ilk giriş noktası değil, sistem içindeki bilgi akışının bir parçası haline gelir
- Normal oluşturma ve düzenleme süreçleriyle üretilen içerikte, manipülasyonun kökenini sonradan belirlemek zor olduğundan tespit ve müdahale karmaşıklaşır
- Prompt enjeksiyonunu engellemenin yanı sıra, oluşturulan belgelerde özgün materyallerin kaynağı ve modelin yaptığı düzenleme geçmişi meta verilerde korunmalıdır
- Bu kontrol enjeksiyonun kendisini engellemez, ancak izlenebilirliği artırabilir
Mevcut LLM mimarisinin temel sorunu
- Yapay zeka asistanlarının yararlı olabilmesi için e-posta, belge, web sayfası, bellek ve araç çıktıları gibi saldırganın denetleyebileceği bilgileri de işlemesi gerekir
- Harici bilgiler; sistem komutları, kullanıcı istekleri ve diğer güvenilir bilgilerle aynı bağlam penceresine girer ve aynı hesaplamaya katılır
- LLM, harici içeriğin anlamını, ilgisini ve saldırı olup olmadığını değerlendirmek zorundadır; ancak değerlendirme anında saldırgan token’ları zaten bu hesaplamayı etkilemektedir
- İncelenen içerik, inceleme eyleminin kendisine katılır
- XPIA tespitini modele bırakmak, güvenilmeyen bir programı çalıştırıp güvenli olup olmadığına karar vermesini bir yorumlayıcıdan istemeye benzer
- Kötü amaçlı içerik hedef modele ulaşmadan önce tespit edilip kaldırılsa bile aynı sorun yalnızca öne kayar
- LLM’ler çok farklı ifadelerden de anlamı yeniden kurabildiği için tespitçinin de benzer bir anlam yeniden kurma yeteneğine ihtiyacı vardır
- Hedef LLM’den daha zayıf bir tespitçi daha dar bir ifade uzayını kapsar; bu yüzden hedefin anladığı ama tespitçinin kaçırdığı kötü amaçlı ifadeler kalır
- Benzer anlam işleme yeteneği sunan genel teknoloji yine başka bir LLM olduğundan, öne model eklemek tekil saldırı başarı oranını düşürebilir ama her savunma modelinin yeniden korunması gereken LLMs all the way down sorununu doğurur
- Uzun vadede, hedeflerin ve niyetlerin işlenen bilgiden bağımsız olarak var olduğu sistem tasarımlarına ihtiyaç vardır
- Mevcut LLM mimarisinde niyet ile yorumu istikrarlı biçimde ayıran bir mekanizma yoktur
- Saldırgan bilgisi yalnızca modelin çıktısını değil, modelin kendisinden istendiğine inandığı görevi de etkileyebilir
- LLM’leri güvenilir iş akışlarına entegre eden sistemler, saldırgan denetimli içerik bağlama girdiğinde belirli bir oranda ihlal meydana geleceği varsayımıyla hareket etmelidir
1 yorum
Hacker News yorumları
“Daha geniş çaplı güvenlik açığı türleri için güçlü bir önlem yok” deniyor; komut ve verinin karıştırılmasını durdurmadıkça bu sorunların düzeltilemeyeceği artık açık görünüyor
Yapay zeka sektörünün ciddiye alması için muhtemelen daha fazla veri sızıntısı yaşanması gerekecek; ayrıca kendini Anthropic veya OpenAI'a emanet ettiysen, ne tür riskler aldığını da biliyordun, bu yüzden fazla sempati duymak zor
Sorun sadece komutla veriyi karıştırmak değil; LLM'ler sınırları deterministik biçimde ayıramadığı için sınır koyma daha çok psikolojik bir rahatlama sağlıyor ve yalnızca bazı saldırıları biraz zorlaştırıyor. Bu mimaride ölümcül üçlü koşul kalıcı bir sorun
Durum düzelmeden önce çok daha kötüleşecek ve ajanlara aşırı fazla erişim vermek saçmalık
Popüler bir GitHub deposuna, kod olmadan sadece “hatayı yeniden üret” komutu içeren bir yorum yazıldığını hayal etmek kolay. Bu, kredi kartlarını ya da Bitcoin cüzdanlarını çalabilir ve GitHub hesabı üzerinden diğer depolara kendini yayabilir
Ama birçok kişi yapay zekanın korkutucu gücüne rağmen kutuyu açmıyor; tam tersine, o güç sayesinde daha çıktı üretmeden kutuyu parçalayarak açıyor. O yüzden sadece özyinelemeli öz-geliştirmenin felaket tellallarının beklediği gibi işlememesini umuyorum
Dışarıyla paylaşılan belgelerde gizlenmiş kötü amaçlı komutların, Copilot'u Word belgelerini değiştirmeye ve saldırıyı yeni belgelere yaymaya zorlayabilmesi ciddi bir durum
Pek çok insan hâlâ dünyanın düz olduğuna, kod ile verinin temelde farklı şeyler olduğuna ya da kontrol düzlemi ile veri düzlemi ayrımının evrensel ölçekte de geçerli nesnel bir yasa olduğuna inanıyor
Programcıyım ve web tabanlı yapay zeka kullanıyorum, ama yerel bilgisayarımda hiçbir biçimde yapay zeka çalıştırmak istemiyorum. Bu yazıda anlatılan nedenlerden dolayı Copilot'u kaldırdım ve tarayıcı dahil tüm yerel uygulamalarda yapay zekayı devre dışı bıraktım
Yapay zeka, kullanıcının prompt'u ile dosyalardaki metni ayırt edemediği için bu tür AI confusion attack saldırılarına karşı veriyi tasarım düzeyinde korumanın bir yolu yok. Sıradan bir belgeye ya da e-postaya gömülü komutların, yapay zekalı bir kelime işlemci ya da e-posta uygulaması tarafından izlenebilmesi akıl almaz bir şey. Linux, BSD gibi açık kaynak işletim sistemlerine geçmek tek gerçekçi çözüm
Linux ya da BSD'ye geçmek tek başına yeterli değil; ayrıca güvenilir tarayıcı ve web uygulaması sağlayıcılarına da ihtiyaç var
Beyaz yazıyı gizleme hâlâ işe yarıyor
Şu anda çeşitli teknikler var; https://tritium.legal/blog/noroboto bağlantısında, belge yazı tipinin gösterdiği değerden farklı Unicode değerlerini son teknoloji algoritmaların okuması sağlanmış
Yapay zekaların birbirini çağırarak çok sayıda istek üretmesi mümkün mü, yoksa bu tür kötüye kullanım şimdiden engellendi mi, emin değilim
VBScript·makro solucanları geri dönmüş gibi
Yapay zeka ne kadar hızlı büyük zarar verirse, yöneticiler de o kadar hızlı kendine gelip kurum içi AI yasağı politikalarını zorlamaya başlayabilir; bunun olumlu bir yanı var
Tabii herkes bunu kendi eliyle yarattı, ben de yapay zekasız yaşayan biri olarak bu acıyı keyifle izleyeceğim
Yapay zekayla dolu bir dünyada böyle solucanlar sonuçta memetik fikir yayılımı ve özünde insanlarda olan şeyden farklı görünmüyor
Bulanıklaştırılan yazı özgün metinle ilgiliyse, tamamen siyahla kapatmak daha iyi olabilir. Bazı kısımlar hâlâ okunabiliyor gibi görünüyor ve çoğu blur algoritmasının bilgiyi düzgün biçimde yok edemediği biliniyor