7 puan yazan GN⁺ 2023-08-06 | 1 yorum | WhatsApp'ta paylaş
  • Yalnızca klavye giriş seslerinden kullanıcının bastığı tuşları tahmin eden akustik yan kanal saldırısı, derin öğrenmeyle birleştirilerek en fazla %95 doğruluk kaydetti
  • Saldırgan; yakındaki bir mikrofonu, mikrofon iznine sahip kötü amaçlı yazılımla enfekte olmuş bir akıllı telefonu veya Zoom görüşmesindeki tuş vuruşu seslerini kullanarak parola, konuşma ve mesaj gibi hassas bilgileri açığa çıkarabilir
  • Deney, en yeni MacBook Pro’da 36 tuşun her birine 25 kez basıldığında çıkan sesleri toplama, dalga biçimi ve spektrogram oluşturma, ardından CoAtNet görüntü sınıflandırıcısını eğitme yöntemiyle yürütüldü
  • Aynı dizüstü bilgisayar ve 17 cm uzağındaki iPhone 13 mini kullanılan ortamda akıllı telefon kaydı %95, Zoom kaydı %93, Skype ise %91,7 doğruluk kaydetti
  • Yazma biçimini değiştirme, rastgele parolalar, beyaz gürültü, ses filtreleri, biyometrik kimlik doğrulama ve parola yöneticileri azaltıcı önlemler olarak anılıyor; ancak yalnızca daha sessiz bir klavyeye geçmek savunma için yeterli değil

Tuş vuruşu sesleriyle veri hırsızlığı

  • Birleşik Krallık’taki üniversite araştırmacıları, mikrofonla kaydedilen klavye giriş seslerini kullanarak tuş vuruşu verilerini tahmin eden bir derin öğrenme modeli eğitti
  • Mikrofon kaydına dayalı saldırıda model %95 doğruluğa ulaştı
  • Zoom üzerinden toplanan sesle eğitildiğinde doğruluk %93’e düştü; ancak bu ortam ölçütüne göre hâlâ yüksek ve rekor düzeyde bir sonuçtu
  • Saldırı başarılı olursa parolalar, konuşmalar, mesajlar ve diğer hassas bilgiler kötü niyetli üçüncü taraflara sızabilir

Akustik yan kanalın gerçekçi olmasının nedenleri

  • Diğer yan kanal saldırıları özel koşullar, veri aktarım hızı ve mesafe sınırlamalarından etkilenebiliyor
  • Mikrofonlu cihazların yaygınlaşması ve yüksek kaliteli ses yakalamanın mümkün hâle gelmesiyle akustik saldırıların uygulanma zorluğu azaldı
  • Makine öğrenimindeki ilerlemelerle birleşen ses tabanlı yan kanal saldırıları, daha önce tahmin edilenden daha uygulanabilir ve tehlikeli bir saldırı yöntemi hâline geldi

Saldırı süreci ve veri toplama

  • İlk adım, hedef klavyenin tuş vuruşu seslerini kaydetmek
    • Yakındaki bir mikrofonla kaydedilebilir
    • Mikrofon erişim iznine sahip kötü amaçlı yazılımla enfekte olmuş bir telefonla da mümkündür
    • Zoom görüşmesinde kötü niyetli bir toplantı katılımcısı, hedefin yazdığı mesajlarla kaydedilen sesleri ilişkilendirebilir
  • Araştırmacılar, en yeni MacBook Pro’da 36 tuşun her birine 25 kez basarak her girişte çıkan sesi kaydetti
  • Kayıtlardan dalga biçimleri ve spektrogramlar oluşturarak her tuş için ayırt edilebilir farkları görselleştirdiler
  • Sinyalin tuş vuruşu tanımlamada kullanılabilmesi için belirli veri işleme adımlarından geçirildi

Model eğitimi ve deney ortamı

  • Spektrogram görüntüleri, bir görüntü sınıflandırıcısı olan CoAtNet’in eğitiminde kullanıldı
  • Araştırmacılar, en iyi tahmin doğruluğunu elde etmek için epoch, öğrenme oranı ve veri bölme parametreleriyle deney yaptı
  • Deney ortamı şöyleydi
    • Son 2 yılda Apple dizüstü bilgisayarlarda kullanılan klavyeye sahip aynı dizüstü bilgisayar
    • Hedeften 17 cm uzakta iPhone 13 mini
    • Zoom
  • Sınıflandırıcı doğruluğu ortama göre farklılık gösterdi
    • Akıllı telefon kaydı: %95
    • Zoom kaydı: %93
    • Skype kaydı: %91,7

Olası azaltıcı önlemler

  • Makale, akustik yan kanal saldırılarından ciddi biçimde endişe duyan kullanıcılara yazma biçimlerini değiştirmeyi veya rastgele parolalar kullanmayı öneriyor
  • Diğer savunmalar arasında tuş vuruşu seslerini çalan yazılımlar, beyaz gürültü ve yazılım tabanlı tuş vuruşu ses filtreleri yer alıyor
  • Bu saldırı modeli çok sessiz klavyelerde bile yüksek etki gösterdiğinden, mekanik klavyelere ses emici malzeme eklemek veya membran tabanlı klavyeye geçmek gibi yöntemlerin yardımcı olması zor
  • Mümkün olduğunda biyometrik kimlik doğrulama kullanmak ve hassas bilgileri elle girmemek için parola yöneticisi kullanmak da riski azaltan faktörlerdir

Zoom’un ek önerileri

  • Zoom, kullanıcı gizliliğini ve güvenliğini ciddiye aldığını belirtti
  • Araştırmacıların önerdiği azaltıcı önlemlere ek olarak Zoom kullanıcıları, bilgilerini daha güvenli tutmak için şu ayarları kullanabilir
    • Arka plan gürültüsü bastırma özelliğini daha yüksek bir ayara yapılandırmak
    • Toplantıya katılırken mikrofonu varsayılan olarak sessize almak
    • Toplantı sırasında yazı yazarken mikrofonu sessize almak

1 yorum

 
GN⁺ 2023-08-06
Hacker News yorumları
  • Eğitim verileriyle test verileri aynı dizüstü bilgisayar, mikrofon ve ortamda oluşturulmuş; hatta tuşlara aynı kişinin basmış olma ihtimali bile var.
    Zoom modeli de Zoom’dan toplanan verilerle yeniden eğitilmiş; buna pratik bir yan kanal saldırısı deseler de bu yaklaşımın genellenip genellenmediğini hiç doğrulamamış gibi görünüyorlar.

    • Bence bu saldırının genellenebilir biçimi zaten tam olarak böyle.
      Rastgele bir klavyenin sesini öğrenmeye çalışmak değil, belirli bir hedefin sesini öğrenen bir saldırı.
      Örneğin bir Twitch yayıncısı canlı mikrofon açıkken sohbete yanıt yazıyor ve daha sonra Twitch parolasını giriyorsa, ilk durumdaki sesle modeli eğitip ikinci duruma uygulayabilirsiniz.
    • Böyle sınırlı bir saldırı yüzeyi söz konusuysa, tek bir modeli birçok kişiye ya da klavyeye genellemeden de çalışabilir diye düşünüyorum.
      Zoom saldırısının avantajı, hedefi sohbet penceresine bir şey yazmaya yönlendirebilirseniz “şifreli metni” duyduktan hemen sonra “düz metni” elde etmeniz.
      Başka bağlamlarda duyulan yazma sesleri de çoğunlukla LLM’in zaten tanıyabileceği birkaç dilbilgisi türünden birine, yani doğal dil, programlama dili, komutlar, hesaplama girdileri vb. biçimlere uyacaktır; uymuyorsa da muhtemelen parola olma ihtimali yüksektir.
    • Günümüzde Zoom’da tuş basma seslerinin hâlâ olduğu gibi iletilip iletilmediğini merak ediyorum.
      Son zamanlarda gürültü giderme o kadar agresif ki, “motor sesi/ambulans/şehir gürültüsü için kusura bakmayın” deseniz bile diğerleri çoğu zaman neden bahsettiğinizi anlamıyor.
    • Hedefli saldırı içinse genellenmesi gerekmez.
    • Neden tüm çevrimiçi iletişim uygulamalarında klavye sesi bastırma standart bir seçenek olarak yer almıyor, anlamıyorum.
      Klavye sesleri epey ayırt edilebilir olduğundan bu o kadar da zor bir iş değil.
  • Üniversite bitirme projemde buna benzer bir akustik yan kanal saldırısı yapmıştım; bu alanda epey çalışma var ve birilerinin yöntemleri birleştirmesini bekliyor.
    Geometrik modelleri, bu tür öğrenmeli/öğrenmesiz istatistiksel modelleri ve çeşitli dil modellerini birleştiren yaklaşımlardan oldukça iyi sonuçlar çıkıyor.
    Okuduğum birkaç makale şunlardı:
    https://doi.org/10.1007/s10207-019-00449-8 - SonarSnoop. Telefon hoparlöründen ultrason yayıp kullanıcının etkileşimlerini, örneğin kaydırma tabanlı parola girişini profilleyerek çıkarıyor.
    https://people.eecs.berkeley.edu/~daw/papers/ssh-use01.pdf - “Timing Analysis of Keystrokes and Timing Attacks on SSH”. 2001 tarihli bir makale; tuş basma zamanlamalarının istatistiksel modelini kullanarak şifrelenmiş SSH trafiğinden parolayı kurtarıyor.
    https://doi.org/10.1145/1609956.1609959 - “Keyboard acoustic emanations revisited”. Gizli Markov modeli ve İngilizcenin özelliklerini kullanarak kepstrum özelliklerine dayalı sınıflandırmayla metni kurtarıyor.
    https://doi.org/10.1145/2660267.2660296 - “Context-free Attacks Using Keyboard Acoustic Emanations”. Varış zamanı farkıyla fiziksel konumu olasılıksal olarak tahmin eden geometrik bir yaklaşım kullanıyor.

  • Bunun neden önemsizmiş gibi küçümsendiğini pek anlamıyorum.
    Güvenlik ve istihbarat açısından oldukça anlamlı; ses üzerinden öğrenmenin, hassas bir dinleme cihazını fiilen keylogger’a dönüştürebilecek seviyeye geldiği anlamına geliyor.
    Ses dinleme cihazı yerleştirmenin geleneksel ağ saldırılarından çok daha kolay olduğu pek çok bağlam var; modern shotgun mikrofonlarla binanın içine girmeniz bile gerekmeyebilir.
    Bu, parola hırsızlığından çok daha geniş bir alana uygulanabilir.
    Bu saldırı vektörü uzun zamandır ilgimi çekiyordu ve gerçekten bu noktaya gelip gelmeyeceğini merak ediyordum.

    • Olası tüm fiziksel yan kanallar, örneğin Tempest gibi olanlar da artık makine öğrenmesi yaklaşımlarına iyi uyuyor gibi görünüyor.
      Gerçekten ilginç.
    • Sürekli yazma sesi çalmanın yardımcı olup olmayacağını merak ediyorum.
      Soyut bir ses değil; söz konusu klavyede gerçekten benim yazdığım kayıtları alıp gerçekçi duyulan cümleler veya diziler hâlinde karıştırarak çalmak.
      Gerçek tuş basma sesleri araya karışabilsin diye çok kısa duraklatmalar yapılırsa, çözmek ya da parola girme anı gibi başka olaylarla korelasyon kurmak çok zor olur gibi geliyor.
      Daha iyisi, ortamda beyaz gürültü çalmak da bir yöntem; gerçekten çok önemli toplantılarda bazen böyle yapıldığını duydum.
      O kadar önemli biri değilseniz, önemli şeyleri yalnızca telefondan girmek yeterli. Dokunmatik ekranların yeterince ses çıkarmamasını umalım.
    • Mikrofon girdisini gerçekten basılan tuşlarla ilişkilendirmeniz gerekiyor ve modeli eğitecek kadar yeterli miktara da ihtiyaç var.
      Pek de büyük bir mesele değilmiş gibi görünüyor.
  • İlginç. Hangi akustik özellikleri tanıdığını gerçekten merak ediyorum.
    Her tuşun fiziksel parmak izine yakın bir şey mi; bu yüzden tuş kapaklarını ya da yayları değiştirirseniz modeli güncellemeniz gerekir mi? Eski daktiloların üretim tutarsızlıkları nedeniyle adli olarak ayırt edilmesine benzer mi?
    Yoksa tuşun kendisi aynı ama etraftaki nesnelerin biçimi nedeniyle klavye veya dizüstünün içinde her tuş farklı rezonans desenleri mi üretiyor? Klavyeyi odanın içinde başka bir yere taşırsanız modeli yeniden eğitmeniz gerekir mi?
    Tuşa ne kadar sert bastığınıza göre hiç fark olmuyor mu, yoksa fark büyük mü, bunu da merak ediyorum.
    Klavye bazında, ince MacBook tuşlarıyla harici tam yükseklikte bir klavyeyi karşılaştırdığınızda, hangi tarafta her tuşu ayırt etmek daha kolay ya da daha zor olurdu, onu da merak ediyorum.

    • Genişletirsek (1) tuşun kendi özellikleri, (2) diğer tuşlara kıyasla tuş özellikleri, (3) tuş ile mikrofon arasındaki ses iletim yolu ve ortam, (4) tuş ile parmak arasındaki ilişki, (5) tuş ile ilgili dendritler arasındaki ilişki gibi şeylere bakılabilir.
    • Yazma tarzı da önemli olabilir gibi geliyor.
      Her tuşa ne kadar hızlı ulaştığınız, ritim, belirli tuşlara ne kadar sert basma eğiliminde olduğunuz gibi şeyler etkili olabilir.
      Klavyeden çok kişiyi profillemek gibi hissettiriyor.
  • Bu arada bazı, muhtemelen çoğu video konferans yazılımı sesten klavye seslerini kaldırıyor.
    Dizüstü bilgisayarlarda mikrofon tuşların hemen yanında olduğu için bu özellikle dikkat dağıtıcı bir sorun oluyor.
    Zoom’un gürültü engellemenin bir parçası olarak bunu varsayılan biçimde yaptığından eminim. Keydown olaylarını kullanarak yalnızca ses akışını değil, tanımlamayı da destekleyebileceği için daha kolay olabilir.
    Yalnızca temel gürültü engelleme açık olsa bile, normal video konferanslarda bu tür bir saldırıyı engelleyebilir.
    Bu yüzden saldırganın zaten sıradan bir keylogger ya da gizli kamera kurabilecek kadar fiziksel erişimi olmadığı bir durumda, bunun gerçekçi bir tehdit olacağı senaryolar pek aklıma gelmiyor.

    • Teams’te kesinlikle yok gibi. En azından varsayılan değil ya da bizim şirketin varsayılanı değil.
      Görüşme sırasında biri yazmaya başlarsa çok net duyuluyor.
    • Kurumlar arası toplantılar, birden fazla ofisin karıştığı yemekhaneler, kahve dükkânları gibi yerler mümkün.
    • Herhangi bir web sayfası mikrofon erişim izni alırsa sorun olabileceğini düşünüyorum.
  • Georgi Gerganov birkaç yıl önce zaten bir tane yapmıştı.
    https://github.com/ggerganov/kbd-audio

  • Örnek görsel, her 0,5 saniyede bir tuşa basıldığını gösteriyor; bu da yaklaşık 24 wpm’lik iki parmakla yazma hızına işaret ediyor.
    Bu yöntemle model çok temiz bir dalga biçimi elde ediyor.
    Bu yaklaşımın ortalama ya da hızlı yazan kişilerde de iyi çalışıp çalışmayacağını merak ediyorum. Ses profillerini harflerle eşleştirmek çok daha zor olabilir.

    • Belirsizlik olsa bile veri olmamasından iyidir.
      Yeterli eğitim verisi varsa standart yazıcılarda tekrarlanabilir örüntüler bulunabileceğini düşünüyorum.
      Örneğin QWERTY düzeninde “A”dan sonra “Q”ya basmak, “J”ye basmaktan 1,2–2,3 kat daha uzun sürebilir; bunun gibi ikili tempo örüntüleri olabilir.
      Tüm aday karakterleri kaba kuvvetle denemeye kıyasla arama uzayını daraltmaya yardımcı olur.
      Hedef bir parola cümlesi kullanıyorsa, “hXXXse battXXX stXXXXX cXXXXXX” gibi bazı referans karakterler yüksek olasılıkla belirlendiğinde yorumlanabilir hâle gelir.
    • Sovyetler 1970’lerde bile daktilo seslerini dinleyerek bilgi sızdırmayı başarmıştı.
  • Bu yazıyı görünce, bu fikrin bir varyasyonu için başlangıç projemi açık kaynak olarak yayımladım: https://github.com/secretlessai/audio-mnist
    Uzun zamandır CNN gibi görüntü sınıflandırma tekniklerini ses verilerine uygulamakla ilgileniyordum.
    Birkaç yıl önce bir hafta sonu projesi olarak el yazısı rakamların ses kayıtlarından basit bir “audio-mnist” veri seti oluşturdum, ancak birkaç gün çalıştıktan sonra daha ileri götüremedim.
    Yine de bir süredir bunu açık kaynak yapmam gerektiğini düşünüyordum ve bu yazı beni harekete geçirdi.
    Daha fazla veri toplayıp temel CNN örnekleri gibi şeyler eklersem çeşitli araştırmalar ve araçlar için iyi bir başlangıç noktası olabilir.
    Kayıtları oluşturmak ve sesi bölmek için ayrı kodu hâlâ bulup anlaşılır şekilde düzenlemem gerekiyor.
    Bu sürecin bir kısmı ilginç ya da yararlı gelen kişilere yardımcı olmasını umuyorum.

  • Bununla çalışan bir kablosuz klavye olsa güzel olurdu.
    Ne pil, ne şarj, ne de eşleştirme gerekirdi.

    • Eski TV kumandalarından bazıları bu şekilde çalışıyordu.
      Zenith’in ürettiği Space Command kumandasıydı; TV kumandalarına bazen “clicker” denmesinin sebebinin de bu olduğu söyleniyor.
      https://www.theverge.com/23810061/zenith-space-command-remot...
    • Yazdığınız 20 karakterden 1’inin yanlış tahmin edildiği bir kullanıcı deneyimini hayal edin.
      Başarısızlık olasılığı × maliyet etkisi, hata oranı tek haneli bir düzeyde iyileşse bile katlanılması zor görünüyor.
  • Artık Zoom görüşmesine benim “fuck you” yazdığımı gösteren arka plan sesi enjekte etmenin zamanı geldi.

    • Metni tuş vuruşu sesine dönüştürün; metni de şu LLM isteminden alın: “HGTV’nin Love It or List It programına dayanan, Ewok bir emlak danışmanı ve Klingon bir iç mimarın yer aldığı anapestik tetrametre fanfic.”
      Amaç, dinleyenin hayat tercihlerini baştan sona yeniden sorgulamasını ve belki de hikâyenin kendisine kapılmasını sağlamak.
    • Aksine, çözmeyi daha da kolaylaştırabilir.
      Çünkü iyi bir referans noktası olur.