Müşteri verileriyle yapılan Slack AI eğitimi
(slack.com)- Slack, üretken yapay zeka modellerini müşteri verileriyle geliştirmez; ancak emoji ve kanal önerileri gibi tahmine dayalı modeller için mesajlar, içerikler, dosyalar ve kullanım bilgileri analiz edilebilir
- Küresel modeller, müşteri verilerinin herhangi bir bölümünü yeniden üretmeyecek şekilde tasarlanır ve AI/ML geliştirme ya da analiz süreçlerinde çalışanların temel içeriğe erişmesini engelleyen kontroller bulunur
- Müşteriler, çalışma alanı veya kuruluş verilerinin Slack küresel modeli eğitimine dahil edilmemesini talep edebilir; hariç tutulduktan sonra da küresel olarak eğitilmiş ML modellerinin avantajlarından yararlanmaya devam edebilir
- Kanal önerileri, arama sonuçları, otomatik tamamlama ve emoji önerileri; dış modeller, sayısal puanlar, geçmiş etkileşim sayıları ve herkese açık ifadeleri kullanarak müşteri verilerinin açığa çıkmasını azaltacak şekilde çalışır
- Slack’in üretken yapay zeka özellikleri üçüncü taraf LLM’ler kullanır, ancak müşteri verileri Slack’in güven sınırı içinde kalır ve açık bir opt-in olmadan üretken yapay zeka modeli eğitiminde kullanılmaz
Slack’in AI/ML veri kullanım ilkeleri
- Slack’in ürün geliştirme ilkeleri, müşteri verilerinin gizliliği ve güvenliği etrafında şekillenir
- ML ve AI, Slack ürünlerini iyileştirmek için araç olarak kullanılır
- Üretken yapay zeka modelleri müşteri verileriyle geliştirilmez
- Emoji önerileri ve kanal önerileri gibi tahmine dayalı modellerin geliştirilmesi için şu veriler analiz edilebilir
- Slack’e gönderilen müşteri verileri: mesajlar, içerikler, dosyalar vb.
- Gizlilik politikası ve müşteri sözleşmelerinde tanımlanan diğer bilgiler: kullanım bilgileri dahil
Küresel modeller ve erişim kontrolleri
- Slack, tüm müşteriler genelinde yaygın şekilde kullanılan modelleri, müşteri verilerinin bir kısmını yeniden üretebilecek biçimde oluşturmaz veya eğitmez
- AI/ML modeli geliştirme ya da müşteri verisi analizi sırasında Slack çalışanları temel içeriğe erişemez
- Müşteri verilerinin gizliliğini ve güvenliğini korumak için çeşitli teknik önlemler bulunur
- Müşteriler, kendi müşteri verilerinin Slack küresel model eğitiminde kullanılmaması için opt-out yapabilir
- Opt-out yapılan çalışma alanının müşteri verileri yalnızca o çalışma alanı deneyimini iyileştirmek için kullanılır
- Küresel olarak eğitilmiş ML modellerinin avantajlarından yararlanmaya devam edilir
- Org veya Workspace Owners ya da Primary Owner,
feedback@slack.comadresine Workspace/Org URL’siyle birlikteSlack Global model opt-out requestbaşlıklı bir e-posta göndermelidir - Slack, talebi işledikten sonra tamamlanma durumuna ilişkin yanıt verir
Müşteri verileri ve diğer bilgilerle hizmet iyileştirme
- Slack’in ürün ve analiz ekipleri, hizmeti geliştirmek, güncellemek ve iyileştirmek için müşteri verileri ile diğer bilgileri kullanabilir
- Bu kişiselleştirme ve iyileştirmeler, kullanıcıların Slack ile nasıl etkileşim kurduğunu araştırma ve anlama süreciyle mümkün olur
- Slack’in müşteri sözleşmesindeki ve Privacy Policy içindeki gizlilik yükümlülükleri her senaryoda geçerlidir
- Müşteriler kendi müşteri verilerinin sahibidir
- Slack, müşteri verilerini toplulaştırır ve ayırır; böylece hizmet güncellemelerinde müşteri verileri kullanılsa bile üçüncü taraflar belirli bir müşteri veya kişiyi iyileştirmenin kaynağı olarak tanımlayamaz
- Slack’in iştirakleri veya alt işleyenleri bu istisna kapsamına dahildir
Tahmine dayalı özelliklere göre veri koruma yöntemleri
-
Kanal önerileri
- Şirket içinde yeni herkese açık kanallara katılmanız önerilebilir
- Öneriler, kanal üyeliği, etkinlik ve konu örtüşmesine dayanır
- Model, geçmiş önerilerden ve kullanıcının kanala katılıp katılmadığından öğrenir
- Slack mesajlarıyla eğitilmemiş bir dış model, konu benzerliğini değerlendirip sayısal puan üretir
- Küresel model, yalnızca bu sayısal puan ve müşteri dışı verilerle öneri yapar
-
Arama sonuçları
- Arama ML modeli, belirli bir sorguya uygun sonuçları belirleyerek kullanıcının aradığı bilgiyi bulmasına yardımcı olur
- Geçmiş arama sonuçlarına ve önceki etkileşim geçmişine dayanır
- Model, arama sorgularını veya sonuçlarını yeniden üretemeyecek şekilde tasarlanmıştır
-
Otomatik tamamlama
- Arama sorguları veya diğer metinler otomatik tamamlanabilir
- Örneğin kullanıcı
Customer Supportifadesinin ilk birkaç harfini yazdığında, sistem bu ifadeyi tamamlayabilir - Öneriler yerel olarak oluşturulur ve kullanıcının çalışma alanındaki yaygın herkese açık mesaj ifadelerinden alınır
- Olası önerileri seçen algoritma, daha önce önerilen ve kabul edilen tamamlama örneklerinden küresel olarak öğrenir
- Girdi metni ile öneri arasındaki benzerliği puanlayan kurallar kullanılır ve algoritmaya yalnızca sayısal puanlar ile geçmiş etkileşim sayıları girer
-
Emoji önerileri
- Mesajın içeriği ve duygusu, emojilerin geçmiş kullanımı ve belirli bağlamlarda ekip içindeki emoji kullanım sıklığına göre tepki emojileri önerilebilir
- Belirli bir kanalda kutlama mesajlarına 🎉 tepkisi yaygınsa, benzer şekilde olumlu yeni mesajlar için de 🎉 tepkisi önerilebilir
- Slack mesajlarıyla eğitilmemiş bir dış model, mesaj duygusunu sınıflandırabilir
- Slack modeli, yalnızca ilgili çalışma alanında belirli duygudaki mesajlarla belirli emojilerin ne sıklıkla eşleştiğini dikkate alarak emoji önerir
Üretken yapay zekada müşteri verilerinin işlenmesi
- Üretken yapay zeka, kullanıcının girdiği prompt’a yanıt olarak metin gibi içerikler üretebilen AI sistemleri kategorisidir
- Bu kategoriye büyük dil modelleri (LLM) dahildir
- AI in Slack, üretken yapay zekayı kullanır ve üçüncü taraf LLM’lerden yararlanır
- Müşteri açıkça opt-in onayı vermedikçe müşteri verileri üretken yapay zeka modeli eğitiminde kullanılmaz
- AI in Slack, hazır LLM’ler kullanır; bu modeller istekten sonra müşteri verileriyle güncellenmez ve müşteri verilerini başka bir şekilde saklamaz
- Bu modeller, AWS gibi bulut sağlayıcısı altyapılarında barındırılır
- Müşteri verileri Slack’in güven sınırı içinde kalır ve LLM sağlayıcıları müşteri verilerine erişemez
- Alt işleyen değişikliği bildirimleri Trust and Compliance webpage üzerinden alınabilir
Slack AI arama yanıtlarının kaynakları
- AI in Slack’in arama özelliği, yanıt kaynaklarını Slack içi özelliklerden ve bağlı belgelerden alır
- Arama kaynakları şunları içerir
- Slack özellikleri: canvas, huddles canvas notes, clip transcripts, text snippets
- Slack’e yüklenen dosyalar: PDF, email, docx, pptx, Keynote
- Google Drive’daki bağlı belgeler: Docs, Slides
- Sharepoint/OnDrive belgeleri: Word, Powerpoint
- Box gibi dosya depolama iş ortağı uygulamaları: yüklüyse
- Kullanıcıların bu dosyalara erişebilmesi için Slack entegrasyonu üzerinden kimlik doğrulaması yapmış olması gerekir
- Yöneticiler tüm dosya sonuçlarını devre dışı bırakabilir veya harici barındırılan dosyaların kaynak olarak kullanılmasını engelleyecek ayar yapabilir
- İlgili bilgiler Help Center üzerinden görülebilir
1 yorum
Hacker News yorumları
Destek ekibiyle iletişime geçip opt-out yaptım; yanıtları isteğin tamamlandığı yönündeydi
Slack, kanal/emoji önerileri ve arama sonuçları gibi platform düzeyi makine öğrenimi modelleri olduğunu, ancak bunları müşteri verilerini öğrenebilecek, ezberleyebilecek veya yeniden üretebilecek şekilde oluşturmadığını ya da eğitmediğini açıkladı
Slack AI'ın ayrıca satın alınan bir eklenti olduğunu; müşteri verileriyle LLM eğitmediğini ve Slack'in AWS altyapısı içinde barındırılan LLM kullandığını, bu nedenle verilerin harici LLM sağlayıcılarıyla paylaşılmadığını söylüyor
Politika bağlantıları: https://slack.com/trust/data-management/privacy-principles, https://slack.engineering/how-we-built-slack-ai-to-be-secure...
Muhtemelen bir sonraki Kullanım Şartları güncellemesine kadar böyle kalır
Muhtemelen sen de bunu yaptın, değil mi?
“Slack genel model eğitimi için müşteri verilerinin kullanılmamasını istiyorsanız opt-out yapabilirsiniz. Opt-out yapsanız bile çalışma alanı verileri yalnızca o çalışma alanı deneyimini iyileştirmek için kullanılır ve genel eğitim modelinin faydalarından yararlanmaya devam edersiniz” şeklinde bir yapı varsa, neden kimse opt-out yapmasın ki diye düşünüyorum
Elbette opt-out yapması gerektiğini bilmeyenler hariç; tamamen zararlı bir seçenek gibi görünüyor
Bireysel kullanıcıların kendi verilerinin nasıl kullanıldığı konusunda söz hakkı yok gibi; Workspace Owner ile iletişime geçmeleri gerekiyor
Böyle iletişime geçerken de bunun yerine alternatif platformları değerlendirmelerini istemeyi düşünüyorum
Sonunda bu bir opt-out köstebek avına dönüyor; yöntem de genel destek talebi ve opt-out yapsanız bile hâlâ eğitim yapıyorlar gibi görünüyor
Şartların 300. sayfasında, hiç dikkat çekmeyen bir yere küçük bir ipucu koyabilirler
Opt-out yapmamayı “daha iyi bir ürün geliştirmeye yardımcı olmak” olarak görürseniz, zaten para ödediğiniz bir ürünse ve ek zaman harcamadan bir sonraki sürümü daha iyi hale getirebiliyorsanız neden yapmayasınız ki?
Aynı fiyata daha iyi bir ürün alırsınız, şirket de satması daha kolay bir ürün elde eder
Şirketin daha fazla kazandığı bir anlaşma olabilir ama taraflardan birinin daha çok kazanması diğerinin kaybettiği anlamına gelmez
Veri gizliliğine çok önem veriyorsanız ya da eğitime izin vermenin gerçekten gizli bilgilerin açığa çıkması riski yarattığına inanıyorsanız durum değişir; o zaman durdurma seçeneğiniz olduğuna göre “daha iyi ürün” ile “gizli bilgilerin açığa çıkmasına dair varsayılan risk” arasındaki değeri herkes kendi tartabilir
“Tüm müşteriler tarafından yaygın biçimde kullanılacak modeller, müşteri verilerinin bir kısmını öğrenebilecek, ezberleyebilecek veya yeniden üretebilecek şekilde oluşturulmaz ya da eğitilmez” ifadesinde o kadar çok ince ipucu ve sorumluluktan kaçınma dili var ki güven vermekten çok güvensizliği artırıyor
Bu yalnızca “tüm müşteriler tarafından yaygın biçimde” kullanılan modeller için geçerli; yani yaygın kullanılmıyorsa veya yalnızca bazı müşteriler için kullanılıyorsa tüm cümle geçersiz oluyor
Mantıksal olarak bu durumlarda verinin sızabileceği iması gibi duyuluyor ve bu oldukça kötü
Bu ifade düzeltilmeli; bunu yazan kişi bir risk
Bu, müşteri verilerinin “tüm müşterilerce yaygın kullanılan modelleri o şekilde” eğitmek için kullanılmadığı, ama genel model eğitimine katkı sağladığı anlamına geliyor
Ancak bu sorun onlar için olduğundan bize daha büyük
Birisi çok belirli bir durum hakkında sohbet eder gibi soru sorarsa, müşteri adına bağlanmasa bile gizli veriler dışarı çıkabilir gibi görünüyor
Belirli bir sektördeki belirli ya da rastgele bir şirketin bir şeyi nasıl tasarlayacağını LLM'e soramayacak değiliz
Kanal öneri modelinin geçmiş önerilerden ve kullanıcıların önerilen kanallara girip girmediğinden öğrendiği, ancak gizliliği korumak için müşteri verileriyle modeli ayırdığı söyleniyor
Slack mesajlarıyla eğitilmemiş harici bir modelle konu benzerliğini değerlendirip sayısal puan ürettiği; genel modelin de yalnızca bu puan ve müşteri dışı verilerle öneri yaptığı açıklanıyor
Aramanın da sorguları veya sonuç metninin kendisini eğitmediği; bir mesajın aramada kaç kez tıklandığı ya da sorgu ile önerilen mesajdaki kelime örtüşmesi gibi ekip bazlı bağlam bilgilerini öğrendiği söyleniyor
Otomatik tamamlama önerileri, çalışma alanındaki herkese açık mesajlarda sık geçen ifadelerden alınıyor; genel düzeyde ise daha önce önerilmiş ve kabul edilmiş tamamlama sonuçlarına göre öğreniyor, ancak algoritma yalnızca puanları ve geçmiş etkileşim sayılarını kullanıyor deniyor
Emoji önerileri de Slack mesajlarıyla eğitilmemiş harici bir modelle duyguyu sınıflandırıp, ilgili çalışma alanında o duygudaki mesajlarla belirli bir emojinin birlikte kullanılma sıklığını dikkate alıyor gibi
Özetle, verileri küresel modelin dışında bırakmak için opt-out yapmak gerekiyor.
Aynı zamanda “veriler çalışma alanları arasında sızmaz” diye muğlak konuşmaları çok kafa karıştırıcı.
“Sızmayacak” değil, “sızması mümkün olmayan” araçlar kullanılmalı.
“AI/ML modelleri geliştirirken veya müşteri verilerini analiz ederken Slack temel içeriğe erişemez. Bunu engelleyen çeşitli teknik önlemler vardır” cümlesi kafa karıştırıcı.
“Erişemez” güçlü bir ifade; yapay zeka modeli veriye erişebiliyorken Slack, Inc’in kendisinin nasıl erişemediğini merak ediyorum.
Kaçırdığım bir şey yoksa bu, “yapamaz”dan çok “yapmaz”a yakın görünüyor.
Muhtemelen “Slack çalışanları” demek istiyorlar, ama “Slack” şirketin varlıklarını, vekillerini, sistemlerini, bilgisayarlarını, sunucularını, yapay zeka modellerini vb. hepsini kapsayabilir.
Signal “kullanıcı içeriğine erişemeyiz” dese bile bu, kırılgan ve iyimser bir ifade gibi duyulur.
“Erişemez” dendiğinde, şirket içindeki hiç kimsenin yasal sınırlar içinde bunu yapamayacağı anlamına geldiğini düşünürüz.
Slack çalışanları söz konusu teknik önlemleri kapatabilir; Signal çalışanları da bir uygulama güncellemesiyle tüm mesajları başka bir sunucuya yönlendirebilir.
Daha iyi ifade “Slack çalışanları temel içeriğe erişmez” olurdu.
Bu durumda çok açık biçimde erişilebilir görünüyor.
Örneğin model eğitimi toplu işi, “etkileşim” olarak etiketlenmiş verilere erişen bir sistem kullanıcısı olarak çalışabilir; ancak mesaj gövdesi veya kullanıcı sorgu metni gibi “içerik” verilerine erişim yetkisi olmayabilir.
Eğitim işi bu tür içeriği getirmek için bir RPC gönderirse, oturum açmadan başkasının DM’lerine erişmeye çalıştığınızda olduğu gibi reddedilir.
Büyük şirketlerde mühendisler veya ürün yöneticileri erişim kontrol listelerini keyfî olarak belirleyemez; toplu iş erişim yetkisini bir sistemden talep ederler ve o sistemi işleten kişiler de şirket politikalarına uyar.
Bu, bir banka çalışanının hesap numaralarıyla çalışıp kişisel hesabına gizlice para aktaramaması ya da bunu yaparsa yakalanması gibi.
Bu cümlenin anlamı daha çok, bir Slack ürün yöneticisinin kendi takım OKR’larını yükseltmek için politikayı yok sayıp başka bir takımın kullanmadığı müşteri verileriyle gizlice eğitim yapmasının sistemsel olarak mümkün olmadığına yakın.
Elbette benzetme kusursuz değil.
Banka çalışanı, müşteri onayından sonra mesajları onun adına görebilecek bir Slack müşteri destek temsilcisine daha çok benzer; kişiye verilmiş sınırlı erişimi model eğitimi işine akıtmanın gerçekten bir yolu olmaması muhtemeldir.
Olgun bir şirkette, bir çalışanın kişisel veri erişim yetkisiyle rastgele bir dizüstü bilgisayarda model eğitip o modeli üretime dağıtması da engellenmiş olmalı.
Startuplar ise böyle çalışıyor olabilir.
Telegram ve WhatsApp için de aynı şey geçerli.
Böyle şeyler yapan şirketlerin bir listesini tutsak da onlardan kaçınabilsek diye düşünüyorum.
Kolay ve görünür bir opt-out anahtarı olmadan müşteri verileriyle eğitim yapan başka şirketleri biliyorsanız aşağıya eklemeniz iyi olur.
Önceden teknik destek taleplerinden elde edilen bilgilerin yalnızca sorun gidermek için kullanılacağı, kişisel veriler kaldırıldıktan sonra bazı teknik ayrıntıların hata raporu oluşturmak için kullanılabileceği yazıyordu.
Yeni metinde, kişisel veriler kaldırıldıktan sonra belirli teknik bilgilerin hata raporu oluşturmak için kullanılabileceği ve anonimleştirilmiş teknik bilgilerin teknik destek deneyimini iyileştirmek amacıyla OpenAI hizmetlerinden yararlanmak üzere Microsoft Azure’a gönderilebileceği yer alıyor.
Ad, telefon numarası, adres, e-posta, IP adresi, ürün seri numarası gibi kişisel olarak tanımlanabilir bilgileri hariç tutacaklarını söylüyorlar.
Eskiden gizlilik politikası güncelleme e-postalarını doğrudan silerdim; artık araya böyle ifadeler sıkıştırılmış mı diye diff’e bakma alışkanlığı edindim.
Teşvik o kadar güçlü ki buna direnmek zor.
https://twitter.com/kepano/status/1688610782509211648
https://twitter.com/kepano/status/1682829662370557952
Liste boş.
Bunun Avrupa’daki unutulma hakkı yasasıyla nasıl bağdaşabildiğini anlamıyorum.
Aslında bu yapay zeka modellerinden hangisi bu hakkı koruyabilir ki diye düşünüyorum.
Kullanıcı silme talep ederse tüm model yeniden mi eğitiliyor? Öyle olacağını sanmıyorum.
Telif hakkı artık yok; bunun çalmak değil dönüştürmek olduğunu söylüyorlar, tüm internetle modeli eğitmeden önce opt-out yapmanız gerektiğini belirtiyorlar, yine de bunu yapmayacaklarmış gibi geliyor.
İşlerin hiç azalmayacağını söylerken her şirketin derhal %15 işten çıkarması, ofise dönüşü zorunlu kılıp otomobil verilerini bile daha fazla elde etmeye çalışması gibi.
“Tek garip numara” ile en üretken programcı olunacağını satıyorlar ama kendi başlarına kârlı bir ürün yapmak yerine bunu bireylere satmaya çalışıyorlarmış gibi görünüyor.
En ciddi ve tehlikeli olan şey, bilginin insanların parmak uçlarına ya da gözlerinin önüne ulaşmadan önce en alt düzeyde sansürlenmesi.
[0] https://ai.stanford.edu/~kzliu/blog/unlearning
Bildiğim kadarıyla model zaten eğitildiyse unutulma hakkı talebi nedeniyle silinmesi gerekmiyor deniyor, ama hukuki belirsizlik büyük.
Son GDPR kararlarına bakınca, opt-in değil opt-out olması nedeniyle hâlâ ihlal olma ihtimali yüksek.
Muhtemelen EEA’da üretilen verilerin tamamını filtreliyorlardır.
Ekip mesajlaşması için Matrix/Element gibi self-hosted çözümler gerçekten kullanılmalı.
Kendi donanımını şirket içinde tutmak istememek anlaşılır, ama çözüm barındırma sağlayıcısının verilere erişemeyeceği şekilde uçtan uca şifreli bir çözüm çalıştırmak.
cryptpad.fr de harika bir yazılım.
Kaynak kodunu (Ruby on Rails) alıp istediğiniz yere dağıtma modeli; biz DigitalOcean droplet üzerinde çalıştırıyoruz.
Slack, Google, Microsoft dahil tüm SaaS araç sağlayıcılarının bunu yapması için teşvik inanılmaz büyük.
Şirketlerin satıcılar tarafından metalaştırılmaktan kaçınması için sonunda kendi verilerini ve yapay zeka stratejilerini kontrol etmesi gerekiyor.
Bu da muhtemelen küçük, pahalı ve işi batırabilecek özellikleri kapatıp; erişim kontrolü ve yönetişimi düzgün kurulmuş merkezi bir bilgi tabanı oluşturduktan sonra, herhangi bir sağlayıcının açık kaynak ya da kara kutu LLM’ini buna takıp kullanma yönüne gitmek anlamına geliyor.
Bu yüzden şirketin Slack yerine Mattermost self-hosted kullanmasını istiyordum.
Bu arada Windows 11 varsayılan olarak dosyaları Microsoft sunucularına senkronize ediyor.
“Sadece emoji seçmek için kullanacağız, bir de dahili kullanıma özel eğlenceli bir hisse senedi öneri aracı için biraz kullanacağız” gibi bir şeye dönüşecek gibi.
Yüz binlerce teknoloji şirketinin anonimleştirilmiş, gerçek zamanlı iç seslerine dayanarak alınabilecek eğlenceli hisseler öneren bir araç yani.