8 puan yazan GN⁺ 2024-07-17 | 1 yorum | WhatsApp'ta paylaş
  • 2017’de ortaya çıkan Transformer, makine çevirisiyle başlayıp neredeyse tüm alanlara yayıldı ve modern mühendislerin bilmesi gereken temel yapay zeka bilgilerinden biri haline geldi
  • Bu rehber, mühendislerin Transformer’ı anlamak için ihtiyaç duyacağı kadarını takip edebilmesi için sinir ağlarından attention’a kadar aşamalı biçimde yapılandırılmış
  • Doğrudan çalıştırılabilen Python kod örnekleri ve referanslarla birlikte sunulduğundan, öğrenme okumakla kalmayıp elle deneyerek doğrulamaya da uzanıyor
  • İçerik sinir ağları, RNN, NLP ve attention, Transformer ile Python·matematik temelleri eklerine ayrılıyor; PyTorch ve LLM tabanlı Multi-Agents bölümleri de eklenmiş
  • Eğitim ve ticari olmayan kullanım koşulları nispeten açık olsa da, iletişime geçerken doğrulama için en az 2 sosyal medya adresi istenmesi gibi anonim iletişime sınırlamalar var

Transformer’ı anlamak için öğrenme yolu

  • The Engineer’s Guide To Deep Learning, mühendislerin Transformer’ı anlaması için gereken asgari yolu sunan özlü bir rehber kitap
  • Günümüz yapay zekası üçüncü altın çağ olarak tanımlanıyor
    • Önceki iki altın çağ 1950–1960’lar ve 1980’lerdi
    • O dönemlerde beklentiler teknik kapasitenin önüne geçerek hayal kırıklığına yol açtı
    • 2010’ların ortasında başlayan mevcut yapay zeka altın çağı ise beklentileri sürekli aşan bir akış olarak açıklanıyor
  • Transformer, 2017’de tanıtılan bir dönüm noktası
    • Başlangıçta makine çevirisi modeli olarak geliştirildi
    • Daha sonra etkisi neredeyse tüm alanlara yayıldı
  • Öğrenmeye yardımcı materyal olarak çalıştırılabilir Python kod örnekleri sunuluyor
  • Her okurun kendisine uygun materyali seçebilmesi için ek referanslar da birlikte tanıtılıyor

Belgenin yapısı ve güncellemeler

  • Rehber, doğrudan Transformer’a atlamak yerine gerekli temelleri sırayla inşa edecek şekilde hazırlanmış
  • Değişiklik geçmişi, ilk sürümün 21 Mayıs 2024’te yayımlanmasından sonra da devam ediyor
    • 23 Temmuz 2024: Part 1 ve 2’ye PyTorch sürümü eklendi
    • 16 Eylül 2024: LLM tabanlı Multi-Agents bölümü eklendi
  • Gelecekte, şu anda geliştirilmekte olan çeşitli Transformer tabanlı teknolojileri ve yakın gelecekteki bir başka büyük dönüm noktasını da ele alma olasılığı var

Kullanım koşulları ve iletişim yöntemi

  • Telif hakkı SSS’sindeki kullanım koşulları, eğitim ve ticari olmayan kullanımlar ağırlıklı olmak üzere açık
    • Eğitim kurumlarındaki öğretmenler ve öğrenciler, öğrenme amacıyla belge ve görselleri serbestçe kullanabilir
    • Ticari olmayan buluşmalar ve derslerde, site bağlantısı ve telif hakkı belirtildiği sürece belge ve görseller kullanılabilir
    • Ticari kullanım bölümündeki revenue share ve full buyout açıklamalarının şaka olduğu, ticari ilişki kurma niyeti olmadığı belirtiliyor
  • İletişim e-postalarında doğrulama amacıyla LinkedIn, Twitter gibi en az 2 sosyal medya adresi sağlanmalı
  • XZ backdoor olayından sonra anonim kişilerden gelen iletişimler kabul edilmiyor

1 yorum

 
GN⁺ 2024-07-17
Hacker News yorumları
  • Çok daha iyi kaynaklar var. The Annotated Transformer / Attention is All You Need: http://nlp.seas.harvard.edu/annotated-transformer/
    Transformers from Scratch: https://e2eml.school/transformers.html
    Andrej Karpathy’nin giriş serisi de iyi: https://karpathy.ai/zero-to-hero.html
    Let’s build GPT: from scratch, in code, spelled out: https://www.youtube.com/watch?v=kCc8FmEb1nY
    GPT with Andrej Karpathy: Part 1: https://medium.com/@kdwa2404/gpt-with-andrej-karpathy-part-1...
    3Blue1Brown’un “But what is a GPT? Visual intro to transformers | Chapter 5, Deep Learning” videosu: https://www.youtube.com/watch?v=wjZofJX0v4M
    “Attention in transformers, visually explained | Chapter 6, Deep Learning”: https://www.youtube.com/watch?v=eMlx5fFNoYc
    3Blue1Brown’un tüm sinir ağları oynatma listesi: https://www.youtube.com/playlist?list=PLZHQObOWTQDNU6R1_6700...
    • Ek olarak, yukarıdaki sitelerin tamamı ücretsiz. Burada paylaşılan site ise “tüm içerik ve GitHub deposu için tam ticari kullanım haklarının satın alınması €10.000.000” diyor ve ticari kullanım için ayrıca %20 telif payı istiyor
      Bir Keras öğreticisine göre epey pahalı
    • Biraz konu dışı bir soru ama Vesuvius Challenge’a katılmak istiyorum; makine öğrenmesi geçmişim yok, sıradan bir web geliştiricisiyim. Karpathy’nin Zero to Hero’su ve Understanding Deep Learning kitabıyla pratik makine öğrenmesi altyapısı edinmek yeterli olur mu, yoksa öğrenmem gereken daha fazla şey var mı merak ediyorum
      Geçen yılın kazanan çözümlerini anladıktan sonra daha küçük bir alt görev seçmeyi planlıyorum: https://scrollprize.org/
    • Lucas Beyer’in slaytları da oldukça iyi: https://docs.google.com/presentation/d/1ZXFIhYczos679r70Yu8v...
  • Transformer öğreticileri yeni Monad öğreticileri gibi bir şeye dönüşmüş görünüyor
  • Bu materyal perceptron’dan Transformer’a kadar çok sıkıştırılmış biçimde gözden geçiriyor
    Örneğin LSTM’in gradyanını açtığı bölüm, onu tercih ettiğiniz framework’te uygulamanıza yardımcı olmak için değil, anlamayı kolaylaştırmak için var
    Çözümleri birden fazla framework ile göstermesinin amacı da formüllerin nasıl göründüğünü ve kodda nasıl görünebileceğini birbirine bağlamak
  • Transformer belgelerinde en sinir bozucu nokta, neredeyse tamamının yalnızca doğal dil işlemeye odaklanması
    Transformer mimarisinin özellikle ilginç tarafı, attention mekanizmasının permütasyon değişmez olması. İnsanlar bu özgün özelliği dengelemek için konum gömmeleri kullanmasa bu daha da belirgin; grafikteki belirli düğümleri veya tek tek kenarları bile keyfi olarak maskeleyebilmek, alan bilgisini mimariye katmak için büyük esneklik sağlıyor
    Çoğu durumda konum gömmeleri hâlâ gerekli olabilir, ama attention katmanının girdisini basit bir tek boyutlu diziden ibaret gören aşırı kısıtlayıcı bakıştan çıkıp daha akıllıca tasarım yapmak mümkün
  • Makine öğrenmesi/yapay zeka uzmanlarına sormak istiyorum. CRUD/backend API’den ML/AI alanına geçmek isteyen birinin bakabileceği giriş kaynakları varsa paylaşmanız iyi olur. Alan çok kollara ayrılıyor, nereden başlayacağımı bilmiyorum
    Anladığım kadarıyla ML mühendisi PyTorch gibi framework’lerle model yapan mühendis, AI mühendisi prompt mühendisliği ya da OpenAI/Claude API gibi yapay zeka çözümlerinin üzerine uygulama geliştiren mühendis, MLOps ise modellerin dağıtımına ve servis edilmesine yardımcı olan kişiler; bu ayrım doğru mu merak ediyorum
    • Bu terimlerin resmi tanımları yok. İhtiyacınız olan tek çağrışım kuralı şu: kulağa makul gelen unvan → şirketin istediği herhangi bir anlama gelebilir
      Bu roller pratikte “en ileri düzey araştırma yapmak”tan “bir kez CSV açmış olmak”a kadar her şeyi kapsayabilir
    • Makine öğrenmesi projelerinde zamanın %85’i veri kalitesine ve biraz da alana özgü özellik mühendisliğine gider
      Etki yaratmak istiyorsanız o tarafta çok iyi olmanız yeterli. Sistem entegrasyonu veya iş analizi gibi alanlarda da kullanılabilecek bir beceridir; algoritmaları ve günümüzde eğitilmiş modelleri bile araştırmacılar getirip sağlayabilir
    • “AI mühendisi” için, makine öğrenmesini yazılıma entegre etmede uzmanlaşmış uygulama mühendisi demek daha doğru olur
    • Kaggle iyi bir başlangıç noktasıdır
  • Girişteki birkaç paragraf dışında içerik yok. Asıl içerikte 404 not found çıkıyor
    • Metnin içindeki bağlantı bozuk. Hamburger menüsündeki bağlantı düzgün çalışıyor
    • Masaüstündeki sol menü çalışıyor. Görünüşe göre yalnızca ilk sayfadaki bağlantı bozuk
  • “E-posta gönderirken doğrulama amacıyla LinkedIn, Twitter gibi sosyal medya adreslerinden en az ikisini sağlayın… anonim bireylerden artık ileti almıyorum” şeklinde bir ifade görünüyor
    Teknik insanlar arasında bile sosyal ağların kimlik ve güven doğrulama aracı olarak benimsenmesini görmek epey buruk. Bazı hükümetlerin vize/göçmenlik incelemelerinde sosyal ağ kullanıcı adları istemeye başlaması zaten yeterince kötüydü; şimdi bir teknik kişiye tek bir e-posta göndermek için bile sosyal kanıt mı gerekiyor diye düşündürüyor
    • “Anonim bireylerden artık ileti almıyorum” sözü, Hava Kuvvetleri karargâhı asker alma merkezine birinin geldiği bir fıkrayı hatırlatıyor. “Pilot lisansınız? Deneyiminiz? Yeterlilikleriniz?” diye sorulunca “Yok. Sadece benden bir şey beklemeyin demeye geldim!” diye cevap vermesi gibi
    • Gizlenen kısmı açınca ifade “XZ arka kapı olayı nedeniyle anonim bireylerden artık ileti almıyorum” oluyor
      XZ saldırganı sayısız servise GitHub ile giriş yapabiliyor olurdu. Orijinal yazının yazarının da 1 yıldan uzun süre ortada kalan token sızıntısı nedeniyle potansiyel olarak ihlal edilmiş PyPI’dan bir şey indirme ihtimali yüksek görünüyor
      Ayrıca makine öğrenmesi alanında olduğu için GitHub, conda ve PyPI’dan denetlenmesi zor devasa Python framework’leri indirme ihtimali de yüksek; bu alandaki insanlar güvenilmeyen modelleri de indirip deniyor
      Ama sorun, MIME ve diğer eklentileri kapatılmış komut satırı posta istemcisinde okunabilen düz metin e-posta mı?
  • Temelden başlayıp kısa ve öz şekilde üstüne koymak için çok iyi bir kaynak