- 2017’de ortaya çıkan Transformer, makine çevirisiyle başlayıp neredeyse tüm alanlara yayıldı ve modern mühendislerin bilmesi gereken temel yapay zeka bilgilerinden biri haline geldi
- Bu rehber, mühendislerin Transformer’ı anlamak için ihtiyaç duyacağı kadarını takip edebilmesi için sinir ağlarından attention’a kadar aşamalı biçimde yapılandırılmış
- Doğrudan çalıştırılabilen Python kod örnekleri ve referanslarla birlikte sunulduğundan, öğrenme okumakla kalmayıp elle deneyerek doğrulamaya da uzanıyor
- İçerik sinir ağları, RNN, NLP ve attention, Transformer ile Python·matematik temelleri eklerine ayrılıyor; PyTorch ve LLM tabanlı Multi-Agents bölümleri de eklenmiş
- Eğitim ve ticari olmayan kullanım koşulları nispeten açık olsa da, iletişime geçerken doğrulama için en az 2 sosyal medya adresi istenmesi gibi anonim iletişime sınırlamalar var
Transformer’ı anlamak için öğrenme yolu
- The Engineer’s Guide To Deep Learning, mühendislerin Transformer’ı anlaması için gereken asgari yolu sunan özlü bir rehber kitap
- Günümüz yapay zekası üçüncü altın çağ olarak tanımlanıyor
- Önceki iki altın çağ 1950–1960’lar ve 1980’lerdi
- O dönemlerde beklentiler teknik kapasitenin önüne geçerek hayal kırıklığına yol açtı
- 2010’ların ortasında başlayan mevcut yapay zeka altın çağı ise beklentileri sürekli aşan bir akış olarak açıklanıyor
- Transformer, 2017’de tanıtılan bir dönüm noktası
- Başlangıçta makine çevirisi modeli olarak geliştirildi
- Daha sonra etkisi neredeyse tüm alanlara yayıldı
- Öğrenmeye yardımcı materyal olarak çalıştırılabilir Python kod örnekleri sunuluyor
- Her okurun kendisine uygun materyali seçebilmesi için ek referanslar da birlikte tanıtılıyor
Belgenin yapısı ve güncellemeler
- Rehber, doğrudan Transformer’a atlamak yerine gerekli temelleri sırayla inşa edecek şekilde hazırlanmış
- Part 1: Neural Networks — sinir ağlarının temel kavramları
- Part 2: Recurrent Neural Networks (RNNs) — RNN, LSTM, GRU
- Part 3: Natural Language Processing (NLP) and Attention Mechanisms — makine çevirisi ve attention dahil NLP’nin temel ilkeleri
- Part 4: Transformer — Transformer modeli
- Appendix: Basic Knowledge — Transformer’ı anlamak için gereken asgari Python ve matematik bilgisi
- Değişiklik geçmişi, ilk sürümün 21 Mayıs 2024’te yayımlanmasından sonra da devam ediyor
- 23 Temmuz 2024: Part 1 ve 2’ye PyTorch sürümü eklendi
- 16 Eylül 2024: LLM tabanlı Multi-Agents bölümü eklendi
- Gelecekte, şu anda geliştirilmekte olan çeşitli Transformer tabanlı teknolojileri ve yakın gelecekteki bir başka büyük dönüm noktasını da ele alma olasılığı var
Kullanım koşulları ve iletişim yöntemi
- Telif hakkı SSS’sindeki kullanım koşulları, eğitim ve ticari olmayan kullanımlar ağırlıklı olmak üzere açık
- Eğitim kurumlarındaki öğretmenler ve öğrenciler, öğrenme amacıyla belge ve görselleri serbestçe kullanabilir
- Ticari olmayan buluşmalar ve derslerde, site bağlantısı ve telif hakkı belirtildiği sürece belge ve görseller kullanılabilir
- Ticari kullanım bölümündeki revenue share ve full buyout açıklamalarının şaka olduğu, ticari ilişki kurma niyeti olmadığı belirtiliyor
- İletişim e-postalarında doğrulama amacıyla LinkedIn, Twitter gibi en az 2 sosyal medya adresi sağlanmalı
- XZ backdoor olayından sonra anonim kişilerden gelen iletişimler kabul edilmiyor
1 yorum
Hacker News yorumları
Transformers from Scratch: https://e2eml.school/transformers.html
Andrej Karpathy’nin giriş serisi de iyi: https://karpathy.ai/zero-to-hero.html
Let’s build GPT: from scratch, in code, spelled out: https://www.youtube.com/watch?v=kCc8FmEb1nY
GPT with Andrej Karpathy: Part 1: https://medium.com/@kdwa2404/gpt-with-andrej-karpathy-part-1...
3Blue1Brown’un “But what is a GPT? Visual intro to transformers | Chapter 5, Deep Learning” videosu: https://www.youtube.com/watch?v=wjZofJX0v4M
“Attention in transformers, visually explained | Chapter 6, Deep Learning”: https://www.youtube.com/watch?v=eMlx5fFNoYc
3Blue1Brown’un tüm sinir ağları oynatma listesi: https://www.youtube.com/playlist?list=PLZHQObOWTQDNU6R1_6700...
Bir Keras öğreticisine göre epey pahalı
Geçen yılın kazanan çözümlerini anladıktan sonra daha küçük bir alt görev seçmeyi planlıyorum: https://scrollprize.org/
Örneğin LSTM’in gradyanını açtığı bölüm, onu tercih ettiğiniz framework’te uygulamanıza yardımcı olmak için değil, anlamayı kolaylaştırmak için var
Çözümleri birden fazla framework ile göstermesinin amacı da formüllerin nasıl göründüğünü ve kodda nasıl görünebileceğini birbirine bağlamak
Transformer mimarisinin özellikle ilginç tarafı, attention mekanizmasının permütasyon değişmez olması. İnsanlar bu özgün özelliği dengelemek için konum gömmeleri kullanmasa bu daha da belirgin; grafikteki belirli düğümleri veya tek tek kenarları bile keyfi olarak maskeleyebilmek, alan bilgisini mimariye katmak için büyük esneklik sağlıyor
Çoğu durumda konum gömmeleri hâlâ gerekli olabilir, ama attention katmanının girdisini basit bir tek boyutlu diziden ibaret gören aşırı kısıtlayıcı bakıştan çıkıp daha akıllıca tasarım yapmak mümkün
Anladığım kadarıyla ML mühendisi PyTorch gibi framework’lerle model yapan mühendis, AI mühendisi prompt mühendisliği ya da OpenAI/Claude API gibi yapay zeka çözümlerinin üzerine uygulama geliştiren mühendis, MLOps ise modellerin dağıtımına ve servis edilmesine yardımcı olan kişiler; bu ayrım doğru mu merak ediyorum
Bu roller pratikte “en ileri düzey araştırma yapmak”tan “bir kez CSV açmış olmak”a kadar her şeyi kapsayabilir
Etki yaratmak istiyorsanız o tarafta çok iyi olmanız yeterli. Sistem entegrasyonu veya iş analizi gibi alanlarda da kullanılabilecek bir beceridir; algoritmaları ve günümüzde eğitilmiş modelleri bile araştırmacılar getirip sağlayabilir
Teknik insanlar arasında bile sosyal ağların kimlik ve güven doğrulama aracı olarak benimsenmesini görmek epey buruk. Bazı hükümetlerin vize/göçmenlik incelemelerinde sosyal ağ kullanıcı adları istemeye başlaması zaten yeterince kötüydü; şimdi bir teknik kişiye tek bir e-posta göndermek için bile sosyal kanıt mı gerekiyor diye düşündürüyor
XZ saldırganı sayısız servise GitHub ile giriş yapabiliyor olurdu. Orijinal yazının yazarının da 1 yıldan uzun süre ortada kalan token sızıntısı nedeniyle potansiyel olarak ihlal edilmiş PyPI’dan bir şey indirme ihtimali yüksek görünüyor
Ayrıca makine öğrenmesi alanında olduğu için GitHub, conda ve PyPI’dan denetlenmesi zor devasa Python framework’leri indirme ihtimali de yüksek; bu alandaki insanlar güvenilmeyen modelleri de indirip deniyor
Ama sorun, MIME ve diğer eklentileri kapatılmış komut satırı posta istemcisinde okunabilen düz metin e-posta mı?