- Hafta sonunda birkaç saat ayırarak LLM’lerin nasıl çalıştığını kod üzerinden adım adım izleyip uygulama, eğitme ve kullanma akışını tek seferde görebileceğiniz bir atölye
- Uygulamalı çalışma, LLM tanıtımıyla başlayıp girdi verisi, tokenizer ve model mimarisinin uygulanmasına doğru adım adım ilerliyor
- Mimari uygulamasının ardından GPT-2 ve Llama 2, ön eğitim ve önceden eğitilmiş ağırlıkların yüklenmesi ele alınıyor; böylece gerçek model kullanım akışına bağlanıyor
- LitGPT ile ağırlık kullanımı, instruction fine-tuning, benchmark değerlendirmesi ve diyalog performansı değerlendirmesi de içeriliyor
- Kitap, GitHub deposu, atölye kodları, Lightning Studio ve LitGPT deposu birlikte sunulduğu için birebir takip etmek kolay
3 saatlik atölye videosunun akışı
- LLM’leri uygulama, eğitme ve kullanma süreci tek bir kodlama atölyesinde ele alınıyor
- Tıklanabilir bölüm işaretleri sayesinde doğrudan istediğiniz konuya geçebilirsiniz
-
Temeller ve girdi işleme
- 0:00 Atölyeye genel bakış
- 2:17 LLM tanıtımı
- 9:14 Atölye materyalleri
- 10:48 LLM girdi verisini anlama
- 23:25 Basit bir tokenizer sınıfı
-
Model uygulaması ve eğitim
- 41:03 LLM mimarisini kodlama
- 45:01 GPT-2 ve Llama 2
- 1:07:11 Ön eğitim
- 1:29:37 Önceden eğitilmiş ağırlıkları yükleme
- 1:45:12 LitGPT ile ön eğitim ağırlıklarını kullanma
-
Fine-tuning ve değerlendirme
- 1:53:09 Instruction fine-tuning
- 2:08:21 LitGPT ile instruction fine-tuning
- 2:26:45 Benchmark değerlendirmesi
- 2:36:55 Diyalog performansı değerlendirmesi
- 2:42:40 Kapanış
Takip etmek için gereken materyaller
- Build an LLM from Scratch book: LLM’leri sıfırdan yapmayı anlatan kitap
- Build an LLM from Scratch GitHub repository: kitapla ilgili GitHub deposu
- GitHub repository with workshop code: atölye kod deposu
- Lightning Studio for this workshop: bu atölye için Lightning Studio
- LitGPT GitHub repository: LitGPT GitHub deposu
1 yorum
Hacker News yorumları
Çok örtüşen kısım var ama bazı konuları daha ayrıntılı ele alıyorlar ya da odakları farklı. Andrej’in tüm serisi kesinlikle izlemeye değer; ileride gelecek Eureka Labs çalışmaları da çok iyi görünüyor. Sebastian’ın blogu ve kitabı da zaman ve para ayırmaya değer bence
https://ai.meta.com/research/publications/the-llama-3-herd-o...
İyi bir PyTorch eğitimi olabilir ama düşük seviye gibi davranmayalım demek istiyorum
Ondan önce fast.ai ile öğrenmeye çalışmıştım ama doğrudan Pytorch ile ağ kurmaya başladığı için çabucak bıraktım. Lisede Java öğrenmek kadar sıkıcı gelmişti; neyle uğraştığımı anlamam gerekiyordu
https://16x.engineer/2023/12/29/nanoGPT-azure-T4-ubuntu-guid...
Böyle oluşturulan şeyle neler yapabildiğini ve güncel olayları nasıl öğrettiğini de merak ediyorum
Şimdi inceleyecek olursak, "code" codex denen ortamın içeriğiyle oluşturulan şeydir. Tarihsel arka plan için https://en.wikipedia.org/wiki/Codex görülebilir; hukuk alanındaki kurallar bütününden başlayıp İngilizcede en azından 16. yüzyıl ortalarından itibaren başka alanlara yayılmıştır
"program" ise bir niyetler bütününü içerecek şekilde yayımlamak gibidir; örneğin "önce Bach çalınır, ardından Mozart çalınır" gibi bir anlamı taşır. Bu kullanım, "kurallar bütünü" anlamındaki code’dan birkaç yüzyıl sonra ortaya çıkmıştır
"develop" açıp ortaya çıkarmak anlamına geldiği için güzel ama önceki iki kelime gibi kural ya da sıralı prosedür çağrıştırmaz
Kesin nedenini bilmiyorum ama Brezilya Portekizcesinde "program"ın fuhuşla güçlü biçimde ilişkilendirilmesinden kaynaklanıyor gibi
Andrej’in materyalleri benim için fazla düşük seviyeli; ayrıntılara dalıp yolumu kaybediyorum. Bu bir eleştiriden çok, benimle benzer durumda olanlara yardımcı olabilecek bir yorum
Uzun zaman önce derin RNN’lerde geri yayılımın nasıl çalıştığını takip etmişliğim vardı; geri kalanını görmek de eğlenceli olur diye düşündüm
Windows açıkça belirtilmediğinde genelde o ortamda test edilmemiş oluyor ve keyfi sorunlar nedeniyle çoğu zaman düzgün çalışmadığını görüyorum
https://developer.nvidia.com/cuda-downloads?target_os=Linux&...