5 Dakikada Dizüstü Bilgisayarda Eğitilebilecek En Güçlü AI Modeli Hangisi?
(seangoedecke.com)- MacBook Pro üzerinde 5 dakikada yaklaşık 1.8M parametreli GPT tarzı bir transformer modeli, yaklaşık 20M TinyStories token’ı ile eğitilerek yaklaşık 9.6 perplexity elde edildi
- 5 dakika içinde eğitim için temel kısıtlar model boyutu ve işlenebilen token sayısı; model büyüdükçe yakınsama yavaşlıyor ve az veriyle verim düşüyor
- Performans optimizasyonu tarafında MPS kullanımı, derleme/kuantizasyon/gradient accumulation ve PyTorch alternatifi denemelerinden daha etkili; en iyi sonuç küçük model seçmekle alınıyor
- TinyStories gibi basit ve tutarlı veri kümeleri, ansiklopedik veri kümelerine kıyasla küçük modellerin performansını daha olumlu etkiliyor
- Transformer mimarisi, küçük boyut ve kısa eğitim süresi koşullarında LSTM veya diffusion yaklaşımlarından daha iyi sonuç veriyor
Genel Bakış
Bu yazı, bir dizüstü bilgisayarda (MacBook Pro) 5 dakikada eğitilebilen en yüksek performanslı AI dil modelini deneme sonuçlarıyla birlikte inceliyor; ayrıca en uygun eğitim stratejisi, veri kümesi seçimi ve model mimarisi hakkında içgörüler sunuyor.
Deney Sonuçlarının Özeti
- Yaklaşık 1.8M parametreli GPT tarzı bir transformer modeli, yaklaşık 20M TinyStories verisiyle eğitildi ve 9.6 perplexity değerine ulaştı
- Üretim örnekleri kısa ama tutarlı hikâyeler biçiminde; İngilizce dil bilgisi çoğunlukla doğru kalıyor
- 5 dakika içinde pratik sayılabilecek düzeyde model çıktısı elde edilmesinin beklentilerin üzerinde olduğu vurgulanıyor
Deneyin Arka Planı ve Sınırları
- Dizüstü bilgisayar ortamında güçlü bir modeli hızlıca eğitmek, gerçekçi olmaktan çok meraktan doğan bir deney olarak başladı
- Gerçekte bulutta yüksek performanslı GPU’larla (H100 vb.) çok daha güçlü modeller eğitmek mümkün; ancak bu deneyin temel sınırı zamandı: 5 dakika
- Model boyutu büyüdükçe token işleme hızı düşüyor ve 5 dakika içinde iyi sonuç almak zorlaşıyor
- Çok küçük modeller (ör. 10K parametre) yeterli karmaşıklığı öğrenemiyor
- Pratik aralık yaklaşık 1M~2M parametreli modeller
İşleme Hacmi Optimizasyonu
- MPS (Apple’ın Metal Performance Shaders’ı) kullanımı en etkili yöntem
torch.compile, float16, MLX gibi çeşitli matematiksel optimizasyonlar beklenenden daha az fayda sağladı, hatta bazı durumlarda performansı düşürdü- Gradient accumulation bellek yönetimi açısından faydalı olsa da, pratikte ciddi hız kaybına yol açıyor
- Verimli olmak için modelin ağırlık güncellemelerini dahili bellekte hızlıca yapabilmesi gerekiyor
Veri Kümesi Seçimi
- Sınırlı token sayısıyla (yaklaşık 10~20M) önce Simple English Wikipedia gibi basit İngilizce wiki verileri kullanıldı; sonuçta dil bilgisel tutarlılık yakalansa da anlamsal tutarlılık zayıf kaldı
- Özel isim ağırlığı ve yapay duran olgu sıralamaları nedeniyle anlamlı içerik üretiminde sınırlar görüldü
- TinyStories veri kümesi kullanıldığında, hikâye yapısı net ve dil basit olduğu için sonuçlar çok daha tutarlı ve anlamlı oldu
- 4 yaş düzeyinde hikâyeler içerdiğinden, küçük modeller için öğrenmesi daha kolay oldu
Tokenizer ve Tokenizasyon
- Tokenizer eğitimi bu 5 dakikalık süreye dahil değil ve veri ölçeği küçük olduğu için optimizasyon gereksinimi de düşük
- Çok baytlı token’ların öğrenilmesi model için daha kolay
Model Mimarisi Deneyleri
-
Transformer (GPT-2 tarzı) mimarisi kullanıldı
- 2~3 katman, SwiGLU gibi aktivasyon fonksiyonları, positional embedding gibi hiperparametreler ayarlandı
- LSTM performans olarak yaklaşsa da perplexity açısından transformer daha iyi sonuç verdi
- Dropout, mixture-of-experts gibi yöntemler bu kadar küçük ölçekte verimsiz kaldı
- Curriculum learning, eğitim süresi çok kısa olduğu için anlamlı fayda sağlamadı
-
Diffusion modeli (D3PM) denemesi
- Doğal dil ayrık token’lardan oluştuğu için, diffusion sürecinde yalnızca anlamsız rastgele token’lar üretildi ve yaklaşım başarısız oldu
- Transformer veya LSTM’ye kıyasla cümle yapısını hızlıca oluşturmakta zorlandı
Model Boyutu ile Token/Saniye İşleme Hacmi Arasındaki İlişki
- 1M~2M parametreli modeller en ideal sweet spot’u oluşturuyor
- Daha büyük modeller 5 dakika içinde yakınsayamıyor, daha küçük modeller ise çok erken performans sınırına ulaşıyor
- Chinchilla scaling law ile deney sonuçları genel olarak uyumlu
- Toplam eğitim token’ı/20 oranının ideal model boyutunu verdiği ve bu deneyde de bunun doğrulandığı belirtiliyor
Sonuç ve Çıkarımlar
- Çok kısa sürede ve küçük donanımla bile tutarlı hikâye anlatımı yapabilen bir model eğitmek mümkün
- 5 dakikalık eğitim, güçlü model geliştirmek için uygun olmasa da küçük ölçekli, ultra hafif model tasarımı ile donanım ve mimari optimizasyon deneyleri için anlam taşıyor
- Gelecekte dizüstü GPU’ları ve model yapıları geliştikçe, yalnızca birkaç dakikada eğitilebilen modellerin performansının daha da artma potansiyeli var
1 yorum
Hacker News görüşleri
Kuantum kriptografiyle ilgili konuşmasını izlemek istiyor; videonun başında bahsedilen o konuşmanın bağlantısını bilen var mı diye merak ediyor
Küçük modellerin optimize edilmiş eğitimi yalnızca erişilebilirlik açısından değil, LLM’lerin bilimsel araştırılması açısından da önemli; biyoloji araştırmalarında maya gibi basit organizmaların kullanılması gibi, anlamak ve kontrol edebilmek için büyük modellerde görülen ilginç davranışları sergileyen en basit transformer’ları incelemek gerekiyor
Son zamanlarda etkileyici bulduğu podcast’lerden biri Tiny Stories makalesi ve veri kümesi hakkındaydı; bu veri kümesi yalnızca küçük çocuk masallarındaki gibi basit kelime ve kavramlar içeriyor, ama bununla küçük modeller bile dilbilgisi, çeşitlilik ve akıl yürütme içeren İngilizce üretmeyi başarabiliyor; yazarlarla yapılan podcast’in kendisi de LLM yeteneklerini küçük ve kontrollü bir araştırma örneğiyle çok iyi açıklıyor; biyolojik benzetmede veri kümesini muhtemelen çok basit ve kontrollü bir ortam olan agar plağına benzetiyor; ilgili bağlantılar: podcast bölümü, TinyStories makalesi
Birçok şirket, kullanıcı satın alma geçmişi gibi özel veri kümelerini kullanarak küçük modellerle gerçek iş problemlerini çözebilir; büyük dil modellerinden gelen ilerlemeler de, girdi dizileri uzmanlaşmış bir dilde ifade edilebiliyorsa, küçük problemlere doğrudan uygulanabilir
Küçük modellerde ortaya çıkan davranış ve optimizasyonların büyük modellerde iyi yeniden üretilemediği yaygın olarak biliniyor
Yazarın burada yaptığı şey pretraining; bunu genelde Google ya da Meta gibi model üreticileri yapar, oysa bir işletme için fine-tuning ya da daha az ölçüde ek pretraining çok daha pratiktir; yazarın bunu akademik nedenlerle denediğini vurguluyor
Dizüstünde hızlı çalışan modellerle ilgileniyor, ama eğitim sürecinin kendisi birkaç gün ya da daha uzun sürebilir
Zaman yerine enerjiyi ölçüt almanın daha iyi olacağını düşünüyor; yani joule cinsinden verilmiş bir enerji bütçesi içinde en iyi modeli eğitmek gerçek karşılaştırma olurdu, böylece MBP ile H100 arasındaki karşılaştırma da daha adil hale gelirdi
Buradaki asıl nokta verimlilik değil, “erişilebilirlik”; çünkü H100 günlük kullanım ürünü değil ama dizüstü bilgisayar öyle
Anladığı kadarıyla Mac, güç tüketimi açısından daha rekabetçi; Nvidia GPU’lar gibi yüksek güç çekmiyor; ayrıca H100’ü saatlik 10 doların altında kiralamanın mümkün olduğunu, bu yüzden 1 saatten kısa sürede eğitilebilen modellerin performansını yarıştırmanın da ilginç olabileceğini söylüyor
Hangi ölçütün kullanıldığının çok da önemli olmadığını, biraz keyfi olsa bile sorun etmeyeceğini düşünüyor
Eğer amaç pratik ölçütü dizüstü tabanlı mı, yoksa MacBook Pro tabanlı mı diye ifade etmekse, bunun daha açık belirtilmesini isterdi
Artık bir tür AI verimlilik olimpiyatı düzenleme havası olduğunu söylüyor; dizüstü, masaüstü, telefon, 5 dakika, 1 saat, 1 gün, 1 hafta, teknede ya da keçiyle birlikte fark etmez diye esprili biçimde anlatıyor
“Keçiyle birlikte” ifadesinin muhtemelen Llama’ya gönderme olduğunu; kafiyenin sınırlı kaldığını ama Boston aksanıyla daha komik olabileceğini söylüyor
Bir Vernor Vinge romanında insanların taşınabilir satranç bilgisayarları yapıp maç sırasında yardımcı olarak kullandığını hatırlatıyor; turnuvada satranç saati dışında elektrik de verilse, katılımcıların kendi AI’larına en uygun hamleleri düşünmesi ilginç olurdu diye ekliyor
Mac Studio M3 Ultra 512GB ile aşırı performans alınabileceğini söyleyen bir ifade; öyle bir tekneyle keçiyi bile yüzdürebilirsin diye şaka yapıyor
Keçinin parametre sayısının o kadar yüksek olduğunu, neredeyse GPT-4 seviyesinde sayılabileceğini söyleyen bir şaka
GoatLM çıkarsa para vermeye hazır olduğunu söylüyor
"Paris, France is a city in North Carolina..."gibi saçma bir örnekte geçen officially major people ifadesini beğendiğini, bunu günlük konuşmada nasıl kullanabileceğini merak ettiğini söylüyorBunun birkaç yıl önceki “cramming” makalesini hatırlattığını; o çalışmada yazarın modern bir dizüstünde bir gün içinde en iyi modeli eğitmeye çalıştığını belirterek makale bağlantısını paylaşıyor
Yalnızca GPT-2 speedrun denemesinden alınan birkaç numara (Muon, daha iyi ağırlık başlatma, dikkatli öğrenme oranı ayarı) bile uygulansa çok daha iyi sonuç alınabileceğini düşünüyor; ilgili kaynak burada
AI alanında demoscene benzeri bir kültürün eksik olduğunu düşünüyor
Küçük, daha uzmanlaşmış modeller oluşturmanın ve gerektiğinde anında üretmenin değerli olduğunu düşünüyor; her şeyi bilen büyük bir model değil, sadece kendi çalıştığı alana lazer gibi odaklanan ve çok hızlı çalışan bir modele daha çok ihtiyaç duyuyor; büyük bir LLM’ye “
<gerekli görev>için optimize edilmiş bir modeli eğitecek script yaz” deyip sonra o modeli çalıştırabilmek istiyor; ama bu yorumu yazarken Google’ın Gemma 3 270M’i duyurduğunu ekliyor"Paris, France is a city in North Carolina..."gibi saçma örnekleri vererek, sadece “Bilmiyorum” diyebilme yeteneği olsa küçük modellerin çok daha kullanışlı hale geleceğini söylüyor; çok büyük LLM’lere ihtiyaç duyulmasının nedeni kapsamın çok geniş olması ve bu sayede uydurmalarının engellenmesi; müşteri hizmetleri chatbot’unu bir dizüstünde makul sürede eğitmenin mümkün olmasının güzel olacağını, ama o alanın dışında ciddi biçimde alakasız cevaplar verme olasılığının yüksek olduğunu belirtiyor