2 puan yazan GN⁺ 2025-08-15 | 1 yorum | WhatsApp'ta paylaş
  • MacBook Pro üzerinde 5 dakikada yaklaşık 1.8M parametreli GPT tarzı bir transformer modeli, yaklaşık 20M TinyStories token’ı ile eğitilerek yaklaşık 9.6 perplexity elde edildi
  • 5 dakika içinde eğitim için temel kısıtlar model boyutu ve işlenebilen token sayısı; model büyüdükçe yakınsama yavaşlıyor ve az veriyle verim düşüyor
  • Performans optimizasyonu tarafında MPS kullanımı, derleme/kuantizasyon/gradient accumulation ve PyTorch alternatifi denemelerinden daha etkili; en iyi sonuç küçük model seçmekle alınıyor
  • TinyStories gibi basit ve tutarlı veri kümeleri, ansiklopedik veri kümelerine kıyasla küçük modellerin performansını daha olumlu etkiliyor
  • Transformer mimarisi, küçük boyut ve kısa eğitim süresi koşullarında LSTM veya diffusion yaklaşımlarından daha iyi sonuç veriyor

Genel Bakış

Bu yazı, bir dizüstü bilgisayarda (MacBook Pro) 5 dakikada eğitilebilen en yüksek performanslı AI dil modelini deneme sonuçlarıyla birlikte inceliyor; ayrıca en uygun eğitim stratejisi, veri kümesi seçimi ve model mimarisi hakkında içgörüler sunuyor.

Deney Sonuçlarının Özeti

  • Yaklaşık 1.8M parametreli GPT tarzı bir transformer modeli, yaklaşık 20M TinyStories verisiyle eğitildi ve 9.6 perplexity değerine ulaştı
  • Üretim örnekleri kısa ama tutarlı hikâyeler biçiminde; İngilizce dil bilgisi çoğunlukla doğru kalıyor
  • 5 dakika içinde pratik sayılabilecek düzeyde model çıktısı elde edilmesinin beklentilerin üzerinde olduğu vurgulanıyor

Deneyin Arka Planı ve Sınırları

  • Dizüstü bilgisayar ortamında güçlü bir modeli hızlıca eğitmek, gerçekçi olmaktan çok meraktan doğan bir deney olarak başladı
  • Gerçekte bulutta yüksek performanslı GPU’larla (H100 vb.) çok daha güçlü modeller eğitmek mümkün; ancak bu deneyin temel sınırı zamandı: 5 dakika
  • Model boyutu büyüdükçe token işleme hızı düşüyor ve 5 dakika içinde iyi sonuç almak zorlaşıyor
    • Çok küçük modeller (ör. 10K parametre) yeterli karmaşıklığı öğrenemiyor
    • Pratik aralık yaklaşık 1M~2M parametreli modeller
Reklam

İşleme Hacmi Optimizasyonu

  • MPS (Apple’ın Metal Performance Shaders’ı) kullanımı en etkili yöntem
  • torch.compile, float16, MLX gibi çeşitli matematiksel optimizasyonlar beklenenden daha az fayda sağladı, hatta bazı durumlarda performansı düşürdü
  • Gradient accumulation bellek yönetimi açısından faydalı olsa da, pratikte ciddi hız kaybına yol açıyor
  • Verimli olmak için modelin ağırlık güncellemelerini dahili bellekte hızlıca yapabilmesi gerekiyor

Veri Kümesi Seçimi

  • Sınırlı token sayısıyla (yaklaşık 10~20M) önce Simple English Wikipedia gibi basit İngilizce wiki verileri kullanıldı; sonuçta dil bilgisel tutarlılık yakalansa da anlamsal tutarlılık zayıf kaldı
    • Özel isim ağırlığı ve yapay duran olgu sıralamaları nedeniyle anlamlı içerik üretiminde sınırlar görüldü
  • TinyStories veri kümesi kullanıldığında, hikâye yapısı net ve dil basit olduğu için sonuçlar çok daha tutarlı ve anlamlı oldu
    • 4 yaş düzeyinde hikâyeler içerdiğinden, küçük modeller için öğrenmesi daha kolay oldu

Tokenizer ve Tokenizasyon

  • Tokenizer eğitimi bu 5 dakikalık süreye dahil değil ve veri ölçeği küçük olduğu için optimizasyon gereksinimi de düşük
  • Çok baytlı token’ların öğrenilmesi model için daha kolay
Reklam

Model Mimarisi Deneyleri

  • Transformer (GPT-2 tarzı) mimarisi kullanıldı

    • 2~3 katman, SwiGLU gibi aktivasyon fonksiyonları, positional embedding gibi hiperparametreler ayarlandı
    • LSTM performans olarak yaklaşsa da perplexity açısından transformer daha iyi sonuç verdi
    • Dropout, mixture-of-experts gibi yöntemler bu kadar küçük ölçekte verimsiz kaldı
    • Curriculum learning, eğitim süresi çok kısa olduğu için anlamlı fayda sağlamadı
  • Diffusion modeli (D3PM) denemesi

    • Doğal dil ayrık token’lardan oluştuğu için, diffusion sürecinde yalnızca anlamsız rastgele token’lar üretildi ve yaklaşım başarısız oldu
    • Transformer veya LSTM’ye kıyasla cümle yapısını hızlıca oluşturmakta zorlandı
    Reklam

Model Boyutu ile Token/Saniye İşleme Hacmi Arasındaki İlişki

  • 1M~2M parametreli modeller en ideal sweet spot’u oluşturuyor
    • Daha büyük modeller 5 dakika içinde yakınsayamıyor, daha küçük modeller ise çok erken performans sınırına ulaşıyor
  • Chinchilla scaling law ile deney sonuçları genel olarak uyumlu
    • Toplam eğitim token’ı/20 oranının ideal model boyutunu verdiği ve bu deneyde de bunun doğrulandığı belirtiliyor

Sonuç ve Çıkarımlar

  • Çok kısa sürede ve küçük donanımla bile tutarlı hikâye anlatımı yapabilen bir model eğitmek mümkün
  • 5 dakikalık eğitim, güçlü model geliştirmek için uygun olmasa da küçük ölçekli, ultra hafif model tasarımı ile donanım ve mimari optimizasyon deneyleri için anlam taşıyor
  • Gelecekte dizüstü GPU’ları ve model yapıları geliştikçe, yalnızca birkaç dakikada eğitilebilen modellerin performansının daha da artma potansiyeli var

1 yorum

 
GN⁺ 2025-08-15
Hacker News görüşleri
  • Kuantum kriptografiyle ilgili konuşmasını izlemek istiyor; videonun başında bahsedilen o konuşmanın bağlantısını bilen var mı diye merak ediyor

  • Küçük modellerin optimize edilmiş eğitimi yalnızca erişilebilirlik açısından değil, LLM’lerin bilimsel araştırılması açısından da önemli; biyoloji araştırmalarında maya gibi basit organizmaların kullanılması gibi, anlamak ve kontrol edebilmek için büyük modellerde görülen ilginç davranışları sergileyen en basit transformer’ları incelemek gerekiyor

    • Son zamanlarda etkileyici bulduğu podcast’lerden biri Tiny Stories makalesi ve veri kümesi hakkındaydı; bu veri kümesi yalnızca küçük çocuk masallarındaki gibi basit kelime ve kavramlar içeriyor, ama bununla küçük modeller bile dilbilgisi, çeşitlilik ve akıl yürütme içeren İngilizce üretmeyi başarabiliyor; yazarlarla yapılan podcast’in kendisi de LLM yeteneklerini küçük ve kontrollü bir araştırma örneğiyle çok iyi açıklıyor; biyolojik benzetmede veri kümesini muhtemelen çok basit ve kontrollü bir ortam olan agar plağına benzetiyor; ilgili bağlantılar: podcast bölümü, TinyStories makalesi

    • Birçok şirket, kullanıcı satın alma geçmişi gibi özel veri kümelerini kullanarak küçük modellerle gerçek iş problemlerini çözebilir; büyük dil modellerinden gelen ilerlemeler de, girdi dizileri uzmanlaşmış bir dilde ifade edilebiliyorsa, küçük problemlere doğrudan uygulanabilir

    • Küçük modellerde ortaya çıkan davranış ve optimizasyonların büyük modellerde iyi yeniden üretilemediği yaygın olarak biliniyor

    • Yazarın burada yaptığı şey pretraining; bunu genelde Google ya da Meta gibi model üreticileri yapar, oysa bir işletme için fine-tuning ya da daha az ölçüde ek pretraining çok daha pratiktir; yazarın bunu akademik nedenlerle denediğini vurguluyor

    • Dizüstünde hızlı çalışan modellerle ilgileniyor, ama eğitim sürecinin kendisi birkaç gün ya da daha uzun sürebilir

  • Zaman yerine enerjiyi ölçüt almanın daha iyi olacağını düşünüyor; yani joule cinsinden verilmiş bir enerji bütçesi içinde en iyi modeli eğitmek gerçek karşılaştırma olurdu, böylece MBP ile H100 arasındaki karşılaştırma da daha adil hale gelirdi

    • Buradaki asıl nokta verimlilik değil, “erişilebilirlik”; çünkü H100 günlük kullanım ürünü değil ama dizüstü bilgisayar öyle

    • Anladığı kadarıyla Mac, güç tüketimi açısından daha rekabetçi; Nvidia GPU’lar gibi yüksek güç çekmiyor; ayrıca H100’ü saatlik 10 doların altında kiralamanın mümkün olduğunu, bu yüzden 1 saatten kısa sürede eğitilebilen modellerin performansını yarıştırmanın da ilginç olabileceğini söylüyor

    • Hangi ölçütün kullanıldığının çok da önemli olmadığını, biraz keyfi olsa bile sorun etmeyeceğini düşünüyor

    • Eğer amaç pratik ölçütü dizüstü tabanlı mı, yoksa MacBook Pro tabanlı mı diye ifade etmekse, bunun daha açık belirtilmesini isterdi

  • Artık bir tür AI verimlilik olimpiyatı düzenleme havası olduğunu söylüyor; dizüstü, masaüstü, telefon, 5 dakika, 1 saat, 1 gün, 1 hafta, teknede ya da keçiyle birlikte fark etmez diye esprili biçimde anlatıyor

    • “Keçiyle birlikte” ifadesinin muhtemelen Llama’ya gönderme olduğunu; kafiyenin sınırlı kaldığını ama Boston aksanıyla daha komik olabileceğini söylüyor

    • Bir Vernor Vinge romanında insanların taşınabilir satranç bilgisayarları yapıp maç sırasında yardımcı olarak kullandığını hatırlatıyor; turnuvada satranç saati dışında elektrik de verilse, katılımcıların kendi AI’larına en uygun hamleleri düşünmesi ilginç olurdu diye ekliyor

    • Mac Studio M3 Ultra 512GB ile aşırı performans alınabileceğini söyleyen bir ifade; öyle bir tekneyle keçiyi bile yüzdürebilirsin diye şaka yapıyor

    • Keçinin parametre sayısının o kadar yüksek olduğunu, neredeyse GPT-4 seviyesinde sayılabileceğini söyleyen bir şaka

    • GoatLM çıkarsa para vermeye hazır olduğunu söylüyor

  • "Paris, France is a city in North Carolina..." gibi saçma bir örnekte geçen officially major people ifadesini beğendiğini, bunu günlük konuşmada nasıl kullanabileceğini merak ettiğini söylüyor

  • Bunun birkaç yıl önceki “cramming” makalesini hatırlattığını; o çalışmada yazarın modern bir dizüstünde bir gün içinde en iyi modeli eğitmeye çalıştığını belirterek makale bağlantısını paylaşıyor

  • Yalnızca GPT-2 speedrun denemesinden alınan birkaç numara (Muon, daha iyi ağırlık başlatma, dikkatli öğrenme oranı ayarı) bile uygulansa çok daha iyi sonuç alınabileceğini düşünüyor; ilgili kaynak burada

  • AI alanında demoscene benzeri bir kültürün eksik olduğunu düşünüyor

  • Küçük, daha uzmanlaşmış modeller oluşturmanın ve gerektiğinde anında üretmenin değerli olduğunu düşünüyor; her şeyi bilen büyük bir model değil, sadece kendi çalıştığı alana lazer gibi odaklanan ve çok hızlı çalışan bir modele daha çok ihtiyaç duyuyor; büyük bir LLM’ye “<gerekli görev> için optimize edilmiş bir modeli eğitecek script yaz” deyip sonra o modeli çalıştırabilmek istiyor; ama bu yorumu yazarken Google’ın Gemma 3 270M’i duyurduğunu ekliyor

    • Gerçekte makine öğrenmesinde, genel amaçlı modellerin uzmanların görevlerinde bile uzman modellerden daha iyi performans göstermesinin bir eğilim olduğunu söylüyor
  • "Paris, France is a city in North Carolina..." gibi saçma örnekleri vererek, sadece “Bilmiyorum” diyebilme yeteneği olsa küçük modellerin çok daha kullanışlı hale geleceğini söylüyor; çok büyük LLM’lere ihtiyaç duyulmasının nedeni kapsamın çok geniş olması ve bu sayede uydurmalarının engellenmesi; müşteri hizmetleri chatbot’unu bir dizüstünde makul sürede eğitmenin mümkün olmasının güzel olacağını, ama o alanın dışında ciddi biçimde alakasız cevaplar verme olasılığının yüksek olduğunu belirtiyor

    • Dizüstünde sadece 5 dakikada eğitilmiş bir AI ile küçük modellerin sınırlarını tartışmanın pek adil olmadığını düşünüyor; elbette halüsinasyon sorunu hâlâ büyük, ama bu yazıdan o açıdan daha fazla içgörü elde ettiğini de söylemiyor