- E-ticaret katalog denetimi için 9B açık kaynak modelin yaklaşık 500 dolarlık pekiştirmeli öğrenme ince ayarı sonucunda, aynı araçlar, görseller ve puanlayıcı kullanılarak test edilen tüm frontier model yapılandırmalarından daha yüksek puan elde edildi
- 177.767 denetim epizoduyla oluşturulan dijital ikizde, ürün sınıflandırma, marka doğrulama, öznitelik çıkarımı ve politika kararı tekrar edilerek şirkete özgü taksonomi ve değerlendirme ölçütleri model ağırlıklarına öğretildi
- GRPO ile eğitilen model, ulaşılabilir maksimum puanın %87,3'ünü alarak en iyi frontier yapılandırmasının %76,9'una göre görece %13,5 daha yüksek çıktı; eğitilmemiş temel modelin %64,2'sine göre ise %36 iyileşti
- Maliyet 1.000 ürün başına yaklaşık 0,50 dolar; en ucuz frontier yapılandırmadan 40 kat, en pahalı yapılandırmadan yaklaşık 340 kat daha ucuz. Günde 40 milyon işlem ölçeğinde yıllık yaklaşık 7 milyon dolar ile 500 milyon dolar arasında fark oluşuyor
- Sonuçları kurallar, testler ve rubriklerle doğrulanabilen yüksek hacimli tekrarlı işler için uygun; değişen olguların arama araçlarında tutulduğu, şirkete özgü karar verme biçiminin ise modele öğretildiği bir yapı gerekiyor
Yapay zeka yatırımının sonucunu belirleyen işletim biçimi
- ChatGPT'nin çıkışından sonra yapay zeka kullanımı, belge özetleme ve e-posta taslağı gibi düşük riskli işlerden yazılım geliştirme, içerik üretimi ve iç bilgi, veri ve araçları bağlayan şirket beyni (company brain) fikrine genişledi
- Ramp müşteri verilerinde, yapay zeka harcamasında en üst %25'te yer alan şirketlerin geliri Kasım 2022'den Aralık 2025'e kadar iki kattan fazla artarken, yapay zeka harcaması olmayan şirketler aynı dönemde yaklaşık %15 büyüdü
- Sonuç alan organizasyonlarda şu işletim biçimleri tekrar ediyor
- İş akışını yeniden tasarlama: Mevcut sürece yalnızca model eklemek yerine onay, inceleme, devir ve insan müdahalesi noktaları yeniden tasarlanmalı
- McKinsey'nin 2025 üretken yapay zeka kullanan organizasyonlar araştırmasında iş akışını yeniden tasarlama, EBIT etkisiyle en yüksek korelasyonu gösterdi; ancak gerçekte en az bir iş akışını yeniden tasarlayan organizasyonların oranı yalnızca %21'de kaldı
- Deneyleri teşvik etme: Modeller, araçlar ve en iyi uygulamalar hızla değiştiği için yalnızca başarılı lansmanlar değil, deneyler ve başarısızlıkların paylaşılması da ödüllendirilmeli
- Özelleştirilmiş iş bağlamı: Veri erişimi, istek bazlı erişim denetimi, ilgili kanıtların aranması ve uzadıkça kullanımı dengesizleşen context window yönetimi ayrı bir mühendislik konusu haline geliyor
- Kullanım ve etki ölçümü: Kendi veriniz üzerinde puanlama değerlendirmeleri yoksa performans, karar alma maliyeti ve verimlilik etkisini kanıtlamak zorlaşır; öz bildirime dayalı zaman tasarrufu rakamları da hatalı olabilir
- İş akışını yeniden tasarlama: Mevcut sürece yalnızca model eklemek yerine onay, inceleme, devir ve insan müdahalesi noktaları yeniden tasarlanmalı
“Zekaya sahip olmak” için dağıtım biçimi
- Tekrarlayan yapı açık kaynak modeller, şirkete özgü iş verisi ve puanlanabilir iş akışlarıyla yapılan pekiştirmeli öğrenme
- Frontier modeller, otomasyon olasılığını doğrulamak ve ilk baseline'ı oluşturmak için kullanılır
- Çağrı sürecinde girdiler, kararlar ve düzeltme kayıtları birikir; bunlar daha sonra uzman modelin eğitim verisine dönüşür
- Prototip aşamasından çıkıp büyük ölçekli operasyona geçildiğinde çağrı başına maliyet ve performans öncelik haline gelir
- Frontier modeller ile uzman modeller birbirini tamamen ikame eden şeyler değildir
- ChatGPT veya Claude gibi genel amaçlı modeller, iç bilgi gerektiren kısımları uzman modele bırakabilir
- Uzman modeller de yüksek genel amaçlı yetenek gerektiren işlerde frontier modeli çağırabilir
- Model şirketin araçları ve verileriyle çalışır, rubrik (rubric) sonuçları puanlar ve ödül sinyali modeli günceller
- On binlerce iş tekrarlandığında iş yargısı ağırlıklara yerleşir
- Fiyat, stok, politika belgeleri gibi değişen olgular araçlarda tutulur
Uzman modelin gerçek dağıtım örnekleri
- Bridgewater Associates, haberlerin, açıklamaların ve e-postaların yatırım teziyle ilişkili olup olmadığını ve basmakalıp ifadelerin nerede başladığını değerlendirmesi için uzman yatırımcı etiketleriyle açık kaynak bir modeli eğitti
- Yalnızca prompt kullanmak, iç değerlendirme ölçütlerini istikrarlı biçimde yansıtamadı
- Eğitilmiş model, en iyi frontier modele göre yaklaşık %30 daha az hata yaptı ve çıkarım maliyeti de daha düşüktü
- Harvey, işlem due diligence'ı ve hukuk notu hazırlama gibi hataların çok aşamalı biçimde biriktiği işlere açık ağırlıklı model ve pekiştirmeli öğrenme uyguladı
- Kendi rubriğinde hukuk ajanı GPT-5.5 ve Claude Opus 4.8'i geride bıraktı
- Intercom Fin Apex, haftada yaklaşık 2 milyon müşteri sorununu işleyen ölçekte çağrı başına maliyeti ve çözüm oranını iyileştirmek için milyarlarca müşteri hizmetleri etkileşimiyle sonraki eğitimden geçirildi
- Intercom, en iyi frontier modelden daha fazla sorunu çözerken işletme maliyetinin de daha düşük olduğunu belirtti
- Ortak dağıtım süreci, prompt ve bağlamı optimize edilmiş frontier modelle baseline oluşturup yürütme kayıtları ve öğrenilenleri şirketin sahip olduğu küçük modele aktarma biçiminde
Katalog bütünlüğü ve maliyet sorunu
- E-ticaret katalogları, her ürünü doğru taksonomiye yerleştirmeli ve arama, filtreleme, öneri ve sonraki operasyonlarda kullanılan öznitelikleri görsel ve açıklamalardan doğru biçimde çıkarmalıdır
- Hatalı kararlar ürün bulunabilirliğini ve öneri kalitesini düşürür, politika ihlallerinin kaçmasına yol açar
- Sahte ürünler kaçırılırsa müşteriler ve markalar dolandırıcılığa maruz kalır
- Normal ürünler gereğinden fazla işaretlenirse inceleme kuyrukları ve satıcı rahatsızlığı artar
- İş ölçeği de büyüktür
- eBay'de yaklaşık 2,5 milyar aktif ürün var
- Shopify kataloğuna günde 10 milyondan fazla ürün güncellemesi geliyor
- Walmart, yapay zeka destekli katalog işlerinin yalnızca insanlarla yapılması halinde yaklaşık 100 kat iş gücü gerekeceğini tahmin ediyor
- Tüketicilerin %71'i, gerçek ürün liste bilgilerinden farklı olduğu için iade deneyimi yaşadığını söylüyor
- Orta ölçekli bir marketplace günde yaklaşık 10 milyon ürün oluşturma ve düzenleme işlemi yaparsa frontier model tabanlı denetimin yıllık yaklaşık 500 milyon dolar, ince ayarlı uzman modelin ise yaklaşık 10 milyon dolar tutacağı tahmin ediliyor
- Shopify, ticari API'lerle ekonomik olarak karşılanmasının zor olması nedeniyle, ince ayar yapılmış açık model kullanarak günde yaklaşık 40 milyon ürün sınıflandırma çıkarımı yapıyor
Katalog denetim ajanının işi
- Ajan ürünü incelerken taksonomiyi arar, markayı doğrular, ilgili sınıfın öznitelik şemasını getirir ve yapılandırılmış kararı kesinleştirir
- Kanıt yetersizse veya risk yüksekse insan incelemesine aktarır
- İş eldiveni örneği şu sırayla işlenir
search_taxonomyileSafety Work Glovessınıfını bulurlookup_brandile AmazonBasics'in kayıtlı olduğunu ancak koruma kapsamında olmadığını doğrularget_attribute_schemaile marka, renk, malzeme ve beden özniteliklerini sorgular- Sınıf ve özniteliklerle birlikte
allowedkararını kesinleştirir
- Gerçek ihlali kaçırmanın maliyeti yanlış pozitiften 7 kat yüksek ayarlanarak iki hata asimetrik biçimde öğretilir
Eğitim için dijital ikiz
- Amazon Berkeley Objects gerçek ürün görselleri ve liste bilgileri kullanılarak 177.767 denetim epizodu oluşturuldu
- Her epizot görsel, başlık, açıklama, iddia edilen marka ve bölgeyi içerir
- Kontrollü politika ihlalleri, uyumsuz görseller, çelişen marka iddiaları ve zor negatif örnekler olarak meşru iddialar eklendi
- Tüm epizotlarda puanlanabilir doğru cevap bulunur
- Modelin kullandığı ortam gerçek analistin işini yeniden üretir
- Yaklaşık 13.000 sınıfı arar
- Markanın kayıtlı ve koruma kapsamında olup olmadığını doğrular
- Seçilen sınıf için gereken öznitelikleri getirir
- Nihai sınıflandırmayı, öznitelikleri ve politika kararını kesinleştirir
- Puanlayıcı doğru cevapları ödüllendirir; ihlal kaçırma, kanıtsız öznitelik, yanlış sınıflandırma ve gereksiz araç çağrılarına ceza verir
- Gerçek işin listelerini, araçlarını ve karar maliyetlerini yeniden üreten bir ortamda başarısızlık ve yeniden deneme tekrarlanabilmelidir ki pekiştirmeli öğrenme mümkün olsun
Frontier model baseline'ı
- GPT-5.5, GPT-5.6-sol, Gemini 3.1 Pro, Claude Opus 4.8 ve Claude Fable 5, katmanlandırılmış 200 doğrulama epizodunda karşılaştırıldı
- Tüm modellere aynı araçlar, görseller, puanlayıcı ve tur bütçesi uygulandı
- Temel prompt ile 2.800 karakterlik çıkarım kuralları, sorgulama prosedürü ve örnekler içeren optimize prompt ayrı ayrı test edildi
- En iyi frontier yapılandırma ulaşılabilir puanın %76,9'unu, GRPO ile eğitilen 9B model ise %87,3'ünü aldı
- Frontier modeller her epizotta ilgili mağazanın taksonomisini, stok uygulamalarını, desteklenen öznitelik değerlerini ve istisna işleme biçimlerini prompt içinde yeniden kurmak zorunda kaldı
- Optimize talimatlarla bilginin bir kısmı sıkıştırılabilse de puanı belirleyen tüm istisnaları listelemek mümkün olmadı
- Optimize edilmiş frontier yapılandırmalar birbirine 0,1 yüzde puan içinde yakınsadı
- Zero-shot çıkarım performansı en yüksek olan Gemini'nin performansı, optimize talimatlar uygulandıktan sonra tersine düştü
- Ek talimatlar modele göre giriş token maliyetini çağrı başına %28–55 artırdı
- Prompt'a konan iş bilgisi her çağrıda maliyet yaratır; öğrenilmiş bilgi ise ağırlıklarda tutulur
500 dolarlık GRPO eğitimi
- Eğitimde iki RTX PRO 6000 GPU kiralandı; biri rollout üretimi, diğeri gradyan güncellemesi için kullanıldı
- Altyapı açık kaynak prime-rl ile kuruldu
- Tüm eğitim 1.000 optimizasyon adımı, yaklaşık 3,5 gün ve yaklaşık 500 dolar GPU maliyeti aldı
- Yaklaşık 250 adım ve bir gün civarı eğitimle frontier model aralığı aşıldı
- Kalan adımlar maksimum performansı çıkarmak için kullanıldı
- Nihai katı benchmark puanı 0,626 oldu; bu ulaşılabilir üst sınırın %87,3'ü ve en iyi frontier yapılandırmadan yaklaşık 10 yüzde puan yüksek
- W&B eğitim monitöründe yaklaşık 0,50'den 1.000 adımda 0,671'e yükseldi
- Monitör, epizot başına 2 örnek rollout kullandığı için katı benchmark harness'ından biraz daha yüksek puan veriyor
- Eğitilmemiş 9B temel model maksimum puanın %64,2'sindeydi; ince ayardan sonra %87,3'e çıkarak görece yaklaşık %36 iyileşti
- Uzman model taksonomi, araçlar, politika ve ödül arasındaki ilişkiyi öğrenerek kapasitesini belirli ortamın davranışına odaklar; bunun karşılığında genel amaçlı yetenekten feragat eder
- Daha güçlü açık kaynak temel modeller çıktığında aynı eğitim yöntemi aktarılabilir; operasyonda kaydedilen kararlar da gözetimli ince ayar verisi olarak damıtılıp sonraki yeniden eğitimlerde kullanılabilir
Maliyet ve kalite karşılaştırması
- Uzman modelin çıkarım maliyeti 1.000 ürün başına yaklaşık 0,50 dolar; ince ayarla aynı maliyette temel 9B modele göre yaklaşık 23 yüzde puan daha yüksek puan alıyor
- Karşılaştırılanların maliyet farkı şöyle
- En ucuz frontier yapılandırma olan Gemini, 1.000 ürün başına 19 dolar ile uzman modelden 40 kat pahalı
- En pahalı GPT-5.5-pro, 1.000 ürün başına 172 dolar ile yaklaşık 340 kat pahalı
- En yüksek frontier puanını alan yapılandırma 1.000 ürün başına 34 dolar ile uzman modelden 68 kat pahalı
- 2.800 karakterlik talimatlar GPT-5.5'in ölçülen maliyetini yaklaşık üçte bir artırdı; bu prompt vergisi sonraki tüm çağrılarda tekrarlanıyor
- Günde yaklaşık 40 milyon işlem yapıldığında 1.000 işlem başına 34 dolarlık yapılandırma yıllık yaklaşık 500 milyon dolar, 0,50 dolarlık uzman model ise yaklaşık 7 milyon dolar tutuyor; yaklaşık %98 maliyet farkı oluşuyor
Uygun işler ve kaçınılması gereken alanlar
- Uygun işler, bilgiden karar üreten yüksek hacimli tekrarlı işlerdir
- Ticket yönlendirme
- Belge alanı çıkarımı
- Politikaya göre gönderi denetimi
- Ürün sınıflandırma
- İşlem onaylama veya işaretleme
- Temel koşul, her kararın doğru ya da yanlış olduğunun kurallar, şemalar, testler, rubrikler veya uzman yargısıyla doğrulanabilir olup olmadığıdır
- Puanlanabilen kararlar model tarafından alıştırma yapılabilir
- Uzlaşma olmadan yalnızca tartışılabilen sonuçlar bu yöntemle alıştırma yapılamaz
- Sıklık ve doğrulanabilirliğe göre araç seçilir
- Sıklığı yüksek ve doğrulanabilir işler için ince ayar uygundur
- Doğrulanabilir ama nadir işler için prompt'u optimize edilmiş frontier model uygundur
- Doğrulanamayan sonuçlarda insan devrede olmalıdır
- Sorunun özü yargı değil değişen olgularsa sıklıktan bağımsız olarak arama destekli üretim uygundur
- Aşağıdaki koşullardan biri veya fazlası varsa ince ayar adayı olabilir
- Çağrı maliyeti ve hatalar gerçek maliyet olarak birikecek kadar yüksek hacimlidir
- Tüm sonuçlar insan olmadan kurallar, testler ve rubriklerle doğrulanabilir
- Uzmanlar doğru cevabın ölçütlerinde uzlaşır
- Yetenekli bir model kısmen başarılı olur ama güvenilir olacak kadar tutarlı değildir
- Doğru cevap rastgele tahminle bulunamaz
- Akıl yürütme, araç çağrıları ve nihai kararın birden fazla aşamasından oluşur
- Kendi araçlarınız, şemalarınız ve politikalarınız üzerinde çalışır
- Hata türlerinin maliyetleri farklıdır
- Hassas veriler kontrol dışı altyapıya gönderilemez
- Modeli kendi sınırlarınız içinde çalıştırırsanız prompt'lar ve kayıtlar dış sağlayıcılara aktarılmaz; model, değerlendirme ve veriye birlikte sahip olup bunları iyileştirebilirsiniz
Diğer sektörlerden uzman model örnekleri
- Cognition'ın production yazılım yazma ve düzeltme modeli, standart kodlama benchmark'larında GPT-5.5'i geride bırakıyor ve saniyede 1.000 token stream ediyor
- AT&T, günde 900.000 destek çağrısını özetliyor ve kişisel verileri işaretliyor
- Kişisel veri tespit performansı GPT-4o'dan %17 yüksek
- GPT-4o düzeyi doğrulukla dolandırıcılık olaylarını 12 kat hızlı inceliyor ve yılda milyonlarca dolar tasarruf sağlıyor
- LinkedIn'in iş arayan–iş ilanı eşleştirme modeli, yerini aldığı GPT modelinden %4 daha doğru
- GPT-4'ten 75 kat, GPT-4o'dan 6 kat ucuz
- Ambience Healthcare'in tıbbi faturalandırma kodu modeli, gold panel testinde 18 uzmandan daha doğru
- Temel aldığı prompt tabanlı o4-mini yönteminden 12 yüzde puan yüksek
- Phonely'nin telefon yanıtlama modeli %99,2 doğruluk kaydederek GPT-4o'nun %94,7'sini geçti
- Önceki GPT-4o yapılandırmasına göre yanıtları %73 daha hızlıydı; bir müşteri bir ay içinde 350 insan temsilcinin yerini aldı
- OpenPipe'ın e-posta ve destek ticket modeli, destek QA'de %93 alarak OpenAI o3'ün %50'sini geçti
- o3'ten 64 kat ucuz ve 5 kat hızlı
- Perplexity Sonar, kaynaklı arama yanıtlarında kör kullanıcı testi ölçütlerine göre GPT-4o ile eşit düzeyde
- GPT-4o'dan 10 kat hızlı ve fiyatı da daha düşük
- Checkr'ın sabıka kaydı sınıflandırma modeli en zor vakalarda GPT-4'ü geride bırakıyor
- Mevcut GPT-4 yapılandırmasına göre 5 kat ucuz ve 30 kat hızlı
- Her rakam, ilgili şirketin değiştirdiği veya rekabet ettiği frontier modeli baz alan öz bildirimli sonuçtur
2 yorum
İnsan psikolojisi de böyle aslında: her olay için ayrı bir uzman bulup yalnızca kendi iş kapsamını vermektense, işi tek bir kişiye verince onun her şeyi kendi kendine halletmesini isteriz.
LLM’lerde de ödül fonksiyonu, ne atarsanız atın hepsini kabul edecek şekilde kurulmak zorunda kalmıyor mu?
Hacker News görüşleri
Büyük araştırma laboratuvarlarının kaçırdığı temel nokta, çoğu kullanımın 50 doktora düzeyinde bilgi ve 12 dil yeteneği gerektirmemesi ve maliyet kısıtlarının çok daha önemli olması
Açık ağırlıklı modeller ve ucuz ince ayarın yaygınlaşmasıyla, devasa modellerin ve borçla finanse edilen büyük altyapının ekonomisi çöker
Siyaset ya da Çin tehdidi söylemi yalnızca görünen gerekçe; küçük açık ağırlıklı modeller standart haline gelirse büyük laboratuvarların ayakta kalması zor olur
İnce ayarda gerçekten pahalı olan kısım iyi veri kümesi toplamaktır ve temiz veri olsa bile değerlendirme yürütüp kaliteyi ölçebilecek yetkinlik gerekir
Mühendislik, veri etiketleme ve sürekli kalite incelemesi maliyetleri de eklendiğinde, baştan iyi çalışan en ileri laboratuvar modelini kullanmaya devam etmek birçok kullanım için daha ucuz olabilir
Yaklaşık 10 yıl önce FAANG mülakat yöntemi ortaya çıkınca herkesin onu aynen kopyalamasına benziyor
Şu anki gibi ağırlıkları sürekli büyütüp donanım yükleme yolu çıkmaz sokak; sonunda AI tarihinde hep olduğu gibi amaca uygun algoritmalara geri dönüleceği savunuluyor
O kadar fazla parametreye gerek olmadığını göstermek için TinyToT geliştiriliyor
Böyle şeyler gördüğümde hep iki nokta takılıyor
Birincisi, mevcut modelleri daha iyi kullanmanın ya da hiçbir şey yapmadan beklemenin yeniden eğitimden daha iyi sonuç verdiğini birçok kez gördüm. Karşılaştırma noktası mevcut en ileri model değil, ince ayarlı modeli korurken çıkacak bir sonraki model olmalı
İkincisi, 500 dolarlık eğitim maliyeti en ucuz kalem; veri üretimi ve sonrasındaki model bakımı çok daha pahalı. Puanlanmış 177 bin bölümü gerçekten üretebilecek kaç kullanım alanı olduğu şüpheli
Burada Amazon Berkeley Objects ile sentezlemek gerekmişti; eğer doğal olarak mevcut olsaydı üretmeye gerek kalmayacak bu veri kümesinin kendisi, ince ayarı uygulamanın zorluğunu en iyi gösteriyor
GPU gibi özelleşmiş donanımların CPU gelişiminden sonra da kullanılmaya devam etmesi gibi, özelleşmiş modeller de maliyet veya sonuç açısından genel amaçlı modellerden üstün kalabilir
İlk eğitim 500 dolarsa, sürekli eğitim nispeten ucuzdur. Veri değişimlerine uygun yeni örnekler üretmek daha pahalıdır ama bir sonraki model eğitiminde yeniden kullanılabilir; ayrıca model ve prompt değişikliklerini değerlendirmek için zaten bir miktar gerekir
Sonuçta veri üretimi, eğitim maliyeti ya da veri eksikliği yüzünden bu her zaman mantıklı değildir; yalnızca makaledeki tablo örneğinde olduğu gibi sık ve doğrulanabilir işler için uygundur. Milyonlarca kararı işleyen büyük işletmeler için ancak gerçekçi olabilir
Veri kümesi ve model bakım maliyetleri de Braintrust ya da Hugging Face gibi girişimler aracılığıyla genel hizmete dönüşüyor
En ileri modeller kendi işlerini ortadan kaldırmakta çok başarılı
Zaten GPT'de de Luna, Sol kullanımının %90'ını karşılıyor. Çin'in hâlâ model damıtımına yoğunlaşmasının nedeni doğru eğitim verisi üretimi; OpenAI ve Anthropic bunu hukuki sorunlardan kaçınarak toplamak için yıllar harcadı
Modeller akıllandıkça insanlar işi yeterince gören daha ucuz alternatiflere geçiyor. Doğruluk zaten %99 ise en ileri modeli kullanmanın pratik faydası neredeyse kalmıyor; bu da ABD laboratuvarları için en büyük risk gibi görünüyor
Bunun dışındaki işler için daha ucuz modeller fazlasıyla yeterli
2018 civarında alınmış bir LCD TV'yi değiştirmeyi düşünmemek gibi, diğer teknolojilerde de benzer durum var
Teknoloji yeni teknolojilerin yerini almaya ya da boş alanlara sızmaya eğilimlidir ama insan etkileşimi gibi teknik olmayan alanların yerini alması nadirdir. Ekran karşısındaki boş zaman etkinlikleri de çoğunlukla parasosyal ilişkilere yöneliyor
Açık model ince ayarıyla çok ilgileniyorum ve doğrudan önerebileceğim kaynaklar arıyorum; bu yazıyı da ayrıntılı okumak için kaydettim
Nemotron-3-Nano 30B'yi yerelde çalıştırdım ve hedefim 30 milyar ila 120 milyar parametreli modeller. Yalnızca temel modelle bile pratik değer üretmek mümkün ama özel görevlerde eğitimin son boşluğu kapatabileceğini düşünüyorum
Yazarın tüm süreci düşünmesi özellikle hoşuma gitti; aynı kullanım alanını ve değer üretme stratejisini doğrulayabildim. Bu uzun vadeli bir proje olduğu için ince ayar donanımı da satın almayı planlıyorum
Ramp yazısını okumadım ama bu post hoc yanılgısı gibi görünüyor. Geliri 2 katına çıkan şirketin yapay zekaya harcayacak parası vardır, 1,15 katına çıkanın ise olmayabilir
Küçük LLM'leri ya da BERT gibi daha küçük dil modellerini ince ayar yapma yaklaşımı, LLM'lerin ortaya çıktığı ilk dönemden beri öneriliyordu. Hızlı çalışması, tüm teknik yığını kontrol edebilmeniz ve özel alanlara daha iyi uyum sağlaması gibi avantajları açık
Ancak büyük dil modeli API'leri hâlâ ucuz, yeterince hızlı ve sürekli iyileştiği için pratikte çok fazla ince ayar yapılmıyor. Çünkü zaman ve para harcayıp özelleşmiş bir modeli yayına alır almaz, yeni bir genel amaçlı model bunun önüne geçebilir
Bir gün LLM gelişimi yavaşlar ya da API fiyatları taşınamayacak seviyeye gelirse, ince ayar ve küçük modeller dönemi yeniden gelecektir
Modelin ne zaman ince ayar alması, ne zaman da en ileri modeli kullanması gerektiğini gösteren 2×2 matris hoşuma gitti
Yine de değerlendiricinin her bölümün puanını nasıl verdiği belirsiz. Eğer puanlamayı en ileri model yaptıysa, ince ayarlı model o modeli görevde geçtikten sonra değerlendirmenin hâlâ geçerli olup olmayacağını merak ediyorum
Önce Kimi K3 gibi daha büyük bir açık modelden, alana özgü iş akışının tam olasılık dağılımını damıtmak ve ardından sonuca kendi özel kapalı takviyeli öğrenme hattınızı uygulamak faydalı olur. Biz GLM 5.2 kullanarak İngilizce→SQL için özel kapalı bir 27B model yaptık ve Fable'dan daha iyi sonuç aldık, ancak açıklama yeteneği kayboldu
Aşırı derecede özelleşmiş alanlarda, maliyetin çok küçük bir kısmıyla en ileri modeli geçmek zor değildir. Kendi takviyeli öğrenme hattınız olmasa bile yalnızca damıtma ile büyük maliyet tasarrufu sağlanabilir ve 27B model bu görevde 3T modele yaklaşabilir
Ancak uzman modele uymayacak kadar iddialı görevlerde bunun işe yaramama ihtimali yüksektir
Son zamanlarda Apple'ın 3B Foundation Model'ini çok belirli bir görevde Sonnet 4.6 seviyesine çekmeye çalışan otomatik araştırmaya dalmış durumdaydım
İnce ayar adaptörleriyle bir deterministik adımı birleştirerek %90 seviyesine kadar ulaştık
Soru-cevap, 96 deney ve soy ağacı dahil tüm süreç https://alexisrondeau.me/tada/research/FMDiscovery/dashboard... adresinde derlendi
Darboğaz model boyutu değil, problemi gerçekten anlayan birinin ödül fonksiyonunu tanımlamasıydı
Çözümü tanımlayan harika programlama dilleri çok, ama problemi açıkça tanımlayan dilin nerede olduğunu merak ediyorum