4 puan yazan GN⁺ 1 일 전 | 1 yorum | WhatsApp'ta paylaş
  • Nativ, Apple Silicon Mac'lerde açık yapay zeka modellerini indirip hesap·abonelik·bulut olmadan çalıştıran MIT lisanslı açık kaynak bir uygulamadır
  • Google, Cohere, Liquid AI ve diğerlerinin modellerini sunar, Mac donanımına uygun modeller önerir ve tüm yanıtları yerel olarak üretir
  • Sohbette akış, Markdown, kod vurgulama ve görsel girişi destekler; saniye başına token sayısı ve bellek baskısı gibi performans durumları gerçek zamanlı izlenebilir
  • MLX-VLM ile M serisinin birleşik belleği·Metal için optimize edilmiştir; dil, görsel, video, kod ve ses işlerini işler
  • Yerel model sunucusunu Pi, Codex, Claude Code, Hermes, OpenCode ile bağlayabilir ve uygulama ile model yükleyicinin tüm kodu da açıktır

Mac için optimize edilmiş yerel model çalıştırma

  • Apple Silicon M1 ve üzerini destekleyen evrensel bir macOS uygulaması olarak, bulut veya ek dönüştürme katmanı olmadan gerçek modelleri Mac'te çalıştırır
  • Seçilmiş kütüphaneden Google, Cohere ve Liquid AI'nin açık modelleri seçilebilir; ayrıca donanıma uygun modeller önerilebilir
  • Sohbet arayüzü şu özellikleri sunar
    • Akış yanıtları ve mesaj başına performans metrikleri
    • Markdown ve kod sözdizimi vurgulama
    • Görsel girişi
  • Gerçek zamanlı performans ölçümü ile saniye başına token sayısı, bellek baskısı, ısınma durumu ve ilk token üretim süresi görülebilir
  • MLX-VLM tabanlıdır ve M serisinin birleşik belleği ve Metal yapısına göre ayarlanmıştır
  • LLM sohbeti, görsel açıklama üretimi, video özetleme, kod otomatik tamamlama, ses dönüştürme ve üretimi destekler
  • Hesap·kredi·abonelik gerektirmez ve kullanıcı verilerini satmaz

Geliştirici araçları entegrasyonu ve açık kaynak ilkesi

  • Nativ'in tek yerel endpoint'i üzerinden mevcut kodlama ajanları, Mac'te çalışan yerel modellere bağlanabilir
    • Pi
    • Codex
    • Claude Code
    • Hermes
    • OpenCode
  • Masaüstü uygulaması, model yükleyici ve performans ölçüm grafiklerini içeren tüm kod açıktır; incelenebilir, fork edilebilir ve Pull Request gönderilebilir
  • MIT lisansı ile dağıtılır; VC yol haritası, enterprise düzeyi veya prompt'ları eğitim verisine dönüştüren dark pattern'ler içermez
  • Tüm model kütüphanesi Hugging Face üzerinde görülebilir

1 yorum

 
GN⁺ 1 일 전
Hacker News görüşleri
  • Bu MIT lisanslı uygulama, popüler kütüphane MLX-VLM'in bakımını yapan Prince Canuma tarafından yapılmış. MLX-VLM, Apple cihazlarda llama.cpp'den daha hızlı çıkarım sunabildiği için uzun süredir LM Studio gibi araçlarda bağımlılık olarak kullanılıyor
    MLX ekosistemi CUDA'dan küçük olsa da yeni modelleri, özellikle de çok modlu modelleri — görüntü, konuşma tanıma, konuşma sentezi ve video üretimi gibi alanlarda — çok hızlı destekliyor. mlx-audio-swift'e de bakmaya değer; bu tür modellerin bu arayüze entegre edilmesi de şaşırtıcı olmaz
    Açılış sayfasında vibe coding izleri olsa da uygulamanın büyük kısmı Swift ile yazılmış, bu yüzden bu çıkarım yığınını iPad ve iPhone'a taşımak da kolay görünüyor

    • Bugünlerde Hugging Face'te neredeyse tüm popüler modellerin MLX sürümü var. Örneğin Qwen 3.6 35B-A3B ana sayfasında quantization bağlantılarını takip edip itibarlı ve popüler bir MLX varyantı seçmek yeterli
    • Alan adında blaizzy görmek hoşuma gitti. Çünkü Prince Canuma'nın MLX ile ilgili işleri sürekli çok yüksek kalitede oldu
    • GitHub deposunda yakında yalnızca ses ve yalnızca görüntü üretimi modelleri için destek ekleneceği yazıyor. Prince Canuma, X ve GitHub issue'larında çok hızlı yanıt veriyor; ben de ses klonlama için mlx-audio ve mlx-community/Qwen3-TTS-12Hz-1.7B-Base-bf16'i neredeyse her gün kullanıyorum
    • Aklıma ilk gelen soru Unsloth ile farkının ne olduğu oldu
    • mlx-vlm, vllm veya sglang gibi araçlara kıyasla modern sampler desteğinde çok zayıf, bu yüzden geçiş yapmak tersine zararlı olabilir. Ben min_p makalesi'nin yazarlarından biriyim; llama.cpp çok daha üstün top-n-sigma desteği sunarken min_p en iyi seçenekse, daha hızlı olsa bile geçmek için bir neden yok
      Modern sampler desteği için makale 1, makale 2 ve makale 3'e bakılabilir
  • Frontier ifadesi fazla kullanılıyor gibi geliyor. Bunu, şu anki Fable gibi en üst düzey modeller anlamında sanıyordum; ama böyle modeller devasa RAM ve pahalı GPU'lar gerektirdiği için kendi başına barındırmak zor değil mi?

    • Burada kastedilenin, çok amaçlı optimizasyon problemindeki en iyi çözümler kümesi olan Pareto frontier olduğu anlaşılıyor. Zeka ve fiyat açısından bakıldığında, aynı ya da daha yüksek zekayı daha ucuza sunan bir model yoksa ve aynı ya da daha düşük fiyata daha zeki bir model de yoksa frontier'dadır
      Artificial Analysis grafiği bunu sezgisel olarak gösteriyor. Örneğin DeepSeek V4 Pro kadar zeki olup daha ucuz bir model olmadığı için frontier model sayılabilir. Pareto frontier üzerindeki çözümler, başka bir şeyden vazgeçmeden daha iyi bir alternatife değiştirilemeyen, kendi sınıfının en iyileridir
    • Bu kullanım kafa karıştırdığı için katılmak zor, ama genel olarak birden fazla frontier olabilir; bunlar arasında açık ağırlıklı küçük yerel modellerin frontier'ının en önemli ve ilginç olan olduğunu düşünüyorum
      Gemma 4 12B'yi her kullandığımda, küçük, akıllı ve verimli olmasına rağmen yapay zeka sektöründeki enerjinin tamamen yanlış yöne aktığını hissediyorum. Araştırma bütçesi 16GB birleşik belleğe sahip sistemlerde çalışan modelleri geliştirmeye odaklansa, önemli ilerlemeler mümkün olabilir
      Qwen 3.6 ve BottleCap'in 27B ince ayar modeli de iyi, ama küçük Gemma 4 modelinin şaşırtıcı performansı yeterince bilinmiyor. Bu sitenin Qwen 3.6 27B için frontier demesi uygunsuz görünebilir, ama performans açısından da tamamen alakasız sayılmaz
    • Frontier; parametre sayısı, görev bazlı performans, aynı donanımda token üretim hızı ve etkin bellek gereksinimi gibi birçok boyuttaki en iyi kombinasyon olarak tanımlanır. Mevcut seçenekler içinde bir metriği iyileştirmek için en az bir başka metriği kötüleştirmek zorunda olduğunuz modeller frontier'dadır
    • Frontier bir eğridir; Pareto front anlamına gelir
    • Açık kaynak ile en ileri seviye arasındaki fark Kimi K3 gibi modellerle azalıyor, ama Kimi K3'ün parametre sayısı 2 trilyonu aşıyor. Sıradan bir Mac'te gerçekten çalıştırılabilen Gemma 4 gibi modeller aynı sınıfta değil
  • Ana sayfanın, sanki LM Studio gibi mevcut uygulamalar yokmuş gibi tanıtılması şaşırtıcı. İlk bakışta farkın ne olduğu belirsiz ve Open WebUI da anılmıyor
    Ben MacBook Pro'mda Open WebUI ve DS4 ile haftalardır DeepSeek V4 Flash'ı yerelde çalıştırıyorum

    • LM Studio, Nativ geliştiricisinin yayımladığı kodu temel alan kapalı kaynak bir yazılım
    • LM Studio da aynı işi yapıyor ama açık kaynak değil. Bu yüzden Nativ'in sunduğu bir farklılaştırıcı var
    • “Duyduğunuz diğer yerel AI uygulamaları, sahip olmadıkları açık kaynak motorlar üzerine kurulmuş proprietery kabuklardır” ifadesi, LM Studio'yu dolaylı biçimde hedef alıyor
    • MacBook'un özelliklerini merak ettim. Benim Strix Halo'mda DeepSeek V4 Flash, ajan kullanımı için fazla yavaş
  • Artık frontier, Claude Code kullanıcılarının bileceği load-bearing gibi aşırı kullanılan bir kelime oldu. Özellikle de bu uygulama gerçek üst düzey modelleri Mac'te yerelde çalıştıramıyorken, artık kullanılmasa iyi olur

  • “Kimsenin yapmadığı şeyi yapıyoruz, çünkü açık kaynağız” gibi pazarlama dili hoşuma gitmiyor. Ben açık kaynak olan oMLX kullanıyorum ve Nativ'in tüm özelliklerini sunduğu anlaşılıyor
    Yok sayılan mevcut açık kaynak rakiplerle düzgün bir karşılaştırma görmek isterdim

    • Muhtemelen LM Studio gibi seçeneklerin neden açık kaynak olmadığını anlatmaya çalışıyordu
  • Küçük yerel modellerin pratikte tam olarak nerede kullanıldığını merak ediyorum. Oldukça yetenekli hale geldiler ama eğlence için yapılan bazı oyuncak projeler dışında gerçek işleri emanet etmek için hâlâ güven vermiyorlar.
    Bunların gerçekten kodlama ajanlarında kullanılıp kullanılmadığını, yoksa daha çok başka amaçlara mı hizmet ettiğini merak ediyorum.

    • OpenCode'da Qwen3.6 27B'nin ürettiği kodu prodüksiyona dağıttığım oldu. Bilgi kapsamı Opus kadar geniş değil ama prompt ve çevredeki koddan değişiklikleri tamamen çıkarabiliyorsa çok iyi çalışıyor.
      Blackwell GPU'lar için yüksek performanslı çıkarım motoru gibi uzmanlık gerektiren kodu sıfırdan yazmak zor, ancak mevcut bir projeye kullanım senaryosu ekleyen sıradan bir PR için Sonnet'e yakın seviyede. Önerilen temperature ve top-p ayarları, aşırıya kaçmayan quantization ve en az 150 bin token bağlam gibi doğru kurulum gerekiyor.
    • Kişisel bir ajanın bellek grafiği çıkarımı için Gemma 4'ü yerelde kullanıyorum. Mesajları konu, kaynak, olgu, varlık gibi parçalara ayırıp NLEmbeddings ile arama için kullanılan bir grafa koyuyor.
      Hedef ajan DeepSeek V4 Flash kullanıyor; yerel model sohbet ajanı olarak kullanmak için yavaş ama bellek çıkarımında oldukça iyi çalışıyor ve her konuşma turundaki API kullanımını azaltıyor.
    • Kodlama ajanı olarak kullanmıyorum ama metin dönüştürme·özetleme·bilgi çıkarımı için çok faydalı. Zaten ücretli modellere aboneliğiniz varsa gizlilik dışında özel bir kazanç olmayabilir ama bu da küçümsenecek bir şey değil.
    • Küçük modeller de bağımlılık güncellemeleri, merge conflict çözme, --help, Markdown, README yazımı gibi tekrarlı işleri rahatlıkla hallediyor. Başarısız olsa bile git restore ile geri alabilir veya PR'ı reddedip daha iyi bir modele yeniden yaptırabilirsiniz.
    • Qwen35ba3b, nispeten sıradan donanımlarda bile büyük ölçekli veri temizleme yapabiliyor. İki adet 3090 GPU ile şimdiden yaklaşık 100 milyar token işledim.
  • LM Studio'ya göre neyin daha iyi olduğunu ve ayrıca MTP modellerini de çalıştırıp çalıştırmadığını merak ediyorum. Bildiğim kadarıyla MTP modelleri GGUF formatında.

  • Rapid MLX ile MLX'i denedim ama Qwen sürekli takılıyor ve aynı şeyleri tekrar ediyordu. llama.cpp'ye geçince MTP'de token üretimi daha hızlıydı ve model de daha stabildi.
    Başkaları MLX ile llama.cpp'yi karşılaştırınca nasıl sonuçlar aldı merak ediyorum.

    • M1 Max'te MLX'in avantajını neredeyse hiç görmedim. Apple Neural Engine değişiklikleri sayesinde M3 ve sonrasında kazanç daha büyük olabilir.
      Denediğim modellerde llama.cpp'nin GGUF performansı daha iyi olan durumlar da vardı. Gemma 4'ün MTP'si çok değerli değildi ama Qwen 3.6 MoE'de ölçülebilir bir fark vardı; daha yeni donanımlarda daha anlamlı olabilir.
    • İki farklı zamanda MLX'i iki kez denedim ama her seferinde llama.cpp'den belirgin biçimde daha düşük performans gösterdi.
  • Bu kullanım için uygun orta seviye Mac özelliklerini merak ediyorum. 64GB M5 Pro ile ucuz bir M5 Air alıp bulut token maliyetini ödeme seçeneği arasında kararsızım.
    Daha zayıf modelleri yerelde çalıştırmak için 2.000~3.000 dolar daha harcamak yerine hatırı sayılır miktarda bulut token'ı satın alabilirsiniz.

    • M1 Max 64GB ile bile bu tür modellerin epey çoğunu çalıştırabilirsiniz.
  • Neden ds4 üzerinde DeepSeek V4 çalıştırılmadığını merak ediyorum. Sonuçların oldukça iyi olacağını sanıyorum.

    • Görünüşe göre Nativ, DwarfStar benzeri SSD streaming desteği sunmuyor.