- Nativ, Apple Silicon Mac'lerde açık yapay zeka modellerini indirip hesap·abonelik·bulut olmadan çalıştıran MIT lisanslı açık kaynak bir uygulamadır
- Google, Cohere, Liquid AI ve diğerlerinin modellerini sunar, Mac donanımına uygun modeller önerir ve tüm yanıtları yerel olarak üretir
- Sohbette akış, Markdown, kod vurgulama ve görsel girişi destekler; saniye başına token sayısı ve bellek baskısı gibi performans durumları gerçek zamanlı izlenebilir
- MLX-VLM ile M serisinin birleşik belleği·Metal için optimize edilmiştir; dil, görsel, video, kod ve ses işlerini işler
- Yerel model sunucusunu Pi, Codex, Claude Code, Hermes, OpenCode ile bağlayabilir ve uygulama ile model yükleyicinin tüm kodu da açıktır
Mac için optimize edilmiş yerel model çalıştırma
- Apple Silicon M1 ve üzerini destekleyen evrensel bir macOS uygulaması olarak, bulut veya ek dönüştürme katmanı olmadan gerçek modelleri Mac'te çalıştırır
- Seçilmiş kütüphaneden Google, Cohere ve Liquid AI'nin açık modelleri seçilebilir; ayrıca donanıma uygun modeller önerilebilir
- Sohbet arayüzü şu özellikleri sunar
- Akış yanıtları ve mesaj başına performans metrikleri
- Markdown ve kod sözdizimi vurgulama
- Görsel girişi
- Gerçek zamanlı performans ölçümü ile saniye başına token sayısı, bellek baskısı, ısınma durumu ve ilk token üretim süresi görülebilir
- MLX-VLM tabanlıdır ve M serisinin birleşik belleği ve Metal yapısına göre ayarlanmıştır
- LLM sohbeti, görsel açıklama üretimi, video özetleme, kod otomatik tamamlama, ses dönüştürme ve üretimi destekler
- Hesap·kredi·abonelik gerektirmez ve kullanıcı verilerini satmaz
Geliştirici araçları entegrasyonu ve açık kaynak ilkesi
- Nativ'in tek yerel endpoint'i üzerinden mevcut kodlama ajanları, Mac'te çalışan yerel modellere bağlanabilir
- Pi
- Codex
- Claude Code
- Hermes
- OpenCode
- Masaüstü uygulaması, model yükleyici ve performans ölçüm grafiklerini içeren tüm kod açıktır; incelenebilir, fork edilebilir ve Pull Request gönderilebilir
- MIT lisansı ile dağıtılır; VC yol haritası, enterprise düzeyi veya prompt'ları eğitim verisine dönüştüren dark pattern'ler içermez
- Tüm model kütüphanesi Hugging Face üzerinde görülebilir
1 yorum
Hacker News görüşleri
Bu MIT lisanslı uygulama, popüler kütüphane MLX-VLM'in bakımını yapan Prince Canuma tarafından yapılmış. MLX-VLM, Apple cihazlarda llama.cpp'den daha hızlı çıkarım sunabildiği için uzun süredir LM Studio gibi araçlarda bağımlılık olarak kullanılıyor
MLX ekosistemi CUDA'dan küçük olsa da yeni modelleri, özellikle de çok modlu modelleri — görüntü, konuşma tanıma, konuşma sentezi ve video üretimi gibi alanlarda — çok hızlı destekliyor. mlx-audio-swift'e de bakmaya değer; bu tür modellerin bu arayüze entegre edilmesi de şaşırtıcı olmaz
Açılış sayfasında vibe coding izleri olsa da uygulamanın büyük kısmı Swift ile yazılmış, bu yüzden bu çıkarım yığınını iPad ve iPhone'a taşımak da kolay görünüyor
blaizzygörmek hoşuma gitti. Çünkü Prince Canuma'nın MLX ile ilgili işleri sürekli çok yüksek kalitede oldumlx-community/Qwen3-TTS-12Hz-1.7B-Base-bf16'i neredeyse her gün kullanıyorumModern sampler desteği için makale 1, makale 2 ve makale 3'e bakılabilir
Frontier ifadesi fazla kullanılıyor gibi geliyor. Bunu, şu anki Fable gibi en üst düzey modeller anlamında sanıyordum; ama böyle modeller devasa RAM ve pahalı GPU'lar gerektirdiği için kendi başına barındırmak zor değil mi?
Artificial Analysis grafiği bunu sezgisel olarak gösteriyor. Örneğin DeepSeek V4 Pro kadar zeki olup daha ucuz bir model olmadığı için frontier model sayılabilir. Pareto frontier üzerindeki çözümler, başka bir şeyden vazgeçmeden daha iyi bir alternatife değiştirilemeyen, kendi sınıfının en iyileridir
Gemma 4 12B'yi her kullandığımda, küçük, akıllı ve verimli olmasına rağmen yapay zeka sektöründeki enerjinin tamamen yanlış yöne aktığını hissediyorum. Araştırma bütçesi 16GB birleşik belleğe sahip sistemlerde çalışan modelleri geliştirmeye odaklansa, önemli ilerlemeler mümkün olabilir
Qwen 3.6 ve BottleCap'in 27B ince ayar modeli de iyi, ama küçük Gemma 4 modelinin şaşırtıcı performansı yeterince bilinmiyor. Bu sitenin Qwen 3.6 27B için frontier demesi uygunsuz görünebilir, ama performans açısından da tamamen alakasız sayılmaz
Ana sayfanın, sanki LM Studio gibi mevcut uygulamalar yokmuş gibi tanıtılması şaşırtıcı. İlk bakışta farkın ne olduğu belirsiz ve Open WebUI da anılmıyor
Ben MacBook Pro'mda Open WebUI ve DS4 ile haftalardır DeepSeek V4 Flash'ı yerelde çalıştırıyorum
Artık frontier, Claude Code kullanıcılarının bileceği
load-bearinggibi aşırı kullanılan bir kelime oldu. Özellikle de bu uygulama gerçek üst düzey modelleri Mac'te yerelde çalıştıramıyorken, artık kullanılmasa iyi olur“Kimsenin yapmadığı şeyi yapıyoruz, çünkü açık kaynağız” gibi pazarlama dili hoşuma gitmiyor. Ben açık kaynak olan oMLX kullanıyorum ve Nativ'in tüm özelliklerini sunduğu anlaşılıyor
Yok sayılan mevcut açık kaynak rakiplerle düzgün bir karşılaştırma görmek isterdim
Küçük yerel modellerin pratikte tam olarak nerede kullanıldığını merak ediyorum. Oldukça yetenekli hale geldiler ama eğlence için yapılan bazı oyuncak projeler dışında gerçek işleri emanet etmek için hâlâ güven vermiyorlar.
Bunların gerçekten kodlama ajanlarında kullanılıp kullanılmadığını, yoksa daha çok başka amaçlara mı hizmet ettiğini merak ediyorum.
Blackwell GPU'lar için yüksek performanslı çıkarım motoru gibi uzmanlık gerektiren kodu sıfırdan yazmak zor, ancak mevcut bir projeye kullanım senaryosu ekleyen sıradan bir PR için Sonnet'e yakın seviyede. Önerilen temperature ve top-p ayarları, aşırıya kaçmayan quantization ve en az 150 bin token bağlam gibi doğru kurulum gerekiyor.
Hedef ajan DeepSeek V4 Flash kullanıyor; yerel model sohbet ajanı olarak kullanmak için yavaş ama bellek çıkarımında oldukça iyi çalışıyor ve her konuşma turundaki API kullanımını azaltıyor.
--help, Markdown, README yazımı gibi tekrarlı işleri rahatlıkla hallediyor. Başarısız olsa bilegit restoreile geri alabilir veya PR'ı reddedip daha iyi bir modele yeniden yaptırabilirsiniz.LM Studio'ya göre neyin daha iyi olduğunu ve ayrıca MTP modellerini de çalıştırıp çalıştırmadığını merak ediyorum. Bildiğim kadarıyla MTP modelleri GGUF formatında.
Rapid MLX ile MLX'i denedim ama Qwen sürekli takılıyor ve aynı şeyleri tekrar ediyordu. llama.cpp'ye geçince MTP'de token üretimi daha hızlıydı ve model de daha stabildi.
Başkaları MLX ile llama.cpp'yi karşılaştırınca nasıl sonuçlar aldı merak ediyorum.
Denediğim modellerde llama.cpp'nin GGUF performansı daha iyi olan durumlar da vardı. Gemma 4'ün MTP'si çok değerli değildi ama Qwen 3.6 MoE'de ölçülebilir bir fark vardı; daha yeni donanımlarda daha anlamlı olabilir.
Bu kullanım için uygun orta seviye Mac özelliklerini merak ediyorum. 64GB M5 Pro ile ucuz bir M5 Air alıp bulut token maliyetini ödeme seçeneği arasında kararsızım.
Daha zayıf modelleri yerelde çalıştırmak için 2.000~3.000 dolar daha harcamak yerine hatırı sayılır miktarda bulut token'ı satın alabilirsiniz.
Neden ds4 üzerinde DeepSeek V4 çalıştırılmadığını merak ediyorum. Sonuçların oldukça iyi olacağını sanıyorum.