1 puan yazan catch88 7 시간 전 | Henüz yorum yok. | WhatsApp'ta paylaş

Yerel ajanlarla (Hermes/OpenClaw) konuşmak için Telegram sekmesini bütün gün açık tutmaktan hoşlanmadığım için, onun yerini alacak bir avatar yaptım. Monitörde sürekli duran iki görüntülü görüşme tarzı pencereyle (avatar + sohbet), ajan yanıtlarını okutmak yerine onları "oynatıyor".

  • Avatar çalışma anında GPU kullanmıyor. Gerçek zamanlı çıkarım yerine, önceden render edilmiş yaklaşık 30 klip LLM çıktısındaki duygu etiketlerine göre seçilip oynatılıyor. [working] olduğunda gözlük takıp not alıyor; [confirm] etiketinde onay/iptal çıkıyor ve geri alınamaz işlemlerden önce soruyor; kod/log ise sesli okunmayıp kart olarak render ediliyor. GPU tamamen modele kalıyor.

  • Ajanın yerini almıyor, bağlayıcı olarak ekleniyor. Ağ geçidi, uygulamanın açtığı yerel WebSocket'e dial-out yapan bir yapıda olduğu için, ajan açısından bakıldığında sadece bir kanal daha eklenmiş oluyor. Ajanın slash komut menüsünü de aynen alıp gösteriyor.

  • Çift yönlü ses: Edge TTS (yerel motorla değiştirilebilir) + Silero VAD·faster-whisper.

  • Open-core (MIT). Ücretsiz başlangıç avatarı paketle birlikte geliyor; bu yüzden klonladığınız anda çalışıyor. O avatarın kendisi de yalnızca ücretsiz yerel araçlarla (Animagine XL → HunyuanVideo 1.5 i2v) üretildiği için, belgelerdeki üretim yönteminin gerçekten işe yaradığını kanıtlayan bir örnek de oluyor.

Bunu yaparken öğrendiğim şey: video difüzyon modellerinde ince yüz ifadelerini prompt ile üretmek, düşündüğümden daha zor. Wan 2.2 5B, ağzı iyice açılan bir gülümsemeyi yapabiliyor ama "endişe" ya da "öfke" gibi kaşlarla ifade edilen duygularda sonuç dümdüz ifadesiz kalıyordu; HunyuanVideo 1.5'e (8.3B aşama damıtmalı) geçince ise aynı 12GB kartta daha hızlı çalışırken yüz ifadeleri de düzgün çıktı.

Şu anda yalnızca Windows derlemesi var ve gerçek zamanlı lip sync yok (önceden render yaklaşımının getirisi/götürüsü).

Henüz yorum yok.

Henüz yorum yok.