1 puan yazan GN⁺ 2 시간 전 | 1 yorum | WhatsApp'ta paylaş
  • Claude uygulamaları geliştirmek için pratik kılavuz ve örnekleri bir araya getirerek ajan oluşturmadan RAG, araç kullanımı, multimodal ve değerlendirmeye kadar geniş bir kapsam sunar
  • Claude Agent SDK ve Managed Agents örnekleri; çoklu ajan koordinasyonu, oturum yönetimi, dağıtım, arıza müdahalesi, zafiyet tespiti ve kullanıcı belleği gibi operasyonel kalıpları içerir
  • Uzun süre çalışan ajanlar için bellek ve bağlam sıkıştırma, programatik araç çağırma, embedding tabanlı araç arama ve asenkron alt ajan teknikleri sunar
  • RAG, SQL üretimi, bilgi grafikleri, belge özetleme, görüntü ve ses işleme yanında değerlendirme, maliyet, gözlemlenebilirlik ve güvenlik önlemlerini de uygulama örnekleriyle gösterir
  • Docker, Modal ve Kubernetes dağıtımı, prompt sürüm yönetimi ve geri alma, insan onayı ve maliyet analizini kapsayarak geliştirme ve üretim operasyonlarının geneline uygulanabilir

Ajan değerlendirmesi ve güvenlik önlemleri

Çoklu ajan ve iş akışı kalıpları

  • Asenkron çoklu ajan koordinasyonu: Paylaşılan bir hub üzerinden eş mesajları alıp gönderen sabit N ajanlı ekipler ile dinamik olarak oluşturulan asenkron alt ajanların mesajlaşma ve yaşam döngüsü yapısını ele alır
  • Çoklu ajan: uzman ekip koordinasyonu: Koordinatör; web araması araştırmacısını, dosya inceleme sorumlusunu ve kural tabanlı fiyatlandırma sorumlusunu yönlendirerek bir satış teklifi hazırlar
    • multiagent alanını, thread_created ve thread_message_received olaylarını, role göre araç kapsamı kısıtlamalarını içerir
  • Outcomes: kendi çalışmasını doğrulayan ajan: Yazar, alıntılı araştırma özeti oluşturur; durumsuz puanlayıcı URL’leri ve alıntıları denetler, ardından geçene kadar düzenleme yapan bir puanlama ve iyileştirme döngüsü kurar
    • user.define_outcome, span.outcome_evaluation_* olaylarını ve puanlayıcının çalıştırabileceği değerlendirme ölçütlerinin nasıl yazılacağını ele alır
  • Temel iş akışları: Maliyet veya gecikmeyi performansla takas eden üç çoklu LLM kalıbı sunar
  • Değerlendirici-optimize edici: Bir LLM’in sonuç ürettiği, diğer LLM’in değerlendirme geri bildirimi verdiği yinelemeli bir yapıdır
  • Koordinatör-çalışanlar: Merkezi LLM işi dinamik olarak devreder ve çalışan LLM’lerin sonuçlarını sentezler
  • Haiku’yu alt ajan olarak kullanma: Haiku alt ajanı finansal raporları çıkarır ve Opus sonuçları sentezler

Claude Agent SDK

  • Tek satırlık araştırma ajanı: Claude Code SDK ve WebSearch ile otonom bir araştırma ajanı oluşturur
  • Özel kalem müdürü ajanı: Alt ajanlar, hook’lar, çıktı stili ve planlama moduyla çoklu ajan sistemi oluşturur
  • Gözlemlenebilirlik ajanı: MCP sunucusuyla ajanı harici sistemlere bağlayarak GitHub izleme ve CI iş akışlarını işler
  • Site güvenilirliği ajanı: Okuma-yazma MCP araçlarıyla arızaları teşhis edip giderir ve olay sonrası raporu hazırlar
  • OpenAI Agents SDK’den geçiş: Maliyet onayı ajanı örneği üzerinden araçları, guardrail’leri, oturumları ve handoff’ları Claude Agent SDK temel bileşenleriyle eşleştirir
  • Oturum tarayıcısı oluşturma: Diskteki Agent SDK oturumlarını listeler ve görüntüler; yeniden adlandırma, etiketleme ve fork etme yaparak ayrı bir sohbet geçmişi ayrıştırıcısı olmadan kenar çubuğu oluşturur
  • Zafiyet tespit ajanı: C hedefi için tehdit modellemesi yapar; yerleşik dosya araçlarıyla bellek güvenliği hatalarını bulur ve yapılandırılmış raporla sınıflandırır
  • Ajan barındırma: Aynı konteyner imajını ve HTTP arayüzünü koruyarak araştırma ajanını Docker, Modal ve Kubernetes olmak üzere üç aşamada dağıtır

Claude Managed Agents

Bellek ve context yönetimi

Araç kullanımı ve dış entegrasyonlar

Arama·RAG·bilgi işleme

Multimodal·ses·belge

Yanıt, akıl yürütme ve prompt

Skills ve iş uygulamaları

LlamaIndex ajan kalıpları ve topluluk katkıları

  • ReAct ajanı: LlamaIndex ile araç tabanlı akıl yürütme ve eylem iş akışları yürüten bir ReAct ajanı oluşturur
  • Yeni Cookbook fikirleri için topluluk katkıları kabul edilir ve katkı rehberi sunulur

1 yorum

 
GN⁺ 2 시간 전
Hacker News yorumları
  • Dürüst olmak gerekirse, neredeyse tüm AI kullanım rehberleri anlamsız görünüyor. Yöntemi doğrudan AI'a sorabilirsiniz; AI'ı nasıl kullanacağınız konusu ise ya harness'e gömülmeli ya da küçük bir özellik olarak Anthropic/OpenAI tarafından uygulanması beklenmeli.
    Ajan iş akışları, bellek yönetimi ve harness mühendisliği gibi şeylerin çoğu da büyük ölçüde gösteriş amaçlı geliyor

    • 2023'te prompt engineering'in yeni yazılım mühendisliği olacağı söylenirken CoT, ReAct vb. şeyleri hevesle öğrenmiştim, ama 2024'te bunların çoğu çıkarım modelleri ve harness güncellemeleri yüzünden gereksiz hale geldi.
      En yeni AI teknikleri ve framework'leri de 3 aylık döngülerle özümseniyor ya da yerleri dolduruluyor, bu yüzden yatırım yapmaya pek değmez görünüyor
    • Model yetenekleri büyüdükçe çevresindeki araçları kendi içine alıyor, bu yüzden bu araçların raf ömrü çok kısa. Aynı örüntüyü zaten defalarca gördük
    • Vercel, araç çağrılarındansa açık talimatlar içeren tek bir Markdown dosyasının daha etkili olabileceğini ve sıkıştırılmış indeks kullanımını da anlattı. Ben de araç çağrılarını mükemmelleştirmek için saatler harcadım ama benzer sonuçlar yaşadım; sonrasında sadece Claude.md, Agents.md ve gerekirse Project.md kullanıyorum
    • LLM'ler, bir harness içinde başka LLM'leri kullanma konusunda çok kötü görünüyor. Kendi haline bırakırsanız .md dosyalarına her türlü şeyi doldurup bağlamı kirletebiliyorlar.
      Sonuçta LLM'in bu tür materyalleri araması gerekiyor, yani bunlar insanlardan çok LLM'ler için hazırlanmış olabilir
    • Herkes MCP'yi överken skills daha verimli bir alternatif oldu ve agresif bağlam yönetimi de uzun bağlam pencereleri ile ajan yetenekleri nedeniyle daha az önemli hale geldi. İyi bir teknikse bir sonraki sürüme gömülme ihtimali yüksek.
      Bu yüzden gerçekten gerekmedikçe eklentilerden ve MCP'den kaçınıp sadık prompt'lar kullanıyorum. Böylece eski optimizasyonları LLM'e zorla dayatıp gelişimi engellemekten kaçınabildim
  • Frontend estetik prompt'lama için önce/sonra görselleri gülünç derecede kötü. Bu skill'in tasarımı gerçekten iyileştirip iyileştirmediğini sanki kimse kontrol etmemiş

    • Gösterilen sonuçların hepsi iyileşme değil gerileme gibi görünüyor
    • Birçok rehber, tipik bir LLM cargo cult yaklaşımıyla frontend tasarım skill'ini körü körüne öneriyor, ama gerçek içerik insanların düşündüğünden farklı
    • Estetik uygulanmış site 2000'lerin başındaki keygen'lere benziyor; bir tek tekno müzik eksik
    • Gerçekten oldukça utanç verici bir sonuç. Neredeyse “siyah arka plan ve korkunç derecede geniş font kullan” seviyesinde
    • Etkili olduğu izlenimi vermek için önce/sonra farkını en üst düzeye çıkaran örnekleri mi seçtiler diye merak ediyorum. Bana göre tüm örneklerde uygulama öncesi tasarım daha iyi
  • Frontend estetik prompt'lama sonuçları, uygulanmadan önce düz; uygulandıktan sonra ise gradient eklenmiş bir düzlük gibi

    • Bazı örneklerde öncesi daha iyi ve gerçekten iyileşti denebilecek tek şey blog örneği
    • Hatta estetik uygulanmamış sürümü daha çok beğeniyorum
    • AI tasarımı sayfaların tipik özelliği olan BÜYÜK HARFLİ etiketler de eklenmiş
  • Evde Matt Pocock'un skills'lerini kullanıyorum ve oldukça iyiler. Otomatik çağrı yerine kullanıcının doğrudan çağırması için tasarlanmışlar, bu yüzden sadece var olmaları bile fazla bağlam tüketmiyor.
    Programcıyı nihai sonuçtan dışlamak yerine, sonucu daha derin düşünmeye yönlendiriyorlar. grill skills gerçek gereksinimleri netleştirmeye, prototype skill ise ancak bizzat deneyimleyerek karar verilebilecek zor noktaları keşfetmeye yardımcı oluyor

  • OpenAI Cookbook da faydalı. Diğer AI laboratuvarları da GitHub ve Hugging Face üzerinde sık sık örnekler ve cookbook'lar yayımlıyor, bu yüzden takip etmeye değer

  • Kodlama ajanları, backend'e kıyasla frontend'de çok daha sık hatalı, bozuk, eksik ve tuhaf özellikler üretiyor. Bunun nedeni iki alan arasındaki doğrulanabilirlik farkı gibi görünüyor ve temel test paketleri tek başına yeterli değil.
    Garry Tan'in gstack gibi bir yaklaşımı uygun görünüyor, ama benimsemeye yetecek kadar olgun mu emin değilim. Gemini 3.5 Flash'ın frontend işlerinde Opus veya GPT-5.5'tan daha iyi olduğu da söyleniyor; bunun multimodal yeteneklerden mi yoksa Chrome anlayışından mı kaynaklandığını, gerçek kullanıcı değerlendirmelerini merak ediyorum

    • Claude'un Front End Design skill'i gibi ajanla birleşik seçenekler de olabilir, ama bizzat kullanmadım. Magic Patterns, işlevleri ve kısıtları bilen bir ajan tarafından yönlendirildiğinde özellikle ilk prototip üretimi konusunda çok başarılı.
      Yaratıcı sonuçlar için aktif şekilde talep vermeniz gerekiyor ama standart frontend tasarımları için iyi. Yine de bunu rastgele özellik eklemek veya düzeltmek için değil, fikirleri denemek amacıyla kullanıyorum
    • Ajanlar, karmaşık eşzamansız durum güncellemelerini bağlam içinde ifade etmekte zorlandıkları için bu işleri iyi yapamıyor. Buna karşılık karmaşık bileşenleri bağımsız biçimde yapmakta veya animasyon gibi düşük bağlılık gerektiren özellikleri uygulamakta fena değiller
  • Bunun LLM ile makul ve gerçekten pişirilebilir tarifler üreten gerçek bir yemek kitabı olduğunu sanmıştım, ama daha o aşamada değiliz galiba

    • 1 yılı aşkın süredir ayda birkaç kez LLM yardımıyla yemek yapıyorum ve on denemenin dokuzunda iyi sonuç aldım. Model ağırlıklarına gömülü ortalama tarifler de genelde sağlam oluyor; “X malzemesi yok” ya da “bunu vejetaryene çevir” gibi malzeme ikamelerinde de çok iyiler.
      Tarifi aldıktan sonra bir iki kez “bunu daha lezzetli hale getir” deyip çıkan sonuca bakmak da eğlenceli
    • ChatGPT ile İtalyan mutfağı öğreniyorum ve birkaç deneme-yanılma dışında şaşırtıcı derecede iyi çalışıyor
    • Bu yıl Gemini ile birkaç kez yemek yaptım ve beklediğimden iyiydi. “Kilerimde şu malzemeler var ve keto diyet istiyorum” deyip ardından sohbet ederek seçenekleri daraltabiliyorsunuz
    • Ben de dijital öğün planlama aracı beklemiştim
  • Bunun Claude ile tarif üreten yeni bir ürün olduğunu sanmıştım

    • Claude projelerini tarifler için kullanıyorum; menü önermede ve kilerdeki malzemelere göre tarifleri uyarlamada harika, bu yüzden ben de böyle bir ürün bekledim
    • Aslında bu amaçla da kullanılabilir
  • Cookbook uygulanmadan önceki ve sonraki tasarımlar da her iki tarafta vibe coding ile yapılmış gibi görünüyor. Kesin nedeni söyleyebilecek kadar tasarımcı değilim ama Claude'un kullandığı stil aralığı biraz sınırlı gibi.
    Gerekli değişiklikleri daha spesifik tanımlarsanız bu eğilim bastırılabilir belki

  • En azından UI bir kez gözden geçirilmeliydi. Basit tablo aralığını bile düzgün ayarlayamamışlar