1 puan yazan GN⁺ 2 시간 전 | 1 yorum | WhatsApp'ta paylaş
  • Google DeepMind, görsel ve dil girdilerini eyleme dönüştürerek insansı robotları ayaklarından parmak uçlarına kadar kontrol eden, hassas manipülasyonu ve robotlar arası iş birliğini destekleyen Gemini Robotics 2 model ailesini duyurdu
  • Model ailesi; tüm vücut kontrolü için bir VLA olan Gemini Robotics 2, uzun süreli görevleri planlayıp denetleyen Gemini Robotics ER 2 ve robot üzerinde yerel olarak çalışan Gemini Robotics On-Device 2’den oluşuyor
  • İnsansı robotlar yürüme, eğilme ve nesne taşımayı birleştirebiliyor; 22 serbestlik dereceli 5 parmaklı el ile düğüm atabiliyor veya fermuarlı poşetleri kapatabiliyor; birden fazla robot, tek başına çözmesi zor görevlerde iş birliği yapabiliyor
  • On-Device 2, ağ bağlantısı olmadan çalışıyor ve genellikle 200’den az örnek ile birkaç saatlik adaptasyon süreciyle form, sensör ve serbestlik derecesi açısından büyük ölçüde farklı yeni çift kollu robotlara uygulanabiliyor
  • ER 2, Google AI Studio’da ve Gemini Enterprise Agent Platform’da kapalı önizleme olarak sunuluyor; VLA ve On-Device modelleri erken erişim ortaklarına açık, ancak hareket hızı ve hassasiyet hâlâ iyileştirme gerektiriyor

Farklı rollere sahip üç robot modeli

  • Mevcut robotlar çoğunlukla dar kapsamlı ve tekrarlı görev dizilerini önceden programlama veya uzaktan kumanda etme yöntemine dayanıyor; bu nedenle öngörülemeyen ortamlara kendi kendine uyum sağlamak ya da bir robotun becerisini başka bir forma aktarmak zor oluyor
  • Gemini Robotics 2, görsel ve dil girdilerini motor kontrolüne dönüştüren bir vision-language-action modeli (VLA)
    • İnsansı robotun tamamını ve çift kollu robotları kontrol eder
    • İki el ve gripper ile hassas manipülasyonu destekler
  • Gemini Robotics ER 2, robotun ajanı rolünü üstlenen bir bedenselleştirilmiş akıl yürütme (ER) modeli
    • İnsanlarla iletişim kurar ve fiziksel ortamı anlar
    • Dakikalar süren çok adımlı görevleri planlar
    • Birden fazla robotun ekip çalışmasını destekler
  • Gemini Robotics On-Device 2, robot cihazında yerel olarak çalışacak şekilde optimize edilmiş verimli bir VLA’dır
    • Birkaç saatlik veriyle tamamen yeni robot formlarına uyum sağlayabilir
  • Modellerin sunulma kapsamı birbirinden farklıdır

Üst gövdenin ötesinde insansı robotlarda tüm vücut kontrolü

  • Önceki model masa üstü görevler için insansı robotun üst gövde kontrolüne odaklanırken, Gemini Robotics 2 kontrol kapsamını tüm vücut hareketlerine genişletiyor
  • Apptronik Apollo 2, “sulama kabını alt raftaki yeşil kutuya koy” talimatını işleyebiliyor
    • Masaya kadar yürüyüp sulama kabını alır
    • Rafa hareket ettikten sonra belirtilen konuma doğru şekilde bırakır
  • Yürüme, eğilme, denge sağlama ve nesne manipülasyonunu birleştirerek dar ve dağınık alanlarda görevleri yerine getiriyor, ancak hareket hızının daha da iyileştirilmesi gerekiyor

Eller ve gripper’larla hassas manipülasyon

  • Apollo 2’ye takılı SharpaWave elinin beş parmağını ve 22 serbestlik derecesini kontrol eder
    • Düğüm atma gibi hassas hareketleri gerçekleştirir
    • Fermuarlı poşeti kapatabilir
  • Franka Duo üzerindeki standart 2 parmaklı paralel gripper ile eşyaları sıkı şekilde paketleme gibi karmaşık görevleri de yerine getirir
  • İnsan seviyesinde el becerisine ulaşmak için hassasiyet ve hızın sürekli artırılması gerekiyor

Uzun süreli görev akıl yürütmesi ve çoklu robot iş birliği

  • Gemini Robotics ER 2, robotun üst düzey beyni olarak kullanıcı talimatlarını işler ve insanlarla iletişim kurar
    • Alanı gözlemleyerek gerekli adımları çıkarır
    • Gerçek hareketleri gerçekleştirmek için VLA ile koordine olur
    • Tamamlanana kadar ilerlemeyi takip eder
  • Karmaşık çok adımlı görevleri yürütürken bir adım başarısız olursa kendi kendini düzeltir ve yeni durumlar ile hedeflere genellenebilir
  • Tek bir görevde yüzlerce kez karar verir ve dakikalar süren görev dizilerini eskisine göre daha kararlı şekilde işler
  • Bir görevin başlangıcını ve bitişini anlar, önemli olayların gerçekleştiği anı belirleyerek ilerleme durumunu takip eder
  • Farklı türde robotların iletişim kurup iş birliği yapmasıyla, tek bir robotun tek başına gerçekleştirmekte zorlanacağı karmaşık iş akışları ele alınabilir

Yeni robot formlarına hızlı adaptasyon

  • Gemini Robotics On-Device 2, ağ gecikmesi veya internet bağlantısı olmadan çalışması gereken ortamlar için robot cihazında yerel olarak çalışır
  • Birden fazla robot formunu yerleşik olarak destekler ve Gemini Robotics 1.5’in eylem aktarımı teknolojisini devralır
  • Genellikle 200’den az örnek ve birkaç saatlik adaptasyon süreciyle yeni çift kollu robotlara uygulanabilir
  • Görünüm, sensör ve serbestlik derecesi açısından büyük ölçüde farklı robotlara da uyum sağlar; Dexmate, SO101 ve Trossen platformlarında çeşitli görevleri yerine getirir

Belirsizliği de ele alan robot güvenliği

  • Robotların fiziksel yetenekleri arttıkça, geleneksel fiziksel güvenlik önlemleriyle yapay zeka güvenliği çerçevelerini birleştiren çok katmanlı bir güvenlik yaklaşımı uygulanıyor
  • ASIMOV-Agentic, ajan güvenliği uyumunu ve belirsizlik yönetimini değerlendiren yeni bir benchmark’tır
    • VLA’nın talep ettiği güvenli olmayan araç çağrılarını bedenselleştirilmiş akıl yürütme ajanının reddedip edemediğini ölçer
    • Görevin yapılabilirliğini tahmin edip, belirsizlik olduğunda proaktif olarak insan müdahalesi isteyip istemediğini değerlendirir
  • Gemini Robotics ER 2, güvenlik kısıtlarına uyum ve insan yakınlığı benchmark’larında Google DeepMind’ın mevcut robot modelleri arasında en güvenli performansı gösteriyor
    • Çevredeki insanları daha iyi algılar
    • Bir insan aşırı yaklaştığında güvenlik aracını çağırır ve robotu güvenli şekilde durdurur
    • Bu, insanlarla birlikte çalışmaya yönelik iş birliğine dayalı güvenlik standartlarının gerektirdiği bir işlevdir
  • Ayrıntılı değerlendirme Gemini Robotics 2: Safety Technical Report üzerinden görülebilir
  • Tekil görev otomasyonunun ötesine geçerek, insanlarla birlikte karmaşık problemleri çözen genel amaçlı fiziksel yapay zekânın temel zekâsını oluşturmayı hedefliyor

1 yorum

 
GN⁺ 2 시간 전
Hacker News yorumları
  • Bu modelin geliştirilmesine katılan bir DeepMind araştırmacısı olarak, DeepMind çalışmak için harika bir yer. Gemini·Gemma, robotik, hava durumu·biyoloji gibi bilim alanları dahil olmak üzere zekâyla ilgili neredeyse her alan arasında geçiş yapabileceğiniz az sayıdaki benzersiz araştırma laboratuvarından biri ve çok iyi ekip arkadaşları var; katılmayı düşünmeye değer

    • Frontier model geliştirme ile açık model geliştirme arasındaki somut farkın ne olduğunu merak ediyorum. Açık modeller genelde daha küçük oluyor ve daha fazla güvenlik testinden geçiyor ama özünde benzerler; genel AI araştırmalarının çoğu da her iki tarafa uygulanmıyor mu diye düşünüyorum
    • Hükümetlerin, şirketlerin ve orduların kötüye kullanımını nasıl engellediğinizi gerçekten merak ediyorum. Bu teknolojinin sıradan insanların hayatını iyileştirmek için ne kadar, gözetim ve kontrolü güçlendirmek için ne kadar kullanılacağını da bilmek istiyorum
    • “Tek araştırma laboratuvarı” ifadesi abartılı. Allen Institute for AI(AI2) da frontier düzeyi biraz daha düşük olsa da çoğu alanı kapsıyor ve NSF’nin 152 milyon dolarlık desteği ile Nvidia iş birliği de umut verici. Robotik tarafında MolmoBot, MolmoSpaces, MolmoAct gibi çalışmalar var: https://allenai.org/embodied-ai
    • 2007’den beri AGI Conference düzenleyen AGI Society’nin icra direktörü olarak, gelecek yılki etkinlikte araştırmanızı sunmanız için sizi davet etmek isterim. Bu yıl Alexander Lerchner’in sunumu çok iyiydi; tercih ettiğiniz e-posta adresini paylaşırsanız iletişime geçerim
  • İlginin %80’ini Anthropic ve OpenAI toplasa da, Google’ın frontier seviyesinde, hızlı ve açık ağırlıklı modellerden görüntü·video·müzik üretimine ve robotiğe kadar uzanan kapsamı etkileyici

    • Google birçok yeni teknolojinin ön saflarında sessizce yetkin bir şirket gibi hareket ederken, OpenAI ve Anthropic’in son chatbot’ları “kontrolden çıkan AI”, “çok tehlikeli, yasaklanmalı” gibi abartılı haberlerle anılıyor. Bu hype döngüsü, yeni rakiplerin saçma seviyedeki şirket değerlemelerini ayakta tutuyor
    • Google DeepMind AI’ın ön cephesinde yeni kavramlar geliştirirken, başka yerler benchmark puanındaki birkaç yüzdeyi kovalamakla meşgul
    • Protein katlanması araştırması ve Nobel Ödülü de unutulmamalı
  • Robot hareketleri yavaş ve akıcı değil ama ilk ChatGPT de çok hantal görünüyordu. LLM’ler kadar hızlı gelişirse, birkaç yıl içinde kullanım alanı muazzam biçimde büyüyebilir

    • Ev işleri insanın yaptığından uzun sürse de sorun değil. İşten dönmeden önce temizliği bitirmesi yeterli
    • GPT-2’den GPT-3’e geçiş de, Gemini Robotics 1’den 2’ye geçiş de 15 ay sürdü; ama ilki muazzam bir sıçramayken ikincisi neredeyse hiç değişmemişti: https://blog.google/products-and-platforms/products/gemini/h...
      Yavaş ve statik robot hareketleriyle hızlı ve esnek hareketler tamamen farklı zorluk seviyelerine sahip. Hızlı hareket ettiğinizde, çok sayıda eklemin ve kütlenin dönme ataleti ile denge değişimlerini saniyede yüzlerce ila binlerce kez hesaplamanız gerekir. Bir tişörtü hareketsiz durumda %90 olasılıkla katlamak kolaydır, ama %99 başarı oranı ya da hızlı katlama inanılması güç derecede karmaşıktır
    • Gerçek zamanlı hızda bile makul görünen ilk tanıtım videosu bu. Ancak diğer materyallerdeki %50~75 başarı oranının ilk deneme mi yoksa nihai başarı mı olduğu belirsiz
    • Google’ın Moravec paradoksuna doğrudan meydan okuması oldukça cesur: https://en.wikipedia.org/wiki/Moravec%27s_paradox
    • Hareketler akıcı ama yavaş; muhtemelen güvenlik nedeniyle. Güçlü motorlara sahip robotlar insanları gerçekten yaralayabilir, bu yüzden endüstriyel robotlar da güvenlik çitlerinin içinde çalışır
      Dijital bir kukla gibi ters kinematik hareketleri birebir taklit etmesini beklememek gerekir. Optimizasyon hedefi enerji tüketimini azaltmaksa, çok eklemli elektrikli bir kolun hareketi biraz garip görünebilir
  • İnsansı robotlar konusunda aktüatörlerin sınırları nedeniyle umutlarımı kestim. Honda ASIMO’dan bu yana neredeyse hiç yenilik olmadı ve kimsenin evine ya da iş yerine 80 kg’lık sallanan bir metal yığınını koymak isteyeceğini sanmıyorum
    Nihai robot devrimi, beynin yerine kullanılan genetiği değiştirilmiş insan ya da hayvan bedenlerinden de yararlanabilir. Bilinci olmayacak şekilde tasarlanmış bir ayıyı Neuralink ve LLM ile kontrol etmek inşaat işçisi olarak daha uygun olabilir; hızlı hayvanlar teslimatta, zürafalar da depolarda kullanılabilir diye düşünüyorum

    • Zürafalar yalnızca uzundur, neredeyse hiç yük taşıyamaz; bu yüzden depoda ne kadar işe yarayacağı şüpheli. Aktüatörlerde yenilik olmadığı iddiasına da inanmak zor; MIT Cheetah’ın aktüatörleri, geri sürülebilirlik ve değişken sertlik açısından ASIMO’dan tamamen farklı ve elastik elemanları birleştiren araştırmalar da çok aktif
    • Cortical Labs bu alanı araştırıyor ve bir ara Doom demosu da göstermişti. Biyolojik tip sistemler genel amaçlı olabilir ama birçok iş için metalik olanlar daha dayanıklı; ayrıca beyin düşük bant genişliğine ve yüksek gecikmeye sahip olduğu için çıkarımda silikon çipler daha avantajlı
      3D baskı alanındaki ilginç çalışmaları görünce aktüatörlerin de çok ilerlediğini düşünmüştüm; bu yüzden geri kaldıkları iddiası hakkında daha fazlasını bilmek isterim
    • Aktüatörlerin gelişmediği görüşüne hiç katılmıyorum. Ben Katz’ın MIT Mini Cheetah çalışmasından sonra tork yoğunluğu ve fiyat ciddi biçimde iyileşti; buna dayanan Unitree G1 aktüatörleri küçük ama güçlü ve yarı doğrudan tahrike yakın. BD E-Atlas motorları da tamamen pasif soğutmalı olmalarına rağmen iyi bir tork yoğunluğu sunuyor gibi görünüyor; şu anki kadar hızlı ilerledikleri bir dönem olmadı
    • Böyle bir gelecek korkunç olurdu ama teknik zorluk ve deney izni engelleri yüzünden çok uzakta görünüyor. Yine de insansı formun çıkmaz sokak olduğu konusunda hemfikirim
      Bulaşık makinesi gibi girdiyi işleyip sonuç üreten dev bir kutu yapmak yeterli. İnsan elini taklit etmektense, çamaşır makinesi·kurutucuya uyumlu bir kıyafet katlama cihazı ya da entegre bir robot mutfak yapmak çok daha verimli olur
    • Canlıları modifiye etmek, insansı robot yapmaktan birkaç büyüklük mertebesi daha zor görünüyor. Hâlâ inek olmadan hamburgeri pazarlanabilir bir fiyatla üretemiyoruz
  • Bu teknolojinin gerçek düzeyini dürüstçe değerlendirecek birine ihtiyaç var. Gerekli ölçüm ekipmanı, etkileşim kalitesi, kapı kolu çevirme ve düşüşten toparlanma, çarpışmadan kaçınma gibi yapılandırılmamış gündelik görevlerdeki performansı merak ediyorum

    • Bu alanda çalışıyorum ve insansı olmayan görsel-dil-eylem modeli (VLA), yani ChatGPT’nin bir robot kola bağlanması üzerine lisans tezi yazdım. Hâlâ pratik kullanım aşamasında değil; montaj parçalarının bazen kesin adları bile olmuyor, bu yüzden insanın anlayacağı muğlak talimatları robot işleyemeyebilir
      Güvenilir doğruluk verileri de yetersiz ve LIBERO gibi benchmark’ların neredeyse hepsi %95 kaydedip doygunluğa ulaştı; şirketler ve araştırmacılar da kendi değerlendirmelerini kullanıyor. Demoyu aldatıcı şekilde sunan ya da insanlara yakın mesafede tehlikeli biçimde çalıştıran çok şirket var
      Zorluk, kapı kolu ya da düşüşten toparlanmadan çok, üretim sürecinde tuğla veya parçaları hassas biçimde hizalamakta. Yönetilecek eklem sayısı fazla ve karmaşık olan insansılar yerine, Mobile ALOHA gibi tekerlekli robot kollar otel odası toplama ya da işi daha düzenli olan restoran hazırlığında daha uygun görünüyor
    • Şimdilik GPT-1 seviyesinde ama GPT-2’ye denk gelen an sanki çok yakın
    • Gerçek doğrulama ölçütü, ev tipi hizmet robotu satan startup’ların gerçekten tekrar tekrar kullanan kullanıcılar edinip edinmediğidir. Birden fazla robot prototipini profesyonel olarak ürettim; ilerleme kesinlikle var ama sıradan tüketicinin ayak işlerinde güvenle kullanabilmesi için daha çok erken
      https://rodneybrooks.com/why-todays-humanoids-wont-learn-dex... yazısında savunulduğu gibi el becerisi bir donanım sorunu da; gripper, el değildir. Çok parmaklı manipülasyon bile hâlâ zor ve sensörler de yeterli değil
    • Robot sektöründe, sadece belirli bir demo için özenle kurgulanmış videolardan, otonom çalışıyor denip gerçekte uzaktan kumanda edilen dolandırıcılıklara kadar çok fazla göz boyama var. Robot köpekler ve insansız kara araçları da abartılı tanıtımların aksine pek pratik değil
      Robotik, cobot alanı dışında niş bir endüstri; istisna ise yalnızca havada kalış süresi sorunu çözülürse büyük potansiyeli olan dronelar. İnsansılar gerçek dünyada faydalı olmaktan hâlâ çok uzak ve çoğu insansız kara aracı merdivende geri geri bile inemiyor
  • Yapay zeka robotiği asıl devrim. Şu anda sermaye sahiplerinin daha fazla sermaye elde etmesi için insan emeğine ihtiyaç var; ama robot çıkarım maliyeti işçilikten düşük olduğunda artık insan emeğine ihtiyaç kalmayacak. Yapay zeka bedensel olmayan işlere de etki ediyor ama dünya nüfusunun büyük kısmı fiziksel emekte çalışıyor

    • Çıkarım dışı maliyetleri yok sayıp o nihai durumu kabul edersek, sermaye demokratikleşirse bu çok iyi olabilir; ama azınlık bir kesimde yoğunlaşmayı sürdürürse sona yakın sonuçlar doğurur
    • Mesele yalnızca çıkarım maliyeti değil. Gerçek dünyada nesne ya da canlıları yanlış ele almanın zararı, maddi olmayan uygulamalardan tamamen farklıdır; bu yüzden arıza güvenlikleri ve bağımsız sınırlayıcılar gerekebilir
    • Bu değişimin gerçekten iyi bir şey olup olmadığından emin değilim
  • Çocuğu olmayan 47 yaşında bir erkek olarak, yaşlılığımda bakım robotlarından yardım alma ihtimalini umut verici buluyorum

    • Hayattayken Star Wars tarzı droidler görme ihtimalimizin artmış olması şaşırtıcı; ama herkes bunu fazla sıradan bir şeymiş gibi karşılıyor gibi
    • 50’lerinde biri olarak, 80’lerindeki ebeveynlerim için şu anda bile çok faydalı olurdu. Çevremdeki birçok arkadaş da benzer durumda
  • Birçok ev işi, insansıya gerek kalmadan otomatikleştirilebilir. Roomba zemini temizler; evlere otomatik çöp işleme ile market ürünlerini içeri alma, ayırma ve depolama sistemleri kurulabilir
    İnsansılar rahatsız edici ve güven vermiyor. Üreticisinin politik görüşlerine karşı olduğunuz bir durumda böyle bir robot evin içindeyken rahat uyuyup uyuyamayacağımı bilmiyorum

    • Mevcut apartmanlara, sıra evlere ya da yarı müstakil evlere böyle sistemler kurmak fiilen imkânsız; yeni müstakil evlerde bile pahalı bir çözüm. Mevcut insan çevresi insansılara göre düzenlenmiş olduğu için insansı form kullanışlı
    • Roomba zeminin ancak %80-90’ını temizliyor ve gerçek bir elektrikli süpürge kadar da temiz yapmıyor. Köpek oyuncaklarını toplama ve toz haznesini boşaltmayı da katınca gerçekte yaklaşık %60 ediyor; yani %100’ünü yapmak için tam bir insan biçimi gerekiyor
    • Robotlara güvenmek zorunda kalınan bir durum hiç olmamalı. Roomba ya da bulaşık makinesi arızalansa bile parmaklarınızı koparamaz, sizi dinleyemez ya da gözetleyemez; iyi robot böyle bir şeydir
  • Sonlu bir Dünya’da durmadan artan insanlara ek olarak neden bir de robot gövdeleri eklemek istiyoruz, anlamıyorum. Veri merkezi yapay zekası en azından fiziksel olarak omuz omuza benimle rekabet etmiyor; insanlar varken neden gelişmiş robotlar istediğimizi bilmiyorum

    • İnsanlığın sonsuz genişlemesi duracak gibi görünen pek çok işaret var. Gelişmiş robotlara ihtiyaç duymamızın açık nedeni, beli kıracak kadar ağır, kirli, tehlikeli ya da sıkıcı olduğu için insanların yapmak istemediği işleri üstlenmeleri
  • Robotu sürmek için tam bir LLM kullanılırsa bu fazla ağır olur; güçlü GPU’larda bile en düşük gecikme muhtemelen 1-2 saniye olur ve bu da pratik robotlar için uygun değildir
    Makine görüşünü makine öğrenmesi yapmalı ama hareket sürüşü geleneksel PID tabanlı doğrusal ve doğrusal olmayan kontrole bırakılmalı; denetleyici olarak tam bir LLM kullanmak donanım sınırlarına çarpacak gibi duruyor

    • Şu an gecikme sorunu doğru, ama çıkarım optimizasyonu için büyük alan var; yakın gelecekte bu değişebilir. PID gibi analiz/optimizasyon tabanlı kontrol onlarca yıldır durgunken, uçtan uca kontrol yürümenin enerji verimliliğinde ve yaprak yığınına basınca bile düşmeme sağlamlığında üstün performans gösterdi; ayrıca yeni robotlara uygulaması da çok daha kolay
      Physical Intelligence gibi şirketler, zeka ile gecikmeyi birlikte çözmek için hızlı ve yavaş katmanları birleştiren hiyerarşik mimarilerde de iyi sonuçlar alıyor
    • Nvidia’nın kendi çiplerinde 2 milyar parametreli VLA’yı 10Hz hızında çalıştırdığını, yayımladıkları 500 milyon parametreli modelin de 10Hz’de çalıştığını biliyorum