OK-Robot: Her Yerde Alıp Taşıyabilen Açık Modüler Ev Robotu Framework'ü
(ok-robot.github.io)- OK-Robot, yeni ev ortamlarında yalnızca dil talimatlarıyla nesneleri bulup kavrayarak taşıma şeklindeki pick-and-drop görevlerini zero-shot olarak gerçekleştirmeyi hedefleyen açık modüler bir robot framework'üdür
- Vision-language model (VLM), navigasyon primitive'leri ve kavrama primitive'lerini birleştirerek ek eğitim olmadan nesne tanıma, hareket ve manipülasyonu ardışık biçimde bağlar
- New York City'deki 10 gerçek evde 171 görev değerlendirildi ve tamamen yeni evlerde %58,5 başarı oranı kaydedildi
- Temiz ve dağınık olmayan ortamlarda başarı oranı %82'ye yükseldi; Open Vocabulary Mobile Manipulation (OVMM) alanında önceki çalışmalara göre yaklaşık 1,8 kat performans gösterdi
- Başlıca başarısızlıklar nesne arama, zor manipülasyon pozları ve donanım sorunlarından kaynaklandı; bu da açık bilgi modelleri ile robot modüllerinin ince ayarlı entegrasyonunun performansı belirlediğini gösteriyor
Framework bileşimi ve hedefi
- OK-Robot, herhangi bir evde zero-shot, dil koşullu pick-and-drop görevlerini gerçekleştirmeye yönelik açık modüler bir framework'tür
- Sistem üç bileşeni birleştirir
- Vision-language model (VLM): Dil sorgusu tabanlı nesne tespiti
- Navigasyon primitive'i: Mobil sistem hareket kontrolü
- Kavrama primitive'i: Çeşitli nesnelerin manipülasyonu
- Ayrı bir eğitim aşaması olmadan nesne tanıma, hareket ve kavramayı entegre ederek gerçek ev görevlerini gerçekleştiren sistem öncelikli bir yaklaşım kullanır
- Proje materyalleri:
Gerçek ev değerlendirmesi ve başarısızlık etkenleri
- New York City'deki 10 ev ortamında 171 pick-and-drop görevi denendi
- Tamamen yeni evlerdeki başarı oranı %58,5 oldu ve Open Vocabulary Mobile Manipulation (OVMM) alanında önceki çalışmalara göre yaklaşık 1,8 kat performans gösterdi
- Başarı oranı: {p:58}
- Daha temiz ve dağınık olmayan ortamlarda başarı oranı %82'ye yükseldi
- Düzenli ortam başarı oranı: {p:82}
- Başarısızlık nedenleri uzun kuyruklu bir dağılım gösterir; en büyük üç neden şunlardır
- Anlamsal bellekte taşınması gereken doğru nesnenin bulunamaması: %9,3
- Manipülasyon modülünün zor bir poz alması: %8,0
- Donanım zorlukları: %7,5
- VLM gibi açık bilgi sistemlerini robot modülleriyle birleştirirken yalnızca model performansının değil, nesne belleği, manipülasyon pozu ve donanım kararlılığının da birlikte uyumlu çalışması gerekir
3 yorum
https://hello-robot.com/purchase
Cihazın kendisi 25 bin dolar...
Ek olarak bir iPhone Pro da gerekiyor
Dock tipi şarj cihazı ise 995 dolar hahahaha
Enayi silkeleme fiyatı mı bu
Docking istasyonu gerçekten neden o fiyatta acaba?
Bağlantı yöntemi de DC konnektörü doğrudan takma şeklindeymiş.. hahaha
https://hello-robot.com/stretch-docking-station
Hacker News yorumları
Bu tür robotların, engellerle başa çıkma mümkün hâle gelene kadar pazarının küçük kalacağını düşünüyorum.
Kedinin zeminin ortasına bıraktığı oyuncak, açık pencere yüzünden masadan uçan kâğıt, çocukların etrafa saçtığı oyuncaklar, siz yokken masadan yuvarlanıp düşen kalem, yere bırakılmış çamaşır, halı ile parke zemin arasındaki seviye farkı, açık ya da kapalı kapılar gibi şeylerin hepsi sorun.
Ana işten önce oyuncakları kaldırmak, kâğıt toplamak, çamaşır almak, kapı açmak gibi çeşitli ara işler araya girebilir.
Kablolar, taşınmaması gereken üst üste konmuş eşyalar, mobilyalar, uyuyan evcil hayvanlar, teslimat kutusu yığınları gibi şeyler tekerlekli bir robotu yarı kalıcı olarak engelleyebilir.
Bu yüzden genel amaçlı ev robotlarının tekerlekleri değil, bacakları olması gerektiğini; hatta denge için ikiden fazla bacak gerekebileceğini düşünüyorum.
Kulağa tuhaf gelebilir ama ideal tasarım, büyük ve sevimli bir örümcek ile köpek arasında bir şey olabilir.
Robotik alanının genel olarak dünyayı 2 boyutlu bir düzlem olarak görme fikrine sıkışıp kalmış olması tuhaf; 3 boyutlu dünyada hareket kabiliyetiyle ilgili gerçekten zor problemi idealleştirip ortadan kaldırmış gibi.
Bu robotun yaptığı her şey de yalnızca düz yatay yüzeylerde gerçekleşiyor ve çalışabilmesi için sanki önce bir insanın odada dolaşıp ortalığı toplamış olması gerekiyor.
Roomba’da da aynı sorun var.
Yere uzun kablolar sermeyebilirsiniz, mobilyalara işaret bandı yapıştırabilirsiniz ve robotun eşyaları alıp kaldırmasını sağlayarak bunların takılıp düşme riski olarak kalmasını önleyebilirsiniz.
Bulaşık makinesinin kolayca kavrayıp taşıyıp yıkayabildiği tabak çanaklar gibi, hem insanlar hem de robotlar için dostça olan eşyalara da geçebilirsiniz.
Mikrodalga fırına ya da bulaşık makinesine uygun ürünler satın alarak bunu zaten yapıyoruz; bir şeyin buna uygun olmadığını öğrenince şaşıracak hâle geldik.
Evcil hayvanların kendi başına kullanabilmesi için insan kapılarına evcil hayvan kapısı takmanın maliyetine de katlanıyoruz.
İnsanlar uyum yeteneği yüksek bir tür.
İkinci olarak, robotu tavandaki bir rayın altına asma fikrini hep sevmişimdir.
Harika film Moon’da da bunu görebilirsiniz; mobilyaların üzerinde süzülebildiği için insandan daha iyi hareket kabiliyetine sahip olma avantajı var.
Robotun kolunun, önündeki zeminde duran nesneleri alabilir hâle gelmesi yeterli.
İmkânsız görünmüyor; birden fazla modeli bağlayıp “Takis’i yatak odasındaki komodine götür” dediğinizde bunu yapabildiğini gösteren demo etkileyici.
Geriye yalnızca kolun zemine kadar uzanacak kadar yeterince eklemli yapılması gibi “küçük” bir robotik problemi kalıyor.
Orada bunu kablo itici ile çözüyorlar.
Zemindeki eşyaları kenara iten, bir tür hayvan engelleme ızgarasına benzeyen bir düzenek.
Her sorun karmaşık bir çözüm gerektirmez.
Bence bu projenin başarısı özellikle robot tasarımının sadeliğinde yatıyor.
Çok havalı.
Robotik konusunda neredeyse hiç deneyimim yok, bu yüzden aptalca sorular olabilir ama merak ediyorum.
Bir nesnenin ne olduğunu nasıl biliyor? Gerçek zamanlı nesne sınıflandırma sinir ağı gibi bir şey mi kullanıyor, sınırları neler?
Robot bir isteği yerine getiremeyeceğini biliyor mu? Örneğin büyük bir kutuyu ya da çok ağır bir kettlebell’i taşımasını isterseniz?
Nesne gizliyse ya da önü kapanmışsa ne kadar iyi çalışıyor? Aramaya çıkıyor mu? İstenen nesneye erişmek için başka nesneleri kaldırması gerekiyorsa ne oluyor?
Bu çalışma gerçekten çok etkileyici, ama modern robot öğrenme sistemlerinin birçok sınırını da olduğu gibi gösteriyor.
Burada (https://github.com/ok-robot/ok-robot/tree/main/ok-robot-navi...) açıklanmış; anladığım kadarıyla temelde bir ViT modeli, yani bir görüntü sınıflandırma modeliyle görüntülere etiket koyuyor ve bunları bir voksel ızgarasına yansıtıyor.
Ardından CLIP’in dil gömmeleriyle dili voksel ızgarasına bağlıyor.
Sınırı şu: Bunu robot üzerinde çalıştırmak için bu tür modellerin devasa sürümlerini kullanamazsınız.
Bulutta büyük modeller kullanılabilir ama bu da ciddi gecikme yaratır.
Dil gömmesinin kapsamadığı bir istekse robot hiçbir şey yapmayabilir.
Ancak bu sistem, fiziksel denetleyicinin donanım sınırları dışında fiziğe dair bilgiye sahip görünmüyor.
Voksel etiketleme, voksele etiket atayan modüle bağlıdır; görsel bilgi yoksa etiket koyamaz.
Ayrıca çatalın çekmecede, çekmecenin mutfakta, mutfağın da genelde evin arka tarafında olduğu gibi karmaşık üst düzey akıl yürütme de yok gibi görünüyor.
Kısmen önü kapanmış durumlarda ise bu, görsel sınıflandırıcının sınırlarına bağlı; çalışabilir de.
ViT çok iyi ama nesnenin ne kadarının kapalı olduğuna bağlı olacaktır.
Nesne tanıma çoğunlukla Lang-SAM(https://github.com/luca-medeiros/lang-segment-anything) kullanıyor; görüntü ile metni bağlamadaki ağır işi ise CLIP gömmeleri(https://openai.com/research/clip) üstleniyor.
CLIP tarzı modellerin avantajlarından biri, daha sonra sorgulanabilecek sınıfları önceden belirtmeniz gerekmemesi ve çalışma sırasında aklınıza gelen ifadeleri olduğu gibi kullanabilmeniz.
Şu anda robot, gerçekleştirilemeyecek istekleri bilmiyor.
Mevcut model çok basit ve özellikle akıllı bir işlem yapmaya çalışmıyor.
Ancak kodu bu yüzden açtık; topluluğun bu projenin üzerine, ortamın görsel ipuçlarından daha fazla yararlanan daha akıllı robotlar inşa edebilmesini umuyoruz.
İlk taramada nesne gizliyse ya da önü kapanmışsa başarısız olur.
Yine de bunun ek araştırmalar için iyi bir başlangıç noktası olabileceğini düşünüyoruz.
Bir avantajı, tüm 3D bilgiyi dikkate alması; bu nedenle bir nesne yalnızca bazı açılardan görünse bile robotun onu bulma ihtimali var.
Engelliler, yaşlılar, oyuncular, aşırı tembel insanlar ve onlara bakım verenler için hayat değiştirebilecek bir teknoloji gibi görünüyor
Kaldırımları tekerlekli sandalyeye uygun hale getirdiğinizde, bebek arabası süren ebeveynlere, ağır yük taşıyanlara, baston kullananlara, bisiklet süren küçük çocuklara ve görme yetisi zayıf olanlara da yardımcı olması gibi
Kişisel olarak, yapay zekaya herkesin istediği işleri değil, kimsenin istemediği işleri üstlenmeyi öğretebilmeyi umuyorum
Harika
Çamaşırları katlayıp yerine koyacak şekilde eğitilebilirse 25 bin dolarlık bir robotu da ciddi ciddi satın almayı düşünürüm
Ortada olmayan bir eşyayı aramak gibi uzun vadeli görevleri çözmek için, açıklama eklenmiş sahneleri şablonlaştırılmış betimlemelere dönüştürüp interactive fiction ile eğitilmiş yeterince büyük bir modele verebilirsiniz
“Mutfakta duruyorsunuz. Ön sağınızda, kulpu sağ tarafta olan büyük bir buzdolabı var. Solunuzda dolaplar var ve üzerlerindeki tezgahta bir tabak duruyor.”
> get beer“Burada bira görünmüyor.”
<< COT: Biranın sık sık buzdolabında olduğunu biliyorum. Buzdolabını açmam gerek> open fridge“Buzdolabını açınca 4 kutu bira görüyorsunuz.”
> get beer“Aldınız”
Elbette bunun gerçekten çalışması için hâlâ birkaç yıl var ama düşününce çok ilginç
Gerçek sensörlerin beslediği interactive fiction anlatısını, iç monolog olarak chain-of-thought bloklarıyla birleştirme yaklaşımı
Mutfağın fotoğrafını çekip ChatGPT’ye birayı nerede bulabileceğinizi sorabilirsiniz
Ben gerçekten bunu oldukça sık kullanıyorum
Üşengeç olduğum için parçaların ve kartların fotoğrafını çekip ESP32’ye nasıl kablolayacağımı soruyorum; sadece birkaç fotoğrafla kartları, çipleri ve pin dizilimlerini ayırt edip hangi kablonun nereye bağlanması gerektiğini ve nelere dikkat edeceğimi söylüyor
Çoğu zaman parçalar için faydalı kütüphaneler bile öneriyor; adeta sihir gibi
Hata analizi gerçekten çok iyi yapılmış
Donanım hatasının ne anlama geldiğini merak ediyorum
Örneğin “Realsense yanlış derinlik verdi” denilen 5 deneme var; bunun nasıl değerlendirildiğini merak ediyorum
Bahsedilen 5 denemede Realsense, şeffaf veya yarı saydam nesnelerde yanlış derinlik değerleri üretti; bu yüzden robotun kafa kamerasından oluşturulan point cloud’un kendisi hatalıydı
Açık kaynak olmasına rağmen neredeyse 25 bin dolar tutuyor
Neden bu kadar pahalı olduğunu merak ediyorum
Çoğu mobil manipülasyon robotu beş haneli fiyatların üzerinde; bunun başlıca nedenleri pazarın küçük olması, malzeme ve mühendislik maliyetlerinin yüksek olması ve robot üretmenin başlı başına zahmetli olması
Emek bedava değil
Özel PCB ve donanımları küçük hacimde üretmek de ucuz değil; robotları üretmek, kalibre etmek ve test etmek de ucuz değil
Ürün sayfası bağlantısı var mı merak ediyorum
Donanım kapalı kaynak ve patentlerle korunuyor
Bu, Dobb-E ile aynı şey değil mi?
https://dobb-e.com/
Ama ekipte bazı aynı kişiler var
Örneğin ben Dobb-E’nin birinci yazarıyım ve danışmanım iki projeyi de yönetiyor
Temel fark şu: Bu proje zero-shot, yani yeni bir evde 0 yeni veriye ihtiyaç duyuyor; ancak becerileri yalnızca alma ve bırakma olmak üzere iki tane
Buna karşılık Dobb-E birden fazla beceriye sahip olabiliyor, fakat yeni evde birkaç demonstrasyon sunmanız gerekiyor
İkisi de kullanılan robotun web sitesinde anılıyor: https://hello-robot.com/stretch-embodied-ai
Bir süredir bu projeyi takip ediyorum; ilerleme harika
Uzuv kontrolü sınırlı kişiler için tekerlekli sandalye gibi mobil yardımcı cihazlarla entegre edildiğini hayal ediyorum
İmkânsız olan işleri yapmaya yardımcı olan “akıllı” bir dış iskelet gibi bir şeye dönüşürse, gerçekten çok sayıda insan için oyunun kurallarını değiştirebilir
Üzerine yük koyup noktalar arasında gönderebileceğim stabilize platformlu bir araç gerçekten istiyorum
Segway benzeri jiroskopik stabilize bir platformu A noktasından B noktasına, çok kötü olmayan ama engebeli bir yürüyüş yolu gibi bir güzergâhta gidip gelecek şekilde kullanabilmek isterdim
Daha önce seçenekleri sürekli incelemeye çalışmıştım ama bu amaca uygun bir şey görmedim
Bu kullanım senaryosuna uygun yeni bir ürün bilen var mı merak ediyorum
Daha spesifik olarak, içecekler ve ordövrlerle dolu bir tepsiyi bir mülkün bir tarafından diğer tarafına dökmeden taşımam gerekiyor; en azından biraz arazi kabiliyeti de gerekli
İçecek taşıdığını gördüm mü bilmiyorum ama yemek taşıdığı kesin
Teknoloji zaten var; sadece hepsini düzgünce birbirine bağlamak gerekiyor
Yerçekimi her zaman bardağın tabanına doğru kalmasını sağlar, bu yüzden elektronik stabilizasyona gerek yok