2 puan yazan GN⁺ 2024-02-24 | 3 yorum | WhatsApp'ta paylaş
  • OK-Robot, yeni ev ortamlarında yalnızca dil talimatlarıyla nesneleri bulup kavrayarak taşıma şeklindeki pick-and-drop görevlerini zero-shot olarak gerçekleştirmeyi hedefleyen açık modüler bir robot framework'üdür
  • Vision-language model (VLM), navigasyon primitive'leri ve kavrama primitive'lerini birleştirerek ek eğitim olmadan nesne tanıma, hareket ve manipülasyonu ardışık biçimde bağlar
  • New York City'deki 10 gerçek evde 171 görev değerlendirildi ve tamamen yeni evlerde %58,5 başarı oranı kaydedildi
  • Temiz ve dağınık olmayan ortamlarda başarı oranı %82'ye yükseldi; Open Vocabulary Mobile Manipulation (OVMM) alanında önceki çalışmalara göre yaklaşık 1,8 kat performans gösterdi
  • Başlıca başarısızlıklar nesne arama, zor manipülasyon pozları ve donanım sorunlarından kaynaklandı; bu da açık bilgi modelleri ile robot modüllerinin ince ayarlı entegrasyonunun performansı belirlediğini gösteriyor

Framework bileşimi ve hedefi

  • OK-Robot, herhangi bir evde zero-shot, dil koşullu pick-and-drop görevlerini gerçekleştirmeye yönelik açık modüler bir framework'tür
  • Sistem üç bileşeni birleştirir
    • Vision-language model (VLM): Dil sorgusu tabanlı nesne tespiti
    • Navigasyon primitive'i: Mobil sistem hareket kontrolü
    • Kavrama primitive'i: Çeşitli nesnelerin manipülasyonu
  • Ayrı bir eğitim aşaması olmadan nesne tanıma, hareket ve kavramayı entegre ederek gerçek ev görevlerini gerçekleştiren sistem öncelikli bir yaklaşım kullanır
  • Proje materyalleri:

Gerçek ev değerlendirmesi ve başarısızlık etkenleri

  • New York City'deki 10 ev ortamında 171 pick-and-drop görevi denendi
  • Tamamen yeni evlerdeki başarı oranı %58,5 oldu ve Open Vocabulary Mobile Manipulation (OVMM) alanında önceki çalışmalara göre yaklaşık 1,8 kat performans gösterdi
    • Başarı oranı: {p:58}
  • Daha temiz ve dağınık olmayan ortamlarda başarı oranı %82'ye yükseldi
    • Düzenli ortam başarı oranı: {p:82}
  • Başarısızlık nedenleri uzun kuyruklu bir dağılım gösterir; en büyük üç neden şunlardır
    • Anlamsal bellekte taşınması gereken doğru nesnenin bulunamaması: %9,3
    • Manipülasyon modülünün zor bir poz alması: %8,0
    • Donanım zorlukları: %7,5
  • VLM gibi açık bilgi sistemlerini robot modülleriyle birleştirirken yalnızca model performansının değil, nesne belleği, manipülasyon pozu ve donanım kararlılığının da birlikte uyumlu çalışması gerekir

3 yorum

 
yeorinhieut 2024-02-24

https://hello-robot.com/purchase

Cihazın kendisi 25 bin dolar...
Ek olarak bir iPhone Pro da gerekiyor
Dock tipi şarj cihazı ise 995 dolar hahahaha

Enayi silkeleme fiyatı mı bu

 
yeorinhieut 2024-02-24

Docking istasyonu gerçekten neden o fiyatta acaba?
Bağlantı yöntemi de DC konnektörü doğrudan takma şeklindeymiş.. hahaha

https://hello-robot.com/stretch-docking-station

 
GN⁺ 2024-02-24
Hacker News yorumları
  • Bu tür robotların, engellerle başa çıkma mümkün hâle gelene kadar pazarının küçük kalacağını düşünüyorum.
    Kedinin zeminin ortasına bıraktığı oyuncak, açık pencere yüzünden masadan uçan kâğıt, çocukların etrafa saçtığı oyuncaklar, siz yokken masadan yuvarlanıp düşen kalem, yere bırakılmış çamaşır, halı ile parke zemin arasındaki seviye farkı, açık ya da kapalı kapılar gibi şeylerin hepsi sorun.
    Ana işten önce oyuncakları kaldırmak, kâğıt toplamak, çamaşır almak, kapı açmak gibi çeşitli ara işler araya girebilir.
    Kablolar, taşınmaması gereken üst üste konmuş eşyalar, mobilyalar, uyuyan evcil hayvanlar, teslimat kutusu yığınları gibi şeyler tekerlekli bir robotu yarı kalıcı olarak engelleyebilir.
    Bu yüzden genel amaçlı ev robotlarının tekerlekleri değil, bacakları olması gerektiğini; hatta denge için ikiden fazla bacak gerekebileceğini düşünüyorum.
    Kulağa tuhaf gelebilir ama ideal tasarım, büyük ve sevimli bir örümcek ile köpek arasında bir şey olabilir.
    Robotik alanının genel olarak dünyayı 2 boyutlu bir düzlem olarak görme fikrine sıkışıp kalmış olması tuhaf; 3 boyutlu dünyada hareket kabiliyetiyle ilgili gerçekten zor problemi idealleştirip ortadan kaldırmış gibi.
    Bu robotun yaptığı her şey de yalnızca düz yatay yüzeylerde gerçekleşiyor ve çalışabilmesi için sanki önce bir insanın odada dolaşıp ortalığı toplamış olması gerekiyor.
    Roomba’da da aynı sorun var.

    • Birçok kişinin kolaylık uğruna gerekli fedakârlıkları yapacağını düşünüyorum.
      Yere uzun kablolar sermeyebilirsiniz, mobilyalara işaret bandı yapıştırabilirsiniz ve robotun eşyaları alıp kaldırmasını sağlayarak bunların takılıp düşme riski olarak kalmasını önleyebilirsiniz.
      Bulaşık makinesinin kolayca kavrayıp taşıyıp yıkayabildiği tabak çanaklar gibi, hem insanlar hem de robotlar için dostça olan eşyalara da geçebilirsiniz.
      Mikrodalga fırına ya da bulaşık makinesine uygun ürünler satın alarak bunu zaten yapıyoruz; bir şeyin buna uygun olmadığını öğrenince şaşıracak hâle geldik.
      Evcil hayvanların kendi başına kullanabilmesi için insan kapılarına evcil hayvan kapısı takmanın maliyetine de katlanıyoruz.
      İnsanlar uyum yeteneği yüksek bir tür.
      İkinci olarak, robotu tavandaki bir rayın altına asma fikrini hep sevmişimdir.
      Harika film Moon’da da bunu görebilirsiniz; mobilyaların üzerinde süzülebildiği için insandan daha iyi hareket kabiliyetine sahip olma avantajı var.
    • Bu, genel amaçlı kavrama değil, daha çok belirli bir platformun sınırlarına yönelik bir eleştiri.
      Robotun kolunun, önündeki zeminde duran nesneleri alabilir hâle gelmesi yeterli.
      İmkânsız görünmüyor; birden fazla modeli bağlayıp “Takis’i yatak odasındaki komodine götür” dediğinizde bunu yapabildiğini gösteren demo etkileyici.
      Geriye yalnızca kolun zemine kadar uzanacak kadar yeterince eklemli yapılması gibi “küçük” bir robotik problemi kalıyor.
    • Tekerlekli ekipman söz konusuysa hastane ortamlarında da aynı sorun var.
      Orada bunu kablo itici ile çözüyorlar.
      Zemindeki eşyaları kenara iten, bir tür hayvan engelleme ızgarasına benzeyen bir düzenek.
      Her sorun karmaşık bir çözüm gerektirmez.
      Bence bu projenin başarısı özellikle robot tasarımının sadeliğinde yatıyor.
  • Çok havalı.
    Robotik konusunda neredeyse hiç deneyimim yok, bu yüzden aptalca sorular olabilir ama merak ediyorum.
    Bir nesnenin ne olduğunu nasıl biliyor? Gerçek zamanlı nesne sınıflandırma sinir ağı gibi bir şey mi kullanıyor, sınırları neler?
    Robot bir isteği yerine getiremeyeceğini biliyor mu? Örneğin büyük bir kutuyu ya da çok ağır bir kettlebell’i taşımasını isterseniz?
    Nesne gizliyse ya da önü kapanmışsa ne kadar iyi çalışıyor? Aramaya çıkıyor mu? İstenen nesneye erişmek için başka nesneleri kaldırması gerekiyorsa ne oluyor?

    • Bu alanda çalışıyorum ama yazarlardan biri değilim; bu ön kabulle söyleyeyim, sorular tam can alıcı noktaları yakalamış.
      Bu çalışma gerçekten çok etkileyici, ama modern robot öğrenme sistemlerinin birçok sınırını da olduğu gibi gösteriyor.
      1. Nesne sınıflandırıcı kullanıyor.
        Burada (https://github.com/ok-robot/ok-robot/tree/main/ok-robot-navi...) açıklanmış; anladığım kadarıyla temelde bir ViT modeli, yani bir görüntü sınıflandırma modeliyle görüntülere etiket koyuyor ve bunları bir voksel ızgarasına yansıtıyor.
        Ardından CLIP’in dil gömmeleriyle dili voksel ızgarasına bağlıyor.
        Sınırı şu: Bunu robot üzerinde çalıştırmak için bu tür modellerin devasa sürümlerini kullanamazsınız.
        Bulutta büyük modeller kullanılabilir ama bu da ciddi gecikme yaratır.
      2. Geçersiz istekleri büyük olasılıkla pek tanımlayamıyor.
        Dil gömmesinin kapsamadığı bir istekse robot hiçbir şey yapmayabilir.
        Ancak bu sistem, fiziksel denetleyicinin donanım sınırları dışında fiziğe dair bilgiye sahip görünmüyor.
      3. Gizli nesneler neredeyse kesinlikle olmaz.
        Voksel etiketleme, voksele etiket atayan modüle bağlıdır; görsel bilgi yoksa etiket koyamaz.
        Ayrıca çatalın çekmecede, çekmecenin mutfakta, mutfağın da genelde evin arka tarafında olduğu gibi karmaşık üst düzey akıl yürütme de yok gibi görünüyor.
        Kısmen önü kapanmış durumlarda ise bu, görsel sınıflandırıcının sınırlarına bağlı; çalışabilir de.
        ViT çok iyi ama nesnenin ne kadarının kapalı olduğuna bağlı olacaktır.
    • Projenin/makalenin yazarı olarak doğrulayacak olursam, aşağıda fishbotics zaten birçok soruyu yanıtlamış, ama ek olarak şunları söyleyebilirim.
      Nesne tanıma çoğunlukla Lang-SAM(https://github.com/luca-medeiros/lang-segment-anything) kullanıyor; görüntü ile metni bağlamadaki ağır işi ise CLIP gömmeleri(https://openai.com/research/clip) üstleniyor.
      CLIP tarzı modellerin avantajlarından biri, daha sonra sorgulanabilecek sınıfları önceden belirtmeniz gerekmemesi ve çalışma sırasında aklınıza gelen ifadeleri olduğu gibi kullanabilmeniz.
      Şu anda robot, gerçekleştirilemeyecek istekleri bilmiyor.
      Mevcut model çok basit ve özellikle akıllı bir işlem yapmaya çalışmıyor.
      Ancak kodu bu yüzden açtık; topluluğun bu projenin üzerine, ortamın görsel ipuçlarından daha fazla yararlanan daha akıllı robotlar inşa edebilmesini umuyoruz.
      İlk taramada nesne gizliyse ya da önü kapanmışsa başarısız olur.
      Yine de bunun ek araştırmalar için iyi bir başlangıç noktası olabileceğini düşünüyoruz.
      Bir avantajı, tüm 3D bilgiyi dikkate alması; bu nedenle bir nesne yalnızca bazı açılardan görünse bile robotun onu bulma ihtimali var.
  • Engelliler, yaşlılar, oyuncular, aşırı tembel insanlar ve onlara bakım verenler için hayat değiştirebilecek bir teknoloji gibi görünüyor

    • Nerede gördüğümü unuttum ama genel olarak engelliler için yapılan iyileştirmeler herkes için de iyi olur
      Kaldırımları tekerlekli sandalyeye uygun hale getirdiğinizde, bebek arabası süren ebeveynlere, ağır yük taşıyanlara, baston kullananlara, bisiklet süren küçük çocuklara ve görme yetisi zayıf olanlara da yardımcı olması gibi
    • Bu ev robotu çalışmasındaki büyük motivasyonlardan biri, yaşlıları, engellileri ya da her işi yetiştirecek zamanı olmayan meşgul ebeveynleri düşünmek
      Kişisel olarak, yapay zekaya herkesin istediği işleri değil, kimsenin istemediği işleri üstlenmeyi öğretebilmeyi umuyorum
  • Harika
    Çamaşırları katlayıp yerine koyacak şekilde eğitilebilirse 25 bin dolarlık bir robotu da ciddi ciddi satın almayı düşünürüm

    • Çamaşır, bulaşık, yemek ve çocukların dağıttıklarını toplama işlerini yapabiliyorsa 100 bin dolarlık bir robotu da hemen alırım
    • Katlama işi için bu robot dışında ikinci bir robot almanız gerekebilir: https://pantor.github.io/speedfolding/
  • Ortada olmayan bir eşyayı aramak gibi uzun vadeli görevleri çözmek için, açıklama eklenmiş sahneleri şablonlaştırılmış betimlemelere dönüştürüp interactive fiction ile eğitilmiş yeterince büyük bir modele verebilirsiniz
    “Mutfakta duruyorsunuz. Ön sağınızda, kulpu sağ tarafta olan büyük bir buzdolabı var. Solunuzda dolaplar var ve üzerlerindeki tezgahta bir tabak duruyor.”
    > get beer
    “Burada bira görünmüyor.”
    << COT: Biranın sık sık buzdolabında olduğunu biliyorum. Buzdolabını açmam gerek
    > open fridge
    “Buzdolabını açınca 4 kutu bira görüyorsunuz.”
    > get beer
    “Aldınız”
    Elbette bunun gerçekten çalışması için hâlâ birkaç yıl var ama düşününce çok ilginç
    Gerçek sensörlerin beslediği interactive fiction anlatısını, iç monolog olarak chain-of-thought bloklarıyla birleştirme yaklaşımı

    • Artık robota odada dolaşıp “Anahtarlar, anahtarlar, anahtarlar... Anahtarları nereye koydum?” diye mırıldanmayı öğretebiliriz
    • Multimodal LLM zaten bu tür işlerde çok iyi
      Mutfağın fotoğrafını çekip ChatGPT’ye birayı nerede bulabileceğinizi sorabilirsiniz
      Ben gerçekten bunu oldukça sık kullanıyorum
      Üşengeç olduğum için parçaların ve kartların fotoğrafını çekip ESP32’ye nasıl kablolayacağımı soruyorum; sadece birkaç fotoğrafla kartları, çipleri ve pin dizilimlerini ayırt edip hangi kablonun nereye bağlanması gerektiğini ve nelere dikkat edeceğimi söylüyor
      Çoğu zaman parçalar için faydalı kütüphaneler bile öneriyor; adeta sihir gibi
  • Hata analizi gerçekten çok iyi yapılmış
    Donanım hatasının ne anlama geldiğini merak ediyorum
    Örneğin “Realsense yanlış derinlik verdi” denilen 5 deneme var; bunun nasıl değerlendirildiğini merak ediyorum

    • Tüm veriler toplandıktan sonra hata nedenleri sonradan analiz edildi
      Bahsedilen 5 denemede Realsense, şeffaf veya yarı saydam nesnelerde yanlış derinlik değerleri üretti; bu yüzden robotun kafa kamerasından oluşturulan point cloud’un kendisi hatalıydı
  • Açık kaynak olmasına rağmen neredeyse 25 bin dolar tutuyor
    Neden bu kadar pahalı olduğunu merak ediyorum

    • Çünkü ürettikten sonra bakımını yapan mühendislerin maaşlarını karşılamak zorunda olan düşük hacimli bir ürün
    • Robot standartlarına göre 25 bin dolar fena değil
      Çoğu mobil manipülasyon robotu beş haneli fiyatların üzerinde; bunun başlıca nedenleri pazarın küçük olması, malzeme ve mühendislik maliyetlerinin yüksek olması ve robot üretmenin başlı başına zahmetli olması
    • Açık kaynak ne zamandan beri ucuz demek oldu?
      Emek bedava değil
      Özel PCB ve donanımları küçük hacimde üretmek de ucuz değil; robotları üretmek, kalibre etmek ve test etmek de ucuz değil
    • Fiyat nerede yazıyor?
      Ürün sayfası bağlantısı var mı merak ediyorum
    • Yazılım açık kaynak
      Donanım kapalı kaynak ve patentlerle korunuyor
  • Bu, Dobb-E ile aynı şey değil mi?
    https://dobb-e.com/

    • Hayır
      Ama ekipte bazı aynı kişiler var
      Örneğin ben Dobb-E’nin birinci yazarıyım ve danışmanım iki projeyi de yönetiyor
      Temel fark şu: Bu proje zero-shot, yani yeni bir evde 0 yeni veriye ihtiyaç duyuyor; ancak becerileri yalnızca alma ve bırakma olmak üzere iki tane
      Buna karşılık Dobb-E birden fazla beceriye sahip olabiliyor, fakat yeni evde birkaç demonstrasyon sunmanız gerekiyor
    • İki proje ilişkili görünüyor ve ortak yazarları da var
      İkisi de kullanılan robotun web sitesinde anılıyor: https://hello-robot.com/stretch-embodied-ai
  • Bir süredir bu projeyi takip ediyorum; ilerleme harika
    Uzuv kontrolü sınırlı kişiler için tekerlekli sandalye gibi mobil yardımcı cihazlarla entegre edildiğini hayal ediyorum
    İmkânsız olan işleri yapmaya yardımcı olan “akıllı” bir dış iskelet gibi bir şeye dönüşürse, gerçekten çok sayıda insan için oyunun kurallarını değiştirebilir

  • Üzerine yük koyup noktalar arasında gönderebileceğim stabilize platformlu bir araç gerçekten istiyorum
    Segway benzeri jiroskopik stabilize bir platformu A noktasından B noktasına, çok kötü olmayan ama engebeli bir yürüyüş yolu gibi bir güzergâhta gidip gelecek şekilde kullanabilmek isterdim
    Daha önce seçenekleri sürekli incelemeye çalışmıştım ama bu amaca uygun bir şey görmedim
    Bu kullanım senaryosuna uygun yeni bir ürün bilen var mı merak ediyorum
    Daha spesifik olarak, içecekler ve ordövrlerle dolu bir tepsiyi bir mülkün bir tarafından diğer tarafına dökmeden taşımam gerekiyor; en azından biraz arazi kabiliyeti de gerekli

    • Restoranlarda buna benzer bir şeyi zaten görmüş olabilirsiniz: https://www.pudurobotics.com/product/detail/bellabot
      İçecek taşıdığını gördüm mü bilmiyorum ama yemek taşıdığı kesin
    • https://www.youtube.com/watch?v=VGzRfvgnS_s
      Teknoloji zaten var; sadece hepsini düzgünce birbirine bağlamak gerekiyor
    • İçecekleri bir ipe asılı tabakta taşımanız yeterli
      Yerçekimi her zaman bardağın tabanına doğru kalmasını sağlar, bu yüzden elektronik stabilizasyona gerek yok