- 100 bin saat ölçeğinde, robottan bağımsız UMI yörüngeleri ile ön eğitim yapıldıktan sonra gerçek robot verileriyle devam eğitimi uygulanarak robot politika modellerindeki veri kıtlığını hafifleten bir foundation model
- 1.700'den fazla senaryo otomatik olarak açıklanarak genel davranış üretme yeteneği kazandırıldı ve devam eğitiminde robot biçimleri ile doğal dil komutlarına hizalandı
- Ön eğitim verisi ve model büyüdükçe doğrulama davranış hatası azaldı; devam eğitiminin ardından bilinmeyen ortam ve nesnelerde ölçülen gerçek robot başarı oranı da istikrarlı biçimde arttı ve doygunluk belirtisi görülmedi
- Görev başına ortalama 10 saatten az gösterimle telefon paketleme, yazıcı doldurma, çamaşır yerleştirme ve kutu paketlemede toplam başarı oranı %75 elde edildi; ortalama 40 saatin altında ise %85'e ulaşıldı
- RoboCasa, RoboCasa365, VLABench ve RoboDojo'da en iyi performansın elde edilmesi, büyük ölçekli UMI ön eğitiminin genelleme etkisinin gerçek robot uyarlamasına ve standart değerlendirmelere taşındığını gösterdi
Robot veri bariyerini aşan 2 aşamalı eğitim
- Dil ve görme tabanlı modellerde veri, parametre ve hesaplama arttıkça performans yükselirken robot politika modellerinin ölçeklenmesi büyük ölçekli yüksek kaliteli veri eksikliği nedeniyle sınırlı kalıyordu
- Xiaomi-Robotics-1, büyük ölçekli robottan bağımsız UMI verisiyle ön eğitim yapıp ardından nispeten az miktarda gerçek robot verisiyle devam eğitimi uygulayan 2 aşamalı bir eğitim yöntemi kullanıyor
- Bu sayede robot politika modellerinin ölçeklenme eğilimi ve ön eğitimdeki iyileşmenin gerçek robot performansına aktarılıp aktarılmadığı değerlendiriliyor
Ön eğitim ve devam eğitimi veri yapısı
- Ön eğitim verisi 100 bin saatlik UMI yörüngelerinden oluşuyor
- Ev, ticari tesis, endüstriyel saha ve açık alanları kapsayan 1.700'den fazla senaryo ile çeşitli görevleri içeriyor
- Yörüngeleri sabit uzunluklu parçalara ayırıp her parçadaki sahne durum değişimini dille kaydeden bir otomatik açıklama hattı geliştirildi
- Devam eğitiminde birden fazla robot biçimini kapsayan veri kümeleri kullanılıyor
- Kurum içinde toplanan gerçek robot verisi
- Filtrelenmiş açık kaynak robot verisi
- Özenle seçilmiş yüksek kaliteli UMI verisi
- Kurum içi veride gerçek evlerden toplanmış 7.200 saatten fazla gerçek robot görevi bulunuyor
- Kanepe toplama, ayakkabılık sınıflandırma, mutfak eşyası yerleştirme gibi görevleri kapsıyor
- Devam eğitimi için kullanılan UMI verisinde zaman aralıkları ve komut prompt'ları insanlar tarafından elle açıklanıyor
- Bu, ön eğitim verisinde kullanılan otomatik üretilmiş durum geçiş açıklamalarından farklı bir yaklaşım
UMI ön eğitimi ve otomatik açıklama
- Ön eğitim, modelin çeşitli gerçek ortamlar ve görevlerle karşılaşarak genel davranış üretimi temsillerini öğrenmesi aşaması
- Veri ölçeği nedeniyle manuel açıklama zor olduğundan güçlü bir görsel-dil modeli (VLM) kullanan otomatik bir hat kuruldu
- Uzun videolar sabit uzunluklu kliplere bölünüyor
- Her klipte kıskaç ve etkileşime girilen nesnenin durum değişimi VLM tarafından tarif ediliyor
- Gerçek manipülasyon yörüngeleri ile hassas dil açıklamalarını birleştiren büyük ölçekli bir korpus üretiliyor
- Model, dilde tarif edilen durum geçişine uygun biçimde sahneyi değiştiren davranışlar üretmek üzere eğitiliyor
- Veri ve model boyutu arttıkça doğrulama davranış hatasının sürekli azaldığı net bir ölçeklenme eğilimi görülüyor
Gerçek robotlar ve doğal dil komutlarıyla hizalama
- Devam eğitimi, ön eğitimde kazanılan davranış üretme yeteneğini iki eksende hizalıyor
- Robot biçimi hizalaması: yüksek kaliteli çok biçimli gerçek robot verisiyle genel davranış üretme yeteneğini fiziksel robotlara eşliyor
- Komut hizalaması: sahne durum geçişi açıklamalarını girdi olarak alan modeli, doğal dil komutlarını anlayıp doğrudan yerine getirecek şekilde dönüştürüyor
- Devam eğitimini tamamlayan model, ek ayar gerektirmeden çeşitli gerçek hareket ve manipülasyon görevlerinde kullanılabiliyor
- Ön eğitimin ölçeklenme etkisinin aktarılıp aktarılmadığını görmek için görülmemiş ortamlar ve nesne örneklerinde gerçek robot performansı değerlendirildi
- Ön eğitim verisi ve model boyutu büyüdükçe gerçek robot başarı oranı da istikrarlı ve öngörülebilir biçimde yükseldi
- Daha güçlü ön eğitim modelleri, devam eğitiminin ardından da daha yüksek gerçek robot performansı gösterdi
- Veri ve model ölçeği artışına bağlı başarı oranı yükselişinde doygunluk belirtisi görülmedi
Az veriyle yeni görev öğrenme
- Xiaomi-Robotics-1, görev başına birkaç saatlik gerçek robot gösterimiyle karmaşık yeni görevlere uyum sağlıyor
- Telefon paketleme, yazıcı doldurma, çamaşır yerleştirme ve kutu paketleme değerlendirme görevleri olarak kullanıldı
- Görev başına ortalama 10 saatten az gösterimde toplam başarı oranı %75 oldu ve aynı veri bütçesinde temel model Ï0.5'in %40'ını açık farkla geçti
- Telefon paketleme: XR-1 %70, Ï0.5 %30
- Yazıcı doldurma: XR-1 %70, Ï0.5 %20
- Çamaşır yerleştirme: XR-1 %80, Ï0.5 %40
- Kutu paketleme: XR-1 %80, Ï0.5 %70
- Görev başına ortalama süre 40 saatin altına çıkarıldığında toplam başarı oranı XR-1 için %85'e, Ï0.5 için %53'e yükseldi
- Telefon paketleme: XR-1 %80, Ï0.5 %40
- Yazıcı doldurma: XR-1 %60, Ï0.5 %20
- Çamaşır yerleştirme: XR-1 %100, Ï0.5 %50
- Kutu paketleme: her iki model de %100
Dört simülasyon benchmark'ında performans
- Genelleme odaklı 4 büyük simülasyon benchmark'ının tamamında en iyi performans elde edildi
- RoboCasa: ortalama başarı oranı %74,5; ikinci sıradaki %72,6'ya göre %2,6 iyileşme
- RoboCasa365: %57,4; ikinci sıradaki %46,6'ya göre %23,2 iyileşme
- VLABench: %59,1; ikinci sıradaki %53,2'ye göre %11,1 iyileşme
- RoboDojo: %13,93; ikinci sıradaki %8,80'e göre %58,3 iyileşme
- Ön eğitimde elde edilen genelleme ve ölçeklenme etkisi, standart simülasyon değerlendirmelerine de yansıdı
Ölçeklenme sonuçları ve kullanım kapsamı
- Büyük ölçekli UMI ön eğitimi robot verisi darboğazını hafifletirken, gerçek robot ve komut hizalaması genel davranış üretme yeteneğini fiziksel robotlara taşıyor
- Ön eğitim verisi ve model ölçeğine bağlı performans artışı, devam eğitiminin ardından gerçek robotların anında kullanılabilir performansına da doğrudan yansıyor
- Ortaya çıkan foundation model, az veriyle yeni görevlere uyum sağlarken genellemeyi ölçen 4 simülasyon benchmark'ında da en iyi performansa ulaşıyor
- Gerçek kullanım örneği olarak düzenlenmemiş bavul paketleme videosu da paylaşıldı
1 yorum
Hacker News görüşleri
Buradaki karamsar tepkileri anlayamayacak kadar videoyu izlerken kulaktan kulağa gülümsedim. Sonunda bir çamaşır yapan robot çıktı ve en azından model de ücretsiz olarak yayımlandı, değil mi? İstediğimiz gelecek buydu ve robotik tam da bunun için kullanılmalı
Bu videoda klasik olarak çok zor sayılan birçok görev var; o yüzden etkileyici gelmiyorsa, 10 yıl önce bunu kendiniz yapmak zorunda kalmadığınız için şanslı sayılmalısınız
İki el koordinasyonu, hareketli gövde, şekil değiştirebilen nesneler, çanta fermuarı gibi ince manipülasyon noktaları ve aynı anda birden fazla nesneyi kavrama hareketi var. Bunların her biri algı ya da manipülasyon alanında ayrı ayrı araştırıldı ve birkaç doktora tezini çıkarabilecek problemler
İki kollu robotu görünce, dokunaç benzeri bir tutucu gibi farklı yeteneklere sahip bir üçüncü el olsa birçok işin kolaylaşacağını düşündüm. Uzuv sayısı arttıkça sorunlar da artar ama nesneleri tutup çevirmenin fazladan bir yoluna sahip olmanın faydası büyük
Robot kıyafetleri biraz buruşuk ve özensiz katlasa bile, bunu kusursuz katlama ve ütüye tercih ederek kabullenme biçimine Slopfold demek istiyorum
İlerleme hızı çok yüksek ve yapay zeka geleceğe hakim olacak. Bence henüz mümkün olanların sadece yüzeyini kazıyoruz ama karamsar taraftan bakınca Bill Joy'un öngörülerinin ileri görüşlü olduğunu düşünüyorum
https://www.wired.com/2000/04/joy-2/
Beklenen yapay zeka geleceğinde beni en çok heyecanlandıran şey ev işlerinin otomasyonu. Doğu'da ev yardımcısı nispeten ucuz ve erişilebilir ama Batı'da temizlikçi ya da yardımcı tutmak neredeyse lüks sayılıyor. Her hafta evi çekip çevirmek için muazzam zaman harcıyorum; o zamanı geri alacağım günü bekliyorum
Kurguya uğramamış video olması onu daha da iyi yapıyor. Merdiven ya da dar kapılar gibi yapamadığı şeyler kolayca sayılabilir ama halihazırda yapabildiği işler bile hayranlık uyandırıyor ve sohbet paneli sayesinde etkileşim de iyi görünüyor
İnsansı olmayan robotlar tasarlamak doğru yön gibi geliyor. İleride insanlar ve robotlar birlikte kullansın diye aletler ve ev cihazları da değişecek; ayrıca ayakkabı çantasının fermuar ipi gereğinden fazla hassasiyet istiyor
Gerçek dünyadaki iş öğrenimine yapılan devasa yatırımı kullanarak ucuz insansı robotların çevikliğini, pil ömrünü ve gücünü sürekli iyileştirmek; günlük hayatta kullanılan milyonlarca ürünü bugünün göreve özel robotlarına uyacak şekilde yeniden tasarlamaktan daha olası görünüyor
Sivrisinek avlayan böcek benzeri robot sürüleri, boru tamir eden yılan benzeri robotlar ve yüzey temizleyen örümcek benzeri robotlar istiyorum
Birkaç yıl içinde Home Assistant ve LLM ev dışındayken ev işlerini koordine edebilir gibi görünüyor. LLM evdeki eşyaların envanterini çıkarıp düzenleme için süpürgeyi ve robotları yönlendirebilir
Çok kipli LLM'ler fotoğrafları analiz ederek bulaşık makinesine ya da çamaşır makinesine girecek şeylerle parlatılması gerekenleri ayırabilir; dolap düzenleme, yatak toplama ve bitki bakımı bile yapabilir. Güneş panelleri enerji sağlarken bütün gün çalışmaları yeterli
Ev işlerini tam zamanlı yapan biri olarak bu robotu gerçekten istiyorum. Çamaşır katlamaktan nefret ettiğim için hep erteliyorum; bu yüzden çamaşır makinesine koyma özelliği olmasa bile sadece katlasa yeter