Dyna Robotics, 1 milyon saatten fazla insan videosuyla eğitilen yeni bir robot temel modelini tanıttı. Şirket, bu ölçeğin robotlara fiziksel görevleri üstlenmeyi öğretmedeki en büyük engellerden birini aşmaya yardımcı olabileceğini söylüyor.
Redwood City, California merkezli şirket, DYNA-2 World-Action Model‘in robot eylem verileri yerine tamamen insanın kendi bakış açısından çekilen videolarla eğitildiğini söyledi. Veri kümesi, yaklaşık 170 yıllık kesintisiz uyanık deneyime karşılık geliyor.
Bu yaklaşım, manuel olarak toplanan uzaktan kumanda (teleoperasyon) verilerine olan bağımlılığı azaltarak, robotların insanların nesnelerle ve çevreleriyle nasıl etkileşime girdiğinden fiziksel beceriler öğrenmesini sağlamak üzere tasarlandı. Dyna’ya göre bu yöntem, robotların yetenekleri genişledikçe onları eğitmek için daha ölçeklenebilir bir yol sağlayabilir.
Şirket yapılan testlerde, DYNA-2‘nin yalnızca ön eğitim ölçeğini artırarak yüksek hassasiyetli üretimdeki görev başarı oranlarını %20‘den %80-%90 seviyesine çıkardığını bildirdi. Model ayrıca sabit robot kolları, insansı prototipler ve hünerli robotik eller arasında bilgi aktarımı sergiledi.
İnsan Videosu Eğitim Verisine Dönüşüyor
Dyna’nın modeli, sonraki kare ve sonraki eylem tahminini birleştiren bir dünya modelleme mimarisi kullanıyor. Sistem, yalnızca robotların gerçekleştirdiği eylemlerden öğrenmek yerine insan videolarından yararlanarak fiziksel ortamların nasıl değiştiğini ve nesnelerin harekete nasıl tepki verdiğini kavrıyor.
Şirkete göre bu durum, insan davranışlarından elde edilen bilginin farklı robot donanımlarına aktarılmasına imkan tanıyor. Dyna, DYNA-2‘nin ön eğitim sırasında hiçbir robot verisi görmediğini, yine de sadece birkaç saatlik yerel ince ayarla farklı platformlara uyarlanabildiğini belirtti.
Gerçekleştirilen bir testte, DYNA-2‘nin beş parmaklı bir çift robotik ele şişe kapağını çevirip açma komutu vermesi için 13 dakikalık veri yeterli oldu. Dyna, 15 kıyaslama görevi genelinde daha fazla insan videosuyla eğitilen modellerin tutarlı bir şekilde daha yüksek performans gösterdiğini söyledi.
Şirket ayrıca DYNA-2‘yi, görme-dil-eylem mimarisi kullanan önceki DYNA-1 modeliyle karşılaştırdı. Bir müşteri ortamındaki doğrudan canlı kullanım (zero-shot) testinde DYNA-2 %87‘lik bir kalite uygunluk oranına ulaşırken, DYNA-1 %46‘da kaldı.
Robotları Uzaktan Kumandanın Ötesine Taşımak
Fiziksel müdahaleler bir görevi kestiğinde modelin daha iyi bir dayanıklılık sergilediğini bildirildi. Yiyecek doğrama ve çalışma alanlarını temizleme gibi etkinlikleri içeren testler sırasında DYNA-2, insan müdahalesi olmadan kendini toparlayabilirken önceki model manuel düzeltmeye ihtiyaç duydu.
Şirket, video ortak eğitim yönteminin, robotların komutlara göre farklı fiziksel hareketler yapmasını gerektiren talimat takip görevlerinde puanları %133 artırdığını söyledi.
Dyna Robotics kurucu ortağı Jason Ma, “Yıllardır genel amaçlı robotik alanı bir veri darboğazı nedeniyle tıkanmış durumdaydı; manuel olarak fiziksel teleoperasyon verisi toplamak genel zekaya ölçeklenemez.” dedi. Ma sözlerine şöyle devam etti: “Eylem verisi kıt ancak video her yerde. DYNA-2 ile fiziksel sezginin bir robot kolu üzerinde milyonlarca saatlik eğitim gerektirmediğini gösterdik; bu doğrudan insan videosundan öğrenilebiliyor.”
Dyna Robotics, önceki DYNA-1 modeliyle çalışan robotlarının otellerde, restoranlarda ve çamaşırhanelerde halihazırda görev yaptığını söyledi. Şirket ayrıca, DYNA-2‘yi robotların robota özel büyük miktarda eğitim verisine ihtiyaç duymadan yeni fiziksel görevleri öğrenebilmesini sağlama yolunda bir adım olarak görüyor.
Şirket, Lindon Gao, York Yang ve eski DeepMind araştırma bilimcisi Jason Ma tarafından kuruldu. Yatırımcıları arasında CRV ve First Round gibi kurumlar yer alıyor.
Kaynak: https://interestingengineering.com/ai-robotics/dyna-robotics-dyna-2-human-video-robot-training
