Bir robotun çorap katlaması ya da kahve hazırlaması, tek bir doğru hareketten çok daha fazlasını gerektirir: Önceki adımları hatırlaması, nesnelerin yer değiştirdiğini fark etmesi ve planı aksadığında ne yapacağına karar vermesi gerekir. Songyan Dynamics’in Scalabot markası, HERON-World Model’in ardından duyurduğu ikinci HERON modeli HERON-CRA ile bu sorunları birlikte ele almayı amaçlıyor. Ancak modelin tasarımı ile gerçek ortamlarda kanıtlanmış güvenilirliği aynı şey değil.
6
14
15
Hafıza, düzeltme ve beceri aktarımı nasıl birleşiyor?
Görevin geçmişini izlemek: Context Expert, önceki anlara ait konum ve anlam bilgilerini yapılandırılmış parçalara dönüştürüyor. Böylece robotun sonraki hareketi yalnızca o anda gördüğü görüntüye değil, görev boyunca neler olduğuna da dayanabiliyor. Buradaki “4D”, üç boyutlu uzayın zaman içinde izlenmesi anlamına geliyor.
6
9
Sapmayı düzeltmek: Pekiştirmeli öğrenme bileşeni RL Engine, mevcut hareket politikasının yerine geçmektense ona düzeltici hareketler eklemek üzere tasarlanmış hafif bir actor–critic yaklaşımı olarak anlatılıyor. Bir değer modeli de görevin zaman içindeki ilerleyişini değerlendirmeyi amaçlıyor. Bunun daha hassas kontrol ve hata sonrası toparlanma sağlaması bekleniyor; mevcut bilgiler, kazanımın ne kadarının yalnızca bu bileşenden geldiğini göstermiyor.
5
9
Öğrenileni başka robotlara taşımak: Farklı gövde yapılarına sahip robotlardan verilerle yapılan ön eğitim, becerilerin tek bir robota bağlı kalmamasını hedefliyor. Ayrıca gerçek denemelerdeki başarı ve başarısızlıklardan elde edilen durumlar, HERON-World Model’in olası devam senaryoları üretmesine başlangıç noktası olabiliyor. Bu, fiziksel denemeleri öğrenmeyle birleştirmeye yönelik önerilen bir döngü; üretilen senaryoların gerçek dünyayı her seferinde doğru öngördüğünün kanıtı değil.
7
14
15
Gösterimler ne söylüyor, ne söylemiyor?
Scalabot, kendi çorap katlama testinde başarı oranının %38,5’ten %97,8’e çıktığını bildiriyor. Bu, belirli bir görev için açıklanan güçlü bir artış; robotların genel başarı oranı olarak okunmamalı. Sağlanan bilgiler, deneme sayısının, test koşullarının ve karşılaştırma temelinin bağımsız biçimde doğrulandığını ortaya koymuyor.
12
Kahve hazırlama gösterimi, birden çok adım boyunca görev geçmişini izlemenin neden önemli olduğunu gösteriyor. Becerilerin başka robotlara aktarılması ve beklenmedik değişiklikler karşısında hareketlerin uyarlanması da sistemin hedeflerini örneklendiriyor. Ancak bu gösterimler, yabancı ortamlarda veya farklı aksaklıklar karşısında aynı sonucun ne sıklıkla alınacağını tek başına belirlemiyor.
4
6
15
Asıl açık soru güvenilirlik: HERON-CRA’nın uzun görevlerde ne kadar tutarlı çalıştığını anlamak için bağımsız, karşılaştırılabilir testlere ihtiyaç var. Hafızanın, düzeltici öğrenmenin, ön eğitimin ve dünya modelinin ürettiği senaryoların katkılarını ayrı ayrı ölçmek de gerekli.
4
14
15