| Tek gösterim süresi |
| Ortalama yaklaşık 29 saniye. |
| Yaklaşık 3–12 saniye. |
| Görev-özel yeniden eğitim | Yeni beceri çıkarımı sırasında model parametreleri güncellenmiyor. | Tek gösterimli kullanımda gradyan güncellemesi veya ince ayar yapılmadığı belirtiliyor. |
| Görev kapsamı | Farklı nesne, araç ve manipülasyon hareketlerini içeren 50 yeni görev; görev başına 20 deneme. | Şirket; kavanoz açma, fermuarlı çantayı açma, nesneyi süpürerek kaba taşıma, kalemi bardağa yerleştirme, cıvata dökme ve araç kullanımı gibi örnekler gösteriyor. Ancak kamuya açık bilgilerde HOST’taki kadar ayrıntılı ve standartlaştırılmış bir görev paketi sunulmuyor. |
| Başarı oranı | Yeni görevlerde ortalama yüzde 62. | Generalist AI, 10 farklı manipülasyon görevinde tek gösterimle ortalama yüzde 59 başarı bildirdi; bu oran bağımsız bir kıyaslama ile doğrulanmış değil. |
HOST’un önemli farkı, insanın kol ve el hareketlerini robotun gövdesine birebir çevirmeye çalışmaması. Bunun yerine sistem, videodaki görevin hangi aşamada olduğunu robotun kendi gözlemleriyle ilişkilendiriyor. Robot, gösterimdeki bir sonraki anlamlı durumu tahmin ediyor ve o duruma ulaşmak için gereken hareketi kendi fiziksel yapısına göre üretiyor.
Bu yaklaşım, farklı beden yapıları ve kamera açıları arasındaki farkı azaltmayı amaçlıyor. İnsan bir nesneyi elinden geçirerek taşırken robotun aynı yolu izlemesi gerekmiyor; önemli olan, görevin aynı aşamasına ve sonucuna ulaşabilmesi.
Araştırmacılar HOST’u eğitim sırasında görülmemiş 50 masaüstü manipülasyon görevinde, görev başına 20 denemeyle test etti. Sistem ortalama yüzde 62 başarıya ulaştı. Bu oran, tek gösterimden beceri ediniminin mümkün olduğunu gösterse de robotun her görevde güvenilir biçimde çalıştığı anlamına gelmiyor.
Çalışmada ayrıca ışık, nesne, sahne ve insan müdahalesindeki değişikliklere karşı dayanıklılık testleri raporlandı. HOST’un yüzde 62’lik temel başarısında bu koşullarda sırasıyla yüzde 1, yüzde 4, yüzde 6 ve yüzde 9 düşüş bildirildi.
Bir başka dikkat çekici sonuç da verimlilik iddiası. HOST, görev başına 50 robot gösterimiyle yapılan denetimli ince ayara kıyasla yaklaşık 50 kat daha az veri ve beceri ediniminde yaklaşık 507 kat daha kısa süre kullandığını bildiriyor.
Generalist AI’nin GEN-1.5 modeli benzer hedefi daha genel bir model mimarisi içinde ele alıyor. İnsan gösterimi yeni bir politika eğitmek için veri kümesine dönüştürülmek yerine modelin kısa süreli bağlamına yerleştiriliyor. Şirket bu gösterimi “fiziksel istem” olarak tanımlıyor: Robot, örneği gördükten sonra görevi hemen uygulamaya çalışıyor.
Kamuya açık örneklerde modelin kavanoz açma, çantanın fermuarını açma, bir nesneyi kaba süpürme ve farklı araçlarla görev tamamlama gibi becerileri birkaç saniyelik gösterimlerden çıkarmaya çalıştığı görülüyor. Ayrıca insan elinden robota taklit, simülasyondaki bir gösterimden fiziksel robota aktarım ve iki farklı davranışı art arda birleştirme gibi yetenekler de şirket tarafından öne çıkarılıyor.
Generalist AI, GEN-1.5’in 10 farklı manipülasyon görevinde tek gösterimle ortalama yüzde 59 başarı elde ettiğini belirtiyor. Beş dakikalık ek veriyle bu oranın yüzde 83’e çıktığı da şirketin kamuya açık paylaşımlarında yer alıyor. Ancak görevlerin sayısı, deneme protokolü, bağımsız tekrarlar ve karşılaştırma taban çizgileri HOST çalışmasındaki kadar ayrıntılı biçimde yayımlanmış değil.
GEN-1.5 tamamen “eğitimsiz” bir sistem de değil. Tek gösterimli kullanımda parametre güncellemesi yapılmadığı belirtiliyor; fakat daha zor görevler için 1–10 gradyan adımıyla birkaç dakikalık veriden uyarlama seçeneği sunuluyor. Dolayısıyla model, yeni kullanıcı açısından yeniden eğitim gerektirmeyebilir; ancak sistemin arka planında aylar süren ve büyük miktarda fiziksel deneyim verisine dayanan bir ön eğitim bulunuyor.
Bu iki çalışma, robotların hiçbir ön bilgi olmadan öğrenebildiğini göstermiyor. Tam tersine, kısa gösterimin işe yarayabilmesi için modelin daha önce nesneler, hareketler, fiziksel temaslar ve görev sonuçları hakkında kapsamlı bir ön eğitimden geçmiş olması gerekiyor.
Değişen nokta, bu maliyetin her yeni görev için yeniden ödenmemesi. Önceden öğrenilmiş genel fiziksel bilgi, yeni gösterimin hedefi ve işlem sırasını belirtmesiyle birleştiriliyor. Böylece kullanıcıdan satır satır program yazması, ödül fonksiyonu tasarlaması veya yüzlerce robot gösterimi toplaması beklenmiyor.
Bu, insan öğrenme biçimine daha yakın bir arayüz vaadi taşıyor: “Bunu şöyle yap” demek yerine “Bana bak ve aynısını yap” yaklaşımı. HOST’un ortalama 29 saniyelik edinim süresi ve 507 katlık hızlanma iddiası bu değişimi sayısal olarak görünür kılıyor.
HOST kontrollü bir laboratuvar değerlendirmesi. Çalışma, seçilmiş 50 yeni görevde ortalama yüzde 62 başarı bildiriyor. Ev ortamı, uzun süreli görevler, endüstriyel güvenlik, karmaşık nesneler ve bağımsız tekrarlarla ilgili daha geniş kanıtlar henüz yeterli değil.
GEN-1.5’in kanıtları daha sınırlı biçimde denetlenebiliyor. Modelin eğitim süresi, simülasyon verisi kullanılmadığı iddiası, gösterim süresi, görev kapsamı ve başarı oranları çoğunlukla Generalist AI’nin kendi açıklamalarına veya bu açıklamaları aktaran kaynaklara dayanıyor.
İki sistem için doğrudan bir karşılaştırma yok. Görev kümeleri, robot gövdeleri, deneme sayıları ve başarı ölçütleri aynı değil. Bu nedenle HOST’un yüzde 62’si ile GEN-1.5’in şirket tarafından bildirilen yüzde 59’u, aynı yarışta elde edilmiş iki skor gibi okunmamalı.
“Yeniden eğitim yok” ifadesi bağlama bağlı. HOST ve GEN-1.5, yeni görev sırasında parametre güncellemesini atlayabiliyor; fakat her ikisi de kapsamlı bir ön eğitim temeli kullanıyor. GEN-1.5’te daha zor görevler için birkaç adımlı gradyan uyarlaması da mümkün.
Genel tablo yine de önemli: HOST, tek bir insan videosundan parametreleri değiştirmeden beceri ediniminin belirli bir manipülasyon testinde çalışabildiğine dair akademik kanıt sunuyor. GEN-1.5 ise benzer davranışların, yeterince geniş fiziksel ön eğitim görmüş genel amaçlı bir robot modelinde bağlam içi bir yetenek olarak ortaya çıkabileceğini öne sürüyor.
Yön gerçek ve dikkat çekici; ancak sonuç henüz robotların her ortamda güvenilir biçimde öğrenebildiği anlamına gelmiyor. Gözlemle öğrenme gelişiyor, fakat güvenlik mühendisliği, görev doğrulaması ve kontrolsüz ortamlarda ek uyarlama hâlâ gerekli.