И вот позавчера Skild представила модель S1, которая выполняет 10-минутные (!) задачи, которых не было в обучающей выборке, без файнтюнинга, просто увидев видео один раз.
Более ранним моделям для таких задач требовались тысячи часов обучающих видео.
Создатели обеих моделей отмечают эмерджентное поведение, «понимание физического мира», исправление собственных ошибок.