На протяжении многих лет роботы сталкиваются с трудностями, которые людям кажутся простыми. Они не только должны понимать задачу, но и уметь правильно сопоставлять действия с конкретными предметами и их местоположением. Microsoft, совместно с группой исследователей из университетов, решает эту проблему с помощью нового теста под названием GroundedPlanBench.
Этот тест проверяет способность модели не только строить план действий, но и точно связывать каждый шаг с объектом на изображении. Обычно процесс состоит из двух частей: первая модель составляет словесный план, а вторая переводит его в реальные действия. Однако часто на этом этапе возникают ошибки, из-за чего робот может взять не тот предмет или выполнить лишнее действие.
Проблема особенно актуальна в загроможденных пространствах, где планирование и пространственная привязка осуществляются раздельно. В новом тесте необходимо не только продемонстрировать последовательность действий, но и жестко привязывать их к конкретным объектам. Это подход заставляет модель учесть физическую обстановку, что делает её более эффективной.
Исследователи разработали более 1000 заданий на основе взаимодействий роботов с предметами. Некоторые инструкции простые, например, положить ложку на тарелку, но есть и более сложные, что показывает, насколько алгоритмы далеки от человеческой логики. Система столкнулась с трудностью при выполнении даже простых заданий, когда описание не позволяло правильно различать объекты.
Кроме тестирования команда предложила новый метод обучения, названный Video-to-Spatially Grounded Planning (V2GP), что позволит моделям учиться на видео с задачами. Это обеспечит связь между действиями и конкретными объектами, что поможет улучшить эффективность выполнения задач, хотя полностью решить проблему ещё не удалось.