Роботам опять предлагают думать
Исследователи Массачусетского технологического университета (MIT) разработали систему VLASH, которая позволяет роботам планировать следующее движение, не останавливая выполнение предыдущего. Как это происходит обычно: робот получает изображение с камеры и команду, рассчитывает серию действий, выполняет её — и только после этого снова принимается за анализ и формирование новой команды. Отсюда возникают паузы.
Запустить расчёты параллельно с движением можно и без VLASH, но появляется другая проблема: пока модель размышляет, рука уже успевает переместиться. В итоге новая команда рассчитана для положения, в котором робота больше нет, и движения становятся дёргаными 👆🏻 VLASH заранее прокручивает уже запланированные действия и вычисляет, какое положение нужно занять к моменту выполнения следующей команды.
Чтобы модель действительно учитывала эти данные, её дополнительно обучали на одном и том же изображении, но с разными будущими положениями робота и соответствующими действиями. А для дальнейшего ускорения несколько мелких движений объединяли в одно крупное: вместо десятка коротких шажков манипулятор сразу переходил к следующей важной точке траектории.
Метод проверили с несколькими VLA-моделями, включая π0.5 от Physical Intelligence, GR00T N1.6 от NVIDIA и SmolVLA от Hugging Face, а также на двуруком роботе Galaxea R1 Lite и небольшом манипуляторе LeRobot SO-101. При перекладывании, сортировке и складывании кубиков задачи выполнялись в 1,5-2 раза быстрее без ухудшения результата, а максимальная задержка реакции сократилась до 11,8 раза.
Для наглядности робота отправили играть в пинг-понг: стандартная VLA-модель, которая рассчитывает движения и только потом их выполняет, не отбила ни одной из двадцати подач. VLASH же справился с одиннадцатью. Ещё система заметно лучше показала себя в игре Whac-A-Mole (это та, где надо успевать ударить крота по темечку) — но это уже другой вопрос, насколько достойно мы применяем большие языковые модели.
@anti_robots
«Нероботы» - канал из категории «Технологии», подключенный к сервису кросспостинга MaxGate. Публикации канала синхронизируются между Telegram и мессенджером MAX, а на этой странице собраны ссылки на обе версии канала.
Сейчас у канала 154 подписчика суммарно в Telegram и MAX. За последние 21 день в истории MaxGate учтено 21 публикаций, поэтому перед подпиской можно оценить не только размер аудитории, но и регулярность обновлений.
Чтобы подписаться, используйте кнопки «Открыть в MAX» и «Открыть в Telegram» в верхней части страницы. У отдельных постов ссылка может быть доступна в обоих мессенджерах или только в одном из них, если MaxGate получил такой URL из истории обработки.
Кожаные, подвиньтесь
Минэкономики подготовило финальную редакцию проекта экспериментального правового режима для роботов-доставщиков и направило её в правительство. Эксперимент планируют запустить на три года в 35 регионах: документ впервые подробно прописывает, где роверы смогут ездить, с какой скоростью и как должны вести себя рядом с пешеходами.
По велодорожкам им разрешат разгоняться до 25 км/ч, по тротуарам — до 10 км/ч. Совсем узкие места решили оставить людям: сквозное движение по тротуару шириной меньше метра запретят.
Перед пешеходным переходом робот должен будет сбросить скорость до 6 км/ч, следить за светофором и уступать людям. А вот спорить с регулировщиком ему нельзя — при виде него сразу надо искать другой маршрут. Зато роверам разрешат заезжать внутрь зданий, а в перспективе — самостоятельно пользоваться лифтами. Ждём тот день, когда из квартиры можно больше не выходить.
Сам робот должен быть не длиннее 110 см, не шире 80 см и весить максимум 120 кг без груза; мощность электродвигателя ограничат 4 кВт. Ещё понадобятся номер, фонари, светоотражатели и звуковой сигнал.
Сейчас в России работает больше тысячи таких роверов, и весь парк принадлежит «Яндексу». По плану эксперимента, через три года рободоставщиков должно стать уже 12 тысяч. Так что готовимся к тому, что придётся ютиться на тротуаре и с самокатчиками, и с роверами.
@anti_robots
Робот-кентавр с мёртвыми глазами придёт к вам домой. Но зайти не сможет — у него рога
Калифорнийский стартап Satyress представил Threehalves — телеуправляемого робота с человеческим торсом, четырьмя ногами и головой рогатого козла. Его предлагают отправлять туда, где человеку лучше не появляться: на пожары, завалы, промышленные объекты, в шахты и заражённые зоны.
Четыре ноги дают устойчивость, а вместо кистей у робота быстросъёмные интерфейсы для бензопил, дрелей и другого инструмента. К насадкам можно подвести питание на 12, 18 или 48 вольт и сжатый воздух. Повреждённые конечности, торс и голову обещают менять и калибровать прямо в полевых условиях.
Но прекраснее всего раздел безопасности на официальном сайте. При потере давления тормоза и механические фиксаторы должны обездвижить робота. Если автоматика не поможет, резервуары со сжатым воздухом в корпусе разрешается пробить острым предметом или выстрелом.
А если этого покажется недостаточно, компания предлагает установить рога побольше — чтобы робот физически не мог пройти через дверной проём. Но зато он у удовольствием посмотрит вам прямо в душу.
@anti_robots
Вижу, следовательно, осязаю
Робототехника в буквальном смысле упёрлась в кончики пальцев. Камера показывает положение предмета, но не всегда замечает, что он проскальзывает в захвате, упёрся в край отверстия или прижат с перекосом.
Здесь помогают тактильные датчики. Но они хрупкие, требуют отдельной установки и калибровки, а показания разных систем сложно свести к общему формату. Американские исследователи нашли способ частично обойти проблему: научить камеру предсказывать, что должны чувствовать пальцы.
Система FELT получает один RGB-кадр с камеры на запястье. Предобученный визуальный энкодер DINOv2 извлекает визуальные признаки, а отдельный декодер превращает их в две карты давления размером 12 × 32 ячейки, по одной на каждый палец захвата.
Генератор предварительно обучили на 2,6 млн пар «кадр — показания датчиков» из более чем 2700 демонстраций. После этого новые демонстрации можно собирать уже без тактильного оборудования. FELT либо дорисовывает к старым визуальным данным карты давления, либо сразу передаёт управляющей модели скрытое представление контакта. Во время работы робота тоже достаточно камеры. Генерация занимает около 20 мс на RTX 4090.
На четырёх задачах добавленное таким образом «осязание» улучшило финальную успешность относительно одной камеры:
▪️ вставка трубки: 50% против 40%;
▪️ сбор четырёх чашек в стопку: 35-45% против 25%;
▪️ стирание надписи: 75-85% против 65%;
▪️ вставка треугольного штифта: 70-90% против 50%.
Самый странный результат получился со штифтом. Скрытые признаки FELT дали 90% успешных вставок, тогда как настоящий датчик давления дал 70%. Авторы предполагают, что при 60 обучающих демонстрациях модели оказалось проще тыкать пальцем в небо, чем использовать шумные физические измерения.
@anti_robots