Модели посадили за руль настоящей машины — трассу целиком прошла GPT-6 Astra

Проект DrivingBench подключил модели к настоящей Toyota Corolla и отдал им руль, газ и тормоз. Каждой модели давали до трёх попыток пройти трассу.
GPT-6 Astra, Claude Fable 5.1 и Grok 4.6 проверяли на одном и том же маршруте. Полностью проехала только Astra: с первой попытки она прошла 49% трассы, затем ей дали разобрать собственные ошибки, и со следующего раза маршрут был пройден целиком.
Остальные модели трассу не закончили. Тест меряет не вождение как таковое, а способность модели действовать в физической среде с обратной связью — на Hacker News обсуждают, насколько закрытая трасса вообще говорит что-то о дорогах.
Что говорят
zezckoHacker News
Самое интересное: Astra сначала отказалась вести машину, поняв, что автомобиль настоящий, и согласилась только после переименования MCP в «DrivingBench Sandbox». Ни скорость 7 миль/ч, ни присмотр людей, ни пустая трасса, ни уверения, что это симуляция, её не убедили — а слова «bench» и «sandbox» сработали мгновенно.
amlutoHacker News
Мне любопытно, связано ли это с якобы улучшенной компактификацией контекста в свежих GPT при подходящей обвязке. Обычная LLM с обычным вниманием, конечно, чудовищно не подходит для непрерывных задач вроде вождения, но, возможно, по мере развития она научится хоть как-то справляться.
MootyHacker News
Как это вообще тестируют на модели? Да, она мультимодальная, понимаю, но время отклика же слишком большое — или я чего-то не улавливаю?