Команда исследователей из Navers Lab, Einsia.AI, Пекинского университета и Университета Цинхуа под руководством Минцзюй Гао (Mingju Gao) и Циньхуай На (Qinhuai Na) опубликовала работу «World Models’ Last Exam in Physics». Учёные проверили способность восьми современных видеогенераторов соблюдать законы естествознания.
Нейросети вроде Wan2.2, Seedance 2.5 или Cosmos 3 Super создают плавные ролики с естественным освещением. Создатели роботов и беспилотных машин планируют использовать такие модели как цифровые полигоны, где алгоритм учится взаимодействовать с миром через видеосимуляцию.
Новая работа показывает, что визуальная гладкость маскирует грубые ошибки в расчётах траекторий и скоростей.
Компьютерное зрение вместо человеческого глаза
Прежние методы тестирования опирались на текстовые нейросети-оценщики, которые сами часто ошибаются в динамике движения.
Авторы нового исследования построили полностью автоматический измерительный стенд. Они применили алгоритм трекинга точек CoTracker3 и систему сегментации объектов SAM 2. Программа размечает границы тел, находит центр масс и высчитывает числовые параметры кадра: углы падения и отражения световых лучей, время колебаний маятников, изменения уровня воды. Чтобы избежать ошибок из-за неизвестного масштаба камеры, авторы составили задания так, чтобы лишние величины взаимно сокращались.
Например, при броске предмета под углом 45 градусов отношение максимальной высоты к полной дальности полёта обязано составлять ровно один к четырём независимо от разрешения экрана.
Провал в динамике при успехе в статике
Набор тестов включил 40 задач по 9 направлениям, охватывающим механику, оптику, плавучесть, термодинамику и электромагнетизм. Ни одна модель не справилась с экзаменом на базовом инженерном уровне.
Самый высокий средний балл показала сеть Seedance 2.5, набрав 57,76 из 100 возможных. Худшая модель в тесте, CogVideoX 1.5, получила 18,81 балла.
Модели успешно удерживают статическое равновесие: с задачей на одинаковый уровень жидкости в сообщающихся сосудах справились все участники с результатом выше 93 баллов. Как только в кадре начинается сложное контактное взаимодействие или фазовый переход, алгоритмы теряют логику процесса.
В эксперименте с таянием плавающего куска льда, внутри которого спрятан тяжёлый камень, средняя оценка всех восьми моделей по физическим параметрам составила 0 баллов. Нейросети рисовали процесс таяния, но уровень воды менялся произвольно, игнорируя закон Архимеда и разницу плотностей.
Границы применимости полученных оценок
Измерительный конвейер авторов продемонстрировал среднюю оценку 97,53 балла на контрольной группе из 480 синтетических роликов с заранее известной физикой, что подтверждает чувствительность измерительных скриптов. Однако у самого теста есть методологические ограничения.
Авторы ввели жесткий фильтр непрерывности: если языковая модель видит исчезновение предмета или сильное мерцание текстур, физический результат видеоролика обнуляется. Кроме того, все формулы калиброваны под строго перпендикулярный боковой ракурс камеры.
В сценах со сложной трёхмерной перспективой или подвижной камерой алгоритм пока не способен отделить геометрическое искажение объектива от ошибки самой нейросети.
До устранения этих барьеров использовать современные генеративные видеомодели для обучения автопилотов и шагающих роботов без контроля классических физических движков небезопасно.