Внутренние тесты моделей расходятся с независимыми
Обзор недельной подборки новостей: серийный человекоподобный робот повторяет движения хирурга в гарнитуре, генеративные модели заменяют игровой движок предсказанием следующего кадра, а сборка приложения сводится к описанию задачи обычными словами. Отдельно разбирается, почему внутренним тестам разработчиков верить нельзя: в независимых таблицах те же модели оказываются в конце первой десятки. Общий вывод обзора — граница между цифровой средой и физическим миром перестала быть жёсткой.
ИИ стирает границу между цифрой и физикой: от синхронных голосов и генерации миров до роботов-хирургов, где ун
Из всего обзора применимо одно правило: цифры из презентации разработчика ничего не значат, пока модель не проверена на своей задаче. Перед тем как ставить новую модель в конвейер обработки видео или в бота заказчика, прогнать её на десятке своих реальных примеров и сравнить с текущей — это полчаса работы против недели разбирательств потом.