Модели всё ещё соглашаются с абсурдом и дают 9% недовольства
Модели всё ещё плохо справляются с бессмысленными вопросами и сложными реальными задачами. Бенчмарки показывают прогресс, но данные Arena показывают, что недовольство ответами остаётся высоким (9%). Рассуждения не всегда помогают, а иногда ухудшают результат. Нужно фокусироваться на реальных сценариях и улучшать нижнюю часть распределения.
Модели сильны в узких тестах, но пасуют перед бессмыслицей и сложными экспертными задачами; нужно поднимать ни
Можно использовать BullshitBench для проверки критического мышления моделей при выборе для оркестрации. Учитывать, что reasoning не всегда помогает, и тестировать модели на реальных сценариях. Данные Arena о недовольстве (9%) показывают, что есть пространство для улучшения качества ответов в автоматизации. Категории с низким прогрессом (игры, медицина) — возможности для специализированных агентов.