разбор · иитема в работе · H 1.22
3.0
из 10
смотреть не обязательно — забрать выжимку и пункты
оценка машинная и частично зависит от длины ролика — спорите, открывайте оригинал
Стресс-тест Grok 4.3: быстрая генерация маскирует слабое планирование
Независимый стресс-тест Grok 4.3 и превью Ernie 5.1 на логической головоломке с лифтом при отключённых внешних инструментах: быстрая генерация маскирует слабое планирование, первый отказ Grok из-за придирок к правилам сменяется рабочим решением после перезапуска, а оптимум модель находит только по требованию человека.
ИИ-модели без внешних инструментов показывают слабость: Ernie суетится, Grok впадает в ступор. Только…
что из этого моё
Не принимать первый ответ модели как финальный: Grok 4.3 выдал маршрут в 11 шагов, а после прямого требования найти короче — 8, уровень лучших моделей. В заказные боты и сайты закладывать обязательный второй круг «сократи и упрости» перед сдачей; быстрая генерация, как у Ernie 5.1 с её 19 шагами, качества не гарантирует.
Что забрать
отметь, что берёшь в работу → или отбрось как не своёмоё →
добавить в конвейер разборов второй проход «сократи и упрости» перед выдачей результата
замерить число шагов рассуждения своей модели на головоломке с лифтом при отключённых MCP
о чём говорят, по времени
главы доводят до 07:19 · дальше по ролику меток нет
01
Введение00:01 ↗
Обсуждение проблемы ИИ в сложных условиях.
02
Тесты на MCP01:03 ↗
Инструменты, отключение которых заставляет ИИ использовать только внутреннюю логику.
03
Логические головоломки03:09 ↗
Тесты на удержание контекста и многошаговое планирование.
04
Параметры генерации04:43 ↗
Влияние параметра генерации на вычислительный бюджет ИИ.
05
Результаты тестов07:19 ↗
Анализ эффективности моделей Ernie 5.1 и GRК 43.