← Материалы разборы Yersham
разбор · иитема в работе · H 1.22
3.0
из 10
смотреть не обязательно — забрать выжимку и пункты
оценка машинная и частично зависит от длины ролика — спорите, открывайте оригинал

Стресс-тест Grok 4.3: быстрая генерация маскирует слабое планирование

Независимый стресс-тест Grok 4.3 и превью Ernie 5.1 на логической головоломке с лифтом при отключённых внешних инструментах: быстрая генерация маскирует слабое планирование, первый отказ Grok из-за придирок к правилам сменяется рабочим решением после перезапуска, а оптимум модель находит только по требованию человека.

ИИ-модели без внешних инструментов показывают слабость: Ernie суетится, Grok впадает в ступор. Только…

что из этого моё

Не принимать первый ответ модели как финальный: Grok 4.3 выдал маршрут в 11 шагов, а после прямого требования найти короче — 8, уровень лучших моделей. В заказные боты и сайты закладывать обязательный второй круг «сократи и упрости» перед сдачей; быстрая генерация, как у Ernie 5.1 с её 19 шагами, качества не гарантирует.

Что забрать
отметь, что берёшь в работу → или отбрось как не своёмоё →
добавить в конвейер разборов второй проход «сократи и упрости» перед выдачей результата
замерить число шагов рассуждения своей модели на головоломке с лифтом при отключённых MCP
о чём говорят, по времени
главы доводят до 07:19 · дальше по ролику меток нет
01
Введение00:01
Обсуждение проблемы ИИ в сложных условиях.
02
Тесты на MCP01:03
Инструменты, отключение которых заставляет ИИ использовать только внутреннюю логику.
03
Логические головоломки03:09
Тесты на удержание контекста и многошаговое планирование.
04
Параметры генерации04:43
Влияние параметра генерации на вычислительный бюджет ИИ.
05
Результаты тестов07:19
Анализ эффективности моделей Ernie 5.1 и GRК 43.
дальше в дело
Собрать это в маршрут
все маршруты →
не хочешь разбираться сам
Сделаю это под задачу
форматы и цены →
похожие по смыслу · из облака
ещё разборы