← Материалы разборы Yersham
разбор · reasoning
2.0
из 10
смотреть не обязательно — забрать выжимку и пункты
оценка машинная и частично зависит от длины ролика — спорите, открывайте оригинал

Test-time compute: харнесы временны, данные и RL-файнтюнинг остаются

Scaling Test Time Compute to Multi-Agent Civilizations — Noam Brown, OpenAI

Ноам Браун обсуждает эволюцию reasoning-моделей: от игр до масштабирования test-time compute. Ключевой вывод: модели требуют базового уровня system-one способностей, чтобы выигрывать от system-two мышления. Харнесы и роутеры — временные костыли, которые будут смыты масштабированием. Рекомендация разработчикам: не строить долгосрочные решения на текущих ограничениях, а инвестировать в данные и RL-файнтюнинг.

Reasoning models are the key to scaling AI, but harnesses and routers are temporary crutches that will be repl

что из этого моё

Видео полезно для понимания трендов: reasoning-модели становятся основой, а харнесы/роутеры — временны. Для оператора buyanov.io это сигнал не вкладываться в сложные оркестрации, а использовать готовые reasoning-модели (например, o3) для задач автоматизации и агентов, фокусируясь на данных и RL-файнтюнинге под специфику проектов.

Что забрать
отметь, что берёшь в работу → или отбрось как не своёмоё →
переписать конвейер разборов на использование reasoning-модели o3 для задач с нечеткими критериями
замерить, насколько улучшится качество разборов при замене текущей модели на o3
о чём говорят, по времени
главы доводят до 30:00 · дальше по ролику меток нет
01
Дипломатия и Цицеро00:00
Ноам рассказывает, как работа над Цицеро улучшила его собственную игру и привела к победе на чемпионате мира.
02
Восприятие ИИ и безопасность06:00
Обсуждение того, как сообщество безопасности отреагировало на Цицеро, и почему управляемость важна.
03
Эволюция reasoning-моделей12:00
Ноам объясняет, почему reasoning-парадигма требует сильной базовой модели и как это связано с system-one и system-two.
04
Харнесы и роутеры20:00
Мнение о том, что харнесы и роутеры — временные решения, которые будут заменены более сильными моделями.
05
RL-файнтюнинг и данные30:00
Рекомендация инвестировать в сбор данных и reinforcement fine-tuning, так как это останется полезным при улучшении моделей.
дальше в дело
Собрать это в маршрут
все маршруты →
не хочешь разбираться сам
Сделаю это под задачу
форматы и цены →
похожие по смыслу · из облака
ещё разборы