← Материалы разборы Yersham
разбор · бенчмарк
3.0
из 10
смотреть не обязательно — забрать выжимку и пункты
оценка машинная и частично зависит от длины ролика — спорите, открывайте оригинал

Terminal-Bench: стандарт оценки агентов в терминале

Terminal-Bench: Pushing Claude Code, OpenAI Codex, Factory Droid, et al to the limits

Terminal-Bench — это бенчмарк для оценки агентов в терминале, который стал стандартом для многих лабораторий. Авторы подчеркивают важность разделения модели и агента, а также будущее эвалов в сторону реальной экономической ценности.

Terminal-Bench — это бенчмарк и фреймворк для оценки агентов через терминал, с фокусом на реальные задачи и…

что из этого моё

Можно применить для выбора моделей и агентов: использовать Terminal-Bench для сравнения, учитывая не только точность, но и стоимость. Также идея разделения модели и агента помогает в оркестрации: выбирать лучшую модель для конкретного агента.

Что забрать
отметь, что берёшь в работу → или отбрось как не своёмоё →
запустить Terminal-Bench локально на своей модели и сравнить точность и стоимость с Claude
вынести разделение модели и агента в конвейер разборов: отдельный промпт для модели и обвязка
создать задачу для бенчмарка на основе реального рабочего процесса разбора видео
о чём говорят, по времени
главы доводят до 25:00 · дальше по ролику меток нет
01
Введение и знакомство00:00
Гости рассказывают о себе и о происхождении Terminal-Bench.
02
Дизайн задач05:00
Обсуждение структуры задач и их разнообразия.
03
Адаптация и будущее12:00
Обсуждение адаптации других бенчмарков и планов развития.
04
Модель vs агент18:00
Разделение оценки модели и агента, важность простого агента.
05
Будущее эвалов25:00
Обсуждение двухмерных метрик и экономической ценности.
дальше в дело
Собрать это в маршрут
все маршруты →
не хочешь разбираться сам
Сделаю это под задачу
форматы и цены →
похожие по смыслу · из облака
ещё разборы