разбор · бенчмарк
3.0
из 10
смотреть не обязательно — забрать выжимку и пункты
оценка машинная и частично зависит от длины ролика — спорите, открывайте оригинал
Terminal-Bench: стандарт оценки агентов в терминале
Terminal-Bench: Pushing Claude Code, OpenAI Codex, Factory Droid, et al to the limits
Terminal-Bench — это бенчмарк для оценки агентов в терминале, который стал стандартом для многих лабораторий. Авторы подчеркивают важность разделения модели и агента, а также будущее эвалов в сторону реальной экономической ценности.
Terminal-Bench — это бенчмарк и фреймворк для оценки агентов через терминал, с фокусом на реальные задачи и…
что из этого моё
Можно применить для выбора моделей и агентов: использовать Terminal-Bench для сравнения, учитывая не только точность, но и стоимость. Также идея разделения модели и агента помогает в оркестрации: выбирать лучшую модель для конкретного агента.
Что забрать
отметь, что берёшь в работу → или отбрось как не своёмоё →
запустить Terminal-Bench локально на своей модели и сравнить точность и стоимость с Claude
вынести разделение модели и агента в конвейер разборов: отдельный промпт для модели и обвязка
создать задачу для бенчмарка на основе реального рабочего процесса разбора видео
о чём говорят, по времени
главы доводят до 25:00 · дальше по ролику меток нет
01
Введение и знакомство00:00 ↗
Гости рассказывают о себе и о происхождении Terminal-Bench.
02
Дизайн задач05:00 ↗
Обсуждение структуры задач и их разнообразия.
03
Адаптация и будущее12:00 ↗
Обсуждение адаптации других бенчмарков и планов развития.
04
Модель vs агент18:00 ↗
Разделение оценки модели и агента, важность простого агента.
05
Будущее эвалов25:00 ↗
Обсуждение двухмерных метрик и экономической ценности.