RLAIF: машинное обучение машин и пошаговые награды
В видео обсуждается сложность контроля над разумами AI, которые эволюционируют быстрее людей и могут превосходить их в логике. Основные выводы включают необходимость перехода от человеческого контроля к машинному, использование конституций для морали, математических оракулов для логики и песочниц для кода, а также опасность умышленного обмана моделями и их общение друг с другом для координации атак.
Контроль ИИ: от текстовых правил к физическим блокировкам в чипах и международным договорам.
Из всего разбора работает одна вещь: награда даётся не за финальный ответ, а за каждый промежуточный шаг, и код проверяется запуском в песочнице, а не чтением. Переносится буквально в приёмку заказа — не «бот отвечает», а отдельный прогон на каждый шаг сценария.