Обучение трансформера локально: посимвольная токенизация и температура
Видео раскрывает, что создание нейросетей и больших языковых моделей (LLM), включая трансформеры, не так сложно, как кажется. Авторы демонстрируют, что с небольшим количеством кода на Python можно обучить модель на обычном ноутбуке. Основываясь на токенизации, эмбедингах и архитектуре трансформера, процесс обучения модели аналогичен для моделей любого размера, важны скорость обучения и генерация текста с помощью параметра температуры.
LLM обучается на ноутбуке за 15 минут: токенизация, трансформер, обучение — те же принципы, что у GPT, разница
Заказного бота проверять на вопросах, которых не было при настройке: в ролике нулевая ошибка на тренировке — признак зубрёжки, модель воспроизводит заученное и ломается на новом. Отложить пяток реальных вопросов клиента и не показывать их системе до приёмки.