Натан Ламберт выпустил учебник о дообучении моделей, в том числе о дистилляции
В издательстве Manning Publications вышла книга Натана Ламберта «Reinforcement Learning from Human Feedback». Её текст бесплатно выложен онлайн, к книге прилагаются 12-часовой видеокурс и учебный код.

Исследователь Натан Ламберт, автор рассылки Interconnects, дописал книгу о дообучении языковых моделей. Дообучение — этап после основного обучения, на котором модель учат следовать инструкциям, рассуждать и вести себя определённым образом. Книга вышла в издательстве Manning Publications под названием «Reinforcement Learning from Human Feedback: Aligning and Post-training LLMs». Печатную версию уже продают Manning Publications и американский Amazon, британский Amazon начнёт продажи в октябре.
Бумажную книгу покупать необязательно: весь текст бесплатно лежит на сайте. К нему прилагаются 12-часовой курс со слайдами и видео на YouTube, простой учебный код с упражнениями и сравнения ответов разных моделей. Всё началось как раз с сайта: Ламберт собирал там описания методов, которые, по его словам, больше нигде толком не объяснены. Например, выборку с отбраковкой и настройку «характера» модели.
Около четверти книги посвящено обучению с подкреплением: от базовой теории до алгоритмов PPO, GRPO, GSPO и CISPO. Ламберт хочет научить читателя отличать пустой новый алгоритм от перспективного. Он пишет, что книга не для новичков: она рассчитана на читателя со степенью бакалавра в информатике.
Отдельная глава объясняет дистилляцию, то есть обучение одних моделей на ответах других. Сейчас эту тему часто обсуждают как инструмент геополитической конкуренции. По словам Ламберта, «скучная» учебная глава нужна, чтобы снизить градус спора: она показывает, насколько широкое понятие скрывается за этим словом. Раздел об одной из разновидностей дистилляции автор, как он пишет, добавил в последний момент.
Вторая половина книги рассказывает, где дообучение чаще всего ломается: переоптимизация, регуляризация, оценка моделей, формирование характера. Название книги Ламберт сам считает немного устаревшим, но обещает, что содержание свежее. По его наблюдению, путь от научной статьи до передовой модели сейчас занимает от 3 до 9 месяцев, поэтому компаниям нужно уметь понимать, какие исследования действительно важны.