Canonical показала, как дообучить языковую модель в Charmed Kubeflow
В примере GPT-2 дообучают на компьютере с 32 ГБ памяти и 16 ядрами, без видеокарты. Получившийся чат-бот повторяет одну и ту же фразу, признаёт автор инструкции.

Canonical по шагам описала, как на собственном оборудовании дообучить1 небольшую языковую модель и сделать из неё чат-бота. Инструкция опубликована в блоге компании. Всё собирается на Charmed Kubeflow — это сборка открытой платформы Kubeflow от Canonical. Платформа нужна, чтобы обучать и запускать модели на Kubernetes2.
Canonical — британская компания, которая разрабатывает Ubuntu. Для примера нужен один компьютер с Ubuntu 24.04 или новее, 32 ГБ оперативной памяти и 16 ядрами процессора. Видеокарт у автора не было. Все файлы проекта выложены на GitHub.
Данные — набор текстов nampdn-ai/tiny-webtext с Hugging Face. Его собрали, чтобы развивать у моделей критическое мышление. Тексты загружают в базу PostgreSQL и регистрируют в Feast. Это открытое хранилище признаков: подготовленные один раз данные можно брать для разных задач обучения. Обучение запускает модуль Kubeflow Trainer. Веса модели сохраняются на постоянный диск Kubernetes объёмом 20 ГБ. Дальше сервис KServe отдаёт готовую модель через API, похожий на API OpenAI.
За основу в инструкции взята GPT-2 — модель 2019 года. Её дообучение занимает час или больше, в зависимости от оборудования. На вопрос о любимом цвете готовый бот отвечает: «Я люблю цвет машины». Затем он раз за разом повторяет «Я люблю, как она выглядит».
«Что ж, кульминации не случилось», — признал автор инструкции. Он советует взять модель посовременнее, например Qwen2.5-0.5B-Instruct3 от Alibaba. На тот же вопрос она отвечает связно. Но на том же наборе данных её дообучение заняло у автора целый день.