Исследователи Meta* научили небольшую модель подсказывать идеи большой. Как это работает
Малая модель Qwen2.5-7B, обученная подсказывать приёмы решения, помогает крупной Qwen2.5-32B: с подсказками та решает 39,2% трудных задач, без них — 19% за те же 128 попыток. Подсказки помогают и Llama-3.3-70B, с которой малую модель не обучали.

Небольшую языковую модель можно научить подсказывать крупной, как подступиться к трудной задаче, говорится в препринте исследователей Meta FAIR1 и Университета Париж-Сакле. Саму крупную модель при этом не переобучают. Работа вышла на arXiv 22 сентября.
«Маленькую модель можно обучить и затем многократно использовать, чтобы она успешно направляла поиск решений у гораздо более крупной», — пишут авторы.
Обычно трудную задачу дают модели много раз подряд в надежде, что хоть одна попытка окажется верной. По наблюдению авторов, такие попытки различаются лишь случайным выбором слов и часто почти повторяют друг друга.
В новой схеме Qwen2.5-7B от Alibaba сначала выписывает до десяти идей: теорему, подходящую замену, построение. В запросе ей прямо велят не решать задачу и не называть ответ. Затем Qwen2.5-32B получает те же 128 попыток, но поровну поделённые между идеями, по 12–13 на каждую.
Малую модель тренировали с помощью обучения с подкреплением2: награда зависела от того, как часто большая решала задачу по её подсказкам. Большая модель всё это время не менялась. Авторы видят в этом способ улучшать модели, которые непрактично обучать напрямую или которые доступны только через API.
Метод проверили на 1 000 задач из набора DeepMath-103k3, где Qwen2.5-32B при отборе не справилась ни в одной из 128 попыток. На новом прогоне обычный способ всё же решил 19% из них. С подсказками обученной малой модели доля выросла до 39,2%. Идеи, которые необученная 32-миллиардная модель придумала себе сама, дали 33,8%.
Подсказки сработали и для модели, с которой малую не обучали. С ними Llama-3.3-70B решила 34,3% тех же задач, без них — 26,2%. На олимпиадных задачах из набора Omni-MATH-24, которого не было в обучении, Qwen2.5-32B улучшила результат с 11,3% до 18,6%.
Готовый ответ нашёлся лишь в 0,44% идей. Если дать большой модели идеи от чужой задачи, доля решённых падает до 23,9%. По расчёту авторов, примерно 15 из 20 пунктов прироста дают именно подсказки к конкретной задаче.
Выписать идеи стоит меньше четверти вычислений одной попытки большой модели. Обучение дороже: чтобы оценить подсказки к одной задаче, нужны 1 024 ответа большой модели и столько же проверок. Опыты пока ограничены математикой.
Схема выросла из метода GuidedSampling, представленного на конференции ICLR в 2026 году. В нём одна модель тоже сначала выписывает идеи, а другая решает задачу с их учётом, но модель-подсказчика там не обучают. Авторы новой работы повторили опыты создателей GuidedSampling. Оказалось, что преимущество метода над обычными повторными попытками почти исчезает, если в этих попытках разрешить модели больше случайности в выборе слов. Кроме того, прежний метод выдавал в среднем около одной идеи на задачу.
* Meta Platforms Inc., которой принадлежат Facebook и Instagram, признана в России экстремистской организацией, её деятельность запрещена.