ИИтак

← Назад

Исследователи Meta* научили небольшую модель подсказывать идеи большой. Как это работает

Малая модель Qwen2.5-7B, обученная подсказывать приёмы решения, помогает крупной Qwen2.5-32B: с подсказками та решает 39,2% трудных задач, без них — 19% за те же 128 попыток. Подсказки помогают и Llama-3.3-70B, с которой малую модель не обучали.

Fig.1 Labiad et al. (Meta FAIR), arXiv:2609.26704, CC BY 4.0: training concept generator.

Небольшую языковую модель можно научить подсказывать крупной, как подступиться к трудной задаче, говорится в препринте исследователей Meta FAIR1 и Университета Париж-Сакле. Саму крупную модель при этом не переобучают. Работа вышла на arXiv 22 сентября.

«Маленькую модель можно обучить и затем многократно использовать, чтобы она успешно направляла поиск решений у гораздо более крупной», — пишут авторы.

Обычно трудную задачу дают модели много раз подряд в надежде, что хоть одна попытка окажется верной. По наблюдению авторов, такие попытки различаются лишь случайным выбором слов и часто почти повторяют друг друга.

В новой схеме Qwen2.5-7B от Alibaba сначала выписывает до десяти идей: теорему, подходящую замену, построение. В запросе ей прямо велят не решать задачу и не называть ответ. Затем Qwen2.5-32B получает те же 128 попыток, но поровну поделённые между идеями, по 12–13 на каждую.

Малую модель тренировали с помощью обучения с подкреплением2: награда зависела от того, как часто большая решала задачу по её подсказкам. Большая модель всё это время не менялась. Авторы видят в этом способ улучшать модели, которые непрактично обучать напрямую или которые доступны только через API.

Метод проверили на 1 000 задач из набора DeepMath-103k3, где Qwen2.5-32B при отборе не справилась ни в одной из 128 попыток. На новом прогоне обычный способ всё же решил 19% из них. С подсказками обученной малой модели доля выросла до 39,2%. Идеи, которые необученная 32-миллиардная модель придумала себе сама, дали 33,8%.

Подсказки сработали и для модели, с которой малую не обучали. С ними Llama-3.3-70B решила 34,3% тех же задач, без них — 26,2%. На олимпиадных задачах из набора Omni-MATH-24, которого не было в обучении, Qwen2.5-32B улучшила результат с 11,3% до 18,6%.

Готовый ответ нашёлся лишь в 0,44% идей. Если дать большой модели идеи от чужой задачи, доля решённых падает до 23,9%. По расчёту авторов, примерно 15 из 20 пунктов прироста дают именно подсказки к конкретной задаче.

Выписать идеи стоит меньше четверти вычислений одной попытки большой модели. Обучение дороже: чтобы оценить подсказки к одной задаче, нужны 1 024 ответа большой модели и столько же проверок. Опыты пока ограничены математикой.

Схема выросла из метода GuidedSampling, представленного на конференции ICLR в 2026 году. В нём одна модель тоже сначала выписывает идеи, а другая решает задачу с их учётом, но модель-подсказчика там не обучают. Авторы новой работы повторили опыты создателей GuidedSampling. Оказалось, что преимущество метода над обычными повторными попытками почти исчезает, если в этих попытках разрешить модели больше случайности в выборе слов. Кроме того, прежний метод выдавал в среднем около одной идеи на задачу.

← Все новости