ИИтак

← Назад

Рекомендации разработчика · модели Gemini 3 и 3.1

Как работать с Gemini 3

Пересказ на русском. Оригинал: «Gemini 3 developer guide» ↗ — Google, 23 сентября, на английском.

Руководство Google для тех, кто подключает модели Gemini 3 через Gemini API: как дозировать рассуждения, почему не трогать температуру, как строить длинные запросы и какие инструменты доступны. Google уже пометил страницу устаревшей и отсылает к руководству по Gemini 3.5 Flash, но для моделей 3-й серии советы остаются в силе.

Семейство и его пределы

В серию входят Gemini 3.1 Pro — для сложных задач, где нужны широкие знания о мире и рассуждения над текстом, картинками и видео; Gemini 3 Flash — по словам Google, интеллект уровня Pro при скорости и цене Flash; Gemini 3.1 Flash-Lite — рабочая лошадка для дешёвых массовых задач; и две модели для картинок, Gemini 3 Pro Image (она же Nano Banana Pro) и Gemini 3.1 Flash Image (Nano Banana 2). Все модели серии пока в предварительной версии.

Текстовые модели принимают до 1 миллиона токенов на входе и выдают до 64 тысяч. Знания заканчиваются январём 2025 года, за более свежим Google советует ходить через инструмент поиска. У Gemini 3 Flash в API есть бесплатный уровень, у Gemini 3.1 Pro нет, хотя обе можно бесплатно попробовать в Google AI Studio.

Уровень размышлений

Gemini 3 по умолчанию рассуждает перед ответом, а глубину регулирует параметр thinking_level. Он задаёт не точное число токенов, а верхнюю планку: Google описывает уровни как относительные разрешения на размышление, а не строгие гарантии. Если параметр не указан, действует high.

Четыре уровня:

Старый параметр thinking_budget пока работает, но Google советует перейти на thinking_level ради предсказуемости. Указывать оба в одном запросе нельзя, API ответит ошибкой 400. Тем, кто работает через слой совместимости с OpenAI, менять ничего не нужно: reasoning_effort сам переводится в thinking_level.

Температура и подписи мыслей

Температуру — настройку случайности ответа — у всех моделей Gemini 3 Google настоятельно советует оставить на значении по умолчанию, 1.0. Прежние модели выигрывали от её подстройки, а рассуждения Gemini 3 отлажены именно под 1.0: при значениях ниже модель может зациклиться или отвечать хуже, особенно в математике и сложных рассуждениях. Если в вашем коде температура выставлена явно, особенно низкая ради предсказуемости, параметр советуют просто убрать.

Между вызовами API модель помнит ход мыслей через подписи мыслей — зашифрованные слепки внутреннего рассуждения. Если история разговора хранится у Google (режим с previous_interaction_id, его и рекомендуют), подписями занимается сервер. Если историю вы собираете сами, блоки мыслей с подписями нужно возвращать в следующих запросах, иначе их подлинность не подтвердить. На тех же подписях держится и пошаговое редактирование картинок: просьбу вроде «сделай фон закатным» модель понимает в контексте прежних правок.

Как писать запросы

Gemini 3 — рассуждающая модель, и запросы для неё пишут иначе. Формулируйте коротко и прямо: многословные приёмы, которыми раньше заставляли модель думать, например расписанную по шагам цепочку рассуждений, Gemini 3 может начать разбирать вместо того, чтобы делать дело. При переходе с Gemini 2.5 такие конструкции советуют убрать и поставить thinking_level: high.

По умолчанию модель отвечает коротко и по существу. Если продукту нужен разговорчивый, дружелюбный собеседник, эту манеру задают в запросе прямо.

С большими данными — целой книгой, кодовой базой, длинным видео — порядок такой: сначала данные, а вопрос или указание в самом конце. Вопрос стоит начинать с отсылки к приведённым выше материалам, чтобы модель опиралась на них.

Инструменты

Модели серии работают со встроенными инструментами Google — поиском, картами, поиском по файлам, выполнением кода и чтением страниц по ссылке — и с вашими собственными функциями. Встроенные инструменты и свои функции теперь можно указать в одном запросе, а ответ получить структурированным, по заданной схеме: например, поиск в интернете, разбор найденных страниц и результат в виде JSON одним вызовом.

Gemini 3 Flash умеет разглядывать картинки активно: с подключённым выполнением кода она сама пишет и запускает код на Python, чтобы увеличить, обрезать или разметить изображение. Так она читает мелкие детали вроде показаний прибора или серийного номера, считает сумму по чеку, строит график по извлечённым данным, рисует стрелки и рамки в ответ на вопрос «куда это поставить». Результат вашей функции тоже может содержать картинку, а не только текст.

Модели для картинок рассуждают над запросом и могут сначала сходить в поиск за свежими данными — погодой, биржевым графиком — и лишь потом рисовать, с разрешением до 2K и 4K и разборчивым текстом на изображении.

Переход с Gemini 2.5

Что ещё проверить при переезде, кроме запросов и температуры:

Источник: Gemini 3 developer guide (Google), лицензия CC BY 4.0. Пересказ ИИтак.