Рекомендации разработчика · модель Gemini 3.8 Flash
Как работать с Gemini 3.8 Flash
Пересказ на русском. Оригинал: «What's new in Gemini 3.8 Flash» ↗ — Google, 23 сентября, на английском.
Руководство Google по переходу на Gemini 3.8 Flash: три уровня размышлений без minimal, настройки, которые нужно убрать, и правила для многоходовых разговоров и вызовов функций.
Коротко
- Уровней размышлений три:
low,mediumиhigh; по умолчаниюmedium, аminimalвозвращает ошибку. - Уберите
temperature,top_p,top_kиcandidate_count;thinking_budgetзамените наthinking_level. - Историю разговора ведите на сервере через
previous_interaction_id; заранее заполненные ходы модели удалите. - В generateContent — режиме, где историю собирает ваш код, — у каждого
FunctionResponseдолжны бытьcall_idиname. - На долгих задачах модель по замыслу тратит больше токенов; для повседневных задач понижайте уровень.
Уровень размышлений
Модель рассчитана на долгую работу над кодом, автономных агентов и сложные корпоративные процессы; глубину рассуждений задаёт thinking_level.
low— быстрый ответ там, где важна задержка: разбор инцидентов, чат в реальном времени, черновики, быстрый анализ данных.medium— уровень по умолчанию, лучшее качество для большинства задач; для сложного кода и агентов даёт больше верных ответов с первой попытки.high— предельная глубина рассуждений и работы с инструментами: глубокий анализ, математика, трудные многошаговые задачи.
Пример{"thinking_level": "medium"} и запрос «Найди в этом платёжном сервисе гонки данных при повторных попытках и безопасно перепиши блокировки транзакций».
Расход токенов
На долгих и сложных задачах модель тратит больше токенов, и так задумано: она делает мелкие шаги рассуждений, раз за разом вызывает инструменты и проверяет свою работу. Не каждому процессу нужна такая проверка.
- Решите, нужна ли задаче многошаговая проверка.
- Для повседневных задач понизьте
thinking_level— расход токенов упадёт. - Если такая работа не нужна, Gemini 3.7 Flash остаётся полностью поддерживаемой.
Вместоthinking_level: "high" для всех запросов чата поддержки
Лучшеthinking_level: "low" для коротких ответов клиентам и "high" только для разбора инцидента, затронувшего несколько сервисов
Проверки при переходе
Google даёт список проверок при переходе на gemini-3.8-flash.
- Замените строку модели на
gemini-3.8-flash. - Удалите
temperature,top_pиtop_kиз настроек генерации. - Замените
thinking_budgetна строковыйthinking_levelбезminimal. - Удалите
candidate_count— не поддерживается начиная с Gemini 3. - Переведите многоходовые разговоры на серверную историю через
previous_interaction_idи уберите заранее заполненные ходы модели. - Проверьте вызовы функций: картинки и медиа — внутри ответа функции, указания к результату — в конце его текста через
\n\n, в generateContent у каждогоFunctionResponse—call_idиname. - При ошибках
Malformed_Function_Callиз-за текста перед вызовом инструмента смотрите обходные решения Google. - Проверьте запросы в Google AI Studio.
Что изменилось по сравнению с Gemini 3 и 3.1
- Уровни:
minimalисчез, осталось три; умолчание —mediumвместоhigh. - Бюджет размышлений:
thinking_budgetбольше не «пока работает» — замените его наthinking_level. - Случайность:
temperature,top_pиtop_kне оставляют по умолчанию, а убирают из запросов совсем. - История разговора: серверная история через
previous_interaction_idиз рекомендации стала правилом. - Ответы функций: в generateContent обязательны
call_idиname. - Пределы: контекст 1 миллион токенов, до 64 тысяч на выходе, набор встроенных инструментов прежний.
- Цена: до 31 декабря 2026 года вводная цена — 0,75 доллара за миллион входных токенов и 3,75 за миллион выходных; с 1 января 2027 года — 1,50 и 7,50.
Источник: What's new in Gemini 3.8 Flash (Google), лицензия CC BY 4.0. Пересказ ИИтак.