ИИтак

← Назад

Рекомендации разработчика · модель Gemini 3.8 Flash

Как работать с Gemini 3.8 Flash

Пересказ на русском. Оригинал: «What's new in Gemini 3.8 Flash» ↗ — Google, 23 сентября, на английском.

Руководство Google по переходу на Gemini 3.8 Flash: три уровня размышлений без minimal, настройки, которые нужно убрать, и правила для многоходовых разговоров и вызовов функций.

Коротко

  • Уровней размышлений три: low, medium и high; по умолчанию medium, а minimal возвращает ошибку.
  • Уберите temperature, top_p, top_k и candidate_count; thinking_budget замените на thinking_level.
  • Историю разговора ведите на сервере через previous_interaction_id; заранее заполненные ходы модели удалите.
  • В generateContent — режиме, где историю собирает ваш код, — у каждого FunctionResponse должны быть call_id и name.
  • На долгих задачах модель по замыслу тратит больше токенов; для повседневных задач понижайте уровень.

Уровень размышлений

Модель рассчитана на долгую работу над кодом, автономных агентов и сложные корпоративные процессы; глубину рассуждений задаёт thinking_level.

  • low — быстрый ответ там, где важна задержка: разбор инцидентов, чат в реальном времени, черновики, быстрый анализ данных.
  • medium — уровень по умолчанию, лучшее качество для большинства задач; для сложного кода и агентов даёт больше верных ответов с первой попытки.
  • high — предельная глубина рассуждений и работы с инструментами: глубокий анализ, математика, трудные многошаговые задачи.

Пример{"thinking_level": "medium"} и запрос «Найди в этом платёжном сервисе гонки данных при повторных попытках и безопасно перепиши блокировки транзакций».

Расход токенов

На долгих и сложных задачах модель тратит больше токенов, и так задумано: она делает мелкие шаги рассуждений, раз за разом вызывает инструменты и проверяет свою работу. Не каждому процессу нужна такая проверка.

  1. Решите, нужна ли задаче многошаговая проверка.
  2. Для повседневных задач понизьте thinking_level — расход токенов упадёт.
  3. Если такая работа не нужна, Gemini 3.7 Flash остаётся полностью поддерживаемой.

Вместоthinking_level: "high" для всех запросов чата поддержки

Лучшеthinking_level: "low" для коротких ответов клиентам и "high" только для разбора инцидента, затронувшего несколько сервисов

Проверки при переходе

Google даёт список проверок при переходе на gemini-3.8-flash.

  1. Замените строку модели на gemini-3.8-flash.
  2. Удалите temperature, top_p и top_k из настроек генерации.
  3. Замените thinking_budget на строковый thinking_level без minimal.
  4. Удалите candidate_count — не поддерживается начиная с Gemini 3.
  5. Переведите многоходовые разговоры на серверную историю через previous_interaction_id и уберите заранее заполненные ходы модели.
  6. Проверьте вызовы функций: картинки и медиа — внутри ответа функции, указания к результату — в конце его текста через \n\n, в generateContent у каждого FunctionResponse — call_id и name.
  7. При ошибках Malformed_Function_Call из-за текста перед вызовом инструмента смотрите обходные решения Google.
  8. Проверьте запросы в Google AI Studio.

Что изменилось по сравнению с Gemini 3 и 3.1

  • Уровни: minimal исчез, осталось три; умолчание — medium вместо high.
  • Бюджет размышлений: thinking_budget больше не «пока работает» — замените его на thinking_level.
  • Случайность: temperature, top_p и top_k не оставляют по умолчанию, а убирают из запросов совсем.
  • История разговора: серверная история через previous_interaction_id из рекомендации стала правилом.
  • Ответы функций: в generateContent обязательны call_id и name.
  • Пределы: контекст 1 миллион токенов, до 64 тысяч на выходе, набор встроенных инструментов прежний.
  • Цена: до 31 декабря 2026 года вводная цена — 0,75 доллара за миллион входных токенов и 3,75 за миллион выходных; с 1 января 2027 года — 1,50 и 7,50.

Источник: What's new in Gemini 3.8 Flash (Google), лицензия CC BY 4.0. Пересказ ИИтак.