Что это и как включить
Перед окончательным ответом модель выписывает цепочку рассуждений — промежуточные шаги, которые повышают точность. Режим включён по умолчанию, глубина по умолчанию высокая.
Управление зависит от формата запроса:
- формат OpenAI: параметр thinking включает и выключает режим, reasoning_effort задаёт глубину (low, high, max); через SDK OpenAI с Chat Completions thinking передают в поле extra_body;
- формат Anthropic: один параметр reasoning.effort со значениями none, low, high, max, где none выключает режим;
- формат Responses API: глубину задаёт output_config.effort.
Промежуточных уровней у модели нет: запрошенные minimal и low дают low; medium, high и xhigh — high; max и ultra — max.
Какие настройки не работают
В режиме размышлений не действуют temperature (настройка случайности ответа), presence_penalty и frequency_penalty (штрафы за повторы): ради совместимости ошибки они не вызывают, но и ничего не меняют. Параметр top_p, наоборот, работает только в режиме размышлений и только в диапазоне от 0.95 до 1.0 — значения ниже считаются за 0.95; без размышлений он жёстко равен 1.0.
Что возвращать модели
Цепочка рассуждений приходит отдельным полем reasoning_content рядом с ответом content. Возвращать ли её дальше, зависит от параметра tools — списка инструментов, доступных модели.
Без инструментов reasoning_content возвращать не нужно: API его проигнорирует и в контекст следующего хода не подставит.
С инструментами правило жёсткое: reasoning_content всех предыдущих ходов передают обратно полностью, даже за ходы без вызовов, иначе API вернёт ошибку 400. Так модель может несколько раз подряд порассуждать и вызвать инструмент, продолжая прежнюю мысль. Проще всего добавлять в историю сообщение модели целиком — с полями content, reasoning_content и tool_calls.