Переход с GPT-4-подобной модели на GPT-5-подобную — это не только смена ID. Reasoning меняет бюджет токенов, задержку, рекомендуемый endpoint и набор допустимых параметров.
GPT-4-подобные модели#
Обычно удобны для:
быстрого диалога и преобразования текста;
vision-задач у мультимодальных версий;
существующих Chat Completions интеграций;
сценариев, где нужен привычный sampling.
В старых интеграциях предел ответа часто задаётся через max_tokens.
GPT-5-подобные модели#
Обычно сильнее в:
программировании и сложной отладке;
планировании и многошаговой работе;
function calling и агентных циклах;
анализе длинного контекста;
задачах, где полезен управляемый reasoning.
Для новых reasoning-интеграций предпочитайте Responses API, если он указан на странице модели.
Предел ответа#
В Chat Completions современное поле — max_completion_tokens. Оно может ограничивать сумму reasoning и видимого ответа.
В Responses используйте max_output_tokens.
Не переносите max_tokens из старого GPT-4 запроса в GPT-5 без проверки: некоторые reasoning-модели его не поддерживают.
Reasoning effort#
GPT-5-подобные модели могут принимать уровни от none или minimal до high, xhigh или max. Точный набор и значение по умолчанию зависят от модели.
Начните с medium, затем сравните low и high на собственных примерах. Максимальный effort не всегда окупает задержку и стоимость.
Sampling#
Параметры temperature, top_p, penalties и logprobs могут быть ограничены у reasoning-моделей. Начинайте с defaults и добавляйте только параметры, перечисленные на странице модели.
Миграционный чек-лист#
Смените ID в отдельном тестовом окружении.
Проверьте endpoint и token-limit field.
Удалите необязательные sampling-параметры.
Проверьте tools и Structured Outputs.
Обновите парсер usage для reasoning tokens.
Сравните latency, качество и стоимость.
Только после этого переводите основной трафик.
Для актуальных значений контекста, output limit и effort используйте страницу конкретной модели в каталоге DSLab.