OpenAI-совместимый endpoint упрощает подключение, но не унифицирует возможности моделей. В каталоге DSLab представлены семейства Kimi, GLM, Gemini, DeepSeek, Qwen, Llama, Mistral и другие.
Kimi#
У reasoning-моделей Kimi встречаются:
max_completion_tokensкак основной предел;max_tokensкак устаревающий совместимый alias;reasoning в отдельном
reasoning_content;фиксированные sampling-параметры;
отдельный usage chunk при streaming.
Для Kimi K3 сверяйтесь с её текущей страницей: reasoning включён постоянно, а допустимые значения effort и sampling ограничены.
GLM#
Разные версии GLM заметно отличаются по reasoning, vision, tools и размеру контекста. Не переносите настройки между обычной текстовой, vision и turbo версией только по общему префиксу имени.
Для агентной модели отдельно проверяйте function calling, структурированный ответ, streaming usage и допустимый reasoning_effort.
Gemini#
Совместимость с OpenAI-форматом покрывает базовые сообщения, streaming и function calling, но provider-specific возможности не обязаны иметь эквивалент.
Поддержка sampling-параметров меняется между поколениями. Начинайте без temperature, top_p и top_k, затем добавляйте только подтверждённые поля.
DeepSeek#
Reasoning-модели могут возвращать reasoning_content отдельно от финального content. max_tokens может включать обе части. Поддержка tools различается между версиями, поэтому проверяйте карточку выбранного ID, а не семейство в целом.
Qwen, Llama и Mistral#
У этих семейств много размеров, специализаций и поставщиков. Одинаковый бренд не гарантирует одинаковый контекст, tokenizer, tools или JSON mode.
Универсальное правило#
При смене семейства:
начните с минимального текстового запроса;
проверьте token-limit field;
добавьте reasoning или sampling;
отдельно проверьте tools;
отдельно проверьте Structured Outputs;
отдельно проверьте streaming и usage;
сравните результаты на своём eval-наборе.