概述
思考模式(Thinking Mode,也称推理 / Reasoning)让模型在给出最终回答前先输出一段推理过程,通常能提升复杂任务(如数学、代码、多步工具调用)的准确率,但会增加延迟和 token 消耗。不同模型厂商对思考模式的默认状态、开关参数和字段命名并不统一,本页按模型厂商汇总当前已在 PPIO 平台上线、且明确支持思考模式配置的开源模型,说明如何在 OpenAI Chat Completions、OpenAI Responses、Anthropic Messages 三种协议下开启、关闭或调整思考强度。模型选择总览
下表按每个厂商在 PPIO 的上线时间排序(“最新/次新”指发布时间先后),不代表模型能力强弱或推荐优先级。本页只覆盖各厂商主力文本对话模型;名称带
-exp(实验版,如 deepseek-v4-flash-vision-exp)以及专门的视觉/多模态模型(如智谱 GLM-5v-turbo、GLM-4.6v 系列)不在本页范围内,即使它们同样带 reasoning 能力。表中 GLM-5.3-Flash 虽然输入支持图像/视频,但它是主力对话模型的多模态能力扩展,不是专门的视觉模型,故仍纳入。Zhipu / 智谱
GLM-5.3 / GLM-5.3-Flash
协议与 endpoint
本页示例仅覆盖 OpenAI Chat Completions 下已核实的思考参数行为。OpenAI Responses / Anthropic Messages 下控制该模型思考强度的具体字段尚未逐一核实,暂不提供对应示例。
思考模式说明
- 默认状态:思考始终开启。在 OpenAI Chat Completions 下,官方文档证实两个模型均不支持关闭思考——传入
thinking.type: "disabled"会导致请求报错。Anthropic Messages / OpenAI Responses 下官方未提供该模型的参数文档,是否同样不可关闭未核实,不代表这两个协议下可以关闭。 - 推理强度(OpenAI Chat Completions):
reasoning_effort支持low、high、max,默认max;复杂任务(如编程)官方同样推荐使用max。Anthropic Messages endpoint 是否接受同名字段尚未核实,暂不提供该协议下的示例。
示例:OpenAI Chat Completions
MiniMax
MiniMax-M3
协议与 endpoint
思考模式说明
- 默认状态因协议而异:省略
thinking参数时,OpenAI 兼容接口默认开启思考;Anthropic 兼容接口默认关闭思考。M3 没有reasoning_effort一类的强度分档,thinking.type只有开 / 关两态,不存在”默认强度”的概念。建议调用时显式指定thinking,不要依赖默认值。 - 开启方式:
thinking: {"type": "adaptive"}(adaptive对 M3 等价于开启思考)。 - 关闭方式:
thinking: {"type": "disabled"}。 reasoning_split(仅 OpenAI Chat Completions 支持,Anthropic Messages 无此字段;仅影响返回格式,不控制思考开关):设为true时思考内容拆分到reasoning_content与reasoning_details两个字段;省略或设为false时思考内容以<think>...</think>标签内嵌在content字段中。
示例:OpenAI Chat Completions
示例:关闭思考(Chat Completions)
cURL
MiniMax-M2.7 / MiniMax-M2.7-highspeed
协议与 endpoint
思考模式说明
- 默认状态:思考始终开启,不支持关闭。即使传入
thinking: {"type": "disabled"},请求仍会成功,但思考仍保持开启。 - MiniMax-M2.7-highspeed 是 MiniMax-M2.7 的高速版本,模型能力与 M2.7 一致,推理速度更快;调用时把
model换成minimax/minimax-m2.7-highspeed即可,代码逻辑无需其他改动。
M2.7 系列没有可用于关闭思考的参数,如需降低延迟或成本,请考虑改用支持关闭思考的模型,或缩短输入 / 输出长度。
示例:调用并拆分 reasoning
DeepSeek / 深度求索
DeepSeek V4 Pro / V4 Flash
协议与 endpoint
三种协议均已验证支持思考模式配置的模型 ID 为
deepseek/deepseek-v4-pro-0813 与 deepseek/deepseek-v4-flash-0731。以下示例均使用这两个 ID。思考模式说明
- 默认状态:思考默认开启,默认推理强度为
high。 - OpenAI Chat Completions:开关用
thinking: {"type": "enabled"/"disabled"}(需通过extra_body传递);强度用顶层字段reasoning_effort,支持low、high、max。 - Anthropic Messages:
thinking字段控制开关(budget_tokens子字段会被忽略);强度用output_config: {"effort": "low"/"high"/"max"}。 - OpenAI Responses:开关与强度合并为一个字段
reasoning: {"effort": "none"/"low"/"high"/"max"},其中none表示关闭思考。 - 强度档位映射(用户设置的 effort → 模型实际生效的 effort,对 V4 Pro 与 V4 Flash 一致):
medium、xhigh 也是被接受的输入值,会按上表静默归一化为 high,不会单独产生介于 high 与 max 之间的效果。示例:OpenAI Chat Completions
示例:关闭思考(Chat Completions)
cURL
示例:Anthropic Messages(调整强度)
示例:OpenAI Responses(关闭思考)
cURL
Moonshot / Kimi
Kimi K3
协议与 endpoint
思考模式说明
- 默认状态:始终开启思考,不支持关闭,也不支持
thinking参数——如果您之前调用 Kimi K2.x 系列传入过thinking配置,迁移到 K3 时需要移除该参数,改用下面的顶层reasoning_effort(或对应协议下的等价字段)控制推理强度。 - 推理强度:不嵌套在
thinking内,但三种协议下字段名不同:- OpenAI Chat Completions:顶层字段
reasoning_effort,支持low、high、max,默认max。官方专门写了使用指南并配有真实调用示例。 - Anthropic Messages:
output_config: {"effort": "low"/"high"/"max"},默认max。字段来自 Kimi 官方 API 参考页的请求 schema;该页说明切换档位会导致 prefix-cache 命中失效,建议在会话开始前就定好档位,不要在同一会话中切换。 - OpenAI Responses:
reasoning: {"effort": "low"/"high"/"max"},默认max。字段同样来自官方 API 参考页的请求 schema。
- OpenAI Chat Completions:顶层字段
示例:调整推理强度
示例:Anthropic Messages(调整推理强度)
cURL
示例:OpenAI Responses(调整推理强度)
cURL