Claude 消息接口
完全兼容 Claude Messages API 格式
支持多轮对话和单次查询
支持文本、图像等多模态内容
授权
在请求头中传入 Authorization: Bearer <token>。
请求头
API版本号 指定要使用的Claude API版本
可选的 Claude beta 功能头,提供时转发。
请求体
模型名称
glm-5-turbo, glm-5, glm-5.1, glm-5.2, glm-4.7, glm-4.7-flash, glm-4.5-air, MiniMax-M2.5, MiniMax-M2.7, MiniMax-M2.5-highspeed, MiniMax-M2.7-highspeed, MiniMax-M3, mimo-v2.5, mimo-v2.5-pro, qwen3-max, qwen3.5-flash, qwen3.6-plus, qwen3-coder-plus, deepseek-v3-2-251201, deepseek-v4-flash, deepseek-v4-pro, seed-1-6-250915, seed-1-8-251228, seed-2-0-lite-260228, seed-2-0-mini-260215, seed-2-0-pro-260328 消息列表 消息数组,模型会基于这些消息生成下一条回复。每条消息包含 role 和 content 两个字段。
最大生成token数 生成停止前的最大token数量。模型可能会在达到此限制前停止。 不同模型有不同的最大值,请参考模型文档。 max_tokens 不限制思考过程的长度。开启深度思考时,思考部分的 Token 数由 thinking.budget_tokens 单独控制。
x >= 1系统提示词,用于设定模型的角色或行为。system 通过顶层参数传入,messages 数组中不接受 system 角色。传入字符串等价于单个 type="text" 的内容块。当需要为系统提示词标记显式缓存断点时,必须传入数组形式。
温度参数,范围 [0, 2) 控制输出的随机性:值越大,生成结果越随机。 与 Anthropic 官方的 [0.0, 1.0] 范围不同,从 Anthropic 迁移时请确认该参数取值。
核采样的概率阈值,控制生成文本的多样性。temperature 与 top_p 均可控制生成文本的多样性,建议只设置其中一个值。
停止序列 自定义文本序列,遇到这些序列时模型将停止生成。命中后,响应的 stop_reason 仍为 end_turn,响应不会回填命中的序列。
生成过程中采样候选集的大小。
深度思考配置。开启后,模型会在生成回复前先进行推理,以提升回答准确度。部分模型不支持思考模式。
控制模型的推理强度。默认为 max。支持的模型:deepseek-v4-pro、deepseek-v4-flash。设为 low 或 medium 时会映射为 high,设为 xhigh 时会映射为 max。
high, max 工具定义数组,用于 Function Call 场景。
工具选择策略:auto(默认,模型自行决定)、any(强制调用任意工具)、none(禁止调用工具)、tool(强制调用指定工具)。
- 模式选择
- 指定工具
结构化输出配置。开启后,模型将输出符合 JSON Schema 的 JSON 字符串。deepseek/glm 系列支持严格结构化输出(按 Schema 强约束),其他模型为普通 JSON 模式(需在 system 或 messages 中包含 'JSON' 关键词)。
是否启用流式输出
响应
Claude 兼容响应。
Claude 兼容消息响应。
消息的唯一标识。
固定为 message。
message 固定为 assistant。
assistant 使用的模型名称。
内容数组。
- 文本
- 思考过程
- 工具调用
停止原因:end_turn(正常结束)、max_tokens(达到 Token 上限)、tool_use(工具调用)。
end_turn, max_tokens, tool_use 固定为 null。
Token 用量统计。流式调用中,message_start 事件的 usage 仅包含 input_tokens 和 output_tokens;完整 4 个字段在 message_delta 事件中返回。