“上下文长度”是模型单次请求可处理的输入和生成内容总量边界,不等于每次都能输出同样多的字。读 DeepSeek 官方 API 规格时,要把模型上下文、单次输出上限、max_tokens 和实际计费用量分开看。
先对照当前官方模型规格
截至 2026 年 10 月 1 日,官方模型与价格页给 deepseek-flash 和 deepseek-v4-pro 标示 1M 上下文长度及最高 384K 输出。这里的 K 是 token 量级,不是中文字符数;实际可用空间还要容纳消息角色、历史轮次和模型生成内容。该规格针对官方 API 当前型号,不能直接套到本地蒸馏模型或第三方托管版本。

为什么设置 max_tokens 后仍可能截断
Chat Completions 官方接口说明指出,输入加生成受模型上下文长度限制,max_tokens 还受单独上限约束。当前接口允许最高 393,216 个生成 token;未显式设置时,非思考模式默认 8K,思考模式默认 64K,reasoning_effort=max 时默认 128K。即使把 max_tokens 设高,输入过长也会挤占生成空间;finish_reason=length 是输出可能被截断的信号。
按实际返回值核对,不用字数猜
准备一条较短的测试消息,先发送非流式请求,再读取 usage.prompt_tokens、usage.completion_tokens 与 choices[0].finish_reason。如果持续多轮对话,下一次请求要重新发送你希望保留的历史消息;历史越长,占用的输入 token 通常越多。
# 假设 response 是一次成功的非流式 Chat Completions 返回
print("input:", response.usage.prompt_tokens)
print("output:", response.usage.completion_tokens)
print("total:", response.usage.total_tokens)
print("finish:", response.choices[0].finish_reason)
官方 Token 与用量说明提醒字符与 token 的换算只是近似,实际以返回的 usage 为准。若出现 length,先缩短历史消息或长文输入,必要时再提高 max_tokens;如果请求直接被拒,保留状态码和错误正文,核对当时的模型规格。
以上是官方 API 文档中的规格与检查方法,没有在你的账户或本地硬件上实测。模型名、默认值和上限会随服务更新,部署到第三方平台时还应查询该平台自己的限制。
Ai菜鸟网。发布者:AI小管家,转载请注明出处:https://www.alyyhw.com/29802.html