智谱文件解析是异步 API:先上传 PDF 创建解析任务并保存 task_id,再用这个 ID 查询文本或下载链接。上传请求成功不等于解析完成,只有结果接口返回可用内容并通过原文抽查,才算任务完成。
准备文件和接口参数
先用一份无敏感信息的小 PDF 测试,并在第一页写入“文档代号:PARSER-27”,第二页放一个三列表格。根据智谱官方文件解析文档,服务支持 PDF、Word、Excel、PPT、CSV、文本和部分图片格式;不同 tool_type 支持的格式、大小、结果形式和计费方式不同,必须以调用时的官方页面为准。

Key 放在环境变量中。下面用 PowerShell 调用官方示例路径:
$env:ZAI_API_KEY = "仅在本机设置"
$create = curl.exe -sS -X POST `
"https://open.bigmodel.cn/api/paas/v4/files/parser/create" `
-H "Authorization: Bearer $env:ZAI_API_KEY" `
-F "file=@sample.pdf" `
-F "tool_type=lite" `
-F "file_type=PDF"
$create
把返回 JSON 中的 task_id 原样保存,不能用文件名代替。示例选择 lite 只为了说明流程,不表示它最适合复杂表格或扫描件。
查询解析结果
$taskId = "替换为创建接口返回的 task_id"
$result = curl.exe -sS -X GET `
"https://open.bigmodel.cn/api/paas/v4/files/parser/result/$taskId/text" `
-H "Authorization: Bearer $env:ZAI_API_KEY"
$result
官方流程是“创建任务—保存 task_id—轮询结果”。首次查询未就绪时,按有限次数和间隔重试;不要高速循环请求,也不要因一次超时就重新上传,避免重复任务和重复计费。需要版面文件、图片或 Markdown 时,按当前服务能力选择 download_link,并及时下载,因为官方页面给出的链接可能有有效期。
如何验收 PDF 解析正确
- 确认任务 ID 与本次文件一一对应,日志记录文件哈希而不是敏感文件内容。
- 搜索“PARSER-27”,核对标题、页码和段落顺序。
- 逐格比较第二页表格的表头、行数、数字、小数点和空值。
- 抽查公式、双栏、脚注、图片说明和扫描页;关键合同或财务数字必须人工复核。
- 下载模式下检查链接能打开、内容类型正确,并把结果保存到受控存储。
失败时从哪里排查
| 现象 | 检查 |
|---|---|
| 创建请求失败 | Key、文件路径、格式、大小、tool_type 与 file_type |
| 结果一直未就绪 | 任务 ID 是否抄错;保留原任务,限制轮询并记录状态 |
| 文本乱码或为空 | 是否扫描件、字体嵌入异常;改用适合 OCR/复杂版式的服务 |
| 表格错位 | 切换解析服务或使用版面结果;不要把错位表直接喂给模型 |
隐私、费用与未实测边界
上传前应取得文件处理授权并删除身份证件、客户名单、密码和密钥。文件格式支持不等于所有元素都能无损提取;解析结果也不能替代原件。本文没有上传文件、调用你的账号或验证当前费用,代码是依据 2026-10-01 官方路径整理的示例;SDK、限额、价格、下载时效和服务类型以后可能变化。
Ai菜鸟网。发布者:AI小管家,转载请注明出处:https://www.alyyhw.com/32937.html