已有一段短录音,想用智谱把语音转成文字,最直接的开发者路径是 GLM-ASR-2512 语音转文本接口。先准备符合格式与时长限制的音频,再上传并检查返回的 text;人名、数字和否定词必须回听核对。
准备录音与环境
智谱官方语音转文本接口当前列出的上传格式为 .wav 或 .mp3,文件不超过 25 MB,音频不超过 30 秒。本例用一段你自己录制或获准处理的短音频 meeting.mp3,避免上传含个人敏感信息的素材。按官方快速开始创建 API Key,并存入本机环境变量 ZHIPU_API_KEY。

上传并读取转写文字
下面用 Python 的 requests 发起多部分表单请求;先执行 pip install requests。把脚本与 meeting.mp3 放在同一目录,确认文件确实满足上述限制:
import os
from pathlib import Path
import requests
audio = Path("meeting.mp3")
if not audio.is_file():
raise FileNotFoundError(audio)
with audio.open("rb") as sound:
response = requests.post(
"https://open.bigmodel.cn/api/paas/v4/audio/transcriptions",
headers={"Authorization": f"Bearer {os.environ['ZHIPU_API_KEY']}"},
data={"model": "glm-asr-2512", "stream": "false"},
files={"file": (audio.name, sound, "audio/mpeg")},
timeout=90,
)
response.raise_for_status()
result = response.json()
print(result["text"])
接口文档将 file 与 model 列为必填项,同步调用可把 stream 设为 false。返回对象里的 text 是完整转写文字。不要把样例打印的文本直接当成最终字幕,尤其是会议决策、金额、日期或药品名。
怎么检查转写是否可用
可做一个自录测试句:“项目周五交付,不是周四;预算三千元,负责人王明。”然后对照原音逐字检查“不是”、周五、三千、王明四处。这是建议的测试材料,不是本文章已运行得到的结果。如果错在固定术语,可参考官方文档的 hotwords 参数传入人名或产品名,但它只能帮助识别,不能保证完全正确。
失败与适用边界
- 文件被拒绝:先检查扩展名、大小和 30 秒时长,不要把长录音直接改后缀当成短音频。
- 返回文字缺字:检查录音是否静音、重叠说话或背景噪声过大,再用清晰短片段复测。
- 需要长录音或实时会议:先查官方当前支持的其他模式与限额;这段同步示例只覆盖短音频上传。
本文依据 2026 年 10 月 1 日的官方接口说明写成,未用真实 Key 发起转写请求。处理他人录音前应取得必要授权,输出涉及关键事实时保留人工回听。
Ai菜鸟网。发布者:AI小管家,转载请注明出处:https://www.alyyhw.com/30948.html