已有录音文件要转成文字,直接用 OpenAI 的文件转写接口;不必为一段已录好的音频搭建实时语音连接。本文给出 Python 最小示例,并教你对照原录音检查数字和专有名词。
先准备一段可核对的录音
用自己的声音录一小段不含隐私的测试音频,例如说“今天讨论订单 AC 四十二,明天确认交付”。保存为 sample.wav,并记下原话。测试文件应清晰、时长短;真实客户录音需先确认你有处理和传输权限。官方文件转写文档列出支持格式与文件大小上限;发布时文档给出的上限为 25 MB,较大文件应先按业务边界切分,而不是假设一次上传一定成功。

安装并调用转写接口
按官方快速入门在服务端配置 OPENAI_API_KEY 并安装 SDK。把下面代码保存为 transcribe.py,与音频文件放在同一目录后运行。
from pathlib import Path
from openai import OpenAI
audio_path = Path("sample.wav")
if not audio_path.is_file():
raise FileNotFoundError(audio_path)
client = OpenAI()
with audio_path.open("rb") as audio_file:
result = client.audio.transcriptions.create(
model="gpt-transcribe",
file=audio_file,
)
print(result.text)
官方推荐 gpt-transcribe 用于已录制语音的原语言转写。这个任务的输出是文字;如果要生成语音、翻译为英文或做实时麦克风对话,应使用对应的不同接口和模型。
核对结果再进入业务流程
- 逐段播放原录音,与输出文字对照。特别检查订单号、金额、姓名、日期和否定词。
- 对“AC 四十二”这类口语化编号,判断转写结果是否需要人工规范成业务系统所用格式。
- 音频太嘈杂、多人同时说话或语言预测不可靠时,标记需人工复听,不把转写直接当作确定事实。
如果提示文件格式或体积不符合要求,先按官方文档检查扩展名、实际编码和大小;如果返回 401/403,检查项目 API 权限与密钥;如果文本为空,先确认音频确有可听语音。本文是按 2026 年 10 月 1 日官方接口整理的演示流程,未在你的录音或账号上实测。
Ai菜鸟网。发布者:AI小管家,转载请注明出处:https://www.alyyhw.com/30921.html