OpenAI 语音转文字 API 怎么接入?上传音频并核对转写结果

针对已录制音频,用 Python 调用 OpenAI 文件转写接口,并逐段核对数字、日期和专有名词。

已有录音文件要转成文字,直接用 OpenAI 的文件转写接口;不必为一段已录好的音频搭建实时语音连接。本文给出 Python 最小示例,并教你对照原录音检查数字和专有名词。

先准备一段可核对的录音

用自己的声音录一小段不含隐私的测试音频,例如说“今天讨论订单 AC 四十二,明天确认交付”。保存为 sample.wav,并记下原话。测试文件应清晰、时长短;真实客户录音需先确认你有处理和传输权限。官方文件转写文档列出支持格式与文件大小上限;发布时文档给出的上限为 25 MB,较大文件应先按业务边界切分,而不是假设一次上传一定成功。

OpenAI 语音转文字 API 怎么接入?上传音频并核对转写结果

安装并调用转写接口

按官方快速入门在服务端配置 OPENAI_API_KEY 并安装 SDK。把下面代码保存为 transcribe.py,与音频文件放在同一目录后运行。

from pathlib import Path
from openai import OpenAI

audio_path = Path("sample.wav")
if not audio_path.is_file():
    raise FileNotFoundError(audio_path)

client = OpenAI()
with audio_path.open("rb") as audio_file:
    result = client.audio.transcriptions.create(
        model="gpt-transcribe",
        file=audio_file,
    )

print(result.text)

官方推荐 gpt-transcribe 用于已录制语音的原语言转写。这个任务的输出是文字;如果要生成语音、翻译为英文或做实时麦克风对话,应使用对应的不同接口和模型。

核对结果再进入业务流程

  1. 逐段播放原录音,与输出文字对照。特别检查订单号、金额、姓名、日期和否定词。
  2. 对“AC 四十二”这类口语化编号,判断转写结果是否需要人工规范成业务系统所用格式。
  3. 音频太嘈杂、多人同时说话或语言预测不可靠时,标记需人工复听,不把转写直接当作确定事实。

如果提示文件格式或体积不符合要求,先按官方文档检查扩展名、实际编码和大小;如果返回 401/403,检查项目 API 权限与密钥;如果文本为空,先确认音频确有可听语音。本文是按 2026 年 10 月 1 日官方接口整理的演示流程,未在你的录音或账号上实测。

Ai菜鸟网。发布者:AI小管家,转载请注明出处:https://www.alyyhw.com/30921.html

赞 (0)
AI小管家的头像AI小管家
OpenAI API 怎么识别图片内容?传入图片 URL 并核对回答
上一篇 9小时前
OpenAI API 额度用完怎么办?区分余额、用量与支出上限
下一篇 9小时前

相关推荐

联系我们

联系我们

1

在线咨询: QQ交谈

邮件:admin@example.com

工作时间:周一至周五,9:30-18:30,节假日休息

关注微信
关注微信
分享本页
返回顶部