OpenAI 文字转语音 API 怎么用?生成音频、保存文件并试听核对

调用 OpenAI 文字转语音接口生成 MP3,保存后试听数字、专名和截断,并明确 AI 声音披露。

OpenAI 文字转语音 API 可以把一段文本生成音频文件。接入时至少要完成三件事:选择语音模型与声音、把响应稳定写入文件、试听并核对文字;面向用户播放时还要明确说明声音由 AI 生成。

生成并保存 MP3

官方文字转语音指南当前示例使用 gpt-4o-mini-tts 和内置声音。下面把结果流式写到 speech.mp3,避免把整段音频长期留在内存。

OpenAI 文字转语音 API 怎么用?生成音频、保存文件并试听核对

from pathlib import Path
from openai import OpenAI

client = OpenAI()
output = Path("speech.mp3")
text = "欢迎使用演示系统。本段声音由人工智能生成。"

with client.audio.speech.with_streaming_response.create(
    model="gpt-4o-mini-tts",
    voice="coral",
    input=text,
    instructions="使用清晰、平静的普通话朗读。",
) as response:
    response.stream_to_file(output)

print(output.resolve(), output.stat().st_size)

运行后文件大小应大于 0,并能用本机播放器打开。模型、声音和格式以当前官方文档以及你的项目权限为准。

试听时重点核对

  1. 数字、日期、金额、英文缩写和专有名词是否读对。
  2. 句子是否被截断,首尾是否有异常静音。
  3. 播放时长是否与文本长度大致匹配,文件是否能在目标浏览器或设备播放。
  4. 页面或音频说明是否清楚告知用户这是 AI 生成声音。

对电话号码、药品名或订单号等关键字段,最好改写成更适合朗读的形式,并由人工复听。不要用语气自然来替代事实核对。

和其他语音接口区分

文字转语音的输入是文字、输出是音频;文件转写是输入录音、输出文字;Realtime API 处理可打断的双向实时会话。三者目标不同,把它们混用会增加延迟和验收难度。

常见问题

可以模仿任何真人声音吗?本文只使用官方内置声音。自定义声音涉及权限、同意和额外规则,应严格按官方能力与政策办理。

为什么中文专有名词读错?可调整文字写法、标点和说明,再用固定测试清单复听。本文未在你的设备上生成音频,音质、延迟和兼容性需要实际验证。

Ai菜鸟网。发布者:AI小管家,转载请注明出处:https://www.alyyhw.com/31676.html

赞 (0)
AI小管家的头像AI小管家
OpenAI Batch API 怎么批量处理任务?准备 JSONL、提交并核对结果
上一篇 2小时前
OpenAI 图片生成 API 怎么用?提交提示词、保存图片并检查结果
下一篇 2小时前

相关推荐

联系我们

联系我们

1

在线咨询: QQ交谈

邮件:admin@example.com

工作时间:周一至周五,9:30-18:30,节假日休息

关注微信
关注微信
分享本页
返回顶部