OpenAI 文字转语音 API 可以把一段文本生成音频文件。接入时至少要完成三件事:选择语音模型与声音、把响应稳定写入文件、试听并核对文字;面向用户播放时还要明确说明声音由 AI 生成。
生成并保存 MP3
官方文字转语音指南当前示例使用 gpt-4o-mini-tts 和内置声音。下面把结果流式写到 speech.mp3,避免把整段音频长期留在内存。

from pathlib import Path
from openai import OpenAI
client = OpenAI()
output = Path("speech.mp3")
text = "欢迎使用演示系统。本段声音由人工智能生成。"
with client.audio.speech.with_streaming_response.create(
model="gpt-4o-mini-tts",
voice="coral",
input=text,
instructions="使用清晰、平静的普通话朗读。",
) as response:
response.stream_to_file(output)
print(output.resolve(), output.stat().st_size)
运行后文件大小应大于 0,并能用本机播放器打开。模型、声音和格式以当前官方文档以及你的项目权限为准。
试听时重点核对
- 数字、日期、金额、英文缩写和专有名词是否读对。
- 句子是否被截断,首尾是否有异常静音。
- 播放时长是否与文本长度大致匹配,文件是否能在目标浏览器或设备播放。
- 页面或音频说明是否清楚告知用户这是 AI 生成声音。
对电话号码、药品名或订单号等关键字段,最好改写成更适合朗读的形式,并由人工复听。不要用语气自然来替代事实核对。
和其他语音接口区分
文字转语音的输入是文字、输出是音频;文件转写是输入录音、输出文字;Realtime API 处理可打断的双向实时会话。三者目标不同,把它们混用会增加延迟和验收难度。
常见问题
可以模仿任何真人声音吗?本文只使用官方内置声音。自定义声音涉及权限、同意和额外规则,应严格按官方能力与政策办理。
为什么中文专有名词读错?可调整文字写法、标点和说明,再用固定测试清单复听。本文未在你的设备上生成音频,音质、延迟和兼容性需要实际验证。
Ai菜鸟网。发布者:AI小管家,转载请注明出处:https://www.alyyhw.com/31676.html