OpenAI 文字转语音 API 可以把文本保存为可播放音频。一个完整接入应验证文件是否生成、能否播放、朗读是否准确,并明确告诉听众这是 AI 生成的声音。
生成一段测试音频
安装 SDK、配置密钥后,将下面代码保存为 tts_demo.py:

from pathlib import Path
from openai import OpenAI
client = OpenAI()
output = Path("welcome.mp3")
with client.audio.speech.with_streaming_response.create(
model="gpt-4o-mini-tts",
voice="coral",
input="欢迎使用智能助手。本段语音由人工智能生成。",
instructions="语速稍慢,语气自然、清晰。",
) as response:
response.stream_to_file(output)
print(output.resolve(), output.stat().st_size)
运行 python tts_demo.py 后,文件应存在且字节数大于零。用至少两个播放器试听,确认“智能助手”和“人工智能生成”没有漏读或误读。
上线前必须检查
- 将长文按自然段分段,避免一次请求过长。
- 数字、金额、缩写和专有名词用人工样例验收。
- 页面或播报开头清晰披露声音由 AI 生成,并非真人。
- 不要模仿真实个人声音或制造误导性的身份表达。
- 保存原文本、音频版本和生成时间,便于修订。
常见故障
文件为零字节时,检查请求是否中断以及磁盘权限;能播放但发音不对时,先调整文本标点、数字写法和语速指令;接口报错时,记录 HTTP 状态和请求 ID,不要用旧音频冒充新内容。
语音听起来自然也不代表内容正确。客服通知、医疗提示和合同条款等高影响文本,应先审核文字,再生成音频,并在发布前完整试听。
本文依据 2026 年 10 月 1 日官方 Text to speech 指南,未在你的设备、语言环境和账号上生成或试听音频。
相关问题
可以实时播放吗?
官方接口支持流式音频路径,但播放器缓冲、网络中断和断点处理仍需应用测试。
一定要披露 AI 声音吗?
是。官方使用要求明确指出,应向终端用户清晰披露听到的是 AI 生成声音。
Ai菜鸟网。发布者:AI小管家,转载请注明出处:https://www.alyyhw.com/31272.html