API 回答质量不好时,先固定问题和评价标准,再一次只改一个变量。直接连续调整模型、提示词、温度和上下文,最后即使结果变好,也无法知道是哪项生效。最实用的排查顺序是:输入是否完整、指令是否可验收、参考资料是否正确、模型是否适合,最后才考虑微调。
建立一组不会随调试改变的测试题
从真实业务中选 10 至 30 条已脱敏问题,覆盖正常、边界和失败场景。每条写出必须包含、不得出现和允许人工判断的项目。OpenAI 评测最佳实践建议让评测尽量贴近实际分布,并用明确标准比较版本。

| 现象 | 先查什么 | 验证方法 |
|---|---|---|
| 答非所问 | 用户目标和输出格式是否清楚 | 把要求拆成可勾选项 |
| 事实错误 | 上下文是否提供了正确资料 | 逐条对照原始来源 |
| 格式飘忽 | 是否应使用结构化输出 | 用 Schema 校验而非目测 |
| 偶尔变差 | 测试题和参数是否固定 | 重复多次并记录每次结果 |
把提示词写成可验证的契约
官方提示工程指南区分开发者指令与用户内容。把角色、任务、边界、输出格式和例子分开;资料不足时明确要求说不知道。不要只写“回答得更专业”,而应写“列出三步,每步包含动作和验证结果,不得编造价格”。
- 先运行原版本,保存回答和评分。
- 只修改一处,例如补充输出格式,再跑同一批测试题。
- 比较每个评分项,不以一条看起来更好的回答替代整组结果。
- 如果提供的资料本身错误,先修数据;如果任务需要最新或私有信息,接入检索。
什么时候换模型或微调
当提示词、上下文和结构约束都已稳定,再用同一测试集比较模型的正确率、延迟与成本。只有大量重复任务仍表现不稳,且已有一致的正确示例,才评估微调。验收标准是独立测试集整体改善,不是挑选几条成功案例。
常见问题
问:把 temperature 调低就会更准确吗?采样更稳定不等于事实更正确。先确认资料来源、任务说明和评测标准;当前模型是否支持自定义采样参数也要查模型文档。
问:为什么网页端回答好,API 回答差?两边可能使用不同模型、系统指令、工具和上下文。保存 API 的完整配置,再做同输入对比,不能只凭产品名称推断请求条件相同。
本文没有读取你的提示词、日志或账号,也没有声称某个模型必然更好。请先保留脱敏请求、模型名、参数、请求 ID 和评分,按同一测试集复现问题后再改。
Ai菜鸟网。发布者:AI小管家,转载请注明出处:https://www.alyyhw.com/31437.html