大模型评估
-
AI 回答有没有编造?用 DeepEval 对照上下文检查幻觉
用 DeepEval 4.2.7 的 HallucinationMetric 将 AI 回答与可信上下文对照,准备正反样例、保存分数和理由,解释版本评分方向与裁判局限。
-
AI 提示词改动后怎么回归测试?用 promptfoo 保存断言与失败样例
用固定客服分类用例比较两版提示词:配置 JSON 与类别断言,运行 promptfoo,导出失败输入和输出;离线演示与真实模型评测的边界也逐项说明。