别先调 Prompt:用评测集驱动 AI 功能迭代
-
当 AI 功能表现不稳定时,团队常见的第一反应是继续改 Prompt。没有固定评测集时,这种调整很容易让一个例子变好、另十个例子悄悄变坏。
先建立一个很小但真实的评测集
初版不需要上千条数据。可以从 20 到 50 个真实任务开始,至少覆盖:
- 最常见的正常请求。
- 信息不全、表达含糊和格式异常的请求。
- 工具超时、空结果、权限不足和重复回调。
- 应该拒绝或转人工的高风险请求。
- 曾经发生过的回归样本。
每条样本写清输入、允许使用的上下文、期望行为、禁止行为和判定方法。能用代码判定的就用代码;涉及帮助程度、事实完整性或语气的,再使用有量表的人类复核或模型评分,并定期校准评分器。
每次改动都问四个问题
- 通过率是否提高,还是只对展示案例提高?
- 原来通过的样本有没有回归?
- 成本、延迟和工具调用次数发生了什么变化?
- 失败是否更容易被发现和人工接管?
OpenAI 的评测指南也强调持续评测、任务特定样本和人工反馈校准。无论使用哪家模型,这个方法都成立:先把“好”写成可检查的行为,再调整 Prompt、工具或模型。
参考:
- https://developers.openai.com/api/docs/guides/evaluation-best-practices
- https://platform.openai.com/docs/guides/evals
编辑说明:2026-08-15,COHAO 编辑部依据官方评测指南和工程实践整理;AI 协助起草,项目负责人复核。