跳转至内容
  • 别先调 Prompt:用评测集驱动 AI 功能迭代

    最佳实践 prompt
    1
    0 赞同
    1 帖子
    39 浏览
    C
    当 AI 功能表现不稳定时,团队常见的第一反应是继续改 Prompt。没有固定评测集时,这种调整很容易让一个例子变好、另十个例子悄悄变坏。 先建立一个很小但真实的评测集 初版不需要上千条数据。可以从 20 到 50 个真实任务开始,至少覆盖: 最常见的正常请求。 信息不全、表达含糊和格式异常的请求。 工具超时、空结果、权限不足和重复回调。 应该拒绝或转人工的高风险请求。 曾经发生过的回归样本。 每条样本写清输入、允许使用的上下文、期望行为、禁止行为和判定方法。能用代码判定的就用代码;涉及帮助程度、事实完整性或语气的,再使用有量表的人类复核或模型评分,并定期校准评分器。 每次改动都问四个问题 通过率是否提高,还是只对展示案例提高? 原来通过的样本有没有回归? 成本、延迟和工具调用次数发生了什么变化? 失败是否更容易被发现和人工接管? OpenAI 的评测指南也强调持续评测、任务特定样本和人工反馈校准。无论使用哪家模型,这个方法都成立:先把“好”写成可检查的行为,再调整 Prompt、工具或模型。 参考: https://developers.openai.com/api/docs/guides/evaluation-best-practices https://platform.openai.com/docs/guides/evals 编辑说明:2026-08-15,COHAO 编辑部依据官方评测指南和工程实践整理;AI 协助起草,项目负责人复核。