跳转至内容
  • 最新
  • 最佳实践
  • 失败复盘
  • 工具评测
  • AI 进展
  • 问答
  • 公开共建
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(不使用皮肤)
  • 不使用皮肤
折叠

COHAO 共好

  1. 最新
  2. 版块
  3. 最佳实践
  4. 别先调 Prompt:用评测集驱动 AI 功能迭代

别先调 Prompt:用评测集驱动 AI 功能迭代

已定时 已固定 已锁定 已移动 最佳实践
prompt
1 帖子 1 发布者 39 浏览 1 关注中
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • C 离线
    C 离线
    COHAO编辑部
    发表于 最后由 编辑
    #1

    当 AI 功能表现不稳定时,团队常见的第一反应是继续改 Prompt。没有固定评测集时,这种调整很容易让一个例子变好、另十个例子悄悄变坏。

    先建立一个很小但真实的评测集

    初版不需要上千条数据。可以从 20 到 50 个真实任务开始,至少覆盖:

    • 最常见的正常请求。
    • 信息不全、表达含糊和格式异常的请求。
    • 工具超时、空结果、权限不足和重复回调。
    • 应该拒绝或转人工的高风险请求。
    • 曾经发生过的回归样本。

    每条样本写清输入、允许使用的上下文、期望行为、禁止行为和判定方法。能用代码判定的就用代码;涉及帮助程度、事实完整性或语气的,再使用有量表的人类复核或模型评分,并定期校准评分器。

    每次改动都问四个问题

    1. 通过率是否提高,还是只对展示案例提高?
    2. 原来通过的样本有没有回归?
    3. 成本、延迟和工具调用次数发生了什么变化?
    4. 失败是否更容易被发现和人工接管?

    OpenAI 的评测指南也强调持续评测、任务特定样本和人工反馈校准。无论使用哪家模型,这个方法都成立:先把“好”写成可检查的行为,再调整 Prompt、工具或模型。

    参考:

    • https://developers.openai.com/api/docs/guides/evaluation-best-practices
    • https://platform.openai.com/docs/guides/evals

    编辑说明:2026-08-15,COHAO 编辑部依据官方评测指南和工程实践整理;AI 协助起草,项目负责人复核。

    1 条回复 最后回复
    0

    你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

    厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

    有了你的建议,这篇帖子会更精彩哦 💗

    注册 登录
    回复
    • 在新帖中回复
    登录后回复
    • 从旧到新
    • 从新到旧
    • 最多赞同


    • 登录

    • 没有帐号? 注册

    • 登录或注册以进行搜索。
    Powered by NodeBB Contributors
    • 第一个帖子
      最后一个帖子
    0
    • 最新
    • 最佳实践
    • 失败复盘
    • 工具评测
    • AI 进展
    • 问答
    • 公开共建