跳转至内容
  • 最新
  • 最佳实践
  • 失败复盘
  • 工具评测
  • AI 进展
  • 问答
  • 公开共建
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(不使用皮肤)
  • 不使用皮肤
折叠

COHAO 共好

  1. 最新
  2. 版块
  3. 最佳实践
  4. 把 AI Agent 任务写成可复现运行记录:一份最小模板

把 AI Agent 任务写成可复现运行记录:一份最小模板

已定时 已固定 已锁定 已移动 最佳实践
agent可复现
1 帖子 1 发布者 26 浏览 1 关注中
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • C 离线
    C 离线
    COHAO编辑部
    发表于 最后由 编辑
    #1

    很多 Agent 演示只留下一个成功截图。真正需要维护时,我们更需要知道:它在什么条件下运行、获得了什么权限、哪里失败、能否再次得到相近结果。

    下面是一份可以直接复制的最小运行记录。

    任务名称:
    记录时间与时区:
    执行者:人 / Agent / 人机协作
    工具、模型与版本:
    代码或提示词版本:
    运行环境:操作系统、运行时、关键依赖
    
    目标结果:
    允许读取的输入:
    允许调用的工具:
    明确禁止的动作:
    预算与最长运行时间:
    停止条件:
    
    实际步骤摘要:
    关键工具调用及返回:
    最终结果:成功 / 部分成功 / 失败 / 人工中止
    可核验证据:日志、测试、提交、截图或输出文件
    时间、Token、API 与人工成本:
    
    失败现象:
    已验证根因:
    尚未验证的推测:
    重试是否安全:
    修复或补偿动作:
    下次需要新增的检查:
    

    为什么要把权限也写进去

    同一段提示词,在只读文件系统和拥有生产管理员权限时,风险完全不同。可靠性不是只看回答质量,还要看 Agent 在失败、超时和歧义情况下会不会越过边界。

    最小验收

    • 另一个人能依据记录重跑主要步骤。
    • 关键结果有机器可读或可截图的证据,不只是一句“看起来可以”。
    • 失败后能判断应该重试、人工接管还是回滚。
    • 记录没有包含密码、Token、Cookie、私密原文或未脱敏个人数据。

    这份模板也是 COHAO《AI Agent 工具可靠性报告》的起点。欢迎回复你认为缺失但必须记录的字段。


    编辑说明:2026-08-15,COHAO 编辑部基于本项目真实部署与 Agent 操作经验整理;AI 协助结构化,项目负责人复核。

    1 条回复 最后回复
    0

    你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

    厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

    有了你的建议,这篇帖子会更精彩哦 💗

    注册 登录
    回复
    • 在新帖中回复
    登录后回复
    • 从旧到新
    • 从新到旧
    • 最多赞同


    • 登录

    • 没有帐号? 注册

    • 登录或注册以进行搜索。
    Powered by NodeBB Contributors
    • 第一个帖子
      最后一个帖子
    0
    • 最新
    • 最佳实践
    • 失败复盘
    • 工具评测
    • AI 进展
    • 问答
    • 公开共建