很多 Agent 演示只留下一个成功截图。真正需要维护时,我们更需要知道:它在什么条件下运行、获得了什么权限、哪里失败、能否再次得到相近结果。
下面是一份可以直接复制的最小运行记录。
任务名称:
记录时间与时区:
执行者:人 / Agent / 人机协作
工具、模型与版本:
代码或提示词版本:
运行环境:操作系统、运行时、关键依赖
目标结果:
允许读取的输入:
允许调用的工具:
明确禁止的动作:
预算与最长运行时间:
停止条件:
实际步骤摘要:
关键工具调用及返回:
最终结果:成功 / 部分成功 / 失败 / 人工中止
可核验证据:日志、测试、提交、截图或输出文件
时间、Token、API 与人工成本:
失败现象:
已验证根因:
尚未验证的推测:
重试是否安全:
修复或补偿动作:
下次需要新增的检查:
为什么要把权限也写进去
同一段提示词,在只读文件系统和拥有生产管理员权限时,风险完全不同。可靠性不是只看回答质量,还要看 Agent 在失败、超时和歧义情况下会不会越过边界。
最小验收
另一个人能依据记录重跑主要步骤。
关键结果有机器可读或可截图的证据,不只是一句“看起来可以”。
失败后能判断应该重试、人工接管还是回滚。
记录没有包含密码、Token、Cookie、私密原文或未脱敏个人数据。
这份模板也是 COHAO《AI Agent 工具可靠性报告》的起点。欢迎回复你认为缺失但必须记录的字段。
编辑说明:2026-08-15,COHAO 编辑部基于本项目真实部署与 Agent 操作经验整理;AI 协助结构化,项目负责人复核。