WORK-001 · Public artifact

把 Agent 的失败,变成可复现的公共证据

我们准备共同完成一份中文 AI Agent 工具可靠性报告。它不做热度榜,也不把一次成功 Demo 当成稳定性;每个结论都要能追溯到任务、版本、配置、运行记录和人工复核。

当前状态
方法公开复核中
第一版范围
优先完成受控框架 Track A
交付窗口
负责人确认后的 4 周
最低证据
版本、配置、日志、成本与独立复现
当前负责人
待从创世访谈中确认

Questions before ranking

先回答使用者真正承担的风险

同一工具对不同任务、预算、权限和维护能力可能有完全不同的答案,所以报告不会制造一个脱离情境的总冠军。

01

它在哪里失败?

记录超时、重复调用、错误恢复、权限越界、状态丢失和虚假成功,而不是只展示完成截图。

02

失败要付出什么?

同时计算模型、平台、基础设施、重试和人工诊断成本,区分单次尝试与单次真正成功。

03

别人能否复现?

公开版本锚点、任务输入、验收规则和限制;无法固定的服务端变化必须写进结论边界。

Two tracks

不同类别,不混成一个分数

第一版默认只承诺 Track A。只有人力、预算和复现能力足够时,才单独增加 Track B。

TRACK A

受控框架与编排能力

尽可能固定基础模型、工具接口、任务、超时与资源,比较状态、调用、恢复、可观测性和维护体验。

第一版优先范围
TRACK B

端到端 Agent 产品

比较用户实际获得的完整产品,并明确套餐、地区、默认模型和无法控制的服务端更新。

资源足够后再启动

Benchmark draft

七类首批候选任务

最终任务必须来自真实访谈和可公开问题,并在正式运行前冻结输入、rubric、预算、超时、重试规则与校验哈希。

  1. T1 研究与证据回答

    错引、幻觉来源、回避冲突

  2. T2 结构化数据转换

    静默丢行、格式正确但语义错误

  3. T3 小型代码库修复

    未验证、越界修改、伪造成功

  4. T4 多步骤知识交付

    漏步骤、状态漂移、错误沿链放大

  5. T5 故障注入与恢复

    无限重试、重复写、上下文丢失

  6. T6 权限与提示注入

    越权、泄密、扩大工具范围

  7. T7 中断与跨会话恢复

    重复副作用、旧指令覆盖新状态

Evidence protocol

一条结论如何进入报告

  1. 01
    冻结方法

    任务、版本、配置、预算和失败分类先公开。

  2. 02
    隔离运行

    使用合成或获授权数据,所有写操作都可重置。

  3. 03
    保留失败

    失败记录不会被成功重跑覆盖,人工修复单独标注。

  4. 04
    独立复现

    至少由第二个人核验关键结论和限制。

  5. 05
    带边界发布

    公开分子分母、日期、环境和不能推出的结论。

Open roles

不只需要写代码的人

现在需要的是对方法提出反例、提供去敏失败样本、设计任务、独立复现、安全复核、成本记录和编辑维护。

方法与指标复核真实失败案例基准任务设计独立运行复现安全边界评审成本与数据整理编辑与事实核查研究负责人
带着一个具体问题来

申请不是抢席位。先说明你实际做过什么、哪里失败,以及你愿意共同验证什么。

提交真实问题

Research boundaries

这份报告不会做什么

  • 不接受付费修改结论、隐藏失败样本或未披露的优先配置。
  • 不测试真实生产账户、客户数据、支付、管理员后台或不可逆动作。
  • 不让 Agent 自己选择指标、修改规则、批准结果并自动发布。
  • 不把不同类别系统混成总榜,也不从小样本推出永久结论。
  • 不因项目具有 Web3 方向,就预设链上或 Token 方案更优。