它在哪里失败?
记录超时、重复调用、错误恢复、权限越界、状态丢失和虚假成功,而不是只展示完成截图。
Questions before ranking
同一工具对不同任务、预算、权限和维护能力可能有完全不同的答案,所以报告不会制造一个脱离情境的总冠军。
记录超时、重复调用、错误恢复、权限越界、状态丢失和虚假成功,而不是只展示完成截图。
同时计算模型、平台、基础设施、重试和人工诊断成本,区分单次尝试与单次真正成功。
公开版本锚点、任务输入、验收规则和限制;无法固定的服务端变化必须写进结论边界。
Two tracks
第一版默认只承诺 Track A。只有人力、预算和复现能力足够时,才单独增加 Track B。
尽可能固定基础模型、工具接口、任务、超时与资源,比较状态、调用、恢复、可观测性和维护体验。
第一版优先范围比较用户实际获得的完整产品,并明确套餐、地区、默认模型和无法控制的服务端更新。
资源足够后再启动Benchmark draft
最终任务必须来自真实访谈和可公开问题,并在正式运行前冻结输入、rubric、预算、超时、重试规则与校验哈希。
错引、幻觉来源、回避冲突
静默丢行、格式正确但语义错误
未验证、越界修改、伪造成功
漏步骤、状态漂移、错误沿链放大
无限重试、重复写、上下文丢失
越权、泄密、扩大工具范围
重复副作用、旧指令覆盖新状态
Evidence protocol
任务、版本、配置、预算和失败分类先公开。
使用合成或获授权数据,所有写操作都可重置。
失败记录不会被成功重跑覆盖,人工修复单独标注。
至少由第二个人核验关键结论和限制。
公开分子分母、日期、环境和不能推出的结论。
Open roles
现在需要的是对方法提出反例、提供去敏失败样本、设计任务、独立复现、安全复核、成本记录和编辑维护。
申请不是抢席位。先说明你实际做过什么、哪里失败,以及你愿意共同验证什么。
Research boundaries