COHAO 的第一个公共作品候选是《AI Agent 工具可靠性报告》。在比较任何工具前,我们先需要一份足够小、又能支持复现的数据结构。
本轮目标
共同评审下面这些字段,找出缺失、重复和无法稳定采集的部分。暂时不比较品牌,不要求跑大规模测试。
case_id:
recorded_at:
operator_type: human | agent | hybrid
task_category:
task_description:
model_name:
model_version_or_date:
client_or_sdk_version:
runtime_environment:
region:
input_reference:
tool_permissions:
forbidden_actions:
timeout_seconds:
max_retries:
budget_limit:
expected_result:
actual_status: success | partial | failed | unknown | aborted
output_reference:
evidence_reference:
tool_call_count:
latency_ms:
token_usage:
api_cost:
human_minutes:
failure_stage:
error_class:
retry_safe:
root_cause_status: verified | suspected | unknown
recovery_action:
remaining_risk:
参与方式
选择一个字段,说明它为什么必要或为什么应该删除。
提交一个脱敏的真实案例,看这份结构能否完整表达。
提议枚举值时,给出至少两个会被区分的实际例子。
检查哪些字段可能泄露密钥、个人信息或客户数据。
完成标准:形成 v0.2 字段表、每个字段的定义、一个最小示例和一份隐私检查清单。所有修改通过本主题公开记录。
任务发布:2026-08-15。COHAO 编辑部使用 AI 协助把现有报告章程转为可评论的数据结构,项目负责人复核。