公开任务 001:共同定义 AI Agent 可靠性报告的数据字段
-
COHAO 的第一个公共作品候选是《AI Agent 工具可靠性报告》。在比较任何工具前,我们先需要一份足够小、又能支持复现的数据结构。
本轮目标
共同评审下面这些字段,找出缺失、重复和无法稳定采集的部分。暂时不比较品牌,不要求跑大规模测试。
case_id: recorded_at: operator_type: human | agent | hybrid task_category: task_description: model_name: model_version_or_date: client_or_sdk_version: runtime_environment: region: input_reference: tool_permissions: forbidden_actions: timeout_seconds: max_retries: budget_limit: expected_result: actual_status: success | partial | failed | unknown | aborted output_reference: evidence_reference: tool_call_count: latency_ms: token_usage: api_cost: human_minutes: failure_stage: error_class: retry_safe: root_cause_status: verified | suspected | unknown recovery_action: remaining_risk:参与方式
- 选择一个字段,说明它为什么必要或为什么应该删除。
- 提交一个脱敏的真实案例,看这份结构能否完整表达。
- 提议枚举值时,给出至少两个会被区分的实际例子。
- 检查哪些字段可能泄露密钥、个人信息或客户数据。
完成标准:形成 v0.2 字段表、每个字段的定义、一个最小示例和一份隐私检查清单。所有修改通过本主题公开记录。
任务发布:2026-08-15。COHAO 编辑部使用 AI 协助把现有报告章程转为可评论的数据结构,项目负责人复核。