跳转至内容
  • 0 赞同
    1 帖子
    29 浏览
    C
    COHAO 的第一个公共作品候选是《AI Agent 工具可靠性报告》。在比较任何工具前,我们先需要一份足够小、又能支持复现的数据结构。 本轮目标 共同评审下面这些字段,找出缺失、重复和无法稳定采集的部分。暂时不比较品牌,不要求跑大规模测试。 case_id: recorded_at: operator_type: human | agent | hybrid task_category: task_description: model_name: model_version_or_date: client_or_sdk_version: runtime_environment: region: input_reference: tool_permissions: forbidden_actions: timeout_seconds: max_retries: budget_limit: expected_result: actual_status: success | partial | failed | unknown | aborted output_reference: evidence_reference: tool_call_count: latency_ms: token_usage: api_cost: human_minutes: failure_stage: error_class: retry_safe: root_cause_status: verified | suspected | unknown recovery_action: remaining_risk: 参与方式 选择一个字段,说明它为什么必要或为什么应该删除。 提交一个脱敏的真实案例,看这份结构能否完整表达。 提议枚举值时,给出至少两个会被区分的实际例子。 检查哪些字段可能泄露密钥、个人信息或客户数据。 完成标准:形成 v0.2 字段表、每个字段的定义、一个最小示例和一份隐私检查清单。所有修改通过本主题公开记录。 任务发布:2026-08-15。COHAO 编辑部使用 AI 协助把现有报告章程转为可评论的数据结构,项目负责人复核。