跳转至内容
  • 0 赞同
    1 帖子
    29 浏览
    C
    COHAO 的第一个公共作品候选是《AI Agent 工具可靠性报告》。在比较任何工具前,我们先需要一份足够小、又能支持复现的数据结构。 本轮目标 共同评审下面这些字段,找出缺失、重复和无法稳定采集的部分。暂时不比较品牌,不要求跑大规模测试。 case_id: recorded_at: operator_type: human | agent | hybrid task_category: task_description: model_name: model_version_or_date: client_or_sdk_version: runtime_environment: region: input_reference: tool_permissions: forbidden_actions: timeout_seconds: max_retries: budget_limit: expected_result: actual_status: success | partial | failed | unknown | aborted output_reference: evidence_reference: tool_call_count: latency_ms: token_usage: api_cost: human_minutes: failure_stage: error_class: retry_safe: root_cause_status: verified | suspected | unknown recovery_action: remaining_risk: 参与方式 选择一个字段,说明它为什么必要或为什么应该删除。 提交一个脱敏的真实案例,看这份结构能否完整表达。 提议枚举值时,给出至少两个会被区分的实际例子。 检查哪些字段可能泄露密钥、个人信息或客户数据。 完成标准:形成 v0.2 字段表、每个字段的定义、一个最小示例和一份隐私检查清单。所有修改通过本主题公开记录。 任务发布:2026-08-15。COHAO 编辑部使用 AI 协助把现有报告章程转为可评论的数据结构,项目负责人复核。
  • 0 赞同
    1 帖子
    22 浏览
    C
    长任务最危险的并不总是模型能力不足,而是目标、事实和边界在几十次工具调用后悄悄漂移。一个好的检查点应该让任务被打断后可以继续,也让人能发现它正在回答旧问题。 三份持续更新的状态 事实表 只记录已经验证的事实、证据位置和时间。易变化的信息带日期;不确定内容明确标记为假设。 决策表 记录已经确认的选择、否决项、理由和生效范围。新消息与旧决定冲突时,先停下来处理冲突。 执行表 每个步骤只有 pending、in_progress、completed 三种状态,并写出验收证据。任何时刻最多一个主要步骤处于进行中。 什么时候建立检查点 完成一个可独立验收的阶段后。 即将进行不可逆或高风险操作前。 工具返回异常、环境发生变化或用户追加要求后。 上下文将被压缩、任务将转交或运行时间较长时。 停止条件比“继续努力”更重要 提前定义预算、最长运行时间、最大重试次数、允许修改的对象和必须转人工的事件。检查点不是为了让 Agent 永远运行,而是为了让它知道何时应该停。 编辑说明:2026-08-15,COHAO 编辑部基于长任务执行和社区建设记录整理;AI 协助起草,项目负责人复核。