跳转至内容
  • 0 赞同
    1 帖子
    24 浏览
    C
    社区已经可以注册、发帖和回复,但“服务启动成功”不等于真实设备上的流程顺畅。这个任务邀请你用自己的浏览器完成一次小范围体验测试。 测试路径 未登录阅读首页、分类和一个主题。 注册一个账号;现阶段邮箱不是必填项。 创建一篇测试主题,正文至少写明设备和浏览器。 确认首篇内容进入审核提示,而不是悄悄消失。 审核通过后登录、退出、再次登录。 回复、搜索、收藏或关注一个主题。 尝试举报本任务,并确认能看到合理反馈。 回报问题时请写 测试时间与时区: 设备与屏幕尺寸: 操作系统: 浏览器与版本: 网络环境: 执行到哪一步: 期望看到什么: 实际看到什么: 是否可稳定复现: 截图或录屏:请先遮住账号、Cookie 和个人信息 不要为了测试发布攻击性、违法或大量重复内容,也不要扫描非公开端口。涉及安全漏洞时先通过管理员可见的举报说明最小影响,不在公开回复中放可直接利用的细节。 编辑部会公开更新已确认问题、修复版本和复测状态,不伪造测试人数或成功率。 任务发布:2026-08-15。AI 协助起草测试步骤,项目负责人复核。
  • 0 赞同
    1 帖子
    29 浏览
    C
    COHAO 的第一个公共作品候选是《AI Agent 工具可靠性报告》。在比较任何工具前,我们先需要一份足够小、又能支持复现的数据结构。 本轮目标 共同评审下面这些字段,找出缺失、重复和无法稳定采集的部分。暂时不比较品牌,不要求跑大规模测试。 case_id: recorded_at: operator_type: human | agent | hybrid task_category: task_description: model_name: model_version_or_date: client_or_sdk_version: runtime_environment: region: input_reference: tool_permissions: forbidden_actions: timeout_seconds: max_retries: budget_limit: expected_result: actual_status: success | partial | failed | unknown | aborted output_reference: evidence_reference: tool_call_count: latency_ms: token_usage: api_cost: human_minutes: failure_stage: error_class: retry_safe: root_cause_status: verified | suspected | unknown recovery_action: remaining_risk: 参与方式 选择一个字段,说明它为什么必要或为什么应该删除。 提交一个脱敏的真实案例,看这份结构能否完整表达。 提议枚举值时,给出至少两个会被区分的实际例子。 检查哪些字段可能泄露密钥、个人信息或客户数据。 完成标准:形成 v0.2 字段表、每个字段的定义、一个最小示例和一份隐私检查清单。所有修改通过本主题公开记录。 任务发布:2026-08-15。COHAO 编辑部使用 AI 协助把现有报告章程转为可评论的数据结构,项目负责人复核。