资讯详情

资讯详情

Better Harness架构揭秘:3个独立证据Agent+1个主Agent设计如何保证诊断结论可信

Better Harness架构揭秘3个独立证据Agent1个主Agent设计如何保证诊断结论可信【免费下载链接】better-harnessAn open-source Harness Engineering platform for coding agents—define harnesses as code, run controlled experiments, inspect evidence, and compare outcomes. Turn task evidence into actionable team and organization insights.项目地址: https://gitcode.com/gh_mirrors/be/better-harnessBetter Harness 是一个面向编码 AgentCoding Agent的开源 Harness Engineering 平台它运行在你已有的编码 AgentCodex、Claude Code、Qoder、Cursor 等内部把项目与会话证据转化为可信的诊断结论。它的核心架构正是3 个独立证据 Agent 1 个主 Agent证据采集与结论裁决被彻底分离让每一条发现都有据可查。 为什么要用多 Agent 交叉取证让一个 AI 给另一个 AI 系统看病最大的风险是自证偏见同一个 Agent 既负责收集证据、又负责下判断证据薄弱时容易脑补事实一条 lane 的结论会悄悄影响另一条 lane 的判断比如项目结构好的印象污染了会话行为的评分评分如果跟着候选数量走报告就会变成为了凑够 5 条发现而修改结论。Better Harness 的解法在架构文档中写得很直接三个证据域在统一分析之前保持独立每个结果都保留可见的证据来源、责任方与验证路径Every result retains a visible evidence source, owner, and validation route。 总体图景3个证据Agent各管一摊诊断启动时主 Agent 先收集一个版本化证据包Evidence Bundle它冻结了目标、提供方、时间窗口、深度与权限然后并行派生 3 个全新、只读的专家 Agent各自只能看到自己的 lane专家 Agent证据域能看到的被禁止看到的Session Evidence Agent会话行为带提供方标签的事实信封 精简资产计数项目源码、原始会话、其他简报Project Harness Agent项目工程能力目标、历史/变更边界、projectHarness数据Session 与 Agent Customize 的结论Agent Customize AgentAgent 定制资产lint / inventory / integrity 三个确定性信封Session 与项目结论且不得重跑命令证据包由 scripts/harness-analysis/evidence-bundle/ 实现采用fail-closed策略关键 lane 失败时整个包判定为失败而不是降级凑合出结论。Session Evidence Agent只读事实信封主 Agent 交给它的是脱敏后的语义事实planning 信号、工具调用、验证时机、摩擦点等而不是原始会话——它必须遵守会话诊断规范且被明确禁止顺手看看项目代码。这样它给出的候选发现只能来自会话行为本身而非印象分。Project Harness Agent只量项目底盘它拿到的是目标仓库、历史/当前变更边界与项目工程数据负责判断项目工程能力——可复现启动、快速反馈、分层验证、机械约束、可观测性等。它看不到任何会话结论避免这周任务都成功了所以项目一定健康这类跨域污染。Agent Customize Agent只核资产健康它消费 lint、inventory、integrity 三个确定性信封由一次共享资产快照生成按Agent 定制资产审查评估 Rules、Skills、MCP、Memory、Hooks 等已配置资产。注意资产计数本身永远不产生发现或分数——配了很多 Skill不等于用了很多 Skill。 四条独立性的硬规则这些规则全部固化在 skills/better-harness/SKILL.md 的第二步Run Three Independent Evidence Passes中全新且只读3 个 Agent 并行派生Codex 中使用spawn_agent且fork_turns: none禁止再委托——每个专家 Agent 不能自己再外包取证。互不可见任何证据 Agent 都拿不到完整证据包、原始会话或其他简报只能看到自己的 lane 数据与已解析范围。专家不定级Specialists never assign final severity or scores——专家只产出 3~5 条候选严重度与分数一律留给主 Agent。硬上限本次取证最多 3 个委托 Agent等待期间主 Agent 只读bundle.lead.data不参与取证。normal 模式下任何一个专家 lane 不可用报告直接阻断而不是把缺失证据悄悄标成未观测蒙混过关。⚖️ 主Agent只做对账保留所有候选再独立定级三个专家返回后主 Agent 执行一次对账与重新定级动作是收敛而不是改写默认全部保留先留住所有专家候选只有目标、后果、责任方、修复路径四者完全相同的才合并逐条验证后果、因果链、最小责任方、证据边界、置信度、验证器定级独立于数量维度分数独立于发现条数推导不允许删掉一条凑满五行保留分歧专家间的分歧与不可用证据以低置信度保留而不是被抹平禁止第四审查 Agent主 Agent 自己执行质量门Findings Quality Gates不再外包复审。评分还有一道证据状态天花板定义在Agent Work Loop 模型中——证据越弱分数上限越低从机制上杜绝说得漂亮但证据不足最高支持的证据状态分数上限Missing/Unobserved/Not applicable59Present机制存在74Wired可被任务触达84Exercised被实际使用且保留结果94Outcome-supported后续可比结果支持100 报告输出缺失证据同样显形对账完成后主 Agent 才起草findings.json交由渲染器一次性渲染并校验。报告里每条发现都带完整链条为什么重要 → 预期结果 → 有边界的修复方案 → 验收检查缺失证据保持显式标注而不是用推测填充。报告按五个维度打分——任务理解、受控执行、变更验证、可靠交付、学习捕获。随着时间积累可比报告历史视图能直观看到五个维度如何移动 想深入源码从这里开始模块路径多 Agent 编排总纲31 设计的执行契约skills/better-harness/SKILL.md架构参考页docs/docs/reference/architecture.md五维度评分模型与证据状态models/agent-work-loop.md证据包实现冻结上下文 fail-closedscripts/harness-analysis/evidence-bundle/三证据域命名对齐 Specdocs/specs/2026-07-24-better-harness-evidence-domain-alignment.md工程能力评估模型models/harness-engineering.md一句话总结Better Harness 用专家互相看不见、专家不定级、定级有证据天花板、缺失即阻断四道闸门把 AI 诊断从一次自信的输出变成了可审计的证据对账——这才是 31 架构让诊断结论可信的真正原因。【免费下载链接】better-harnessAn open-source Harness Engineering platform for coding agents—define harnesses as code, run controlled experiments, inspect evidence, and compare outcomes. Turn task evidence into actionable team and organization insights.项目地址: https://gitcode.com/gh_mirrors/be/better-harness创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
觉得有用,分享给同行:

为您的企业打造数字门面

稳重轻奢商务风格,端正雅致视觉,长效耐看不易过时。

立即咨询 →