【Claw-Eval】核心架构与 Harness 设计原理深度解析:300 任务 × 14 模型 × Pass^3 的可信任 Agent 评测 Harness
从 claw-eval/claw-eval(772⭐,2026-09-10 最新提交)出发,深度解析 Harness 工程化评测框架:300 个人工校验任务 × 22 个 Mock 服务 × 4 维评分矩阵 × Pass^3 鲁棒指标 + 沙箱隔离 + 3 层压缩。
从 claw-eval/claw-eval(772⭐,2026-09-10 最新提交)出发,深度解析 Harness 工程化评测框架:300 个人工校验任务 × 22 个 Mock 服务 × 4 维评分矩阵 × Pass^3 鲁棒指标 + 沙箱隔离 + 3 层压缩。
深度剖析 bytedance/UI-TARS-desktop 的核心架构:38k 的多模态 AI Agent 全栈,包含 GUIAgent 主循环、UITarsModel VLM 适配、action-parser 坐标映射、4 套 Operator (nut-js/browser-operator/browserbase/adb)、4 套 MCP Server (browser/commands/filesystem/search)、7 种搜索引擎抽象 (baidu/bing/google/sogou/duckduckgo/tavily/searxng),是首个严肃落地的 Vision-Language Agent 开源栈。
76k⭐ 的 learn-claude-code 把 Claude Code 的 17 个核心机制拆成可运行的最小代码,从一个 while 循环逐步演进到目标驱动的 Agent Harness。
深度剖析 abhigyanpatwari/GitNexus 项目的核心架构:15 万行 TypeScript 代码如何用 19 阶段摄取管道 + LadybugDB 图数据库 + 混合 BM25 向量检索 + 17 个 MCP 工具,把任意代码库转成 AI Coding Agent 可查询的「结构化记忆」。对比 DeepWiki / Cody / Sourcegraph 等同类项目,揭示「预处理式关系智能」 vs 「探索式 Graph RAG」 的设计哲学差异。
从 Tencent/AI-Infra-Guard(6187⭐,2026-09-09 最新提交)出发,深度解析 Harness 6 件套中"安全审计层"的工程化实现:双模式预扫描(regex 静态 + LLM 语义)、SkillTrustBench T01-T09 分类、Crescendo + TAP 多轮攻击策略、Attacker/Evaluator/Target 三角色红队编排。
深度剖析 wanshuiyin/Auto-claude-code-research-in-sleep(ARIS,⭐15.8k)的核心架构:82 个 Markdown Skill × 7 个 MCP Server × 双控制轴(effort / assurance)× 跨模型对抗评审协议,剖析 append-only obligations ledger、typed policy gate、external-cadence 外部心跳规则与 stall-detection 强制 pivot 等工程化创新,附带 Python / YAML / Bash 真实可运行示例。
从 oraios/serena(28,987⭐,MIT,2026-09-06 最新提交)出发,深度解析 Harness 6 件套中"MCP + Sub-Agent"复合组件的工程化实现:solidlsp 语言服务器聚合、NamePath 符号树抽象、Component 注入式工具基类、SymbolRetriever vs CodeEditor 双后端抽象、Project-level MemoryManager 与 `@mem:topic` 引用协议、PreToolUse/PostToolUse Hook 跨宿主(Claude Code/Codex/Grok/Copilot)兼容设计。
深度剖析 nanocoai/nanoclaw (⭐30.7k) 的 v2 架构:双 DB 会话拆分 (inbound.db/outbound.db) + DELETE journal mode 规避 VirtioFS WAL shm 失效 + Channel Adapter 自注册模式 + 三层隔离模型 + Chat SDK Bridge + OneCLI Agent Vault 凭据隔离,揭示为何「一个小到 Claude 都能改的 NanoClaw」能在 OpenClaw 的百万行级项目之外跑出完全不同的工程哲学。
拆解 ACI.dev 如何用统一工具协议、多租户认证、动态发现和权限边界,把工具调用变成可审计的 Agent 执行面。
深入分析 humanlayer/12-factor-agents 如何用十二条工程原则重构生产级 LLM 应用,把上下文、工具调用、控制流、暂停恢复和人机协作从框架黑盒中收回到业务代码。