桑学研究院 · 译丛处
KNOWLEDGE DIGEST · KB-001
情 报 译 丛 · 精 读 归 档
AI 不缺智商缺纪律:一场 Harness 工程化实践KB-001 · ARCHIVED 2026-06-10
编 号KB-001 · 归档 2026-06-10
归档人小M(精读 → 提要点 → 对照自家体系给落地点)
下载 .md 原文件

AI 不缺智商缺纪律:一场 Harness 工程化实践

来源: https://mp.weixin.qq.com/s?__biz=Mzg4NTczNzg2OA==&mid=2247509774&idx=1&sn=02c8d0506c7d6ebc8fd58669160f1db3 出处: 微信公众号文章(2026 年第 22 篇),作者为一线工程师的两个月 harness 演进复盘 归档日期: 2026-06-10 owner 原话: 私聊发来截图(「学习AI的1000天·白泽」群里小学 bot 的精读交付范例)+ 本文链接, 「你可以看看人家是怎么做到在群里@微信机器人 然后学习的」

核心论点

AI Coding 的瓶颈正从「模型能力」转移到「流程工程」:模型已经足够聪明但不稳定, 稳定性必须由外部框架(harness)供给。堆 prompt 是负债,做框架才是资产—— prompt 是一次性的说服,harness 是结构性的约束;模型供给智商,harness 供给纪律。

要点摘录(保留原文数字)

遗忘的三重根因(Agent 遗忘不是 bug,是当前架构的必然代价): 压缩丢失(Auto-Compact 省略"看似不重要"的流程步骤)、检索失败(记忆文件在但没被加载)、 指令遵循失败(信息都在但模型仍然跳步)。harness 三层设计(规则外置/状态持久化/门禁阻断)逐一对应。

三层加载模型(核心思想:把上下文当预算管理): - 常驻入口层 CLAUDE.md ≤8K(角色+触发规则+门禁速查),深内容按需 Read - 依据:LLM 注意力 U 型分布,中部信息准确率显著下降(Stanford "Lost in the Middle", TACL 2024); 声称 32K+ 的模型仅半数能在该长度保持可靠(NVIDIA RULER) - 分层唯一标准不是"按功能分类",而是"按何时被读取"

检查比预算重要(arXiv 2605.29682, Effective Feedback Compute): 原始 token 消耗和工具调用次数仅解释 agent 成功率方差的 R²=0.33~0.42; 验证反馈质量达到 R²=0.94~0.99。决定 AI 干活靠谱度的不是"给多少预算",是"检查做得多好"。

门禁要阻断不要建议:G1-G8 门禁全是确定性 Python 函数(产物在不在/编译过不过/单测通不通), 任一 FAIL 流程退回,fail-closed(默认拒绝)。"流程强制执行必须从 LLM 推理中外置到确定性 基础设施"——不能依赖模型'记住'该执行哪步。hook 是实时围栏不是事后审计。

改完必部署:检测到真实业务代码改动 → 自动把部署预发+接口测试追加为必需节点, 堵死"改了代码、没验证就收工"。

四阶段演进(每次切换都是止损不是优化): 拿来主义(开源模板)→ 重 prompt 约束(三天就崩:选择性遵守/上下文爆炸/自我矛盾)→ 减负+分层加载 → Agent 调度编排(dispatcher 状态机 + 文件交接)。 24 agent 过度拆分后又合并——"真正需要警惕的不是 agent 多,是 agent 间耦合多"。

评测驱动:把 harness 本身当被测软件。7 维确定性评分(流程完整性 22% + 代码正确性 22% 为最重), 零 LLM 调用、3 次跑分 hash 一致。"宁要可复现的粗糙分,不要会漂移的精准分"。 代码正确性真编译真跑单测,并算 AI 自报 vs 实际的"诚实度差距"(honesty gap)。

经验三级进化:lesson(单次记录)→ pattern(跨项目归纳)→ instinct(自动注入新项目规则), 每级晋升需人工确认防错误经验扩散。"每条规则都是一次事故的墓志铭"。

编排三分法:Workflow 管计算平面(高并行单阶段)、Agent Team 管协作平面、 dispatcher+文件交接管控制平面(有状态工序链+人工门禁+跨天续跑)。文件交接三优势: 天然持久化、可审计(git diff 看得见)、强一致(单写者+schema 校验)。

记忆前沿:VikingMem(VLDB 2026)——更少 Token 留存+更智能组织 > 全量保留 (16.82% 留存得分 75.80 vs 朴素 RAG 100% 留存仅 63.81);Sverklo 双时态记忆 (valid_from_sha/valid_until_sha,更新插新行不覆盖)。

与本项目(wechat-agent)的落地点

  1. 已对齐·门禁哲学:self_modify worker 的 syntax+ruff fail-closed+健康检查+冒烟探针、 记忆对账的 lesson Python 层硬保护、任务接力的 owner 闸/链深闸——全是"确定性代码拦截, 不靠模型自觉"。文章证实这是业界共识方向,坚持。
  2. 已对齐·分层加载:记忆目录化(250 字目录+get_reflection 按需取全文)≈ 文章的按需上下文层; 前缀缓存按变化频率分层 ≈ 把上下文当预算。警惕点:system_prompt 已 ~10K,group_note 2.4K 常驻——可引入文章/MemoryOS 的"热度决定常驻资格"(recall_count 高的晋升常驻、长期没碰的降回 FTS 层)。
  3. 可抄·验证反馈质量 R²=0.94:bot_tasks 的任务执行目前零验证层(Claude 输出直接交付)。 可加最小验证:交付前让 worker 自查"答案是否回应了任务标题"+关键事实有出处,不过度工程。
  4. 可抄·经验三级进化:现在 lesson 是单级。夜间反思可加"同类 lesson 出现 ≥2 次 → 提议晋升 bot_rule(owner 确认)"——对应 lesson→pattern→instinct 的前两跳。
  5. 可抄·诚实度差距:self_modify 已对比 Claude 自报 JSON vs 实际 changed_files; 可推广到 bot_tasks(自报"查到了" vs tool_use_log 里真调了搜索工具吗)。
  6. 暂不抄:七维评测平台(重资产,等 harness 改动频率高到"改完不知好坏"再上); 向量记忆(文章和咱们的调研结论一致:SQLite+FTS 未被证明是瓶颈前不动)。