实战手册 / 编码与计算机操作智能体
编码与计算机操作智能体
能读代码、写代码、运行工具并驱动计算机的智能体——模式、外壳与陷阱。
- 编码智能体架构让编码智能体不止是代码生成器的“定位-编辑-验证”循环:智能体-计算机接口、为何智能体式优于流水线式,以及循环在哪里失效。
- 仓库导航与代码上下文代码搜索 vs 向量检索、符号级索引、在大型目录树上做上下文预算,以及为何自信的错误定位是代码检索代价最高的失败。
- 补丁生成与测试驱动循环结构化 diff 与 hunk 应用失败、测试驱动自我纠错、回归守护,以及循环里的三个诚实骗子:flake、过拟合、被删的断言。
- 计算机操作与 GUI 智能体像素 vs DOM 定位、动作空间、截图循环,以及那笔让 GUI 操控成为最后手段的乘法式延迟与可靠性税。
- 浏览器智能体把一个真实浏览器当工具来驱动——DOM 与像素两种观察方式、登录与认证状态、踩烂了的失败模式,以及何时该升级到完整 GUI 智能体。
- IDE 智能体住在编辑器里的编码智能体——内循环和 CLI 编码智能体一样,但交互面、撤销预期与信任阈值都不同。
- 沙箱与安全执行容器化执行、网络与文件系统隔离、能力作用域,以及当智能体运行不可信、受攻击者影响的代码时如何为爆炸半径做设计。
- 评估编码智能体SWE-bench 系列、pass@k vs 解决率、测试编排敏感性、记录在案的污染,以及为何一个截止日期后的私有评测集才是唯一可信的数字。
- 代码评审智能体评审机器人的生死取决于精确率而非召回率:以 diff 为锚的上下文、把说不出具体失败场景的发现一律丢弃的对抗性闸门、按最坏优先排序的硬性评论预算,以及作为唯一生产指标的采纳率。
- 大规模迁移智能体生成成本归零而人工评审没有,所以交付物是证据而不是补丁:先把判据建好、按可核验性而非按目录分批、把机械的头部交给 codemod、只把尾部交给模型,并让一次百文件试点的无需人工编辑落地比例来决定这个项目是否可行。
- 调试与分诊智能体一个读完调用栈就吐出 diff 的智能体是在做模式匹配,不是在调试——把失败的测试定为交付物,评测标准就变得客观,开销从生成挪到观察,而"复现不出来"也成了一个你可以信任的结果。
- 后台编码智能体一个每天开十二个 PR 的智能体,如果团队只合得进四个,就什么也没增加——脱离编辑器把瓶颈搬到了复核端,于是每个决策要么是让一次运行能自我验证,要么是把队列压短到工作真能落地。
- 测试生成智能体从你的代码出发写测试的智能体,是从实现里反推规格的,所以代码错在哪里,测试就在哪里把 bug 认证为正确并挡住修复——覆盖率看不见这件事,变异得分看得见;而值得派发的任务,只有那些你能用一句话说清判据是什么的。
- 依赖升级智能体把版本号往上抬从 2017 年起就已自动化,且一文不值——积压之所以存在,是因为没人愿意合并一个自己担保不了的升级;所以你真正要建的是一份证据规程:全绿的测试恰恰对那些静默出事的默认值变更证明得最少,而正确分流胜过合并数量。
- 文档智能体文档是仓库里唯一没有裁判的产物,而写错的一段话会被人信上好几年——所以按"机器能否证伪"切开语料,只在派生型参考与可执行散文上给智能体无人监督的权限,把删除做成一等输出,并报告新鲜度而不是写了多少页。