深度剖析 / 工具与能力设计
工具与能力设计
设计智能体真正能用的工具——粒度、Schema、错误消息、恢复与反模式。
- 设计智能体能用好的工具工具就是智能体的全部 API:为一个只读描述、且会自信犯错的模型而设计,而非为一个读过源码的工程师。
- 工具粒度与组合粗工具隐藏决策、集中爆炸半径,细工具放大来回、撑大列表——而工具爆炸如今是约 24 个百分点的选择准确率实测损失。
- 模式、契约与默认值模式就是指令集:让非法状态无法表示、让安全相关字段必填,并让最少说明的路径成为最少伤害的路径。
- 把错误消息当作提示工具错误是一段即时提示词:点出原因、回显坏值、开出修正后的调用、说清可重试还是终态——否则就养出一个失控重试循环。
- 工具文档与可发现性选择是对名称与描述的纯文本检索:按服务做命名空间、说清何时用与何时不用、给一个范例——并记住可发现性与库存量成反比。
- 工具设计反模式拖垮多数智能体的四个——厨房水槽工具、字符串化参数、静默失败、泄漏的抽象——每个一分钟可认出,每个都有追踪指纹和机械修法。
- 工具调用厂商对照矩阵(2026)OpenAI(Chat Completions 与 Responses API、parallel_tool_calls、带 Lark/regex 的自定义工具)vs Anthropic(编程式工具调用、Tool Search Tool、Tool Use Examples)vs Gemini(OpenAPI 子集、tool_choice: any、多模态函数响应)。
- 进阶工具编排Anthropic 的 Tool Search Tool(减少 85% 令牌);Programmatic Tool Calling(Claude 在沙箱中写 Python 调工具,只有最终结果进入上下文);Tool Use Examples。
- 结构化输出 vs 工具调用两种约束模型的方式——底层是同一份受限解码,人体工程学不同。Anthropic 的原生结构化输出于 2026 年 GA;各自何时用。
- 各厂商的 JSON Schema 子集各厂商实际能强制到什么——Anthropic 不支持 minLength/maxLength/minimum/maximum;Gemini 只吃 OpenAPI 子集;OpenAI 的 strict 模式要求 additionalProperties:false 且全为 required。
- 流式工具调用实操逐厂商的增量拼接、OpenAI GPT-4.1-nano 的重复调用 bug、Gemini 可聚合的 arguments、Anthropic 带并行调用的流式。
- 代码即动作让模型写代码去调工具,靠着把中间数据挡在上下文之外,使一条被公开报告的工作流从 150,000 token 降到 2,000——而它花掉的是动作日志,因为策略执行、审批闸门与审计全都以工具调用为钥匙,而一段程序从不吐出工具调用。