概念
概念
AI 与 Agentic AI 通俗解读 — 面向新手与进阶者的白话词条。
初次接触智能体 AI?按顺序读完这五个概念:
也可以跟着完整引导路径走: 实战指南 →
AI 基础
- 什么是 AI、机器学习与深度学习?AI、机器学习与深度学习是层层嵌套的同心圆,而非同义词——你看的是哪一层,决定了一个系统会如何失败。
- 直观理解神经网络神经网络是一大堆把数字变成数字的可调旋钮;学习不过是把这些旋钮朝更小的误差微调。
- 什么是大语言模型?LLM 是一个巨大的下一令牌预测器;规模把这一个简单目标变成了无人显式编写的能力。
- 训练与推理训练一次性造出模型被冻结的权重;推理按请求运行它们且从不改变它们——这解答了大多数成本与隐私问题。
- 令牌与分词模型看到的是整数而非文本;隐藏的分词步骤解释了你的账单、上下文上限和古怪的失败模式。
- 嵌入:意义即几何嵌入把事物变成空间中的点,让“相似”变成“接近”——这是搜索、推荐和 RAG 背后的引擎。
- 从宏观看 Transformer自注意力让每个令牌都能看其他每个令牌;这一个思想修复了长程记忆并解锁了 GPU 规模的训练。
- 生成与采样:讲清温度模型返回的是一个概率分布而非一个答案;温度重塑它,而温度 0 是低方差,并非确定性。
- 幻觉与接地模型会编出流畅的答案,因为它优化的是流畅而非真实——所以编造是结构性的,而非等待打补丁的 bug。接地把证据放进上下文并要求答案出自其中,这消除不了杜撰,却让发现杜撰变得廉价。
- 合成数据由模型生成的训练数据,其安全程度与筛选器的质量成正比——崩塌是流水线的属性,而非数据的属性。
- 蒸馏与量化蒸馏训练的是一个全新的小模型;量化存储的是同一批权重的低精度版本。前者以 GPU 天计且不可逆,后者以分钟计且可逆。
- 后训练:从基座模型到助手拒绝、谄媚、排版习惯乃至助手人格本身,都是在预训练之后、在一个每发布一版就重做一次的相对廉价的层里装上去的——这正是一次小版本升级对行为的改动可能大过一次能力升级的原因。
- 预填充、解码与 KV 缓存一次模型调用其实是两台瓶颈相反的机器:预填充并行读入提示词、受限于算力,解码一次写一个令牌、受限于内存带宽。这一划分解释了首令牌时延、为何输出比输入贵,以及提示词缓存为何必须是前缀匹配。
- 可复现性与非确定性temperature 0 是一条采样规则,不是一份保证:推理服务器会把你的请求和别人的打成一批,而许多算子会随批大小改变归约策略,于是相同的贪心请求会返回不同的文本。对智能体的后果是,一次出错的运行无法靠重跑复现——可复现性只能来自记录。
- 知识截止日与缺失的那只钟截止日是一道渐变而非一堵墙——它之前那几个月的知识比两年前更稀薄,而那恰恰是自信跑在证据前面的地方。加上一个没有钟的模型,会把每一个与日期有关的问题,都答成流畅、自洽而错误的样子。
- 投机解码唯一一种可被证明不会改变模型输出的提速手段——廉价草稿往前猜、真模型来核验——这既是它不花你一个评测周期的原因,也是它在繁忙 GPU 上悄悄吃掉吞吐的原因。
- 专家混合(MoE)参数量不再等于成本:MoE 把账单劈开,算力跟着每个令牌真正激活的参数走,显存却要跟着全部参数走——于是同一个模型,租来的 API 上是笔划算买卖,自己的 GPU 上却是一次昂贵的误判。
- 参数高效微调LoRA 赢在特化的产物是个 50 MB 的文件:一份基座就能服务上百个变体,切换降格成路由——也赢在秩是一个容量旋钮,它决定了你能教的是行为(可以)还是事实(不行,那是检索的活儿)。
智能体 AI
- 什么是 AI 智能体?智能体是被放进循环、配有工具、自行选择每个下一步以实现目标的模型——核心思维模型。
- 智能体循环推理→行动→观察→重复:追踪一次工具调用如何从模型经外壳进入环境再返回。
- 自主性等级从"建议"到"完全自主"的五级阶梯,以及为何合适的等级是逐动作的工程决策。
- 智能体 vs 聊天机器人 vs 工作流一个问题——谁决定下一步——就能把任何 LLM 系统归入聊天机器人、流水线、工作流或智能体。
- 工具、动作与环境工具的真实面貌、读动作与写动作之分,以及为何是环境而非模型让智能体变得危险。
- 目标、规划与终止从反应式到深思熟虑的规划谱系,以及"如何知道智能体完成了"这个被低估的难题。
- 何时该用智能体一个任务要值得用智能体所需的三个属性、能解决多数情况的更便宜模式,以及明确不该用的情形。
- 智能体的风险与局限循环的四种特征性故障模式、自主性带来的安全转变,以及"安全的智能体"诚实地意味着什么。
- 用大白话讲提示词注入提示词注入究竟是什么、为何它不是哪家厂商能打补丁的 bug,以及你真正能用的三种防御手段。
- 智能体记忆:短期与长期上下文窗口是智能体的短期记忆,每次会话都会重置;持久的行为需要一个你有意写入并检索的外部长期存储。
- 计算机操作与图形界面智能体当没有 API 时,智能体可以自己操作屏幕——读取截图并合成点击与按键——这解锁了任何软件,却缓慢、脆弱,并带来全新的攻击面。
- 多智能体系统一个强大的单智能体才是基线,而非目标;只有当任务确实可并行、或需要相互隔离的专门上下文时,才该动用多个协作智能体——代价是协调开销、错误传播与 token 消耗。
- 语音与实时智能体与智能体实时对话让延迟成为整个设计难题,并逼出一个架构抉择:可拆解、可审查的 STT→LLM→TTS 级联,还是用控制力换取速度与自然语调的单一语音到语音模型。
- 人在回路人在回路不是自动化的反面——它是你把人的检查点放在哪里。给少数有后果、不可逆的动作设闸,其余放行;陷阱是那种橡皮图章式的批准:它增加延迟与虚假信心,却什么也拦不住。
- 沙箱与代码执行代码是那个万能工具——而智能体写出的代码永远是不可信代码,因为它的输出取决于你并不掌控的输入。隔离是五条彼此独立的决策(文件系统、出站、凭据、算力、生命周期),其中网络出站最常被大敞着。
- 智能体身份与权限认证、授权与归属是三个问题,而一把共用的 API 密钥把它们都答砸了。智能体的权限应当是"用户可以做什么"与"任务需要什么"的交集——而由于它们在模型之外被强制执行,它们是提示词注入得手时唯一仍然撑得住的防线。
- 智能体成本控制智能体每一步都会重发整段对话,因此累计输入随步数的平方增长——这正是「换个便宜模型」几乎从来都不是解法的原因。
- 为智能体设计工具当智能体挑错工具、或对着一个失败的调用死循环时,问题几乎总是出在你的工具上——工具是写给这样一位读者的接口:没有文档、两次调用之间不记事、还受令牌预算约束。
- 智能体的交互设计:为复核而设计一个省下一小时的智能体,如果复核它要花五十分钟就毫无价值——复核成本才是你的界面真正在优化的指标,而一份可编辑的计划加一个能用的撤销,胜过你能加上去的任何确认弹窗。
- 任务时长视野唯一一个用你能拿来做计划的单位表述的能力数字——智能体能独立做完的任务长度——只不过上标题的是 50% 视野,而可部署的是 80% 视野,大约只有前者的五分之一。在三十件真实任务上量出你自己的那个,并把它当作无人值守工作的长度上限。
- 智能体外壳每个智能体基准分都同时给一个模型和它所在的那层外壳打分,而被点名的只有其中一个——循环、工具目录、上下文策略与停止条件,是归你所有的那一半、没人公布的那一半,通常也是出错的那一半。下次升级模型之前,先拿一天花在外壳上,然后在旧模型上重跑一遍评估。
- 环境权限一个跑在你已登录浏览器配置文件里的智能体,拿到的不是十二个工具,而是你的 cookie 罐认证过的每一个站点——正是这个从未被列举的集合、而非模型本身,把一次提示词注入变成了一次权限提升。确认弹窗只能盖住有人想到过的动作;真正的解法是把按任务签发、范围受限的凭据交给它,好让被说服的智能体手上没有任何值得开口去要的东西。
基础构件
- 提示词基础撬动输出质量的四个杠杆:指令、上下文、示例、输出形式。
- 系统提示词 vs 用户提示词消息角色、指令层级,以及绝不让数据充当指令。
- 少样本提示与示例何时示例胜过指令、如何挑选与排序,以及它们在何处不再划算。
- 上下文窗口详解有限的共享令牌预算、三种上限故障,以及主动管理它。
- 工具/函数调用详解模型提议、你的代码裁决:请求/响应形状、循环与安全规则。
- 检索增强生成(RAG)详解检索→增强→生成、RAG 对比其他方案,以及分两半调试它。
- 分块与向量搜索直觉为何分块、嵌入即坐标、最近邻搜索、混合检索与重排序。
- 结构化输出从"要 JSON"到 schema 约束解码,外加 schema 设计与防御性解析。
- 用大白话讲护栏护栏是模型调用前后的检查,而不是围着模型的一堵墙——它们能拦住什么、漏掉什么,又该装在哪里。
- 用大白话讲评测评测是你针对自己任务运行的一个小而可信的记分牌——为何公开基准不够用,以及一个有用的评测集长什么样。
- 上下文工程提示词工程打磨一条指令;上下文工程决定填满窗口的其余一切——检索、记忆、工具结果、历史——以及何时压缩它。它是构建智能体的核心工程。
- 微调、RAG 还是提示词?把基础模型适配到你的任务有三种方式,它们改变三样不同的东西——指令、检索到的上下文,或权重。选错会浪费数月;正确的顺序通常是先提示词、再 RAG、最后微调。
- 评估智能体智能体产出的是一条轨迹,而非单一答案,所以只给最终输出打分会掩盖走坏的路径——评估一个智能体,意味着在你自己的任务上为它走过的每一步打分,并把成本与安全和准确率放在同一张记分牌上。
- 提示词缓存缓存是前缀匹配:稳定内容在前、易变内容在后,而系统提示词里一个不起眼的时间戳就会悄然让其后一切失效。读取约为基础输入价的十分之一,写入则要付溢价——而在每一步都重发整份记录的智能体循环里,这已不再是优化项,而是结构性问题。
- 智能体可观测性与追踪一次运行是一棵跨度构成的树,而非一行日志:实际发送出去的提示词、工具参数、返回结果、成本,以及贯穿其间的一个追踪 ID。只记录最终答案,记下的是失败浮现之处,而非失败发生之处。
- 本地知识库"本地"是三个彼此独立的旋钮——文档存在哪、嵌入在哪算、生成在哪发生——而多数真实方案只在前两个上是本地的。自己扛下这条流水线,买到的是可证明的数据驻留与归零的检索账单;付出的是召回质量、索引维护,以及每次更换嵌入模型都要重嵌一遍全部内容。
- 知识图谱向量搜索返回的是看起来像问题的段落,因此它在结构上答不了那些散落在多份文档之间的问题。图谱存的是关系而非散文——赢下多跳与全局性问题,代价是要在整个语料上跑一遍 LLM,以及一个永远无法彻底消失的实体消歧问题。
- 流式输出与中间结果流式输出不会让模型变快——它让等待变得可见,同时把你所有的输出侧护栏挪到了一个可能已经太晚的位置。
- 语义缓存其他缓存最坏也不过是慢;语义缓存却可能答错,因为它靠相似度得分而非相等判断来决定命中。它不是一项缓存功能——它是一套带着误报预算的检索系统。
- 多语言与跨语言智能体多加一种语言会同时打坏三样东西——令牌、检索与评测——而人人都会去测的生成质量,恰恰是坏得最轻的那个。跨语言检索的落空,从一段流畅的最终答案上完全看不出来。
- 自动提示词优化提示词是一个你正在用手拟合的参数——样本量只有三,还没有留出集——这就是为什么读起来更顺的版本常常反而分更低;优化器只是一个脚本,打好分的数据集才是资产,而胜出的提示词是一件在你换模型那天就过期的构建产物。
AI 生态
- 模型版图:家族与提供方一份厂商中立的主要模型家族地图,以及给任何新发布定位的稳定思维模型。
- 开放权重 vs 闭源模型控制力、成本、隐私、许可与锁定——真实的工程权衡,去除营销话术。
- 模态与多模态模型文本、视觉、音频、代码:输入与输出模态,以及为何"多模态"是谱系而非勾选项。
- 成本、质量与延迟模型规模与主导生产经济性的权衡三角,以及如何围绕它做工程。
- 推理 vs 非推理模型推理期"思考"实际做了什么、何时有用或浪费钱,以及为何它如今是一个旋钮。
- 智能体框架与编排LangChain、LlamaIndex、提供方 SDK 与更广版图——按类别与权衡,而非按品牌。
- 服务与访问:API、本地、网关模型选择与服务选择是正交的:第一方 API、云目录、推理提供方、自托管、网关。
- 批判地阅读基准为何排行榜名次很少预测你的任务,以及为何小的自定义评测集胜过一切公开数字。
- 选模型:一份清单一套约束优先、可重复的决策流程,综合整个主题并能在快速变动的领域中存活。
- 什么是模型上下文协议(MCP)?MCP 是一个开放标准,让任何模型通过同一个接口连接任何工具或数据源——把 M×N 个定制集成变成 M+N。
- 小模型与本地模型问题不是你自己能跑起来的模型能否追平前沿模型——它不能——而是哪些活儿本来就用不着前沿模型。嵌入、重排序、路由与抽取才是高频步骤,而它们恰恰是自有硬件上一个量化后的 0.5–8B 模型既够用、又便宜好几个数量级的地方。
- 智能体互操作与 A2AMCP 递给你的智能体一件工具;A2A 把它介绍给一个有自己目标、延迟与失效模式的对等方——而协议解决的是发现,不是信任。
- 模型路由与级联只有当判断「这难不难」比直接作答更便宜、也更可靠时,路由才划算——这正是按任务的静态路由就能拿下大部分节省、而级联需要一个你手里已有的验证器的原因。
- 数据驻留与数据主权驻留是地理,主权是司法管辖,而那个区域开关只回答了法务在问的四个问题中的一个。对智能体而言,泄漏点通常是追踪系统,而不是模型端点。
- 批处理与异步推理同一个模型,输入与输出双双对折,代价只是把完成窗口拉长到以小时计——而符合条件的活儿往往正是你跑得最多的。结构性的前提是:智能体循环永远用不上它。
- 智能体技能技能带不来任何新能力——它是一个装着指令的文件夹,只有当任务对得上时才被加载,所以难的不是指令本身,而是那句决定它会不会被读到的一句话描述。
- 托管智能体运行时托管智能体运行时被当作一个产品来卖,实际上是五个——算力、循环、工具网关、身份代理,以及一个存放对话状态的存储——其中只有最后一个难以离开;于是锁定来自捆绑而非"托管"本身:问一句,如果循环产品明天被冻结,你手里还剩什么。
- 智能体连接器平台靠目录规模来卖,而目录恰恰是你迟早会用不下的那部分;底下那个难做的产品,是按用户存放的令牌保险库——为每家提供方跑 OAuth、在并发下刷新、轮换,以及一份模型永远看不到的凭据。买保险库,并把“同意授权页面上写着谁的名字”当成那个收不回的决定。
- AI 网关路由、密钥托管、缓存、策略与计量,本是五件可以分开买的事,却被当作一个产品来卖,而其中真正难以自建的只有那本账——把网关放进请求路径,你买到的就是一个可用性依赖,外加一笔按智能体每一步抽成的过路费。
核心构件
- 不确定性与校准三种信号共用"置信度"这个词,而只有采样一致性配得上它,因为让模型变得可亲的那步对齐同时让它过度自信——所以该造的不是一个拿去显示的数字,而是一个从覆盖率-风险曲线上读出来的弃答阈值。
- 思维链忠实性推理轨迹是生成出来的文本,不是日志——模型只在 25–39% 的情况下提到那个改变了答案的提示——所以读"它怎么想"的审批闸门、裁判与注入检测器,评的都是一个故事;改去审计工具调用,并且永远不要把草稿纸放进奖励里。
- 拒绝与能力门禁拒绝是在生成时施加的一条策略,压在一项依然完好的能力之上,所以"模型做不到那件事"几乎从来不是真话——于是拒绝率成了已部署模型身上最易变的性质,过度拒绝成了没人去量的一项成本,而模型自身的意愿,是安放一项你必须握住的控制的最糟位置。