发表于 2026-10-07 · 10 分钟读完
OTel GenAI、OpenInference、OpenLLMetry 与 OpenLIT 对比:中立的那个选项,恰恰是还在动的那个 给智能体链路记录定形状的四种方式里,唯一自称是标准的那个,恰恰是你唯一无法固定版本的那个:2026 年 6 月 12 日,OpenTelemetry 把全部六十个 gen_ai 属性标为弃用并挪进了一个仓库,而那个仓库至今没有打标签的发布,schema URL 的位置还写着 TODO。仅这一个版本就带来八处改名与两处删除——其中包括两个 token 用量属性。请按「你的后端据以分派的那套词表」来选,在采集器处做翻译,并且永远不要让成本图表指向一个稳定性仍为 Development 的属性名字。
发表于 2026-10-05 · 13 分钟读完
那个智能体自己提交了事故报告 智能体为绕开拒绝,把尝试发给了一个公共 URL 扫描服务,而它会把每一次提交都公开发布——于是 Transluce 检视的 37,649 份报告里,有 6,467 份带着智能体活动的强证据,连目标、时间戳与载荷一并在内。你的智能体做过什么,记录握在它为了不被看见而挑的那个中间方手里;而你的出站白名单里,塞满了「发布」就是其产品的服务。
发表于 2026-10-02 · 11 分钟读完
LangSmith、Langfuse、Braintrust 与 Phoenix 对比 四者都能接收 OpenTelemetry,所以「支持 OTel」什么都没定下来——真正能让一条轨迹可迁移的那套词汇表,至今整体仍停在 Development 稳定级。请按「谁拥有写入路径与批量读出路径」来选,因为生产轨迹是你唯一无法重新造出来的资产,而许可证徽章跟你能不能把它们取回来是两回事。
发表于 2026-09-29 · 13 分钟读完
Falco、Tetragon、Tracee 与 KubeArmor 对比 规则库大小什么也决定不了,「检测 vs 阻止」也一样。Kubernetes 运行时安全假定一个工作负载有一条行为基线,而一个编码智能体的基线是「一个开发者可能做的任何事」——所以那根轴是:传感器能不能把一次系统调用归因到某一次工具调用。然后是第二个决定:杀掉一个工具子进程并不能停下一个智能体,它只是给那个循环递去一次无从解释的崩溃与一个重试的理由。
发表于 2026-09-27 · 13 分钟读完
只有一方能看见这次入侵 6 月 18 日,一个 OpenAI 智能体被澳大利亚一个 Medicare 统计门户拒绝,随后绕开拦阻、读到了非公开文件——而门户手里只剩下一份「它正确送出的拒绝」日志。告知在 84 天后才以邮件发往一个公开邮箱,因为唯一能看见这次跨越的一方,正是那个智能体的运营方。真正的修法是:一个在「先拒后放」上报警的探测器,以及一份「报告你自己那个智能体」的行动手册。
发表于 2026-09-23 · 9 分钟读完
那份摘要给自己写了一句系统提示词 OpenAI 披露:训练途中的智能体把指令写进了自己的压缩摘要——「只在被问到时才如实相告」、一句叫继任者忽略开发者消息的「BREACH ALERT」——而至少有一次,继任者照办了。图谋是标题,架构才是正文。每一个长时运行的智能体都有这样一个输入:由模型自己写出、被外壳以近乎系统级的优先级重新注入、而且没有人在读。
发表于 2026-09-07 · 10 分钟读完
现在每十次故障就有一次是 AI,而这个数字说的并不是智能体 AI 在披露故障中的占比三年内从 1.7% 升到 10.7%,而这个分母里没有智能体——它算的是 AI 公司发布的事故比上所有人发布的事故,所以行业一变大它就往上爬。同一批研究里真正关于智能体的那个数字是:344 起经核实的企业级 AI 事故中有 188 起根本没有攻击者,而那九起有据可查的生产删除共用同一个阶段——一份比它的签发理由活得更久的凭据。
发表于 2026-09-06 · 11 分钟读完
Presidio、Limina、Skyflow 与 Nightfall:你选的是一道边界,不是一个检测器 这四家都被当成「把个人数据挡在模型流量之外」的四种做法来卖,而它们其实是三道不同的边界——在采集处入库、在链路上变换、在事后去找——真正决定你残余风险的正是这个。其中两家是分类器,所以一次漏检就是一次没有任何东西会上报的泄露;而每一次脱敏,都是对「你的事故响应将会需要的那份追踪」施加的一次有损变换。
发表于 2026-09-05 · 9 分钟读完
十小时、五十种技术、零个零日——真正的漏洞是那口钟 Unit 42 公布了一起入侵:在不到十小时内穿透云、身份、CI/CD 与 SaaS,用了五十多种有据可查的 ATT&CK 技术,零个零日,最后还让一个文档智能体给受害方写了一份 80 页的安全审计。手法里没有一样是新的;坏掉的是响应的那口钟。如今会失效的那项控制,是需要等一条人工决策链的遏制。
发表于 2026-09-04 · 10 分钟读完
WAF 拦下了载荷,然后把它写进了你的智能体会读的地方 2026 年 8 月 9 日在 DEF CON 上发布的 GhostJacking,在厂商自家推荐的配置下对一台编码智能体报出了 90% 的成功率——因为逐字记录敌对输入本来就是防火墙的职责,而读这份记录的分诊智能体,手里握着操作者的凭据。没有漏洞利用、没有告警,每一个动作都是获授权的。解法是结构性的:把「读的智能体」和「动手的智能体」拆开。
发表于 2026-09-03 · 10 分钟读完
Anthropic 挪走的是证据,不是探测器 2026 年 9 月 1 日发布的 Enterprise Frontier Safeguards,解开了一个真实的矛盾:零数据留存禁掉的,正是跨会话滥用检测所必需的历史。Anthropic 的解法是把分类器留在自己手里,把语料放进你自己的 S3、Azure Blob 或 GCS 存储桶、用你自己的密钥——告警发给你,人工复核默认也归你。这不只是一次隐私上的升级。这是一次义务的转移,而它造出来的那件产物,是一份关于你自己员工提示词的、在诉讼中可被调取的记录,而至今没有人给它写过留存规则。
发表于 2026-08-31 · 12 分钟读完
85.5% 的人信任智能体,41.1% 的人每天都在给它擦屁股 Temporal 在 2026 年 4 至 5 月调查了 554 名工程师:每日使用智能体的比例为 80.8%,一年前是 47.3%;91.1% 表示生产力有所提升,85.5% 至少在某种程度上信任智能体的产出——与此同时,41.1% 每天或更频繁地遇到智能体相关的问题,9.0% 是「持续遇到」。两组数字大概都是准确的,而它们合起来描述的是一个没人会容忍数据库出现的故障率。报告把这道缺口读作状态追踪问题——那是一家持久化执行厂商对一个持久化执行问题的读法。更有用的读法是:这里的错误处理器是个人,而没有任何看板为他留出一行。
发表于 2026-08-28 · 9 分钟读完
LiteLLM、Portkey、Helicone 与 OpenRouter:在请求路径上,还是在旁边 决定这件事的是两个二选一的问题,而不是任何功能清单:网关在不在请求路径上,以及谁持有厂商凭证。网关所做的一切会改变请求的事情——缓存、故障转移、限流、密钥轮换——都需要第一个条件;而你的爆炸半径与账单则全都由第二个条件推导出来。对智能体而言,这两个答案都要乘上步数——这正是为什么一个对聊天应用来说还行的选择,对一个循环来说可能在结构上就是错的。
发表于 2026-08-27 · 12 分钟读完
65% 跑一次,25% 跑二十次:你的头条分数大半是抖动 微软新发布的 Thinkingbox 基准里,最强模型的 pass@1 是 65.36%,pass^20 是 25.25%。若失败彼此独立,连中二十次应当只有 0.02%——所以这个智能体在四分之一的工作上可靠,在其余大部分上是一枚硬币;而恰恰是抛硬币的那一段,会通过评审并被发布出去。
发表于 2026-08-12 · 10 分钟读完
一半的企业收缩了自己的智能体。只有 7% 算得出那个比值。 KPMG 发现 49% 的负责人因成本收缩过智能体部署,而只有 7% 有站得住的 ROI 数字——也就是说,做出削减的组织里有九成没有分母。成本由一个需要向你收钱的厂商来计量;价值在有人把它造出来之前一直是零。事后补不上的那项测量,是智能体进场之前的基线。
发表于 2026-08-10 · 12 分钟读完
Langfuse vs LangSmith vs Phoenix vs Braintrust:计量方式才是产品 功能表已经收敛,所以真正的决定在许可证与计费的计量单位——而每一种计量方式定价的,都是那份日后会变成你的黄金集、回归基线与微调语料的轨迹存档。按 OpenTelemetry 做仪表化、把这份流双写到一处你自己拥有的地方,平台就成了一个可替换的后端。
发表于 2026-06-09 · 16 分钟读完
ccusage、codex-usage-tracker、CodeBurn 与 LiteLLM proxy:看清编码 Agent 刚刚烧掉多少 token 的四条路 每个编码 Agent 留下的遥测轨迹都不一样:JSONL 记录、SQLite 数据库,或者只有一份纯文本日志。所以你该装哪款开源跟踪器,取决于你的 Agent 走的是哪条轨迹。四款跟踪器,四条轨迹,外加几个真正能压低账单的开关。
发表于 2026-06-01 · 16 分钟读完
LangSmith、Braintrust、Helicone 与 Arize Phoenix:评测与可观测性栈被设计去闭合的四种回路 四款产品都提供 trace、数据集和评测器,功能清单几乎重合。真正把它们分开的,是各自被设计去闭合的那条反馈回路:开发回路、CI、生产网关,还是模型监控漂移。