深度剖析 / 推理与测试时计算
推理与测试时计算
思维链、自我一致性、思维树/图,以及支配它们的推理期扩展规律。
- 正确理解思维链CoT 究竟买到了什么(串行计算,而非内省)、忠实性与事后合理化、它何时有害,以及结构化轨迹与自由轨迹之别。
- 自一致性与采样采样加多数投票为何有效、偏差被放大的精确失效条件、收益饱和曲线,以及如何花好 k 这笔预算。
- 思维树与思维图在部分解之上的刻意搜索、乘性成本,以及对部分状态打分器这一承重依赖。
- 核验器引导的搜索结果型与过程型奖励模型如何引导 best-of-N 与束搜索、推理时的奖励作弊,以及为何核验器才是产品。
- 推理时扩展测试时计算作为第二条扩展轴、按难度自适应的计算最优前沿,以及更多思考何处停止见效。
- 推理何时有用(何时烧钱)综合决策规则——任务类别 × 可核验性 × 预算——升级阶梯、点名的烧钱模式,以及一份该做/不该做清单。
- 自适应思考与努力度预算`budget_tokens` 已废弃——Claude 的 `effort`、Gemini 的 `thinking_level`、OpenAI 的 `reasoning_effort`,以及模型何时会覆盖你的预算。
- 把推理一路带过工具调用推理变成了一个带签名、不透明、且必须原样交还的输入——于是塞进一句提醒、运行途中加个工具、或裁剪历史,如今都会让它失效:要么悄无声息,要么一个 400。回送,绝不重建。
- 潜在推理与你从此拿不到的那份轨迹连续思维与循环深度买到的是实打实的能力——两层 Transformer 用 D 步连续思维即可解决图可达性,而离散思维链需要 O(n²) 步解码;一个 35 亿参数的循环模型在 50 圈时达到约 500 亿参数量级的等效计算——代价是删掉了五道生产控制所消费的那件产物。把那五道点名;承认轨迹从来就不忠实、却照样留着它,因为监控它仍然胜过只监控动作;然后把探针拟合在信号集中的那几步靠前的潜在推理上——而这让它变成一个采购问题,因为托管的潜在模型不会给你任何残差流可读。