Skip to content

苹果发布新框架LaDiR:让AI同时走多条推理路,再挑最好的答案

2026年5月1日

📰 概要

你在解一道难题的时候,是不是先想好几种可能,再挑最靠谱的那个? 苹果的新框架LaDiR,就是把这种思维方式给了AI。

2026年4月30日,苹果联合加州大学圣迭戈分校发布了LaDiR框架。 它不是一个新的模型,而是叠加在现有模型之上的通用推理增强方法。 核心思路很简单:让AI同时探索多条推理路径,再从里面挑最好的答案。

在LLaMA 3.1 8B和Qwen3-8B-Base上测试后,数学和代码任务的准确率都有明显提升。 尤其面对没见过的难题时,提升幅度更大。


🔍 解读

LaDiR的全称是Latent Diffusion Enhances LLMs for Text Reasoning。 它把扩散和自回归两种生成范式揉在了一起。

传统的大模型推理是线性的:从左到右一个字一个字生成。 遇到复杂问题,一条路走到黑,走错了只能回头。 LaDiR的做法是:在推理阶段用扩散模型,同时生成多条推理路径。 这些路径从随机噪声开始,逐步优化成有逻辑的推理步骤。 最后用自回归模型从中选出最靠谱的,生成最终答案。

这个做法的好处是显而易见的:多条路同时走,找到正确答案的概率自然更高。 而且框架引入了多样性鼓励机制,防止所有路径缩到同一个结论上。 说白了,就是强迫AI多动脑子,别偷懒走捷径。


💎 深挖

LaDiR最大的价值,不在于它多厉害,而在于它的通用性。

它不是为某个特定任务设计的,而是可以叠加在任何现有模型之上。 研究团队在LLaMA 3.1 8B和Qwen3-8B-Base两个开源模型上做了验证。 这意味着你手上已有的模型,理论上都能通过LaDiR获得推理能力的提升。

具体效果怎么样? 在数学基准测试中,LaDiR的准确率超过标准微调方法。 遇到分布外(没见过的题型)的任务时,提升更加明显。 代码生成测试HumanEval上,生成的代码更可靠,难题表现明显更好。 谜题规划任务中,它能探索更广泛的解空间,找到正确答案的概率高于所有通用基准。

但有个局限值得注意:单次尝试准确率上,LaDiR仍略逊于专门针对特定任务优化的专用模型。 这是通用框架的代价——广泛适用性换极致专精。

技术路线上,LaDiR代表了AI推理的一个新方向:从单路径到多路径,从串行到并行。 过去几年,推理增强的主流方法是Chain-of-Thought(思维链),让模型一步一步想。 CoT的问题在于它是线性的,一旦中间步骤错了,后面的推理都会被带偏。 LaDiR的多路径并行策略,相当于给模型配了一个「多线程大脑」,降低了单点失误的风险。

这个思路跟之前Google的Jigsaw、复旦大学的SPIN等研究方向有相似之处。 都是想让模型在推理时有多样性,而不是死磕一条路。

什么情况不建议用? 如果你的场景对实时性要求极高,LaDiR的多路径并行可能会增加推理延迟。 毕竟同时跑多条线,计算量是成倍增加的。 另外在简单任务上,用LaDiR属于杀鸡用牛刀,标准推理就够了。

对开发者的启发:LaDiR已经在两个开源模型上验证了效果。 如果你在8B级别的模型上做推理增强,这个框架值得跑一轮测试。 代码和论文都是开源的,接入成本不高。 苹果这次开源了论文和框架,但不一定是以官方GitHub的形式,可以去arXiv搜LaDiR看看。

不要孤军奋战啦!

加入微信群一起学习交流 AI

与大神一起使用 OpenClaw、Hermes、Claude Code、Seedance 2.0、GPT-Image-2 等

微信公众号

扫码关注微信公众号
私信 "加群",将自动获取微信群二维码

探索 AI 世界,掌握智能未来