Appearance
📰 概要
2026年4月20日,22 岁开发者 Kye Gomez(Swarms 智能体框架创始人)开源 OpenMythos,实现循环深度 Transformer(RDT)架构,整合了对 Claude Mythos 架构的主流推测和公开研究。
核心机制:同一组权重反复跑最多 16 遍,每次通过 MoE 路由激活不同专家子集,推理全程在潜在空间完成,不生成任何中间 token。
实验结果:770M 参数 RDT 追平 1.3B 标准 Transformer。系统性泛化测试中,训练没见过的知识组合 RDT 能答对,标准 Transformer 直接失败。深度外推测试中,训练 20 跳推理链,测试 30 跳,RDT 多加几轮循环即可应对。
🔍 解读
RDT 的核心假设是:当前大模型在预训练中已记住大量事实,瓶颈不在"记住",在"组合"。循环机制免费解锁了这种组合能力——同一组权重反复跑,每轮激活不同专家,等价于"让现有模型多想几遍"。
MoE 设计借鉴了 DeepSeekMoE:大量细粒度路由专家提供领域广度,循环提供推理深度。LTI 稳定循环注入来自 UCSD 和 Together AI 的 Parcae 论文,保证循环不发散。
潜在空间推理是和 Chain-of-Thought 的根本区别。CoT 是"想一步写一步",中间 token 全暴露;RDT 是"想完 16 遍才说一句话",推理过程完全内化。这意味着推理算力消耗在"思考"上,不在"输出"上。
💎 深挖
对比一下 RDT 和标准 Transformer 的核心差异:
| 维度 | 标准 Transformer | RDT |
|---|---|---|
| 深度策略 | 堆叠上百层不同层 | 同几层反复循环最多 16 遍 |
| 参数效率 | 层数越多参数越多 | 参数量减半效果持平 |
| 泛化能力 | 训练分布内强 | 训练分布外也强 |
| 推理成本 | 固定 | 可动态调整(多想几轮) |
如果这些结论成立,Scaling 的主流方向将从"训练更大的模型"转向"让现有模型在推理时多想几遍"。这对做模型训练和推理优化的人来说是关键信号:
训练侧,不需要为更强的推理能力大幅增加参数量。770M 追平 1.3B 的实验数据说明,循环深度的投入产出比远高于堆层数。
推理侧,RDT 的动态深度意味着简单问题少循环、复杂问题多循环,推理成本可以按需调节——比固定深度的标准 Transformer 更灵活。
但前提是:OpenMythos 目前只验证了 770M 规模,更大参数下的稳定性和效率还未验证。循环 16 次的推理延迟怎么优化、MoE 路由的开销怎么控制,都是实际部署要面对的问题。
项目已在 GitHub 开源:github.com/kyegomez/OpenMythos。对关注大模型架构演进的人来说,这套思路值得跟进——无论 Anthropic 的 Mythos 是否真用了这套架构,循环 Transformer 已经吸引了学术界大量目光,更多理论和实验正在路上。
什么情况不建议跟风?如果你的需求只是日常聊天、简单问答,现有模型差异不大,不必追逐最新版本。处理敏感数据的场景也需要谨慎评估隐私风险。
