Skip to content

SubQ模型:SSA架构颠覆Transformer,1200万上下文成本仅Opus 5%

2026年5月6日

Transformer统治地位悬了!一款SubQ模型带着SSA架构横空出世,1200万上下文成本仅Opus的5%,计算量暴减千倍。

今天,一款AI模型 SubQ 横空出世,震撼了全世界。这是全球首个基于完全亚二次方稀疏注意力架构(SSA)的模型,上下文高达 1200万 Token

SubQ 的核心优势在于,其 SSA 架构会根据内容「动态选择」关注点,不会盲目计算所有 Token 间的关联。相较于 Transformer,它的计算量直接暴减 1000倍

实验结果显示,100万 token 上下文,SubQ 要比 FlashAttention 快 52倍,成本不到 Claude Opus 的 5%

而打造出这款架构的背后公司,叫 Subquadratic,坐标迈阿密,全公司仅 13人

Transformer「原罪」,九年未解

2017年,谷歌那篇「Attention is All You Need」奠定了 Transformer 架构的统治地位。此后九年,从 GPT 到 Claude 到 Gemini,所有前沿大模型都建立在同一个基础上:密集注意力机制

长期以来,Transformer 的工作方式非常暴力,即每个 token 都要和序列中所有其他 token 做一次比较。这种机制让它深陷「二次方复杂度」的泥潭,上下文每增加一倍,计算成本飙升四倍。

这意味着,输入越长,模型越贵、越慢、越容易崩。这就解释了为什么几乎所有 LLM 的上下文卡在 100万 token 左右——不是技术做不到更长,是做到了也用不起。

这一次,SubQ 的诞生,从根本上改变了这个等式。

SSA 架构出世

SubQ 的核心突破叫做 SSA——亚二次方稀疏注意力(Subquadratic Sparse Attention)

它的思路出奇地简单:不再让每个 token 和所有 token 做比较。既然训练好的模型中,绝大多数注意力权重都接近零,那为什么还要算它们?

SSA 的做法是,对每一个 query,基于「内容」选择序列中真正值得关注的位置,然后只在这些位置上精确计算注意力。它只计算那些真正有意义的交互,跳过其余 99% 以上的无用计算。

SSA 的三大关键特性

特性说明
线性扩展计算量随选中的位置数量增长,而不是随整个序列长度增长。上下文翻倍,成本只翻倍,不再是翻四倍
内容依赖路由模型根据语义决定看哪里,而不是根据位置。关键信息在序列第3个 token 还是第1100万个 token,都能被找到
精确检索不像循环模型那样把信息压缩成固定状态,SSA 保留了从头检索任意位置信息的能力

性能对比

指标SubQClaude Opus提升
上下文长度1200万 token~20万 token60倍
100万token成本Opus的5%100%95%节省
FlashAttention速度快52倍基准52倍
计算量线性二次方1000倍降低

行业影响

AI 大佬 Bindu Reddy 辣评道:「若这一切都是真的,Anthropic 和 OpenAI 的估值直接归 0」!

还有人表示,这才是 LLM 接下来真正 Scaling 的方式。

一句话总结

13人团队,用 SSA 架构颠覆 Transformer 九年的统治地位,1200万上下文,成本仅 Opus 的 5%。

不要孤军奋战啦!

加入微信群一起学习交流 AI

与大神一起使用 OpenClaw、Hermes、Claude Code、Seedance 2.0、GPT-Image-2 等

微信公众号

扫码关注微信公众号
私信 "加群",将自动获取微信群二维码

探索 AI 世界,掌握智能未来