Appearance
Transformer统治地位悬了!一款SubQ模型带着SSA架构横空出世,1200万上下文成本仅Opus的5%,计算量暴减千倍。
今天,一款AI模型 SubQ 横空出世,震撼了全世界。这是全球首个基于完全亚二次方稀疏注意力架构(SSA)的模型,上下文高达 1200万 Token。
SubQ 的核心优势在于,其 SSA 架构会根据内容「动态选择」关注点,不会盲目计算所有 Token 间的关联。相较于 Transformer,它的计算量直接暴减 1000倍。
实验结果显示,100万 token 上下文,SubQ 要比 FlashAttention 快 52倍,成本不到 Claude Opus 的 5%。
而打造出这款架构的背后公司,叫 Subquadratic,坐标迈阿密,全公司仅 13人。
Transformer「原罪」,九年未解
2017年,谷歌那篇「Attention is All You Need」奠定了 Transformer 架构的统治地位。此后九年,从 GPT 到 Claude 到 Gemini,所有前沿大模型都建立在同一个基础上:密集注意力机制。
长期以来,Transformer 的工作方式非常暴力,即每个 token 都要和序列中所有其他 token 做一次比较。这种机制让它深陷「二次方复杂度」的泥潭,上下文每增加一倍,计算成本飙升四倍。
这意味着,输入越长,模型越贵、越慢、越容易崩。这就解释了为什么几乎所有 LLM 的上下文卡在 100万 token 左右——不是技术做不到更长,是做到了也用不起。
这一次,SubQ 的诞生,从根本上改变了这个等式。
SSA 架构出世
SubQ 的核心突破叫做 SSA——亚二次方稀疏注意力(Subquadratic Sparse Attention)。
它的思路出奇地简单:不再让每个 token 和所有 token 做比较。既然训练好的模型中,绝大多数注意力权重都接近零,那为什么还要算它们?
SSA 的做法是,对每一个 query,基于「内容」选择序列中真正值得关注的位置,然后只在这些位置上精确计算注意力。它只计算那些真正有意义的交互,跳过其余 99% 以上的无用计算。
SSA 的三大关键特性
| 特性 | 说明 |
|---|---|
| 线性扩展 | 计算量随选中的位置数量增长,而不是随整个序列长度增长。上下文翻倍,成本只翻倍,不再是翻四倍 |
| 内容依赖路由 | 模型根据语义决定看哪里,而不是根据位置。关键信息在序列第3个 token 还是第1100万个 token,都能被找到 |
| 精确检索 | 不像循环模型那样把信息压缩成固定状态,SSA 保留了从头检索任意位置信息的能力 |
性能对比
| 指标 | SubQ | Claude Opus | 提升 |
|---|---|---|---|
| 上下文长度 | 1200万 token | ~20万 token | 60倍 |
| 100万token成本 | Opus的5% | 100% | 95%节省 |
| FlashAttention速度 | 快52倍 | 基准 | 52倍 |
| 计算量 | 线性 | 二次方 | 1000倍降低 |
行业影响
AI 大佬 Bindu Reddy 辣评道:「若这一切都是真的,Anthropic 和 OpenAI 的估值直接归 0」!
还有人表示,这才是 LLM 接下来真正 Scaling 的方式。
一句话总结
13人团队,用 SSA 架构颠覆 Transformer 九年的统治地位,1200万上下文,成本仅 Opus 的 5%。
