Skip to content

蚂蚁百灵Ling-2.6-flash正式开源:104B参数仅花1/10推理成本

2026年4月29日

📰 概要

2026年4月29日,蚂蚁集团百灵大模型宣布 Ling-2.6-flash 正式开源。 总参数量104B,激活参数仅7.4B,采用MoE架构。 同步提供BF16、FP8、INT4三个精度版本,MIT协议。

两周前曾以 Elepant Alpha 的匿名身份登陆 OpenRouter 进行公测。 官方数据显示,推理成本仅为同类模型的十分之一。


🔍 解读

Ling-2.6-flash 的核心定位是"Token效率"。MoE的稀疏激活特性让每次推理只激活不到10%的参数,大幅降低算力消耗。

API定价策略也体现了这一点:输入0.1美元/百万tokens,输出0.3美元/百万tokens。 GPT-4o级别模型输入约2.5到5美元/百万tokens,成本优势巨大。

三个精度版本覆盖不同硬件场景。INT4版本适合消费级显卡部署,开发者能在有限预算内运行百亿参数模型。


💎 深挖

Ling-2.6-flash 之前的匿名测试很有意思。以 Elepant Alpha 之名登上 OpenRouter 后, 一周内日均调用量迅速攀升。匿名发布测试真实性能,已成为行业惯例——DeepSeek 也用过类似手法。

MIT 协议的选择值得注意。相比很多开源模型用 Apache 2.0 或自定义协议,MIT 是最宽松的开源许可。 这意味着商用几乎没有限制,蚂蚁在通过开源建立生态。

什么情况不建议用 Ling-2.6-flash?如果你的任务需要多步推理或深度逻辑链条,7.4B激活参数可能不够。 它更适合简单问答、文本生成、代码补全等效率优先的场景。

蚂蚁百灵的高密度发布节奏(Ling-2.5、Ling-2.6-1T、Ling-2.6-flash)展示了一个明确信号: MoE架构"降本增效"已经成为行业共识。从OpenAI的GPT-4o到蚂蚁Ling系,所有人都在朝同一个方向走—— 花更少的钱,办更多的事。

不要孤军奋战啦!

加入微信群一起学习交流 AI

与大神一起使用 OpenClaw、Hermes、Claude Code、Seedance 2.0、GPT-Image-2 等

微信公众号

扫码关注微信公众号
私信 "加群",将自动获取微信群二维码

探索 AI 世界,掌握智能未来