Skip to content

2025年全国AI训练数据达199.48EB,同比增长42.86%

2026年4月29日

📰 概要

2026年4月发布的数据显示,2025年我国用于人工智能训练和推理的数据总量达到199.48EB,同比增长42.86%。

作为参考,1EB等于10亿GB。199.48EB的数据量相当于约2亿部4K电影的存储需求。数据量快增长的速度比算力还快——高质数据的稀缺正成为行业瓶颈。


🔍 解读

42.86%的同比增长率背后是AI行业对数据的无限渴求。模型参数从百亿到万亿,每代新模型需要的数据量都在翻倍增长。

但问题在于:高质数据的增速跟不上模型扩张的速度。互联网上的文本数据几乎被"挖完"了。合成数据、私域数据、多模态数据成为新的增长点。

同时,2025年全年词元调用量约21100万亿。训练端和推理端都在狂飙,数据供应链正从IT问题变成战略问题。


💎 深挖

数据的结构性变化比总量增长更值得关注。199.48EB中,文本数据占比在下降,图像和视频数据占比在快速上升。多模态模型的普及是核心驱动力。

什么情况不建议用大规模数据堆砌模型?如果你的场景是小模型垂直应用,高质量的小数据集比大而全的通用数据更有效。数据质量永远比数据量更重要。

另一个趋势是数据合成。大模型自生成数据训练小模型,正在成为标准做法。2025年合成数据在所有训练数据中的占比已经超过30%。

数据治理的挑战也在加大。海量数据意味着更高的存储成本、清洗成本、合规成本。AI数据的"大而不精"问题正在从技术问题变成管理问题。

2026年4月发布的数据为行业提供了一个参照基准:199.48EB不是终点,而是新起点。

不要孤军奋战啦!

加入微信群一起学习交流 AI

与大神一起使用 OpenClaw、Hermes、Claude Code、Seedance 2.0、GPT-Image-2 等

微信公众号

扫码关注微信公众号
私信 "加群",将自动获取微信群二维码

探索 AI 世界,掌握智能未来