Appearance
📰 概要
2026年4月发布的数据显示,2025年我国用于人工智能训练和推理的数据总量达到199.48EB,同比增长42.86%。
作为参考,1EB等于10亿GB。199.48EB的数据量相当于约2亿部4K电影的存储需求。数据量快增长的速度比算力还快——高质数据的稀缺正成为行业瓶颈。
🔍 解读
42.86%的同比增长率背后是AI行业对数据的无限渴求。模型参数从百亿到万亿,每代新模型需要的数据量都在翻倍增长。
但问题在于:高质数据的增速跟不上模型扩张的速度。互联网上的文本数据几乎被"挖完"了。合成数据、私域数据、多模态数据成为新的增长点。
同时,2025年全年词元调用量约21100万亿。训练端和推理端都在狂飙,数据供应链正从IT问题变成战略问题。
💎 深挖
数据的结构性变化比总量增长更值得关注。199.48EB中,文本数据占比在下降,图像和视频数据占比在快速上升。多模态模型的普及是核心驱动力。
什么情况不建议用大规模数据堆砌模型?如果你的场景是小模型垂直应用,高质量的小数据集比大而全的通用数据更有效。数据质量永远比数据量更重要。
另一个趋势是数据合成。大模型自生成数据训练小模型,正在成为标准做法。2025年合成数据在所有训练数据中的占比已经超过30%。
数据治理的挑战也在加大。海量数据意味着更高的存储成本、清洗成本、合规成本。AI数据的"大而不精"问题正在从技术问题变成管理问题。
2026年4月发布的数据为行业提供了一个参照基准:199.48EB不是终点,而是新起点。
