Skip to content

字节0.39B参数端侧开源生图模型DreamLite:手机1秒出1024×1024

2026年5月5日

字节跳动智能创作实验室开源DreamLite——0.39B参数的端侧文生图+图像编辑统一模型,在小米14上1秒出图1024×1024,业界首个端侧同时支持生成与编辑的扩散模型。

为什么端侧图像生成这么难

文生图技术突飞猛进,但模型太大了:

  • FLUX.1要12B参数
  • BAGEL要7B
  • 想跑起来得有服务器

普通用户得把图片传到云端处理,带来两个问题:隐私风险没有网络就用不了

端侧AI图像生成不是新概念,但之前的方案基本只做文生图,图像编辑几乎没人碰——因为编辑任务需要同时理解原图和修改指令,对模型能力要求更高。

端侧模型参数对比

模型参数量端侧可跑
FLUX.1-Dev12B
BAGEL7B
OmniGen24B
DreamLite0.39B
SnapGen++(small)0.4B⚠️ 仅生成

DreamLite核心技术

核心数据

指标数值
0.39B模型参数量,压缩30倍
<1s小米14生成1024×1024
4步推断步数(步数蒸馏)
双任务文生图 + 图像编辑

四大技术架构

技术说明
统一架构In-Context Spatial Concatenation,文生图用(target
轻量骨干Pruned Mobile U-Net,针对移动端NPU/GPU优化
训练策略Task-Progressively Joint Pre-training, curriculum learning
推断加速Progressive Step Distillation,28步蒸馏到4步

Benchmark成绩

模型GenEval ↑DPG ↑ImgEdit ↑
FLUX.1-Dev0.6784.03.76
BAGEL0.8285.13.42
LongCat-Image0.8786.64.49
DreamLite(0.39B)0.7285.84.11
SnapGen++(0.4B)0.6685.2

结论:DreamLite以最小的参数量,编辑能力甚至超过了许多2B~7B的服务端模型。0.39B打12B,性价比没谁了。

怎么用

bash
# 1. 克隆仓库
git clone https://github.com/ByteVisionLab/DreamLite.git
cd DreamLite

# 2. 安装依赖
conda create -n dreamlite python=3.10 -y
conda activate dreamlite
pip install -r requirements.txt

# 3a. 高精度版(28步,需GPU)
python infer.py --prompt "一条喷火龙的特写镜头"

# 3b. 超快端侧版(4步,可部署到手机)
python infer_mobile.py --prompt "一位戴花的年轻女子肖像"

⚠️ 模型权重目前在安全审核中,需要发邮件申请early access:klfeng1206@outlook.com

行业意义

趋势说明
端侧AI从"能跑"到"能打"编辑能力已超过部分云端大模型
统一架构是趋势生成和编辑分开做是过去,统一网络同时学好两个任务
字节开源动作加速从DeepSeek到Doubao到DreamLite,真正技术输出

端侧AI图像生成的ChatGPT时刻还没到来,但DreamLite让我们看到了它到来的路径:参数足够小、质量足够好、手机跑得动。

项目资源

资源链接
项目主页carlofkl.github.io/dreamlite
GitHubgithub.com/ByteVisionLab/DreamLite
arXiv论文arxiv.org/abs/2603.28713
HuggingFace Demohuggingface.co/spaces/carlofkl/DreamLite

不要孤军奋战啦!

加入微信群一起学习交流 AI

与大神一起使用 OpenClaw、Hermes、Claude Code、Seedance 2.0、GPT-Image-2 等

微信公众号

扫码关注微信公众号
私信 "加群",将自动获取微信群二维码

探索 AI 世界,掌握智能未来