Appearance
字节跳动智能创作实验室开源DreamLite——0.39B参数的端侧文生图+图像编辑统一模型,在小米14上1秒出图1024×1024,业界首个端侧同时支持生成与编辑的扩散模型。
为什么端侧图像生成这么难
文生图技术突飞猛进,但模型太大了:
- FLUX.1要12B参数
- BAGEL要7B
- 想跑起来得有服务器
普通用户得把图片传到云端处理,带来两个问题:隐私风险和没有网络就用不了。
端侧AI图像生成不是新概念,但之前的方案基本只做文生图,图像编辑几乎没人碰——因为编辑任务需要同时理解原图和修改指令,对模型能力要求更高。
端侧模型参数对比
| 模型 | 参数量 | 端侧可跑 |
|---|---|---|
| FLUX.1-Dev | 12B | ❌ |
| BAGEL | 7B | ❌ |
| OmniGen2 | 4B | ❌ |
| DreamLite | 0.39B | ✅ |
| SnapGen++(small) | 0.4B | ⚠️ 仅生成 |
DreamLite核心技术
核心数据
| 指标 | 数值 |
|---|---|
| 0.39B | 模型参数量,压缩30倍 |
| <1s | 小米14生成1024×1024 |
| 4步 | 推断步数(步数蒸馏) |
| 双任务 | 文生图 + 图像编辑 |
四大技术架构
| 技术 | 说明 |
|---|---|
| 统一架构 | In-Context Spatial Concatenation,文生图用(target |
| 轻量骨干 | Pruned Mobile U-Net,针对移动端NPU/GPU优化 |
| 训练策略 | Task-Progressively Joint Pre-training, curriculum learning |
| 推断加速 | Progressive Step Distillation,28步蒸馏到4步 |
Benchmark成绩
| 模型 | GenEval ↑ | DPG ↑ | ImgEdit ↑ |
|---|---|---|---|
| FLUX.1-Dev | 0.67 | 84.0 | 3.76 |
| BAGEL | 0.82 | 85.1 | 3.42 |
| LongCat-Image | 0.87 | 86.6 | 4.49 |
| DreamLite(0.39B) | 0.72 | 85.8 | 4.11 |
| SnapGen++(0.4B) | 0.66 | 85.2 | — |
结论:DreamLite以最小的参数量,编辑能力甚至超过了许多2B~7B的服务端模型。0.39B打12B,性价比没谁了。
怎么用
bash
# 1. 克隆仓库
git clone https://github.com/ByteVisionLab/DreamLite.git
cd DreamLite
# 2. 安装依赖
conda create -n dreamlite python=3.10 -y
conda activate dreamlite
pip install -r requirements.txt
# 3a. 高精度版(28步,需GPU)
python infer.py --prompt "一条喷火龙的特写镜头"
# 3b. 超快端侧版(4步,可部署到手机)
python infer_mobile.py --prompt "一位戴花的年轻女子肖像"⚠️ 模型权重目前在安全审核中,需要发邮件申请early access:klfeng1206@outlook.com
行业意义
| 趋势 | 说明 |
|---|---|
| 端侧AI从"能跑"到"能打" | 编辑能力已超过部分云端大模型 |
| 统一架构是趋势 | 生成和编辑分开做是过去,统一网络同时学好两个任务 |
| 字节开源动作加速 | 从DeepSeek到Doubao到DreamLite,真正技术输出 |
端侧AI图像生成的ChatGPT时刻还没到来,但DreamLite让我们看到了它到来的路径:参数足够小、质量足够好、手机跑得动。
项目资源
| 资源 | 链接 |
|---|---|
| 项目主页 | carlofkl.github.io/dreamlite |
| GitHub | github.com/ByteVisionLab/DreamLite |
| arXiv论文 | arxiv.org/abs/2603.28713 |
| HuggingFace Demo | huggingface.co/spaces/carlofkl/DreamLite |
