DreamBooth 有哪些应用场景?

DreamBooth 的核心能力是:给定某个主体的少量参考图片,微调预训练的文生图扩散模型,让模型把一个唯一标识符与该主体绑定;之后用这个标识符写提示词,就能生成该主体在新场景、新姿态、新视角、新光照下的全新图像。它主要面向四类任务:主体重语境化、文本引导的视角合成、外观修改、艺术渲染,并且都要求在改变的同时保留主体的关键视觉特征。

主体重语境化

把参考图里的主体放进它从未出现过的场景中,是最直接的应用。

例如参考图是一只特定外观的钟,DreamBooth 可以让它出现在丛林、海滩或其他环境中,而不仅是原图背景。这正是普通文生图模型的短板:即使提示词写得非常细(如“复古风格黄色闹钟,白色表盘,表盘右侧有黄色数字三,在丛林中”),Imagen 这类模型反复迭代提示词也无法重建主体的关键视觉特征。DreamBooth 通过把主体绑定到唯一标识符,绕开了“用文字描述外观”的瓶颈。

文本引导的视角合成

用文本控制生成主体在不同视角下的样子。

参考图通常只覆盖有限角度,而 DreamBooth 能合成参考图中没有出现过的视角、姿态和光照条件。这对需要多角度素材的场景有用,比如为某个物件生成环绕视角的展示图。前提是模型从参考图中已经学到了该主体的身份特征,而不是只记住某一张图的构图。

外观修改

在保留主体身份的前提下改变其外观属性。

关键约束是“保留关键特征”:修改的是可变的表面属性,而不是让主体变成另一个东西。论文把这类能力归入此前难以完成的任务之一,与重语境化、视角合成、艺术渲染并列。

艺术渲染

把主体转换成艺术化风格,同时不丢失可识别性。

论文的 Results 部分专门设有 “Art Rendition”(艺术渲染)小节,说明这是作者重点展示的一类应用。适用条件是:风格变化可以很大,但主体的关键视觉特征仍需被保留。

四类任务对照

应用场景 改变的部分 必须保留的部分
主体重语境化 背景、场景 主体的关键视觉特征
文本引导的视角合成 视角、姿态、光照 主体身份
外观修改 外观属性 主体身份与关键特征
艺术渲染 整体风格 主体的可识别性

使用前需要知道的前提

  • 输入是某个主体的“少量图片”(a few images),不是单张,也不是大量数据集。
  • 方法基于预训练文生图扩散模型做微调,论文以 Imagen 为实验对象,但作者明确说明方法不限于特定模型。
  • 效果依赖一个新提出的 autogenous class-specific prior preservation loss(自生成类别特定先验保持损失),它利用模型内嵌的语义先验,使主体能出现在参考图未覆盖的场景、姿态、视角和光照中。
  • 网站页面提供 [Paper]、[Dataset]、[BibTeX] 入口,需要复现或引用时从这些入口获取原始资料。

如果你的目标是“让某个具体对象出现在任意我描述的场景里,并且一眼能认出是它”,这四类任务就是 DreamBooth 的适用范围;如果只是想要一张符合文字描述的通用图片,普通文生图模型已经够用,不需要 DreamBooth。

dreambooth.github.io