GenAI 是什么?它能生成什么、和普通 AI 有什么区别
GenAI(生成式人工智能)指能够生成新内容的模型——文本、图像、音频、视频,甚至 3D/4D 动态场景,而不只是对已有内容做分类或预测。它和普通 AI 的核心区别在于:普通 AI 通常做判断(这是猫还是狗、这条评论是正面还是负面),GenAI 做创作(画一只猫、写一段评论、生成一段猫叫的音频)。如果你想知道 GenAI 到底能生成什么、该从哪个方向理解它,下面按能力类型和代表方向拆开讲。
判别式 AI 与生成式 AI:一个做判断,一个做创作
| 维度 | 判别式 AI(普通 AI) | 生成式 AI(GenAI) |
|---|---|---|
| 核心任务 | 分类、识别、预测 | 生成新内容 |
| 典型输出 | 标签、分数、判断结果 | 文本、图像、音频、视频、3D 场景 |
| 例子 | 判断一张图里有没有行人 | 根据一句话生成一段视频 |
| 对使用者的意义 | 帮你做决策 | 帮你产出素材 |
这个区分不是绝对的,很多系统会同时用到两类能力,但理解“判断 vs 创作”这条线,是理解 GenAI 的第一步。
GenAI 能生成哪些内容
从公开的研究进展看,GenAI 的生成能力已经覆盖多个模态:
- 图像生成:根据文字描述生成图像,并支持对生成过程做更细的创作控制。Devi Parikh 参与的 Make-A-Scene(2022)就强调“为 AI 图像生成提供更强的创作控制”。
- 视频生成:从文本直接生成视频。Make-A-Video(2022)被描述为“首个同类文本到视频生成”工作。
- 音频生成:从文本生成音频。AudioGen(2022)被描述为“首个同类文本到音频生成”工作。
- 图像与视频编辑:不只是从零生成,还能对已有内容做编辑。Emu、Emu Edit、Emu Video、Emu Video Edit(2023)属于这一方向。
- 动态场景生成:Make-A-Video3D(2023)指向“文本到 4D 动态场景生成”,即在三维空间基础上加入时间维度。
这些例子说明 GenAI 的“生成”不限于单一模态,而是沿着文本、图像、音频、视频、3D/4D 逐步扩展。
为什么这些方向值得关注
Devi Parikh 的公开履历提供了一个观察窗口:她 2023 年进入 Meta 新的生成式 AI 组织,同年推出 Emu 系列;2024 年离开 Meta 的 GenAI 高级总监职位。这条时间线本身反映了 GenAI 从研究走向组织化投入的过程。
对普通人来说,更有用的信息是:这些能力对应到日常场景,大致是——
- 需要配图但不会画:用文生图工具,从一句描述开始
- 需要短视频素材但没有拍摄条件:关注文生视频方向
- 需要配音或音效:关注文生音频方向
- 已有素材想改:关注图像/视频编辑类生成能力
普通人可以从哪里切入
不需要先搞懂模型原理,可以从“你缺什么内容”倒推:
- 先明确你要生成的是哪一类内容:文字、图、音频还是视频。不同模态的工具和能力差异很大。
- 从单次生成开始,而不是追求完美:GenAI 的输出通常需要多轮调整,第一版只是起点。
- 注意“控制”这件事:Make-A-Scene 强调创作控制,说明生成不等于随机——你能通过描述和参数影响结果,这是上手时要练的部分。
- 区分“生成”和“编辑”:从零生成和修改已有内容,是两条不同的使用路径。
如果你只是想理解 GenAI 是什么,记住一句话就够:它是让机器产出新内容的技术,而不是只做判断的技术。至于具体用哪个工具、生成什么,取决于你手头缺的是哪一类素材。