Generative AI 是什么?它能生成什么、和普通 AI 有什么区别

Generative AI(生成式 AI)指能够产出新内容的 AI 系统——文本、图像、音频、视频、3D/4D 场景等,而不只是对已有内容做分类或预测。判断一个工具是否属于生成式 AI,最简单的标准是看它的输出:如果输出是"这段内容属于哪一类""这个问题的答案是什么"这类判断,它更接近判别式 AI;如果输出是一段此前不存在的文字、一张新图、一段新音频,它就是生成式 AI。这个区别重要,因为它决定了你该用什么方式使用它:判别式工具用来做判断和筛选,生成式工具用来做创作和产出,而生成结果需要人来审校。

生成式 AI 与普通 AI 的核心区别

维度 判别式 AI(常说的"普通 AI") 生成式 AI
输出 标签、分数、分类结果 新内容(文本/图像/音频/视频/3D 等)
典型任务 图像分类、垃圾邮件识别、视觉问答 文生图、文生视频、文生音频
使用方式 输入数据,得到判断 输入提示词,得到产物
结果性质 对已有内容的判断 此前不存在的内容

两者并非互斥。视觉问答(VQA)这类任务就同时涉及理解与生成,Devi Parikh 因 VQA 相关工作获得 2025 年 ICCV 的 PAMI Mark Everingham Prize,说明"理解"和"生成"在实际系统里常常交织在一起。

生成式 AI 能生成什么

按内容类型看,目前有代表性的方向包括:

  • 图像:Make-A-Scene 强调对 AI 图像生成的更强创作控制(2022)。
  • 视频:Make-A-Video 是早期文本到视频生成的代表(2022)。
  • 音频:AudioGen 是早期文本到音频生成的代表(2022)。
  • 3D/4D 动态场景:Make-A-Video3D 做文本到 4D 动态场景生成(2023)。
  • 图像编辑与视频编辑:Emu、Emu Edit、Emu Video、Emu Video Edit 覆盖了生成与编辑(2023)。

这些模型来自 Devi Parikh 在 Meta 生成式 AI 组织期间的工作记录。它们说明生成式 AI 的能力边界已经从单一模态扩展到多模态,并且从"生成"延伸到"可控地编辑"。

生成式 AI 是怎么工作的

基本流程可以概括为三步:

  1. 输入提示词:用文字(或其他条件)描述你想要的内容。
  2. 模型生成:模型基于训练中学到的模式,产出一段新内容。
  3. 人工审校与调整:检查结果是否符合预期,必要时修改提示词或直接编辑。

"可控性"是这条流程里的关键变量。Make-A-Scene 之所以被单独强调"更强的创作控制",正是因为早期生成模型常常只能"给什么要什么",用户难以精确指定构图、风格或局部内容。可控性越高,生成式 AI 越接近可用的创作工具,而不是随机出图的玩具。

常见误解与局限

  • 生成结果不等于事实:模型产出的是"看起来合理"的内容,不是经过核实的信息。用于事实性场景时必须人工核对。
  • 可控性有限:即使有 Make-A-Scene 这类强调控制的模型,精确控制输出仍然困难,通常需要多次尝试。
  • 版权与伦理问题:训练数据来源、生成内容的归属和使用边界,仍是行业未完全解决的问题。
  • 能力有边界:不同模态的成熟度不同,文本和图像相对成熟,视频、3D/4D 仍在快速演进中。

怎么判断一个工具是不是生成式 AI

问自己一个问题:它的输出是"判断"还是"新内容"?

  • 输出"这封邮件是不是垃圾邮件"——判别式。
  • 输出"帮你写一封邮件"——生成式。
  • 输出"这张图里有什么"——判别式(理解)。
  • 输出"按这个描述画一张图"——生成式。

如果一个工具既能判断又能生成,看你的使用目的:你要的是结论,还是产物。

deviparikh.com
AI Researcher, Generative Artist
meshy.ai
Meshy 的 AI 3D 模型生成器可在 20–30 秒内将文本和图片转换为可用于生产的 3D 模型。支持导出 FBX、OBJ、GLB 和 STL 格式。免费试用 Meshy。
pixverse.ai
专有 AI 视频生成与制作研究,延伸至实时世界与互动娱乐