技术知识库 · 技术指南 · · 国科智飞 Gavin

AI 视频技术认知:模型、工作流与成本

提示词写了 AI 却不听话?先理解它如何生成:扩散模型加噪去噪,Transformer 指引方向。附五种生成模式与 AI 味修正清单。

Seedance 2.0 出圈之后,大量初学者拿着教程写提示词,却发现理论都懂、AI 就是不听话。YangGuangAI 在一篇面向初学者的教程里给了一个解释:问题往往不在你,也不在 AI,而在于你并不知道它是怎么「理解」你说的话的(原文:https://x.com/yangguangai/status/2025063323893686410)。他的类比很形象——这就像跟一个老外说中文,对方每个字都听懂了,但不知道你到底要什么。

这篇文章不谈创作技巧,只谈技术认知。我们的整理也按这个思路:先理解生成过程,再谈工作流和成本。

生成本质:不是「拍摄」,而是「做梦」

AI 生成视频的过程不是拍摄,更接近「做梦」:从噪声中「回忆」画面。核心机制是扩散模型——先给数据加噪,再逐步去噪还原;Transformer 在这里像导演,不断指引去噪的方向。

Prompt 的清晰度会直接影响画面的稳定性:描述越明确,去噪过程越不容易跑偏。作者用了一句很准确的话概括:「AI 生成视频的过程,就像是一个看过几亿段视频的人在做梦。」理解这一点,就能明白为什么单纯把提示词写长没有用——模型需要的不是字数,而是你在每一步去噪中提供的约束。

五种生成模式

教程把 AI 视频生成分成五类,各有适用场景:

  1. 文生视频:提示词直接生成,适合体验和验证想法,不建议作为主力生产手段;
  2. 图生视频:包括首尾帧控制、参考主体、分镜图生成视频,是目前可控性最高的一类,适合分镜脚本落地;
  3. 视频生视频:模仿参考视频的动作和运镜,适合让画面动起来但保持风格一致;
  4. 多模态混合生成:融合图片、视频等多种素材,适合复杂场景;
  5. 视频编辑:局部修改,不需要整段重做。

选模式的判断标准很直接:要控制构图用图生视频,要控制动作和运镜用视频生视频,只有小改动就用编辑模式。理解这些区别,比背参数重要。

工作流:从分镜到成片

把这五种模式串起来,一条低返工率的工作流大致是:

  1. 先用文字把分镜写清楚——每个镜头要交代什么信息、传递什么情绪;
  2. 每个镜头先出一张关键画面(分镜图),把构图、人物和风格定下来;
  3. 用图生视频让画面动起来,需要精确运镜的镜头再补一段参考视频;
  4. 局部问题(表情、道具、穿帮)用编辑模式修,不整段重做;
  5. 最后筛选、剪辑、统一色调。

这个顺序的要点是:把不确定性前置到成本最低的环节解决。构图错了,在分镜图阶段改几乎不花钱;等视频生成完才发现构图不对,就只能重做。这也是为什么理解模式差别能直接省钱——它决定你在哪一步停下来检查。

「AI 味」的四个来源与修正

画面「假」通常能归到四类问题,每类都有对应的解法:

四条修正思路指向同一个原则:AI 默认输出的是「最干净、最平均」的结果,而真实感来自不完美。你不是在给模型下命令,而是在给它还原真实世界的约束。

成本:返工才是最大的成本

谈到 AI 视频的成本,显性部分是生成费用,真正吃掉预算的通常是返工:动作不对、构图不对、风格不一致,都要整段重做。

从这套认知出发,省成本的路径有三条:一是用图生视频锁定构图和主体,减少「抽卡」次数;二是能局部编辑就不整段重生成,视频编辑模式的价值就在这里;三是把动作、光影、运镜这些容易出问题的维度提前写清楚,别等生成之后才发现问题。相比事后重做几遍,前期多花十分钟写清约束,往往更划算。

学习路径:会用 → 会写 → 会导 → 会想

作者给出的学习路径值得抄:先会用工具,再会写提示词,然后会「导」——像导演一样设计镜头和节奏,最后是「会想」——建立对画面和叙事的判断力。

工具和技术会不断更新,具体用法很快过期;而审美与判断力不会。作者的原话是:「工具可能每个月都会更新,但审美将是我们永远的护城河。」

检查清单

回到最初的问题:提示词不听话,很多时候是因为我们把它当成了许愿池,而不是去噪过程的约束条件。理解模型怎么「做梦」,比收集更多提示词模板更接近问题的根源。

参考来源