技术知识库 · 技术指南 · · 国科智飞 Gavin
AI 视频技术认知:模型、工作流与成本
提示词写了 AI 却不听话?先理解它如何生成:扩散模型加噪去噪,Transformer 指引方向。附五种生成模式与 AI 味修正清单。
Seedance 2.0 出圈之后,大量初学者拿着教程写提示词,却发现理论都懂、AI 就是不听话。YangGuangAI 在一篇面向初学者的教程里给了一个解释:问题往往不在你,也不在 AI,而在于你并不知道它是怎么「理解」你说的话的(原文:https://x.com/yangguangai/status/2025063323893686410)。他的类比很形象——这就像跟一个老外说中文,对方每个字都听懂了,但不知道你到底要什么。
这篇文章不谈创作技巧,只谈技术认知。我们的整理也按这个思路:先理解生成过程,再谈工作流和成本。
生成本质:不是「拍摄」,而是「做梦」
AI 生成视频的过程不是拍摄,更接近「做梦」:从噪声中「回忆」画面。核心机制是扩散模型——先给数据加噪,再逐步去噪还原;Transformer 在这里像导演,不断指引去噪的方向。
Prompt 的清晰度会直接影响画面的稳定性:描述越明确,去噪过程越不容易跑偏。作者用了一句很准确的话概括:「AI 生成视频的过程,就像是一个看过几亿段视频的人在做梦。」理解这一点,就能明白为什么单纯把提示词写长没有用——模型需要的不是字数,而是你在每一步去噪中提供的约束。
五种生成模式
教程把 AI 视频生成分成五类,各有适用场景:
- 文生视频:提示词直接生成,适合体验和验证想法,不建议作为主力生产手段;
- 图生视频:包括首尾帧控制、参考主体、分镜图生成视频,是目前可控性最高的一类,适合分镜脚本落地;
- 视频生视频:模仿参考视频的动作和运镜,适合让画面动起来但保持风格一致;
- 多模态混合生成:融合图片、视频等多种素材,适合复杂场景;
- 视频编辑:局部修改,不需要整段重做。
选模式的判断标准很直接:要控制构图用图生视频,要控制动作和运镜用视频生视频,只有小改动就用编辑模式。理解这些区别,比背参数重要。
工作流:从分镜到成片
把这五种模式串起来,一条低返工率的工作流大致是:
- 先用文字把分镜写清楚——每个镜头要交代什么信息、传递什么情绪;
- 每个镜头先出一张关键画面(分镜图),把构图、人物和风格定下来;
- 用图生视频让画面动起来,需要精确运镜的镜头再补一段参考视频;
- 局部问题(表情、道具、穿帮)用编辑模式修,不整段重做;
- 最后筛选、剪辑、统一色调。
这个顺序的要点是:把不确定性前置到成本最低的环节解决。构图错了,在分镜图阶段改几乎不花钱;等视频生成完才发现构图不对,就只能重做。这也是为什么理解模式差别能直接省钱——它决定你在哪一步停下来检查。
「AI 味」的四个来源与修正
画面「假」通常能归到四类问题,每类都有对应的解法:
- 动作果冻(人物或物体动作不自然):降低动作复杂度,或提供参考视频让模型模仿;
- 画面塑料感:主动加入胶片颗粒、轻微噪点、镜头瑕疵和手持抖动,让画面「脏」一点;
- 光影太均匀:明确光位与光比,告诉模型光从哪来、明暗对比有多少;
- 运镜乱漂:提供参考轨迹,或用明确的动词描述镜头动作。
四条修正思路指向同一个原则:AI 默认输出的是「最干净、最平均」的结果,而真实感来自不完美。你不是在给模型下命令,而是在给它还原真实世界的约束。
成本:返工才是最大的成本
谈到 AI 视频的成本,显性部分是生成费用,真正吃掉预算的通常是返工:动作不对、构图不对、风格不一致,都要整段重做。
从这套认知出发,省成本的路径有三条:一是用图生视频锁定构图和主体,减少「抽卡」次数;二是能局部编辑就不整段重生成,视频编辑模式的价值就在这里;三是把动作、光影、运镜这些容易出问题的维度提前写清楚,别等生成之后才发现问题。相比事后重做几遍,前期多花十分钟写清约束,往往更划算。
学习路径:会用 → 会写 → 会导 → 会想
作者给出的学习路径值得抄:先会用工具,再会写提示词,然后会「导」——像导演一样设计镜头和节奏,最后是「会想」——建立对画面和叙事的判断力。
工具和技术会不断更新,具体用法很快过期;而审美与判断力不会。作者的原话是:「工具可能每个月都会更新,但审美将是我们永远的护城河。」
检查清单
- 写提示词前先想清楚:这个镜头要控制构图、动作还是氛围?
- 优先用图生视频或视频生视频锁定关键要素,再补充细节
- 检查画面是否有塑料感,必要时主动加噪点和镜头瑕疵
- 明确光位与光比,不要让光影「自动平均」
- 运镜用明确动词或参考轨迹描述
- 小问题用编辑模式解决,避免整段重生成
- 把每次生成的失败原因记下来,形成自己的问题清单
回到最初的问题:提示词不听话,很多时候是因为我们把它当成了许愿池,而不是去噪过程的约束条件。理解模型怎么「做梦」,比收集更多提示词模板更接近问题的根源。
参考来源
- YangGuangAI 原文:https://x.com/yangguangai/status/2025063323893686410