| 产品图、主视觉、静态分镜 | Image-to-video(图片生成视频) | 想保留构图或主体形象,只给画面增加镜头运动;Sora API 文档描述了用参考图片作为起始帧,Firefly 也有从图片生成视频的流程。 |
| 已经有一段视频素材 | 编辑/延展视频 | 想修改、继续生成或延长某个镜头;这是 Sora API 文档中提到的能力之一。 |
如果你正在比较工具,尽量以官方页面为准。Google Vids 表示,用户可以在 Google Vids 中使用 Veo 3 通过提示词生成视频。 Adobe 也提供了在 Firefly 生态中使用 Google Veo、Runway Gen-4.5,以及 OpenAI Sora 2/Sora 2 Pro 的相关页面或说明。
好的 AI 视频提示词,不只是说明“画面里有什么”,还要说明“镜头怎样拍”。一个好上手的结构是:
主体 + 动作 + 场景 + 景别/机位/镜头运动 + 光线 + 情绪或风格 + 时长或画幅比例。
这种写法与相关文档中的建议一致:OpenAI 建议清楚描述画面、主体、动作、环境和光线;Adobe 也建议在生成视频时说明 subject、action、place、mood 或 style 等要素。
不够具体的提示词:
更像拍摄 brief 的提示词:
如果是产品图,可以把图片明确设定为画面的锚点:
先问自己三个问题:这条视频是给谁看的?要发布在哪里?观众在前几秒需要看懂什么?
短视频平台上的竖屏片段,和产品介绍、内部培训视频、演示文稿背景画面,节奏与信息密度都不一样。目标越清楚,后面的提示词、画幅、时长和后期取舍就越容易定。
只有文字想法,就用 text-to-video;有产品图、主视觉或静态分镜,就用 image-to-video;如果需要处理已有素材,并且工具支持对应工作流,就用编辑或延展视频的模式。
第一版提示词至少要包含主体、动作、场景、镜头、光线和情绪。这样写出来的内容更接近影像制作 brief,而不是一句模糊的画面描述。
实用做法是先把“画面内容”写出来,再补上“怎么拍”:
不要一开始就追求最长时长或最高画质。OpenAI 文档建议,在反复调提示词时使用较短片段和较小尺寸,因为更长视频或 1080p 输出会明显更耗时。
也就是说,先用几秒钟测试方向:构图对不对,主体有没有稳定,动作是否自然,光线和气氛是否接近预期。确认方向后,再投入更高质量的最终生成。
样片不满意很正常,但不要一次性重写所有内容。更稳的办法是一次只调整一组变量:镜头、动作、光线、场景或情绪。
如果你同时改了主体、机位、光线、风格和时长,就很难判断到底是哪一处让结果变好了或变差了。把修改拆小,反而更快接近目标。
当视频方向基本正确,再输出更高质量的版本。OpenAI 文档提到,sora-2-pro 更适合高质量和 1080p 输出,并描述了在任务完成后下载 MP4 的流程。
不过,AI 生成的只是画面素材。要成为一条完整视频,通常还需要剪辑节奏、旁白、音乐、音效、字幕、片头片尾、品牌 logo 或行动号召等后期步骤。
AI 视频往往需要几轮迭代。与其推倒重来,不如先诊断问题,再有针对性地改。
一段 AI 生成画面再漂亮,也不一定能直接发布。你还需要处理画面之外的层次:
Adobe Firefly 是被描述为可从文字和图片生成 AI 视频的工具之一,但后期仍然是发布前的最后一道质量控制。
如果只是个人练习,这一步能帮你避免误用素材;如果用于品牌、广告或商业内容,这一步就不是可选项,而是必须项。
Adobe 表示,使用 Firefly model 生成的视频可安全用于商业目的。 但如果你使用的是合作伙伴模型或其他工具,应阅读对应工具或模型的条款;Adobe 针对 Firefly 中的 Google Veo、Runway Gen-4.5 和 OpenAI Sora 也有独立页面。
对于 OpenAI Sora API,相关文档提到了一些值得注意的内容限制:不能生成真实人物,包括名人;受版权保护的角色和音乐会被拒绝;在该流程中,包含人脸的输入图片也会被阻止。
发布前至少检查这些问题:
1. 文字生成短视频
2. 产品图生成动态视频
3. YouTube 或演示文稿背景画面
4. 延展已有视频素材
想把 AI 视频做得更稳定,不要从“生成大片”开始,而要从小样片开始:选对输入方式,把提示词写成拍摄 brief,短片段测试,逐项修改,最后再做后期和发布检查。用于品牌、广告或可变现内容前,还要逐一确认商业使用权限、真实人物、角色、音乐和各工具政策。