获取 $9.99

免费开始
返回博客

OpenSora 2 提示词实用指南

面向文本到视频和图像到视频工作流的 OpenSora 2 提示词指南,包含可复用结构、故障诊断和生成器路径。

2026年8月13日OpenSora 2 编辑团队
OpenSora 2 提示词实用指南

当您将 OpenSora 2 提示视为生产指令而不是仅考虑心情的想法时,它们会发挥更好的作用。在此站点上,这意味着在打开 文字转视频 工作区之前编写一条主题线、一条运动线、一条摄像机线、一条照明线、一条环境线和一条约束线。如果您已经有一个框架可以开始,请移至 图像转视频,而不是强制使用文本提示来同时求解结构和运动。简短的版本很简单:保持场景狭窄,保持运动可测量,并决定您是要解决文本到视频的构思还是图像到视频的控制。如果您想要更快地进入工作区,生成器 路线可以安全地重定向到当前的文本到视频流。

OpenSora 2 guide cover showing a dancer in a loft studio used as the article cover.

本指南中 OpenSora 2 的含义

本文使用该网站真实的当前产品映射,而不是通用的互联网速记。在存储库中,OpenSora 标记的文本到视频选项显示为具有不同标签的三个单独的选项:

  • OpenSora Draft
  • OpenSora 2 Lite
  • OpenSora 2

这些选项在代码中连接到不同的提供者模型,同时仍然共享相同的广泛提示规则:编写清晰的场景,定义运动,并避免要求一小段代码同时承载样式、时间、框架和对象行为。实际含义是最好的提示不是最长的提示。最好的提示是让下一代决策变得显而易见的提示。如果主题有误,你应该知道要修改哪一行。如果相机出现问题,您应该知道要修复哪一行。如果时间错误,您应该知道要修复哪一行。

最有效的六部分提示结构

对于大多数 OpenSora 2 文本转视频任务,请按以下顺序使用六个部分:

  1. 主题和行动
  2. 环境
  3. 相机行为
  4. 动作时机
  5. 灯光和纹理
  6. 限制和排除这个顺序很重要,因为它反映了读者通常如何诊断失败。人们很少说,"感觉潜在的空间不舒服"。他们说,"主题改变了","摄像机漂移了",或者"背景变得混乱"。结构化提示为您提供编辑句柄。```text 主题: 一位穿着宽松白衬衫的年轻女子正在练习缓慢的现代舞短语。

环境: 阳光明媚的工业阁楼工作室,有高高的窗户、木地板、空气中的轻尘。

相机: 中广角镜头,缓慢推入,视线水平取景,没有突然的角度变化。

动作时机: 她向前迈出一步,转身一次,举起双臂,停顿一下,然后倾身作最后一击。

灯光和纹理: 柔和的晨光,温暖的高光,逼真的皮肤纹理,自然的布料运动。

限制条件: 没有重复的肢体,没有背景人群,没有硬剪辑,没有额外的道具,没有文字叠加。


## 在风格化之前从基线提示开始

大多数失败的 OpenSora 2 提示都不是"太简单"。它们不稳定,因为在证明基线之前它们混合了太多变量。首先从一个接地版本开始。```text
制作一个女性在阳光明媚的阁楼工作室练习现代舞的逼真电影视频。中广角镜头。缓慢推入。她迈出三步,转身一次,举起双臂,停顿,最后以受控的侧身伸展结束。自然的织物运动,温暖的晨光,真实的肤色,干净的木地板,没有文字,没有多余的人。
```运行该基线一次。然后决定推送哪个单一维度:

- 风格更强
- 更严格的相机
- 更快的运动
- 更密集的环境
- 更具戏剧性的灯光

不要同时更改所有五个。如果这样做,您就失去了诊断价值。

## 文字转视频的提示公式

当任务是产生新想法时,文本转视频是更合适的第一站。最可靠的公式是:

```text
[主体做一个明确动作] + [具体场景] + [相机指令] + [时间节拍] + [灯光提示] + [三个排除项]

下面是三种可直接复用的提示模板。

电影现实主义外壳

[主体] 在 [具体环境] 中完成 [单一动作]。[镜头类型]、[镜头运动]、[取景方式]。动作按照 [时间模式] 展开。[灯光]、[表面细节]、[氛围]。避免 [伪影1]、[伪影2]、[伪影3]。

产品解说外壳

为 [物体] 生成一段干净的棚拍产品视频。从 [开场取景] 开始,然后是 [动作节拍1],再到 [动作节拍2]。中性背景、准确反光、轮廓清晰、优质布光、稳定几何形态。不要出现手、漂浮物体或文字覆盖。

社交短片外壳

为 [主体] 在 [场景] 中生成一段竖版短片。第一秒展示 [钩子画面],然后进入 [主要动作],最后以 [结尾节拍] 收束。手持感流畅、对比明亮、运动模糊可信、不要突然变形、不要重复人脸。

这些并不是魔法词,而是控制模板。

何时从文本转视频切换到图像转视频

如果您的主要抱怨是构图漂移、字符不一致或道具放置,请停止重写文本并转向 图像转视频。文本提示擅长描述意图。当您需要非常具体的第一帧时,它们会较弱。

在以下情况下使用图像转视频:

  • 开头的框架比及时的新奇更重要
  • 你已经有一个可用的蒸馏器
  • 主体身份必须保持密切
  • 背景布局必须保持可识别性

在以下情况下使用文本转视频:

  • 你正在快速探索想法
  • 你没有起始框架
  • 您需要快速的多个视觉方向
  • 场景概念比精确构图更重要

这种分开可以节省时间。当实际丢失的输入是受控图像时,许多用户不断重写文本提示。

值得设计的真实场地限制

该网站当前的 OpenSora 标签视频选项在代码中具有一些实用特征:

  • 对于结构化提示来说,提示长度可以足够大,但这并不意味着每一个额外的句子都有帮助
  • OpenSora 标记的视频选项的默认持续时间很短,因此提示中的每个节拍都必须赢得其位置
  • 默认分辨率比较保守,因此构图清晰度比装饰更重要这些限制促使你采用紧凑的、场景优先的提示方式。如果您尝试将十个镜头的故事板打包到一个短生成中,则在创造力提高之前,动作质量通常会下降。

因此,请将提示编写为具有一个运动弧的一个场景。如果您需要一个序列,请生成多个镜头并稍后进行剪辑。本文并不是声称平台本机编辑器可以解决整个管道;而是声称平台本机编辑器可以解决整个管道问题。它正在推荐一种更安全的发电策略。

如何编写能够承受时间压力的提示

短世代惩罚模糊的动词。用可见的计时提示替换"动作优美"之类的宽泛词语:

  • 向前迈出两步
  • 转动一次
  • 暂停一拍
  • 看起来向左
  • 伸向相机
  • 布料落后运动半秒

比较下面的两个版本。```text 弱: 舞者在拥有电影灯光的工作室里优雅地舞动。


```text
更强:
在阳光明媚的阁楼工作室里,一名当代舞者向镜头迈出两步,转身一次,停顿,然后将双臂伸出最后一臂。中广角镜头,缓慢推入,温暖的晨光,逼真的布料运动,没有多余的人物,没有突然的相机抖动。
```第二个版本为模型提供了可读的运动脊柱。

## 如何修改提示而不丢失好的部分

最大的质量飞跃通常来自于修订纪律,而不是来自于找到全新的提示。每一代之后,写下哪些是正确的,哪些是错误的。然后在下一次通过时保持正确的线条不变。

使用这个三栏评论:

- 保留:看起来已经正确的部分
- 修复:明显失效的部分
- 删除:任何引入混乱且没有增加价值的短语

例如,如果环境和光照较强但相机发生漂移,则不要重写整个提示。保持环境线,保持灯光线,拉紧摄像头线:```text
修订说明:
保持阁楼工作室,温暖的晨光,最后的到达。
将相机固定在一台慢速移动车上,不进行轨道旋转。
删除暗示蒙太奇或梦想逻辑的多余风格词语。
```这很重要,因为稳定的提示是累积的。一旦找到可信的主题和背景,就保护它们。不要仅仅因为后面一层失败就放弃工作结构。

## 本网站内的实用工作流程

以下是适合当前拥有的路线的工作流程,无需发明不支持的参数:1. 从 [文字转视频](/zh/text-to-video?entry_surface=blog_opensora_2_prompt_guide) 开始。
2. 粘贴由六部分组成的基线提示。
3. 首先生成一个简单的现实主义通道。
4. 只更改一个提示块。
5. 如果构图持续漂移,请使用参考系移至 [图像转视频](/zh/image-to-video?entry_surface=blog_opensora_2_prompt_guide)。
6. 如果需要支持静止图像,请在制作动画之前使用 [文字转图像](/zh/text-to-image?entry_surface=blog_opensora_2_prompt_guide) 或 [奎文图3](/zh/qwen-image-3?entry_surface=blog_opensora_2_prompt_guide) 设计帧。

这很重要,因为该站点当前公开了多种创建模式,并且每种模式都解决了不同的故障类别。好的提示包括选择正确的模式,而不仅仅是选择更好的形容词。

<视频
  src="https://cdn.imagetoai.video/uploads/site/seedance2mini-assets/videos/loft-dance.mp4?v=20260616"
  控制
  内联播放
  预加载="元数据"
  海报="https://cdn.imagetoai.video/uploads/site/seedance2mini-assets/posters/loft-dance.webp?v=20260616"
  样式={{宽度:"100%",borderRadius:"16px",marginTop:"1rem",marginBottom:"1rem"}}
>
  您的浏览器不支持视频标签。
</视频>

## 故障诊断:结果错误时改什么

改进 OpenSora 2 提示的最快方法是按故障类型进行诊断。

### 如果对象改变形状

缩短风格语言并强化主题线。将年龄、服装轮廓、家庭姿势和动作放在前面。

### 如果相机感觉随机

使用一种镜头类型和一种动作。删除暗示剪辑、蒙太奇或多个镜头的词语。

### 如果场景变得混乱

将环境缩小到两个或三个可见的锚点。添加排除项。

### 如果感觉动作微弱

用定时的身体节拍代替抽象动词。 "精力充沛"不是节拍。 "转身一次,然后向前猛冲"是一个节拍。

### 如果现实主义在风格推动后崩溃

返回到基线提示并一次仅添加一种风格修饰符。

### 如果开场框架几乎正确但一直漂移

切换到图像到视频。这通常是一个控制问题,而不是措辞问题。

## 提示您可以实际重用的示例

以下是为不同作业构建的四个可重复使用的提示。

### 舞蹈表演提示

```text
创建逼真的电影舞蹈视频。一位穿着宽松白衬衫和木炭练习裤的年轻女子在阳光明媚的阁楼工作室里表演着一段缓慢的现代乐句,工作室里有高高的窗户和木地板。中广角镜头,缓慢推入,视线水平取景。她向前迈了两步,转身一次,举起双臂,停顿,最后以长距离侧身伸展结束。温暖的晨光,空气中的自然灰尘,逼真的皮肤和织物纹理,受控的节奏。没有多余的舞者,没有文字,没有突然的相机抖动,没有重复的肢体。

时尚动作提示

创建一个干净的编辑时尚视频,展示模特走过安静的混凝土走廊。全身取景,从前方缓慢跟踪拍摄,然后在接近尾声时轻微侧移。外套随着每一步自然摆动,模特看向镜头一次,然后停在最后一帧。柔和的头顶灯光,优质的面料细节,内敛的奢华氛围。没有人群,没有道具,没有快速剪辑,没有扭曲的手。

产品美容提示

生成石底座上哑光黑色香水瓶的优质产品视频。从瓶盖特写开始,然后慢慢向后拉,露出整个瓶子,同时柔和的雾气在瓶子后面移动。受控反射、深色中性背景、优雅的边缘光、稳定的几何形状、逼真的玻璃和金属表面。没有手,没有改变形状的标签,没有浮动片段,没有文本覆盖。

环境优先概念提示

创建一段蓝色时刻小雨后狭窄霓虹灯街道的电影视频。从一个空的框架开始,然后一个骑自行车的人从左边进入,经过一个发光的商店招牌,然后消失在远处。缓慢向前的相机移动、潮湿的反射、柔和的雾气、可信的车轮运动、克制的调色板。没有人群聚集,没有混乱的标牌,没有突然的天气变化。
快速调试模板:
保留主体和镜头,
只改一个动作节拍,
如果构图继续漂移,就切换到图像转视频。

你应该诚实面对的限制

没有任何提示指南可以保证准确的排名、准确的视觉保真度或从公开示例中准确恢复原始提示。本指南也不声称 OpenSora 标记的某个选项始终优于网站上的所有其他视频模型。它比那更窄。

本指南的主张是:

  • 结构化提示比纯情绪提示更容易调试
  • 短世代奖励可测量的节拍
  • 图像到视频通常是解决构图漂移的正确方法
  • 该网站拥有的路线支持当今的工作流程

其他一切都应该在实际任务中进行测试。

本文适合您的下一个工作流程

如果您从头开始,请转至 文字转视频 并测试一个基线提示。如果您已经知道所需的确切帧,请使用 图像转视频。如果您首先需要静止图像,请在 文字转图像Qwen Image 3 中生成它,然后再为它制作动画。

这是比追逐单个巨大提示更可靠的工作流程。

常见问题解答

最佳的 OpenSora 2 提示长度是多少?

要足够长,能够明确主题、场景、相机、动作、灯光和约束;也要足够短,让每一行都真的改变画面中可见的部分。结构化的中等长度提示,通常比一整段密集的风格描述更容易调试。

我应该先使用文本转视频还是图像转视频?

使用文本转视频进行构思和场景发现。当开场帧、字符一致性或布局比探索更重要时,请使用图像转视频。

为什么即使提示很长,我的结果看起来也很普通?

因为长度不等于控制。通用的结果通常来自于较弱的动作节拍、模糊的镜头语言或过多与主题相冲突的风格修饰。

一个提示应包含多少个动作?

对于短视频生成,一个动作弧通常比完整序列更稳妥。把它想成一个场景,有开始、有发展节拍,也有收束节拍。

我可以仅从文本中强制实现精确的字符一致性吗?

不可靠。如果身份和构图必须保持紧密,请使用参考系并转向图像到视频,而不是重复扩展文本提示。

当结果损坏时我应该首先删除什么?

首先删除多余的样式术语。保持主题、动作和摄像机线条。一旦基线稳定,一次将样式添加回一个受控图层。

如果您准备测试这套方法,请返回 OpenSora 2 首页,打开 OpenSora 2 生成器,然后进入文本到视频工作区。