OpenAI发布Sora 2:视频生成的GPT-3.5时刻,音画同步+物理真实感质飞跃
2025 年 9 月 30 日(北京时间 10 月 1 日凌晨),OpenAI 正式发布旗舰级音视频生成模型 Sora 2。这款被 OpenAI 称为「视频生成的 GPT-3.5 时刻」的模型,在物理特性准确度、画面真实感以及可操控性方面均较以往系统实现了质的飞跃。
物理真实感的跨越
早期的视频模型往往表现得「过于乐观」——为了响应文本指令,它们不惜扭曲现实或令物体变形。例如,当篮球运动员投篮不中时,球可能会凭空「传送」进篮筐。
但在 Sora 2 中,如果球员投篮不中,篮球会真实地从篮板上反弹。模型经常出现的「错误」看起来更像是内部智能体所犯的错误;尽管仍不完美,但在遵循物理定律方面已有了长足进步。
Sora 2 能够胜任此前模型极难实现的任务:复杂的奥运体操动作、划桨板上精准模拟浮力与刚度的后空翻、猫咪依附下的三周跳等。
音画同步与角色植入
作为通用的音视频生成系统,Sora 2 能创作出具有高度真实感的复杂背景声场、语音及音效,音画同步功能可实现对白与口型的精确对齐。
更突破的是「角色(character)」功能:通过观察团队成员的短视频,模型就能将其置入任何生成的环境,并精准还原其外貌与声音。这种能力适用于任何人、动物或物体。
TikTok 式社交应用
OpenAI 同步推出全新社交 iOS 应用「Sora」:
- 纵向视频流,支持滑动浏览,类似 TikTok
- 可创作内容、对他人作品进行二次创作(remix)
- 定制化的 Sora 动态信息流(feed)
- 「角色」功能将自己或朋友带入视频世界
上线 48 小时内登顶美国 iOS App Store 榜首,超越 ChatGPT,下载量超 16.4 万次。
多镜头叙事能力
Sora 2 在可操控性上有质的飞跃:
- 遵循涵盖多个镜头的复杂指令
- 精准维持世界状态的一致性
- 支持好莱坞式转场效果
- 写实、电影感、动漫风格均有卓越表现
- 系统支持基于文本指令自动规划多角度镜头切换
规格参数
- 标准版:最长 10 秒视频,720p 分辨率
- Pro 版:最长 25 秒视频,1080p 分辨率
- 输入:文本、图像
- 输出:视频 + 同步音频
- 定价:sora-2 0.10 美元/秒,sora-2-pro 0.30-0.70 美元/秒
重大商业合作
2025 年 12 月,迪士尼宣布向 OpenAI 投资 10 亿美元,并签署三年授权协议,允许 Sora 生成包含迪士尼、皮克斯、漫威、星战等 200 多个角色的视频。
安全措施
- 所有视频带水印和元数据标识
- 肖像只能在本人同意下使用,可随时撤销
- 青少年账号受家长控制和使用时长限制
- 生成阶段屏蔽色情、恐怖主义、自残内容
OpenAI 表示:「视频模型正在飞速进化。通用世界模拟器和机器人智能体将重塑社会,加速人类的发展进程。」