关于ZAKER Skills GEO服务 合作
钛媒体 1小时前

Astra 的走红,证明 OpenAI 放弃 Sora 是一个英明决策

文 | 互联网怪盗团

今年 3 月,OpenAI 突然宣布放弃 Sora,此时距离 Sora 2 发布仅有短短半年。我们都还记得它发布时的盛况——朋友圈里用它做的各式各样的视频刷屏了好久!在 Seedance 2 和可灵 3 发布之前,Sora 2 是不折不扣的全球第一视频大模型,在硅谷大厂当中,只有谷歌的 Veo 可以与其相提并论。然后就没有然后了……

当时的情况十分奇怪:OpenAI 全面关闭了一切 Sora 服务,包括 API 在内;用户数据将在一段时间后被清空。不久前刚刚与迪士尼签下的 10 亿美元投资协议当然不会生效。OpenAI 等于完全退出了方兴未艾的视频生成模型市场,一点也没有留后手。假设几年之后它打算重返这个市场,恐怕得从头做起,因为 Sora 的遗产作废了。

对于这个令人费解的现象,当时市场主流的解释是:OpenAI 要集中精力提高编程能力,抢占方兴未艾的 Agentic Coding & Workflow 市场,当时这个市场已经成了 Claude 的天下。这个解释有一定的道理,但 OpenAI 为何不保留一小块根据地,例如仍然为特定企业客户提供视频生成服务呢?为何要完全退出呢?虽然视频生成很消耗算力,但 OpenAI 难道连有限规模的 Sora 算力都承担不起吗?

还有一种愚不可及的解释,就是 " 视频生成市场根本不赚钱 "," 很快会灭亡 " ——主要见于精英论坛知乎。自从 2022 年底 ChatGPT 横空出世以来,知乎对于 AI 行业的技术和市场判断几乎全是错误的,是完美的反向指标,对视频生成的判断只是这群无知傲慢的所谓 " 技术人才 " 做出的众多愚蠢结论之一,不值一驳。

过去一个星期,随着 GPT-6 Astra 的爆红,我在与影视行业的朋友交流的过程中,总算领会到了:当初 OpenAI 毅然放弃 Sora,可能是早早领会到了现有的原生视频生成模式无法满足工业级影视作品的需要,至少不能单独满足。今后的、精品化的、能上大银幕的那种视频生成,脱离不了 Agentic Coding 的模式,而 Astra 恰恰在这方面取得了新的突破。结果就是,Astra 不是一个视频大模型、没有视频生成能力,却正在成为视频生成中不可或缺的重要工具。

原生视频模型,无论是 Sora 还是 Veo,可灵还是 Seedance,海螺还是 HappyHorse ……都无法克服一个致命问题:抽卡本身的不确定性。由于视频生成本身是随机的,没有调度可言,导演永远无法精确地控制一切。如果是一些细节问题(例如一致性),还可以通过反复抽卡解决;但是关键的调度和镜头语言问题,无论抽多少次卡都难以做到。

在短剧乃至一部分互联网原生中剧当中,这不是大问题。红果上每天出现上千部 AI 短剧(含 AI 真人剧和漫剧),绝大部分谈不上什么调度,镜头语言比较单一,大家看的就是剧情。不过这个市场也很容易饱和,尤其是竖屏短剧市场,变化空间太小了,我估计现在其实已经接近饱和。接下来的增量恐怕还是得指望横屏和大银幕(包括电视屏幕),那是真正有可能做出差异化的地方,制作单位的预算也明显更大。

Astra 的诞生给了视频制作者一个崭新的选择:要不要通过 Astra 操纵 Blender 等专业 3D 建模软件,做一个完整的场景,乃至把主要人物的运动轨迹都做出来,由此实现 " 调度 "?别误会,这样生成的东西,本身还不是工业级的视频,无法直接拿给观众看。但是,上述内容可以输入到 Seedance 或可灵里面,作为 Prompt 的一部分,那对输出精度的提高可不是一点半点的!

举个例子:以前你想做一个复杂的动作戏,主人公和反派在西部酒吧场景里拔枪互射,现场十分混乱,很多道具都被破坏,人物运动令人眼花缭乱,最后当然是主人公成功击杀了反派。这种复杂场景是原生视频模型的噩梦!你只能用尽可能详细的文本,加上大量图片(最好有手绘图),去调教模型。至于每个道具(例如桌子、椅子)的具体方位、形状和材质,就更难把控了。附带说一句,大部分视频模型对每个场景能输入的图片 Prompt 数量有限制,你不可能通过无限制补充图片的方式去完善一切细节。

最好的方法当然是交给视频模型一套 3D 建模,把这个 3D 场景本身作为 Prompt,复杂的人物和道具关系就一劳永逸地解决了。说起来容易,可是做起来呢?传统 3D 建模要花多少人力物力?我们用 AI 做视频就是为了节约成本,如果还要在 3D 场景构建上花大钱,岂非南辕北辙?而且就算花了钱也不一定完成任务,优秀的 3D 艺术家和技术人员都很难找,不用我多说。

Astra 把这个问题解决了:它能以 Coding 操纵专业 3D 软件去构建场景和人物,让人物在场景里 " 走戏 ",从而真正解决 AI 视频的调度问题。如果你只想要一个示意、效果展示,或者简单的 PV,其实 Astra + Blender 都已经足够了!要做复杂的、比较长的视频,则还需要用到原生视频模型。公允地说,就视频生成本身而言,Seedance 仍是目前最好的。

然而,不管接下来视频模型如何发展、谁占据第一,Astra 这样具有强大 Agent 能力的文本模型,已经不声不响地占据了 " 指挥官 " 的地位:你想做的东西越复杂、对精确度的要求越高,就越要依靠 Astra(或其同类模型),而且它们的 Agent 能力还会进一步水涨船高,谁知道接下来还能创造什么奇迹!

Seedance 也好,可灵也好,Veo 也好,在 AI 视频当中发挥的作用,虽然不可或缺,但不是 " 最重要 " 的。就像在球场上,它们最终可能只是 " 工兵 " 或 " 角色球员 ",Astra(或其竞品)则是中场组织者。我们都知道,后者的身家和薪酬会远远超过前者,现在已经有这个趋势了。

那么,视频模型的开发者知不知道这一点呢?显然是知道的,我认为 Seedance 的开发者——字节跳动,早就意识到了,并在考虑对策。Astra 发布没多久,就传出了字节跳动要基于 Seedance 去做 " 世界模型 " 的说法。媒体猜测这是要进军游戏乃至元宇宙产业,但我认为字节跳动目的更实际,就是通过世界模型,为视频创作者提供更自由、更精确的调度空间。再过两三年,AI 视频创作或许就是让 3D 建模的角色在世界模型里面 " 演出 " 一遍,再把演出视频进行修改润色,最终包装生成为工业级视频。与传统影视行业的制作思路一致!

由此看来,五个多月前 OpenAI 突然宣布放弃 Sora,简直就是一个英明的战略决策。Sam Altman 当时就想到这一层了吗?不得而知,反正结果是很好的。这对于整个 AI 视频赛道也是好事。我始终认为,只有尽可能摆脱抽卡带来的不确定性,AI 视频才能进一步打开自己的天空,超越短剧层面,进入更宽广的未来。

我非常期待这个未来!

觉得文章不错,微信扫描分享好友

扫码分享

热门推荐

查看更多内容

企业资讯

查看更多内容