
这部剧最大的特点,是全程采用 AIGC 参与制作,并可根据观众反馈调整未播内容。首播后,《后西游记》拿下同时段省级卫视收视第一,制作成本约为真人剧的十分之一,芒果 TV 官方播放量已达 1.1 亿次。

APPSO 之前也报道过,2026 世界人工智能大会(WAIC)期间,智象未来(HiDream.ai)正式发布全球首个无限时长内容创作智能体 vivago R1。
现在,vivago R1 已经正式全球上线,国内版本名为「够搭」(以下统称 vivago R1)。它试图解决的是另一个问题:当 AI 已经能够生成画面之后,普通人距离制作一部完整作品,还有多远?

够搭体验地址:goudaai.com
热知识,vivago R1 是首个可稳定生成 3 至 5 分钟视频的对话式创作 Agent。
不同于需要用户自行搭建工作流的画布式、节点式工具,vivago R1 采用对话式创作路线,用户只需自然语言描述创意,就能完成从故事、脚本、分镜,到角色、镜头和成片生成的全流程,大幅降低了创作门槛。
如果说《后西游记》展示了 AI 如何进入影视工业,vivago R1 展示的则是 AI 如何以 Agent 形式参与影视生产,并将完整的内容生产能力交给普通用户。APPSO 决定第一时间上手测试。
实测 R1 ,一个人就是一支 AI 剧组
既然《后西游记》成为近期 AI 视频领域最受关注的话题,我们直接围绕西游主题进行创作。
我们为够搭设计了一部名为《重启 · 西游》的赛博朋克短片。
2099 年,人类记忆被统一意识网络「天庭系统」重写,最后一段未被改写的原始数据「悟空」从废弃数据中心中苏醒,携带「真经」穿越赛博朋克新长安城,在被系统猎杀之前上传真经。
视觉风格是东方赛博朋克——敦煌壁画遇上银翼杀手。

在这一过程中,R1 够搭的 Chat 与画布形成了一套围绕 Agent 协作设计的创作流程。
Chat 负责承接用户意图、调用素材并推动脚本、分镜和视频生成;画布则结构化呈现脚本、分镜、视频及关键资产,方便用户查看进展、比较结果。简单来说,Chat 用于与 Agent 协作,画布用于整理和呈现创作成果。




如今,行业开始面对更复杂的问题:如何让多个镜头、一段故事乃至一整支视频保持连贯。vivago R1 的最大亮点,正是 AI 视频从生成片段走向完整作品的交付。

完成长视频测试后,我们又尝试了商业广告场景。
我们准备了测试素材:一张人物照片、产品包装和 Logo;让够搭用这些素材做一条社媒广告——「每吃一口,人格切换一次」:没吃前低电量,第一口职场精英,第二口热血侠客,第三口松弛日常。



更刁钻的测试是网络热梗。
我们又输入了一段充满谐音梗的任务——「噜妹噜妹噜妹妹,猪 mer 猪 mer 猪 mermer.....,噜妹听到后走过来掐一下噜噜的脸,哄哄噜噜」。
这类内容看似简单,但实际上需要理解谐音梗、理解「掐脸」的情感含义、还要编排成有节奏的视频。不仅考察它的视频生成能力,还考察它的搜索和理解能力。



除了直接生成内容,够搭还有一个更重要的能力:帮助用户沉淀自己的创作资产。
在够搭的 SkillHub 中,用户可以找到大量预设功能,将抽象的 AI 能力转化成具体创作场景。它的价值在于降低用户理解 AI 能力的成本,让更多人知道自己可以用 AI 完成什么,也让创作从「想到一个点子」更快进入执行阶段。
其中,OOTD Advisor 是一个比较有代表性的功能。






从留声机到 vivago R1,人类创造力迎来第三次释放
回看人类历史,真正改变创作方式的技术,往往都在解决同一个问题:如何让更多人的想法抵达最终作品。
1877 年,爱迪生发明留声机,让声音第一次被记录和复现,人类表达开始摆脱时间与空间的限制。进入 20 世纪,单反相机的问世,尤其是微单的普及,让摄影从少数人的专业技能变成普通人记录世界、表达自我的方式。

而今天,AI 视频正在推动第三次创造力释放。
过去,一个人脑海中的故事想变成一部完整视频,需要经过一条复杂的专业链路。编剧负责构建故事,导演负责设计镜头,摄影负责捕捉画面,剪辑负责组织节奏,后期负责完成最终呈现。
创意和作品之间,始终隔着一层复杂的「翻译层」。

早期 AI 视频模型,例如 Sora,让大众第一次看到机器生成视频的可能性。一句自然语言描述,就可以生成具有电影感的画面,让人类第一次感受到 AI 视频创作的魔力。
但从一个惊艳的镜头,到一部完整的视频作品,中间依然存在巨大距离。视频创作真正困难的地方,在于如何让多个镜头保持统一,让角色在不同场景中保持一致,让故事拥有连续的叙事逻辑。
这也是 R1 想解决的问题。如开头所述,当下行业正在形成两条路线:一种把模型、工具和参数交给用户,让创作者自行组合和调试,换取更高自由度;
另一种则像 R1 一样,是将专业创作者的经验、审美和判断逻辑融入 Agent 编排能力。用户只需简单对话,背后则由 Agent 理解并执行完整创作流程。
两种路径没有绝对对错。前者上限更高,适合专业创作者;后者门槛更低、交付更稳定。

在 AI 视频创作里,模型和工具链再复杂,若不能将创意稳定组织成完整作品,就只是「能力展示」,而非真正的生产力。
除了面向普通用户的对话式创作体验,R1 也开始向开发者和专业内容团队开放更高阶的使用方式。目前,够搭已经支持 CLI 命令行交互模式,让用户可以通过终端直接调用视频生成、素材渲染、任务调度以及参数配置等能力,感兴趣的朋友不妨尝试一下。

作为一家专注多模态生成式人工智能的企业,智象未来自主研发了 HiDream-O1 系列大模型,并将多模态理解与生成能力应用于内容创作。
支撑这一目标的,是智象未来在模型架构上的长期探索。当前许多视频生成模型会先将图像压缩至隐空间,再基于压缩表达进行学习和生成。虽然这种方式能够降低计算成本,但也可能损失文字、表情和纹理等细节。

在这一技术路线下,智象未来进一步拓展了世界模型的能力边界。截止到今年 7 月,智象未来原生全模态交互式世界模型 HiDream-O1-World 在 WBench 评测中取得领先表现。

而模型之外,智象未来也在持续推动产品化加速落地。
如果说 HiDream 系列大模型探索的是模型能力的上限,那么 vivago R1 则致力于把这些能力转化为人人都能使用的创作体验。
从留声机到单反相机,再到 vivago R1,人类创造力的每一次释放,都伴随着创作门槛的降低。
一边是在提升 AI 视频生产的能力边界,一边是在扩大参与创作的人群范围。当这两股力量同时推进,够搭真正改变的,将是未来每个人都拥有用 AI 讲述自己故事的机会。
作者:单玉喆、莫崇宇