关于ZAKER Skills 合作
钛媒体 2小时前

MiniMax Design 用 Agent 串联多模型,争夺专业内容生产入口

图片由 AI 生成

8 月 20 日,MiniMax 发布多模态创作 Agent 工作台 MiniMax Design,其核心目标在于推动模型能力进入商业内容生产流程。

MiniMax Design 是一款多模态创作 Harness。用户提出创作需求后,Agent 能够理解目标、拆解任务,并调用相应的模型与 Skills,完成素材处理、内容生成、编辑和最终交付。

上个月,7 月 31 日,MiniMax 发布了通用全模态生成模型 H3,也是该公司首个开源的视频生成模型。H3 核心的特点是打破任务边界,不再将文生图、图生视频、视频编辑等视为独立任务,而是在一个模型内统一处理。

不过,也有部分开发者表示 H3 提示词复杂,上手难度高,对硬件和配置的要求,让很多个人用户望而却步。

面对一项具体任务,MiniMax Design 试图判断需要提供哪些文字、图片、视频和音频,并识别其中需要参考或保留的内容,将创作需求转化为适合 H3 执行的素材和指令,补充了音视频生成前的分镜规划,以及生成后的剪辑和成片装配能力。

例如,其主推的 "3D 导演台 " 功能,可以根据场景、人物动作和镜头要求,在 3D 空间中摆放角色、调整姿态与机位,并从不同视角检查画面。

围绕 H3 开源后形成的创作者生态,MiniMax Design 已将部分社区工作流集合到产品中。已经使用 ComfyUI 的专业创作者也可以接入原有的本地部署方式和成熟工作流,选择云端或本地运行,并让 Agent 根据对话协助编辑工作流节点、调整生成参数。

MiniMax Design 已将部分社区工作流集合到产品中

此外,MiniMax 分享了对多模态生产力的两个判断:首先,未来的内容创作与修改将逐步从像素、图层、时间点和参数操作,转向语义层面的交互。用户只需说明想要什么、改变什么和保留什么,系统负责理解意图,并完成相应的生成、修改、重组和编辑。

其次,多模态模型需要理解的 Context 将从一次输入扩展到整个 Project。一项完整的内容任务通常包含多轮对话,以及剧本、图片、视频、音频、人物、场景、道具和品牌资产。不同版本及其修改记录也会成为后续创作的上下文。Context 长度之外,模型能否理解并有效使用这些内容,将影响其处理复杂任务的能力。

从行业层面来看,当前主流的 AI 视频生成工具,Runway、Pika、即梦、可灵等,团队迭代的重心在视频模型能力的进阶。其在 AI 视频实际工作流上,可以在输出独立视频片段,以及个人创作者创意实现上表现优异,但缺少完整项目管理、分镜编排、批量版本导出、企业资产规范,在大规模商业化上会存在一定的短板。

而一些垂直行业 SaaS,比如,电商剪辑工具、短剧制片平台,主要是针对单一场景封装,模型能力受限,跨品类复用差。为此,MiniMax Design 通过 Skill 生态,横向覆盖电商、短剧、品牌广告、教育科普、动画漫剧多个内容赛道。

这些是 MiniMax 推出 MiniMax Design 以寻求差异化优势的原因。不过,对于 MiniMax 来说,其视频模型能力在高端影视级生成能力仍有上限,模型画质和口碑均弱于头部竞品,这将直接限制其切入高溢价顶级广告制片市场。

MiniMax Design 的 Skill 生态起步较晚,优质行业模板数量不足,第三方开发者参与度低。而当前主流的创作工具平台,比如,ComfyUI、Runway 已经搭建起了庞大创作者生态,用户可以自定义插件、预设、教程、第三方服务商。

未来的行业竞争不会再只是聚焦于单一的视频生成效果,工作流复用能力、企业资产管控、多模型调度、行业垂直 Skill 生态,也就是 Harness 层的产品能力,也将成为视频模型厂商发展的核心要义。(本文首发于钛媒体 APP,作者|李程程,编辑|杨林)

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容