扩散语言模型(dLLM)正在从论文走向产业。
笔者独家获悉,中国扩散语言模型团队 DiffuSpace 已与亚洲智能体计算平台公司 Acrab 达成战略合作协议,双方将共同推进 dLLM 在 AI PC、智能汽车、机器人、智能家居等端侧 AI 场景中的落地。
DiffuSpace 是全球最早投入 dLLM 范式研究的团队,其核心成员自 2022 年以来,陆续推出 DiffuSeq、RDM、DiffuLLaMA 等研究成果,并研发出全球代表性 dLLM 之一 Dream 7B,是全球唯一在 " 条件生成、离散信号建模、Scaling" 的三大 dLLM 核心问题上均有全球领先突破的团队。
Acrab 则是亚洲一家致力于突破智能体在性能、能效与部署效率上的瓶颈,为端侧场景提供高效、灵活且可规模化落地底座的计算平台公司,已进入产业量产。
双方适配测试显示,dLLM 可将端侧 Agent 的运行速度提升 5 倍。
这意味着,长期以来主要依赖云端大模型的 Agent,正在出现另一条技术路线:不再单纯追求更大的模型,而是通过改变语言模型的生成方式,再叠加端侧芯片的并行算力,压缩 Agent 执行任务所需的时间。
这也是此次合作最值得关注的地方。
传统 GPT 类自回归模型采用 " 从左至右、逐个 Token" 的方式生成内容,一个 Token 接一个 Token 地产生结果。而 dLLM 借鉴图像生成领域的扩散机制,采用 " 全局生成 ",能够结合上下文持续调整生成结果。
简单来说,前者更像 " 一个字一个字写 ",后者则试图 " 先整体生成,再不断修正 "。
笔者从 DiffuSpace 方面获悉,在部分场景中,dLLM 的推理速度甚至可以达到 GPT 式自回归模型的 10 倍。此次 DiffuSpace 与 Acrab 则进一步把这种并行生成能力搬到了端侧 Agent 上,并进行系统级适配。
在 Acrab 的参考设计中,Coding Agent 已经成为测试场景之一:dLLM 可以并行处理多个代码位置,从而提升代码生成和修改效率。
另一个测试场景是视频剪辑智能体。由于需要同时处理图像、语音和文字等信息,dLLM 的全局建模能力被用于多模态任务的协同处理。
笔者独家获悉,这也是目前这次合作释放出的一个关键信号—— dLLM 与端侧计算平台的结合,并不是简单地把一个模型 " 塞进芯片 ",而是围绕 Agent 工作负载进行模型、算力和应用场景的协同适配。
这背后对应的是端侧 Agent 正在面对的一组现实问题:实时响应、计算效率,以及有限端侧算力下的模型运行速度。
Acrab 提供计算底座,它已经推出第一代端侧 AI 芯片 G Ξ LIX 1 以及 Agent Box 智能终端。其中,G Ξ LIX 1 提供超过 700 TOPS 的 AI 算力和 273GB/s 统一内存带宽,Agent Box 可以在消费、工业等场景离线部署智能体。目前 Acrab 累计融资超过 4.8 亿美元,并已进入产业量产阶段。
与此同时,dLLM 本身也正在成为大模型领域的新变量。
今年以来,Google、Inception、蚂蚁集团等科技公司陆续推出相关模型。随着越来越多企业开始进入这一赛道,行业内近期已经出现一种更激进的判断:扩散语言模型可能在未来两年内替代 GPT 类自回归模型。
DiffuSpace 作为国内较早投入扩散语言模型研究的团队,见证了行业对这一技术路线从 " 非共识 " 逐步走向更多认可。该团队认为,扩散语言模型已经展现出成为下一代基础模型范式的潜力,而接下来需要做的,是继续完成更多技术突破与产业验证,加速这一新范式走向成熟。
从此次合作来看,dLLM 正在尝试解决一个越来越现实的问题:当 AI Agent 真正进入 PC、汽车、机器人和家庭设备后,用户需要的可能不只是 " 更聪明的模型 ",还需要一个能够在本地更快行动的 Agent。
如果 5 倍速、10 倍速在更多实际任务中被验证,扩散语言模型或许会成为下一轮模型竞争中,一个不可忽视的新变量。(本文首发于钛媒体,文|钱微镜,作者|钱玉娟,编辑|杨林)