关于ZAKER Skills 合作
36氪 5小时前

异构智算平台天使轮融资千万,瞄准英伟达和国产 GPU 算力调度

硬氪获悉,近日异构智算平台与梯度 Token 工厂技术服务商博伦智汇完成千万级天使轮融资,投后估值约 1.5 亿元。本轮融资由专注 AI 及 AI Infra 赛道、同时布局过大模型训练框架的一线产业基金投资,将主要用于异构智算核心技术迭代、算力基础设施产品打磨、核心技术团队扩充。

博伦智汇创立于 2026 年,总部位于北京。CEO 刘进治曾任职英特尔亚太研发中心,硅谷分布式系统软件中国负责人,在计算架构与系统软件领域经验丰富。刘进治 2016 年曾是全球首批专注自然语言处理的 AI 初创企业核心成员,后参与搭建中国第一批 Nvidia Superpod 训练集群,支撑大语言模型研发与服务落地。

CTO 杨光在西门子通信、Oracle、IBM、华为云等跨国企业先后负责软件研发和系统架构,是云原生研发早期成员。公司核心成员均出自 IBM、天数智芯、华为、趋动科技等创新企业,核心团队曾操盘国内第一批英伟达 SuperPod 训练集群,较早实现国产异构 GPU 万卡推理。

随着各地智算中心建设风潮,纸面算力规模持续攀升,但许多机柜上架后处于 " 空转 " 状态。有芯片不等于有算力,有算力不等于能用。从芯片到输出 Token,中间横着几道工程鸿沟。不同架构芯片如何统一纳管?碎片化算力如何调度优化?算力如何按需分级,产出不同价值?

同时,全球 AI Token 日调用量已突破 300 万亿次。Agent 兴起后,智能体复杂任务增加,单任务消耗 Token 量动辄十万甚至百万级,算力需求爆涨。全球 AI 推理芯片市场规模已近 500 亿美元,推理成本跃升为 AI 企业最大的运营支出。

刘进治向硬氪介绍,基于这一背景,公司自研了 TOLD (Token Oriented Large-scale Distributed architecture)技术栈,将算力优化为梯级 Token 输出。

刘进治在 2023 年就进入了智算赛道。" 我们在英伟达高端算力禁售前,做了国内第一批英伟达 SuperPod,也就是基于英伟达 DGX 的 SuperPod 架构,并与头部大模型公司进行了深度合作。" 另一方面,他带着团队也较早地介入了国产 GPU 的生态和技术体系。

受到地缘政治和国产 GPU 崛起等各种因素,各企业持有的 GPU 资产非常分散,既有英伟达的 GPU,又有不同的国产 GPU," 问题在于,这些不同的 GPU 本身因技术路线等不同没有办法直接协同使用。既能够把它们协同起来,又要做到最优是个技术难题。"

因此,国内企业如何把这些异构的算力资产整合起来并进行调优成为刚需," 而且随着各个企业、国央企积累的 GPU 资产越来越多、越来越多样化,这会成为一个非常大的需求。"

博伦智汇的自研架构 TOLD 则可以兼容英伟达及多种国产 GPU 架构,自研云原生分布式调度技术,实现万卡级异构 GPU 的统一纳管与推理调度。让不同芯片在同一套框架下按模型效能最优协同工作。面向 token 及应用,还能提供大模型一键适配、B2B2C 多租户创新模式。

刘进治介绍,公司目前已经有签单客户,接下来还会推出硬件产品。以下是硬氪与他的访谈节选:

硬氪:现在大模型阶段,算力主要被用在哪些环节?

刘进治:如果按大模型阶段来看,算力主要分成两大块:大模型训练,以及训练完成之后的推理应用。

现在大模型公司已经比较集中,也有一些国央企自己在训练大模型,但不会对外商业化,只是内部使用,它们的投入也很大。这些公司还在持续大量铺设训练算力。中国优质的训练算力目前大概还不到美国的十分之一,所以训练算力还需要继续追赶。

未来更大的市场是推理,DeepSeek R1 带动了真正的推理和 AI 落地,再加上今年出现的一些新的应用,对 Token 落地带动了大量推理需求。长期来看,推理需求可能会达到训练需求的十倍甚至百倍以上。随着大量 AI 应用落地,推理理论上会成为一个更加广泛的市场,也是国产算力能够发挥很大作用的地方。

硬氪:你们自己的 TOLD 技术栈具体是什么?技术壁垒体现在哪里?

刘进治:它有几个特点,第一是面向 Token,让 Token 做到最快、最优。第二是 Large Scale,市场上有很多公司都在讲异构,但我们的特点是真正做过大规模的国产 GPU 集群。从工程角度来讲,大规模异构和做几台异构完全不一样。比如现在一些最新的国产卡,单卡性能已经逼近英伟达 H200,但大模型训练需要上千张甚至上万张卡组成超大规模集群,这种集群的稳定性才是最大的挑战。

另外,我们的集群可以分布在全国甚至全球。实际上,我们拉管过超过 10 个千卡级别、分布在全国各地的计算中心,达到万卡级别。在这个过程中,我们做了非常多研发。第一层是调度层,我们基于云原生,但会深度修改云原生底层的一些东西。这不是单一的架构,我们需要把云、分布式架构、大规模分布式架构,以及对模型本身的理解融合到产品里面。

目前已经支持超过 5 种异构 GPU,包括英伟达和国产的大规模 GPU。

硬氪:目前这种大规模异构平台已经得到验证了吗?主要在哪些场景?

刘进治:我们实际做过超过 10 个千卡级别组成的万卡级国产 GPU 集群,类似一个 " 大网吧 ",这个集群真实对外提供服务。后来有一些卡被商业化出租,但我们已经在这个上面完成了验证。

这个场景其实比较通用,可以 To B,也可以 To C。To B 可以给企业内部提供服务 , 比如一家做 AIGC 短剧的公司,它需要调用不同的语言模型、多模态模型和生图模型,也可以是具身智能,或者其他泛生态场景。C 端则是个人使用,比如个人养 " 龙虾 ",Agent 工具调用,codex、claude code 等都可以接入我们提供的模型。

硬氪:你看重 C 端的原因是?后续会有什么样的商业模式?

刘进治:现在大家都在说用不起 " 龙虾 ",因为它白天晚上都要待机跑任务。核心问题是现在还没有做好分层,大家都想一起上最顶的模型,而最顶的模型也意味着后面使用最贵的卡。

但实际上,大量工作比如整理文件、数据,基础模型完全够用了,也就意味着便宜的卡就够了,尤其是国产 GPU。

在商业模式上,C 端我们首先会自营一部分 Token 工厂,架设在自己的平台上,我们会做好调试工作,保证用户可以自己选择想要的模型,同时给出最优选。B 端我们可以和企业合作,为自己的私有化智算集群提供服务,甚至从头给它设计,看匹配什么样的卡型来满足它的具体场景。

36氪

36氪

让创业更简单

订阅

觉得文章不错,微信扫描分享好友

扫码分享

热门推荐

查看更多内容

企业资讯

查看更多内容