关于ZAKER Skills 合作
36氪 24分钟前

具身 Best Paper 团队组团下场,攻克感控一体大脑模型

卡丁车,这个人类都未必开得好的玩意儿,居然被一台双足人形机器人攻克了??

从 " 走到车边 "、" 坐上车 " 开始,机器人自己看路,自己打方向、踩油门。

右脚控制力度,双手持续修正方向,视觉判断赛道变化,同时需要不断调整重心,维持全身平衡。

好家伙,多接触点平衡,手、眼、脚、脑、全身协同,极其精细的力控程度,一个机器人备全了。

拿出这套方案的公司,共生知行,成立到现在,才刚刚一个多月。

而最惊人的是,视频里这个双足人形机器人,用的竟然是领先行业的原创端到端感控一体化方案,打穿了当前主流具身智能 " 大脑 + 小脑 " 的割裂矛盾,不再把感知、决策、运控拆成几个相对独立的模块,而是让一个模型从看到世界开始,一路输出到机器人最终动作。

要知道,端到端(end-to-end)与全身智能(Whole-Body Intelligence),是 2026 年具身智能学术届关注度最高的技术路径,全球顶尖实验室 / 顶尖企业拿出成果的都寥寥无几,竟然被一家成立不到两个月的年轻中国公司这么水灵灵地做出来了?

共生知行到底是谁?

01. 具身智能 Best Paper" 天团 "

共生知行成立于今年 6 月底,距今还不到 60 天。

如果说这家公司第一个 " 离谱 " 的地方,是成立一个多月就直接拿出了领先行业的感控一体大脑模型成果。那第二个 " 离谱 " 的地方,就是这家公司的创始团队们。

共生知行的创始团队,几乎是一支具身智能 Best Paper 青年天团。

CEO 丁鹏翔,95 后,浙大 & 西湖大学博士,导师王东林。深耕具身智能,履历里有着一串堪称 " 科研圈爽文 " 的耀眼成绩:

国际首个四足 VLA(QUAR-VLA, ECCV 2024)和首个人形 VLA(Humanoid-VLA, 2025.02)一作,ReconVLA(AAAI 2026 Best Paper)核心作者,0.5 亿参数轻量化标杆 VLA-Adapter 一作(一周内 GitHub Star 突破 1k,目前 2k+,是国内开源 VLA 最高 Star 项目,也是全球第五个过千 Star 的 VLA 项目)、具身智能开源社区 OpenHelix Robotics(累计 5k+Star)创始人、国内具身智能博士引用量前五。

核心团队里的其他 " 小天才 " 们,更是不遑多让。

人均博士,人均 00 后,人均顶会,是国内(甚至世界范围内)都罕见的、在四足、机械臂、人形机器人上都有基座模型的团队,其成果涵盖:

• 击败 Pi0.5,拿下全球华人团队首篇 Robotics 顶会 Best Paper 的 CoRL 一作;

•IJCNN Best Paper Candidate;

• 提出首个面向全尺寸双足人形机器人的跨本体 Whole-Body Manipulation Model 的 HEX 一作;

• 全球首批开源人行遥操系统 OpenWBC 一作;

• 引发业内高度关注的首个 Loco-manipulation VLA Trajbooster 一作,直接 " 击穿 " 了跨本体数据利用效率 ……

Loco-manipulation、四足、机械臂、人形、WBC 数采、预训练、后训练、运控、跨本体 ……

其能力之扎实、研究之领先,简直把过去两年国内具身智能最前沿的一批博士论文作者,直接塞进了同一家公司里。

更关键的是,他们并不是各自 " 发过几篇论文 " 这么简单,国际 Loco-manipulation 领域最前沿 5 篇工作中的 3 篇,一个不到 20 人的创业团队,Best Paper 密度高得有点不讲武德。

中国具身智能最年轻的一批 " 论文一作 ",开始组团下场。

有趣的是,对具身智能赛道密切关注的人会发现,共生知行并不是孤例。

过去半年间,具身智能赛道正在悄然进行着一场人才范式 " 大迁移 "。前两年,中国具身智能最典型的创业范式,是教授下场。高校实验室先积累几年技术,教授成为公司的技术旗帜,再带着博士、硕士和实验室成果进入产业。一批明星具身智能创业公司背后,都能找到这样的路径。

但从 2026 年开始,越来越多靠近科研一线的年轻博士,开始自己下场。

为什么?无他,技术太快了。2023 年,行业还在讨论机器人究竟需不需要 " 大模型 ";2024 年,VLA 开始成为核心概念;2025 年,Figure Helix 等双系统模型迅速走红;到了 2026 年,行业全在讨论 " 端到端 "。

这也导致今天行业里出现了一个很有意思的 " 知识倒挂 ":最顶尖的具身智能技术认知,未必掌握在行业 " 资深 " 大佬里,真正最早知道下一代技术范式的人,可能是每天亲自看数据、调模型、摔机器人的一线博士生。

哪个方案只是 Benchmark 漂亮,哪个方法一上真机就崩,技术暗涌下,最顶尖的技术、人才、资源流向何处,得去问刚把模型跑通的博士生。

这种变化,大模型行业其实已经演示过一次。DeepSeek 创始人梁文锋曾在 36 氪的采访中介绍过核心团队的画像:" 都是一些 Top 高校的应届毕业生、没毕业的博四、博五实习生,还有一些毕业才几年的年轻人。"

国内如此,国外也是。

大模型如此,具身智能也是。

02. 端到端,具身智能 " 终局 "

最前沿的团队,最具颠覆性的人才架构,拿出的自然也得是最前沿、最具颠覆性的成果。

上文提到,共生知行的颠覆性,在于其推翻了当前主流的 " 分层 " 方案,直接瞄准了端到端感知控制一体化这个世界难题。

要理解其颠覆性,首先要知道。过去几年,人形机器人的主流思路,本质上还是 " 分层 ",或者说 " 大脑 + 小脑 "。其中上层大脑负责感知、理解和规划;下层小脑负责运动控制和平衡。

共生知行团队是国内最早提出这一架构的团队之一,其在 2023 年就发布了相关成果。

然而,在过去两年间," 分层方案 " 的问题也不断凸显。由于其上下层之间存在天然的间接级联误差,感知和控制映射无法直接联系," 大脑 " 也极难拿到 " 小脑 " 的动作反馈,致使任务效果不佳。

如果类比人类:人去接一个正在掉下桌子的杯子,不会先完成视觉理解,再暂停一下生成轨迹,最后调用手臂;往往在眼睛看到杯子落下的同时,身体已经前倾,手也伸出去了。感知、动作、平衡,本来就是一件事。

而对于双足人形机器人,这个问题会更加极端。机器人的额每一次抬手、转身、弯腰,都会改变身体重心;脚底接触力变化,又会反过来影响上半身动作。上下肢割裂、任务语义无法进行下半身控制和力度控制、失败恢复链路长、数据和目标难以统一 ……

这也是为什么,目前市面上大部分双足人形机器人的演示中,极少能够看到像共生知行 " 开卡丁车 " 一样,需要手、眼、脑、全身协作配合的动作展示。不是不想,是做不到。

行业已经认识到这个问题了。自 2025 年下半年开始,在行业顶会中,"Whole-Body Intelligence(全身具身智能)" 与 " 端到端 " 已经成为公认的下一方向,只是目前能够拿出结果的寥寥无几。

共生知行瞄准的,就是这一方向。

共生知行的 DPC(Direct Perception Control Model 直接感控一体化模型),正是一套打通了机器人 " 大脑 + 小脑 " 壁障的,直接实现端到端、全身协同操作的 Loco-manipulation 感知控制一体化基座模型。

其输入为多模态信息感知数据(视觉、语言、Robot Stat、物理信号);中间经过 Unified Perception Control Model,从视觉、语言、本体、历史反馈和接触反馈直接生成具有力反馈的全身动作。

最后能够直接输出全身协调的关节力矩,瞄准的正是原生交互的全身具身智能(Interaction - Native Whole - Body Intelligence)赛道 " 终局 "。

尤为值得关注的是,共生知行团队率先验证了多源异构数据训练能够有效实现人形机器人全身数据 Scaling,其无本体预训练算法仅需极少量真实数据即可实现复杂的全身协同操作。

相较于传统方案,共生知行的 DPC(直接感控一体化模型)能够将大小脑的感知和控制信号同步优化(开卡丁车时的手眼脑全身协调),极大提升了机器人的柔顺力控能力(卡丁车油门踏板的按压幅度与车体速度),同时能够实现同一套基座模型跨本体、跨构型的通用适配,在真实场景中也拥有强大的零样本泛化能力。

今天," 端到端 " 是具身智能研究最前沿的共识方向,也是 2026 年行业公认的 " 下一代机器人大脑 " 演进方向。

过去两年,运控 WBC 技术成熟、可用数据指数级爆发、VAM 感知决策一体化基座模型路线开始收敛,挡在具身智能感知控制一体化大脑面前的 " 三座大山 " 已经逐渐被移走。

"2026 年,三个条件同时满足了。现在是双足人形端到端感控一体化大脑的窗口期,大概有 6-7 个月,甚至只有 4-5 个月,它不会开很久。" 共生知行 CEO 丁鹏翔告诉 36 氪。

抓住窗口,很重要;" 赢一次 ",很重要。

但还不够。

03. 重要的不只是能 " 赢 ",要能 " 一直赢 "

" 人类社会的方方面面,都是为人类构型所设计的,很多场景只有双足人形构型能够去实现。从第一性原理角度考虑,双足人形机器人一定是未来的终局。" 在采访中,丁鹏翔告诉 36 氪。

共生知行所瞄准的不是短期落地,也不是任何 " 好摘的果子 ",而是一个更宏大、更通用的具身智能 AGI 未来。

这无疑是个非常前沿,甚至非常激进的未来。

但从 2022 年以来,共生知行的团队几乎 " 赌 " 对了具身智能所有技术发展的方向,从 Humanoid-VLA 提供任务理解、视觉 Grounding 和动作语义入口;到 TrajBooster 为端到端 Whole-body Action Model 提供数据飞轮;再到 HEX 为端到端模型提供 Humanoid-native State 和 Action 表示基础,再到通过蒸馏逐步将 Force 小脑 / 安全接触专家融入端到端模型 ……

赌对了一次是 " 赌 ",赌对十次,那可不是一句运气好可以解释的。

" 我们团队一直在引领双足人形 Loco-manipulation 的发展,我们既是行业的参与者,也是行业标准的制定者。" 丁鹏翔说。

而在 2026 年,共生知行押注的是双足人形端到端感控一体大脑模型,并且告诉大家,这将是产业的终局。

而他们的 " 底气 ",正是持续深耕具身智能行业,从不为陈旧的方法论所限,不断突破,不断探索;不只 " 赢一次 ",还要 " 一直赢 "。

在他们身上,我们也能看到中国创新范式的悄然变化。

过去很长时间,中国科技产业最擅长的是工程化、产业化、把技术做得更快、更便宜、更大规模。但在最前沿的基础模型、算法范式上,行业往往习惯先看硅谷出了什么,再讨论中国怎么跟。

过去几年,这个节奏开始变了。

大模型领域,DeepSeek 已经证明,中国一群平均年龄并不大的研究者,同样可以在全球最前沿的问题上给出自己的答案,给出从 0 到 1 的突破性创新。

现在,相似的一幕正在具身智能发生,主角们甚至更年轻。

今天的具身智能赛道上,"00 后 " 玩家越来越多了。他们可能还是博四、博五的学生,可能刚过 25 岁,但他们已经在写全球最前沿的论文、拿 Best Paper、定义最新的模型架构,然后推动整个产业的发展轨迹。

这背后真正值得注意的,不只是 " 中国又多了哪几家具身智能创业公司 ",而是中国顶尖的年轻科研人才,与世界创新前沿之间的距离,正在快速缩短、追上、超越,甚至引领整个行业。

如果说过去几年,大模型让世界第一次认真看见了中国年轻 AI 研究者的力量,那么具身智能,可能正在迎来属于中国的下一次 " 世界级时刻 "。

这一次,Best Paper 天团们,也集体下场了。

36氪

36氪

让创业更简单

订阅

觉得文章不错,微信扫描分享好友

扫码分享

热门推荐

查看更多内容

企业资讯

查看更多内容