96 年创始人率 00 后博士团队,押注具身智能最难赛道,端到端能否取代分层?
机器人卡丁车视频惊艳亮相周末有人在家刷社交平台时被一个视频惊艳到。视频中一个机器人驾驶卡丁车在赛道上飞驰过弯、加速、打方向一镜到底。与展会上机器人跑步、带火花闪电的画风不同视频里的机器人像老司机高速过弯、灵活避障一气呵成。和以往慢吞吞走过去、弯腰拿东西的机器人 demo 相比该机器人手眼脚同步协同在全速状态下完成多接触点平衡和精细力控。这种人形双足机器人全身协同完成细节操作的情况此前在人形机器人演示里几乎没出现过。共生知行团队背景与理念放出这段视频的是共生知行公司该公司做双足人形机器人的端到端感控一体化「大脑」即基座模型。创始人丁鹏翔 96 年出生核心团队其余成员全是 00 后全员博士在读公司成立刚满两个月。对于这个看似「不务正业」的 Demo丁鹏翔表示希望机器人更像人而非只做机械的服务功能就像人能开卡丁车机器人也应能做到。挑战端到端赛道的缘由「端到端」双足人形机器人模型赛道很新市面上找不到现成人才。按丁鹏翔说法这个方向近两年才热起来懂技术的人还在读博士已毕业多年的跟不上节奏没读到博士的对底层理解不足。共生知行团队是年轻又前沿的一批人他们斩获国内具身智能领域两项 Best Paper并有一项入选 Best Paper Candidate还打造了国内首个 GitHub Stars 突破 2K 的具身基座模型。他们是国内最早探索具身基座模型的先行者和坚定的长期主义者团队累计发表 40 余篇顶会论文技术版图覆盖全栈有一系列行业首创工作。他们判断机器人最终广泛进入人类生活的形态是双足端到端是效率最高的技术模式这源自一线研究经验。分层方案的问题与端到端的趋势早在 2023 年 12 月丁鹏翔就开始给四足机器人装「大脑」发布 QUAR - VLA提出「大脑管理解决策、小脑管运动执行」的分层思路如今 Figure 等公司仍沿用。但在后续研究中他发现分层是「理论上可行、但不那么优雅的方案」存在结构上的先天缺陷会增加级联误差和信息损失无法实现真正意义上的 Scaling。他从自动驾驶和大模型发展观察到特斯拉 FSD 转向端到端后性能大幅提升认为机器人可能也会有类似变化。2026 年谷歌的 Gemini Robotics 2 用单一策略统一全身动作而 RSS 2026 顶会共识认为分层模块化是现阶段最优落地方案共生知行押注的纯端到端是更激进、更少人走的路。选择双足机器人的原因丁鹏翔依据第一性原理认为人类社会的建筑、工具、环境是按人的身体构型造的轮式只能在产线和商场干活双足能出门、上下楼、开车跨场景完成不同任务有通用性和拟人化亲和感。时机也很关键2026 年 4 月之前双足人形没有通用遥操作模型英伟达 Sonic 开源后行业才有大规模生产数据的基石共生知行赌的就是这个中间窗口。技术分水岭动力学挑战现在绝大多数机器人基座模型学的是运动学而双足机器人面对的是全身动力学。一台 g1 双足人形有 29 个自由度比机械臂的 7 个自由度复杂得多。从运动学到动力学从完成任务到保持稳定是双足机器人模型的技术分水岭。共生知行把模型做到 Joint Target 关节目标层拿掉分层方案中的中间环节让模型直接面对身体状态。但这样机器人能否站稳成问题因为光靠模仿学习模型缺从失败里站稳的能力。共生知行有一套「任务行为建模—运动先验蒸馏」的双域协同优化机制将「准确完成任务」与「稳定控制身体」能力融入同一模型其运动能力汇聚模块 Motion Expert 规模接近 1B并通过蒸馏吸收不同运控模型能力。端到端大模型还要解决机器人输出的力共生知行先让 Force Expert 学习施力等再融入 Motion Expert 和最终模型这就是共生「全身物理世界模型」的含义。数据荒与模型能力追求模型训练面临数据荒全球合规机器人数据截至 2026 年初约 50 万小时不足大语言模型的两万分之一且很多数据对全身移动操作帮助有限。共生知行 Blog 放出约 1 万多小时数据自采几千小时。他们用 TrajBooster 从机械臂或轮式机器人提取末端轨迹为预训练提供数据。丁鹏翔不用「泛化」追求「涌现」即模型能在关节角层面组合出新技能。他推断十万小时左右数据多是实验室级 Demo百万小时后才有大规模商业意义。目前行业连合适的数据形式都未收敛他认为人形机器人当前最难的三个问题是感知和控制的结合方式、数据类型和数据规模。团队的前沿探索与期望让卡丁车全速过弯的是一群还没毕业的年轻人他们押注具身智能最难、最前沿的方向赌端到端终将取代分层。行业还未证明终局路线跑通双足基础模型行业也未真正收敛。但一支创业团队的前沿性在于更早看见重要问题并在答案不明朗时动手去解。丁鹏翔希望中国团队设计的机器人模型架构能被北美同行广泛采用引领技术发展。那么他们能否成功呢