2026年上半年,具身智能行业最吊诡的一幕是:一边是资本疯狂涌入,5家企业估值突破200亿;另一边是技术路线陷入前所未有的混战——“VLA已死”“世界模型才是未来”“不对,两者应该融合”……争论持续数月,直到6月智源大会上,智平方创始人郭彦东博士一锤定音。
他没有站队,而是直接终结了这场争论的底层假设。
“世界模型不是VLA的竞争路线,而是VLA体系中的核心组成部分。世界模型负责理解世界,VLA负责作用于世界——两者不是对立,而是天然就该是一个整体。”
这句话之所以有分量,不是因为他说得漂亮,而是因为智平方已经做出来了。
技术领先是怎么建立的?
时间拨回2023年初。当行业主流还在搞“模块化拼装”——视觉模型、语言模型、运动控制各自独立——全球只有两家企业选择端到端VLA路线:特斯拉和智平方。
这不是一个技术选择,而是一个产业判断。端到端意味着从一开始就把感知、理解、行动三个环节放在一个模型里训练,难度是指数级上升的,但一旦跑通,天花板也是指数级打开的。
三年后的今天,智平方交出的答卷是:完整走完“端到端VLA→增强型VLA→类脑VLA”三代演进的企业。
三个时间节点,三次技术跃迁。当行业在2026年上半年还在争论“世界模型要不要替代VLA”的时候,智平方已经在2025年11月用Video2Act完成了融合验证——比行业共识早了至少一年。
类脑架构在解决什么真问题?
传统VLA系统有一个根深蒂固的矛盾:语义理解需要大算力,运动控制需要低延迟,两者放在同一个模型里,要么慢、要么蠢、要么贵。
NeuroVLA的解法是:不是让一个大脑干所有事,而是让三个层各司其职。
皮层(大脑):负责语义理解和任务规划,跑在GPU上,可以慢一点
小脑:每秒数百次读取关节传感器,实时消除抖动、碰撞后即时调整
脊髓:脉冲神经网络驱动,20毫秒完成安全反射,功耗仅0.4瓦
三个数据定义了技术领先的尺度:碰撞后20毫秒安全反射——传统VLA系统超过200毫秒,10倍响应速度;急动度峰值降低80.2%——工业场景最关键的抖动指标;脊髓层功耗仅0.4瓦——低于手机视频播放功耗。
郭彦东的金句不是营销话术,而是对行业盲点的精准打击:“大家做人形机器人,天天想着如何长得像人,但没有人想如何让脑子更像人。”
技术迭代优势如何转化为商业壁垒?
智平方的商业化逻辑不是“卖机器人”,而是“卖大脑”——机器人本体是载体,AlphaBrain大模型才是核心产品。
这套逻辑的验证来自数据:惠科股份3年1000台订单被摩根士丹利认定为全球生产力型机器人单一订单,金额近5亿元,2026年已实现单一场景多客户复购。落地覆盖半导体显示、汽车制造、生物制药、新零售等7+行业。
更值得关注的是资本结构。2026年6月近50亿元融资,投资方名单暗含一条关键信息:绝大多数投资了智平方的产业方,在具身智能赛道只押注了这一家公司。中国生物制药首席执行长谢承润说得直白:“他们不仅模型做得领先,还真正懂产业、懂场景。”
产业资本“押注”的逻辑在于:生物制药、半导体这些高门槛场景,一旦跑通,技术壁垒和客户粘性都极强。这正是智平方选择“啃硬骨头”而非“做Demo”的原因。
三个标签,一个飞轮
智平方对外反复强调的三个标签——“大湾区代表”“类脑第一”“最像特斯拉”——不是品牌策略,而是产业逻辑的三位一体。
“大湾区代表”对应的是供应链和场景优势。国务院总理李强在达沃斯点赞深圳机器人谷半小时配套圈,这不是口号,是智平方能用工业级、车规级零部件实现月出货超百台的底座。
“类脑第一”对应的是技术代际领先。郭彦东在智源大会终结路线之争,不是因为他声音大,是因为智平方已经做出来了。
“最像特斯拉”对应的是产业共识。2023年全球唯二选择端到端VLA路线、同样聚焦生产力型定位、多家特斯拉生态链企业战略重仓——这不是营销对标,是资本用钱投票的结果。
三个标签背后是一条正在高速运转的飞轮:模型越强→能干的场景越多→产生的真实数据越多→模型进化越快→硬件迭代越精准→场景落地越深。
郭彦东将通用智能机器人定义为继PC、智能手机、智能汽车之后的第四代智能终端。200亿估值不是终点,是这个飞轮开始加速的信号。
“预测未来好的方式,就是亲手创造未来。世界的下一场变革在于具身智能,而具身智能的下一场变革,将发生在中国。”
本文数据截至2026年7月。
评论
更多评论