这种灵巧性背后是庞大的数据支撑。该模型基于超过38100小时的开源机器人数据与人类演示视频进行预训练,覆盖15种机器人形态。这种大规模的统一训练,意在解决机器人模型在切换不同物理平台时常见的性能暴跌问题
。在第三方权威评测中,不同版本在任务成功率上包揽前两名,甚至能完成双手炸薯条这类高难度复杂任务
。
Qwen-RobotNav的独特之处,在于它将五大类不同导航任务统一到一个框架下,无需切换模型。这包括指令跟随、点到点导航、物体目标导航、目标追踪和自动驾驶。模型采用可控观测编码协议和工具接口,将视觉语言理解与运动控制直接对接
。实践中,一个机器人听到“到走廊尽头找会议室”这样的口头指令,就能在陌生空间里动态解析视觉环境并自主导航,而不依赖预先建好的地图
。
Qwen-RobotWorld不只识别某个场景,而是预测该场景下一秒会如何变化。它以自然语言作为统一动作接口,从机器人当前观察出发,生成符合物理规律的未来视频轨迹。这种预测能力横跨机器人操作、自动驾驶、室内导航,甚至人类行为场景。该模型基于超过860万组跨场景训练对训练而成,能模拟1300多种操作技能,覆盖20余种机器人形态
。
Qwen-Robot套件一个至关重要的设计理念,是部署的灵活性。这些模型既可以独立运行——比如在仓库送货车上单独使用Qwen-RobotNav;也可以整合成完整的技术栈。三个模型协同工作时,构成一个闭环系统:RobotNav和RobotManip负责感知,RobotWorld负责预判,三者相互增强,使机器人真正实现“边走、边看、边思考”。
这种全栈式方法与阿里更广泛的模型生态紧密集成,其中就包括作为旗舰的Qwen3.7-Max智能体模型,后者负责处理复杂的任务拆解。该套件从根本上依赖开源数据并向公众发布模型,这也完全契合阿里大规模开发者生态的扩展策略
。
Qwen-Robot的推出并非一场突袭实验,而是阿里巴巴多年来从纯数字AI到物理领域系统性行军的顶点。
2025年10月,千问技术负责人林俊旸就公开宣布,已在千问内部组建一个专门负责机器人与具身智能的小团队。他将此框定为AI智能体的必然下一步,称多模态基础模型“绝对应从虚拟世界迈入物理世界”。仅仅数月后,2026年2月,阿里发布Qwen 3.5,明确将其定位为“AI智能体时代”的模型,能够自主完成复杂的多步骤任务
。这些语言和推理能力,成了此次6月机器人模型发布背后的认知基石
。
除了内部研发,阿里也做了相应的外部布局。2025年,旗下阿里云领投了中国机器人初创公司星尘智能1.4亿美元融资轮。这套多路并进的打法——内部自研、开源模型生态、初创公司投资——将Qwen-Robot套件置于一个更大的雄心之下:为新一代物理智能机器提供一站式“AI工厂”
。
阿里切入具身AI,使其与英伟达这类提供强大仿真与计算堆栈的公司,以及不断涌现的美国具身AI初创公司形成直接竞争。尽管现有资料并未提供直接的性能对比,但Qwen-Robot套件呈现了一个基于集成与可访问性的独特价值主张。
它是一套开放的模块化地基,可在第三方硬件上以最小适配量进行部署。这与封闭垂直集成的路线形成对比,将阿里定位为面向多种机器人制造商的、中立的模型供应商。这家公司最大的资产恰恰是其已有的庞大千问开发者生态。自2023年发布首代模型起,阿里已开源超300个AI模型,累计下载量超6亿次,衍生模型超过17万个。这意味着数量庞大的开发者社区,如今可以直接基于这套机器人地基进行构建。
然而,不确定性也同样巨大。该套件2026年6月方才发布,现有资料缺乏大规模的商业落地指标或长期可靠性数据。模型在高度非结构化、长时间跨度的工业任务中会有怎样的表现,仍然未知。对阿里物理AI野心的真正检验,将在于这套模型的开源可得性能否真正转化为整个机器人行业的大规模采纳。