智快网
快讯 行业 产业 汽车 科技 AI+ 热点

阿里Qwen团队发布机器人三大基础模型 赋能机器人“思考”“行动”与“预测”

2026-06-17来源:互联网编辑:瑞雪

Qwen团队近日宣布推出一套全新的机器人套件,包含Qwen-RobotNav、Qwen-RobotManip与Qwen-RobotWorld三大基础模型。这一创新成果标志着语言与物理动作的深度融合迈入新阶段,为机器人执行复杂任务提供了更智能的解决方案。

Qwen-RobotNav专注于移动控制领域,通过可控观测编码和工具接口技术,将视觉语言能力转化为精准的移动指令。该模型实现了指令跟随、点/目标导航、目标追踪和自动驾驶四类任务的统一处理,使机器人能够根据语言指令完成动态环境中的路径规划与实时调整。

在操作控制方面,Qwen-RobotManip通过标准化状态-动作空间和末端执行器增量位姿计算,构建了视觉语言与机械臂控制的桥梁。基于超过38,100小时的开源数据语料库,该模型支持多机型训练,能够准确理解"抓取左侧杯子"或"调整工具角度"等复杂操作指令。

Qwen-RobotWorld则开创性地引入自然语言动作接口,将视觉语言能力扩展至世界动态预测。该模型突破单一场景限制,可同时处理操作、驾驶和导航场景下的物理规律预测,例如通过语言描述就能模拟"推倒积木后其他物体的运动轨迹"等复杂物理现象。

三大模型均采用语言优先接口设计,可与通用大模型无缝对接组成物理智能体系统。实际测试中,Qwen团队已验证该系统能完成从语言理解到物理任务执行的完整闭环,包括实时任务分解、多步骤推理和自主纠错能力。例如当机器人执行"将红色方块移到蓝色区域"任务时,若途中遇到障碍物,系统会自动重新规划路径并调整操作策略。

Mindbeam AI发布开源框架Litespark-Inference:让CPU在AI推理中大放异彩
成立仅两年的初创公司 Mindbeam AI 今日发布了一款名为 Litespark-Inference 的开源人工智能推理框架。该框架旨在通过优化算法,让大型语言模型(LLM)在标准消费级中央处理器(CP…

2026-06-17

华为浏览器MAU达3.8亿:AI赋能下内容体验密度升级的长期探索
华为浏览器信息流在技术与分发逻辑之外,内容生产端同样也在联合内容伙伴进行新的尝试。华为浏览器恰好补上了这一环,AI能力能识别用户所处的出行阶段,分发引擎能将专业内容精准推给真正有需求的人,让深度内容不再曲高…

2026-06-17

台积电携手伙伴验证玻璃基板技术 封装性能提升迈向产业化新阶段
封装翘曲相关指标COP改善16%,有效控制封装翘曲程度测试样品采用0.8毫米玻璃核心基板,封装规格为5倍光罩CoW,整体封装尺寸达85×110毫米,属于大型AI GPU封装等级。业内人士指出,玻璃基板的全…

2026-06-17

三星Galaxy Z Fold8获认证入网,7月发布成安卓首款阔折叠新机
快科技6月16日消息,三星将在今年7月份正式发布Galaxy Z Fold8和Galaxy Z Fold8Ultra两款折叠屏,其中Galaxy Z Fold8采用全新的阔折叠形态,是整个安卓阵营首款量产落…

2026-06-17

Apple iOS 27新动向:简化表盘、Siri扩展及自定义相机功能9月待发
A:根据彭博社 Mark Gurman 的报道,iOS 27 目前仍有三项功能尚未正式发布,分别是简化版 Apple Watch Ultra表盘、Siri 第三方聊天机器人扩展接口,以及可自定义控件的相机…

2026-06-17