发现者网
产业经济 科技业界 3C数码 文化传媒 移动智能 家电行业 AI大模型 汽车出行 热点资讯

北大等高校联合研发ω-0模型:突破“先走后做”局限,引领人形机器人居家作业新变革

2026-08-13来源:快讯编辑:瑞雪

家庭场景被视为人形机器人最具潜力的应用领域,却也是技术突破难度最大的试验场。与工厂流水线中结构化、可预判的操作环境不同,家庭空间充满动态变量:堆满杂物的桌面、散落一地的玩具、需要侧身避让的家具,甚至擦窗时需同步调整身体重心以维持平衡。这些对人类而言稀松平常的家务,却对机器人提出极高要求——既要精准感知环境变化,又要实现全身动作的动态协调。

近日,由南洋理工大学、北京大学、香港科技大学(广州)及智源研究院联合研发的ω-0模型,为破解这一难题提供了新思路。该模型通过构建隐空间预测框架,将语言指令、环境感知与动作生成整合为统一流程。输入指令后,系统可同步解析空间布局、物体位置及机器人自身状态,直接输出底层控制器可执行的精简动作指令,支持“移动中操作”的全身协同任务。

研发团队选取11项高难度居家任务进行真机测试,涵盖跨区域物品收纳、高低位杂物清理、动态避障等复合场景。结果显示,ω-0在第一视角任务中成功率达79.1%,全场景模式下更突破81.8%,显著优于π-0.5、EgoVLA等主流模型。这一突破标志着机器人从“分步执行”向“连续协同”的模式跃迁——例如擦大尺寸桌面时,机械臂可随移动持续调整擦拭轨迹,无需停顿重新定位;拖地时双腿能根据手臂用力方向动态平衡重心,避免打滑或倾倒。

技术层面,ω-0摒弃了传统“视频-动作”逆向转换路径,转而采用查询表征架构。该架构通过未来视觉特征预测任务进度与场景演变,同时由动作分支直接生成全身潜在指令。为适应真实家庭环境的复杂性,团队设计了三阶段递进训练体系:第一阶段通过全身动作VLM预训练构建基础能力;第二阶段融合视觉、语言及本体数据,利用视频查询预判环境动态变化;第三阶段引入40.3小时真实居家数据,涵盖4827条任务轨迹及24类场景,使模型具备自主适配能力。

为降低行业训练成本,研究团队同步开源了ω-HOME数据集。该数据集包含多视角语言指令、本体状态及运动轨迹等同步采集信息,每条轨迹均标注第一视角与第三视角画面,为下游任务提供高密度训练样本。这一资源开放或将加速全身协同技术在机器人领域的普及。

尽管81.8%的成功率已属行业领先,但距离真正融入家庭仍存在挑战。当前模型在极端复杂场景中的稳定性、长期运行的自主维护能力等方面仍有提升空间。不过,其核心价值在于验证了“全身整体决策”的技术路径——当机器人的四肢与躯干不再各自为政,而是形成动态协调的有机整体,实验室中的技术演示才有望转化为真实生活中的服务能力。

1987年中国首位手机用户诞生,“大哥大”开启移动通信新纪元
他不是去寄信,也不是去装固定电话,而是准备买一件当时许多人只在影视画面里见过的新东西:移动电话。 一部曾经被拿来和房子比较的手机,如今成了博物馆式的老物件;过去需要多年收入才能拥有的移动通信能力,已经装进了…

2026-08-13

马斯克放话:未来四五年AI成SpaceX核心,算力提升或带来巨额收益
IT之家 8 月 12 日消息,SpaceX 创始人兼 CEO 埃隆 · 马斯克在公司 8 月 11 日发布于 X 的员工讲话中称:“我们的AI 收入可能到 9 月,也就是下个月,就会超过 SpaceX 其…

2026-08-13

马斯克推Grok Bot:AI化身全天候“打工人”,自主协作背后是效率狂飙还是失控隐患?
那些不提供 API 接口、也没有 MCP 支持的传统软件,对 Grok Bot来说同样可以操作,因为它是在界面层上直接操作的,和你一样。你可以「录制」工作流程:向 Grok Bot 显示任务,它会保存步骤…

2026-08-12

Gemini月活破10亿追平ChatGPT,消费级AI市场格局生变竞争升级
分析指出,周活与月活用户之间并无直接可比性,但综合现有数据的最简单解读是:ChatGPT仍是用户规模更大的平台,而Gemini的增速可能更快。在平台分布上,Gemini首席负责人Josh Woodward…

2026-08-12

奥特曼放话:6个月后,AI助理或深度融入生活开启人机共生新篇
而且计算效率提升了约5倍,这也是它能下放到免费用户层的原因。Mem0这类记忆层项目想做的,是变成一层跨平台的记忆中间件,同时对接OpenAI、Anthropic、开源模型,让开发者不必被锁死在某一家。 但…

2026-08-12