发现者网
产业经济 科技业界 3C数码 文化传媒 移动智能 家电行业 AI大模型 汽车出行 热点资讯

大晓机器人携手港大推出StreamPI,为机器人时序理解开启时空智能新篇

2026-08-28来源:互联网编辑:瑞雪

在机器人技术领域,大晓机器人与香港大学联合发布了一项名为StreamPI(Streaming Multimodal Temporal Modeling for Vision-Language-Action Models)的全新研究成果,这一突破性进展为解决视觉-语言-动作模型(VLA)长期存在的“单帧智能”瓶颈提供了关键方案,成功为VLA补上了至关重要的“时间维度”。

传统VLA主要依据当前观测进行独立决策,这种“单帧智能”模式限制了机器人的能力。而StreamPI则为模型构建了持续的多模态时序上下文,使机器人能够记住过去、理解状态变化、判断任务进程,还能利用跨帧信息增强精细空间感知与动作决策能力。它推动VLA从单纯“识别当前状态”,迈向“理解正在发生的物理过程”,让机器人对世界的认知从静态画面转变为动态的时间流。

在技术实现上,StreamPI并未采用依赖额外参数堆叠来获取时序能力的方式,而是基于现有的VLA骨干,通过指令持续锚定、历史信息流式缓存与随机时间间隔训练,实现了从单帧决策到连续时序建模的轻量化扩展。这种创新方法避免了因参数堆叠带来的复杂问题,同时保证了模型的高效运行。

真实机器人实验以及在LIBERO、CALVIN等实验环境中的测试结果显示,StreamPI在时序记忆、精细空间操作与长程连续任务等方面取得了显著提升。以“猜杯子”任务为例,物体被藏入杯子并经过多次交换后,答案存在于整个变化过程而非最后一帧,传统单帧决策的机器人难以应对,而StreamPI赋能的机器人能凭借对历史信息的理解准确判断。在滚动物体场景中,单帧只能确定物体位置,连续观测才能理解其运动趋势,StreamPI让机器人真正理解了“物体正往哪里去”。

在给VLA加入时间信息的方法上,以往简单将过去多帧图像组成窗口一次性交给模型的方式存在诸多弊端。历史帧越多,视觉信息量越大,不仅需要反复计算已处理画面,增加推理开销,还易使任务指令被大量视觉信息稀释,导致机器人在长程执行中“忘记目标”。

StreamPI则采用了更科学的方法,它将每个时刻组织为“视觉观测 + 任务指令”的完整时序单元。语言指令持续绑定每次观测,成为贯穿任务始终的语义锚点,让机器人在接收新信息时始终明确目标。在时序单元内部,视觉与语言充分交互;不同单元之间按时间顺序持续读取和聚合历史信息,使模型既能理解当下所见,又能追溯过去发生的事,将离散的单帧判断连接成连续的时序理解。

为了让机器人拥有记忆的同时避免重复计算历史,StreamPI采用流式推理。首帧观测编码后存入键值缓存,后续只需处理新信息并调用历史表示,避免了重复计算整个观测窗口。而且,StreamPI无需额外引入视频编码器或独立记忆模块,通过重构原有VLA的注意力机制,直接继承π0.5的视觉—语言表征能力,在不增加额外模型参数的情况下,让单帧VLA获得连续时序能力。

真实机器人的运行环境复杂,相机采集、模型推理、通信与机械臂执行等环节都会产生延迟,导致观测时间波动,只在固定间隔数据上训练的模型在部署时易遭遇时序分布差异。为此,StreamPI引入随机时间间隔训练,随机改变历史观测间的时间距离并隐藏部分早期信息,让模型适应不同时间跨度和不完整上下文,学习更稳定的时序关系。

实验数据充分证明了StreamPI的有效性。在LIBERO上,随机时间间隔训练策略将三帧输入时的平均成功率从96.4%提升至97.5%,五帧输入时从97.0%提升至98.3%。在更依赖长程上下文的LIBERO - Long任务中,成功率从π0.5的92.4%提升至95.0%。在CALVIN上,StreamPI平均连续任务长度达到4.547,超过π0.5的4.313和MemoryVLA的4.090;任务推进到第五步时,成功率仍达85.0%,高于π0.5的79.5%。

团队还设计了四项真机任务检验StreamPI的时序记忆与精细空间感知能力,每项任务采集100条人类遥操作示范。在“猜杯子”任务中,StreamPI将π0.5的成功率从46.7%提升至80.0%;在滚动物体抓取任务中,从26.7%提升至63.3%。在强调空间精度的窄瓶口插笔任务中,成功率从40.0%提升至66.7%;纸杯插入杯套任务则从60.0%提升至92.0%。这些数据表明,时间不仅为机器人带来记忆,还帮助它更准确地理解空间。

StreamPI的出现,标志着机器人从基于当前状态决策迈向基于连续过程决策的重要转变。它让机器人对现实世界的认知不再局限于彼此孤立的静态画面,而是能够记忆、理解和持续更新时间流中的信息。目前,StreamPI在超长时间跨度训练和极端异步场景下仍有提升空间,但它的探索为机器人技术的发展开辟了新的道路,推动具身基础模型从空间智能向真正面向动态物理世界的时空智能迈进。

48小时深度实测豆包工作:通用Agent难及之处,它给出企业办公新方案
但字节跳动这次入场的打法有点不同,它将豆包在C端积累的自然交互能力与多模态生成优势,与飞书在B端多年的组织协作、文档沉淀和权限体系深度整合,打造了一个能写文档做PPT、生图生视频、搭网页、操作电脑跑任务、读懂…

2026-08-28

AI赋能千行百业催生新岗位,广东北京江苏成人工智能企业聚集高地
人社部发布的新职业中,超30个与AI紧密相关,AI训练师、提示词工程师、数字人设计师等新岗位市场需求持续走高,同时AI工具大幅降低创业门槛,单人即可完成多环节工作实现轻量创业。其中,2026年截至目前新增注册…

2026-08-28

OpenAI Codex新动态:持久化模式曝光,AI化身“永动机”引关注
但在持久化模式下,AI被明确告知:「当你完成用户的请求时,你的工作并没有结束。 近期,奥特曼及多位OpenAI高管在公开和私下场合,都在频繁探讨一种全新的产品形态——「常驻型」(always-on)AI智能体…

2026-08-28

工业读码难题怎么破?海纳自动化深度剖析选型关键与实战方案
实际项目中,许多客户反映读码器在实验室测试时表现良好,上线后却出现偶发漏读,原因往往就是现场安装位置、光源角度或工件表面状态与测试环境存在差异。海纳自动化在欣旺达圆柱电池产线读码升级项目中,通过对原有读码环境…

2026-08-28

OpenAI自研芯片Jalapeño:AI设计新速度,挑战英伟达市场地位
更值得关注的是,这一成绩是在Jalapeño尚未启用投机解码、未做预填充与解码分离部署等优化手段的情况下取得的,而参与对比的其他芯片均已开启各自最优配置。 外界普遍预设Jalapeño是一颗专为OpenAI…

2026-08-28