Reward AI 推出可从人类数据中学习的 OM-1 机器人模型

Reward AI推出了 OM-1,这是一款旨在直接从人类操作数据中获取物理智能的机器人基础模型。该公司称,该系统无需遥操作数据、在机器人上进行训练或针对特定机器人进行微调,即可在不同机器人本体之间实现零样本泛化,包括桌面机械臂、工业机械臂和人形机器人。该方法将人类示范采集、感知、学习、推理和控制整合为一个单一的栈。

Omnibody Hand采集人类操作数据

该系统的基础是 Omnibody Hand,这是一款基于团队此前斯坦福研究项目 DexCap 打造的可穿戴七自由度设备。该手部设备并非逐关节复制人手,而是围绕功能能力进行设计:选择有用的接触点、在掌中重新调整物体方向,以及在精确抓握和力量抓握之间平稳转型。符合人体工学的设计能够适应手部大小和手指比例的差异,确保记录的动作反映自然且未经补偿的人类行为。

在此基础上的是“One Data Interface”层,它结合高频触觉反馈、接近感知、手部内置全局快门摄像头和电磁手部姿态追踪,以人类动作的全速采集示范。该公司报告称,在受控测试中,通过电磁感知增强视觉惯性追踪,使高速状态下的平均超调误差降低了 60%;同时,力数据会沿轨迹记录,使示范同时编码动作路径及其背后的用力程度。

OM-1仅使用人类示范进行训练

OM-1仅使用人类数据进行训练。据 Reward AI 称,训练期间既不使用遥操作,也不使用任何在机器人上获取的经验;相反,该策略直接从人类动作中学习生成机器人动作,将团队所称的潜意识物理智能提炼到一个统一模型中。由于所有示范都通过同一数据接口输入,预训练和后训练被合并为单一阶段——新数据无需重新采集,也无需针对每个机器人、任务或部署单独建立训练流程。

在架构上,OM-1以各自的原生采样率处理每种感知模态——图像、触觉信号、手指间的接近信号和手部姿态轨迹,在保留较慢视觉上下文的同时保留高频接触线索。这些数据流的时间历史使策略能够推理接触和交易进度如何演变。在其底层,一个以高频运行的基于强化学习的控制层会将动作转化为适用于任意给定机器人本体的执行信号,同时补偿动力学、扰动和系统延迟,并优化连续策略预测之间的转型过程,使运动在高速下保持平滑。

系统从少于 30 分钟的数据中学习任务

公司在结论中表示,OM-1能够从少于 30 分钟的数据中学会全新任务,包括具有挑战性的动力学任务和长时域任务。如果得到验证,这种方法将人类示范采集、感知、学习、推理和控制整合为一个单一的栈——该公司认为,这一栈面向尚未设计出来的机器人硬件,能够适应未来发展。

常见问题

Reward AI 的 OM-1 机器人模型是什么?
OM-1是 Reward AI 推出的机器人基础模型,能够直接从人类操作数据中获取物理智能。该系统无需遥操作数据、在机器人上进行训练或针对特定机器人进行微调,即可在不同机器人本体之间实现零样本泛化,包括桌面机械臂、工业机械臂和人形机器人。

OM-1如何学习操作任务?
OM-1仅使用通过 Omnibody Hand 采集的人类数据进行训练。Omnibody Hand 是一款可穿戴七自由度设备。训练期间,系统无需遥操作或机器人上的经验,即可直接从人类动作中学习生成机器人动作。该公司表示,OM-1能够从少于 30 分钟的数据中学会全新任务。

Omnibody Hand 使用了哪些技术?
Omnibody Hand 结合高频触觉反馈、接近感知、手部内置全局快门摄像头和电磁手部姿态追踪,以人类动作的全速采集示范。据该公司称,在受控测试中,通过电磁感知增强视觉惯性追踪,使高速状态下的平均超调误差降低了 60%。

免责声明:以上内容(如有图片或视频亦包括在内)均为平台用户上传并发布,本平台仅提供信息存储服务,对本页面内容所引致的错误、不确或遗漏,概不负任何法律责任,相关信息仅供参考。

本站尊重他人的知识产权、名誉权等法律法规所规定的合法权益!如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到qklwk88@163.com,本站相关工作人员将会进行核查处理回复

(0)
上一篇 2026年9月15日 下午9:52
下一篇 2026年2月4日 上午11:16

相关推荐

风险提示:理性看待区块链,提高风险意识!