TwelveLabs 推出用于第一人称视频分析的 Pegasus 1.6 AI 模型

TwelveLabs 于 7 日宣布推出 Pegasus 1.6,这是一种旨在处理第一人称视频数据的视觉语言模型(VLM),用于解决物理 AI 开发中的关键挑战。该模型使 AI 系统能够理解通过运动相机和智能眼镜从人类视角捕捉的自我中心视频片段。TwelveLabs 是一家多模态视频理解 AI 公司,为媒体、娱乐、体育和公共部门应用开发通用视频理解技术,专注于解读海量视频内容中的动作、事件和情境关系。

Pegasus 1.6 为视频数据处理提供五项核心功能

Pegasus 1.6 提供五项核心能力,可对视频数据进行分类,并将其优化为适合机器学习应用的格式。该模型能够执行动作分段与标注、详细字幕标注、质量评估、搜索与整理,以及隐私和合规检测。这些功能使模型能够识别视频片段中的人类动作、周围物体和情境顺序,然后对任务进行分段和描述。例如,当一名工人拿起特定零件、使用工具完成一项任务,然后移动完成的物体时,该模型会识别每个动作、出现的物体以及动作顺序,从而构建信息结构。

TwelveLabs 解决物理 AI 开发中的自我中心数据挑战

物理 AI 开发面临的主要挑战之一,是让 AI 系统理解从第一人称视角拍摄的视频。自我中心数据是指从人类视角拍摄的第一人称视频片段,通常通过让工人佩戴运动相机或智能眼镜,记录其执行特定动作的过程来收集。仅获取第一人称视频并不足以构建机器人训练数据。该过程需要选择适合学习的场景,对视频中的人类动作进行分段,并详细识别双手与哪些工具或物体发生了互动,以及产生了什么结果——这类似于人眼识别视频、大脑处理其中信息的方式。

CEO 将 Pegasus 1.6 描述为视频理解使命的自然演进

TwelveLabs 首席执行官 Jaesung Lee 表示,公司始终坚持的发展方向,是通过视频让机器理解现实世界的运作方式。Lee 将物理 AI 描述为这一方向上的自然进步。该公司的方法侧重于开发让机器通过视觉数据理解现实的技术,而 Pegasus 1.6 则代表了这一持续使命的进一步发展。

常见问题

TwelveLabs 于 7 日宣布了什么?
TwelveLabs 宣布推出 Pegasus 1.6,这是一种旨在处理第一人称视频数据、用于物理 AI 应用的视觉语言模型。

Pegasus 1.6 的五项核心功能是什么?
Pegasus 1.6 能够执行动作分段与标注、详细字幕标注、质量评估、搜索与整理,以及隐私和合规检测,从而对视频数据进行分类和优化,使其适用于机器学习。

免责声明:以上内容(如有图片或视频亦包括在内)均为平台用户上传并发布,本平台仅提供信息存储服务,对本页面内容所引致的错误、不确或遗漏,概不负任何法律责任,相关信息仅供参考。

本站尊重他人的知识产权、名誉权等法律法规所规定的合法权益!如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到qklwk88@163.com,本站相关工作人员将会进行核查处理回复

赞 (0)
上一篇 2026年10月7日 上午9:38
下一篇 2026年10月7日 上午9:45

相关推荐

风险提示:理性看待区块链,提高风险意识!