Induction Labs 的 Photon-1 在 1/30 的计算量下优于 Google Gemini

Induction Labs 于 2026 年 7 月 23 日发布了 Photon-1,这是它所称“想象模型”的首个产品——一种新的基础架构类别,旨在在预训练阶段从互联网规模的视频中学习,而不需要带有标注动作示例的训练数据。该 1060 亿参数的稀疏专家混合(Mixture-of-Experts)Transformer 在 50 亿个激活参数条件下训练完成,并在大约 5.75 亿帧的计算机屏幕录制数据上训练;相当于以 1 帧每秒采样的 18 年视频。该公司声称 Photon-1 在内部计算机使用基准测试中优于谷歌的 Gemini 3.1 Flash-Lite,尽管训练所用计算量至少少了 30 倍;同时,面向每 100 万个 token 的服务成本约为 0.11 美元,而 Gemini 为 0.36 美元,Photon-1 大约便宜 3 倍。该模型挑战了 AI 领域一个长期假设:要教机器行动,就必须为其应执行的每一种动作提供精细标注的示例。Induction Labs 的方案通过让机器仅凭观察未标注的计算机界面视频就能学习过程性知识,从而移除关键瓶颈。

Photon-1 架构与训练规格

Photon-1 从头开始训练,仅进行单个 epoch,训练数据来自从最初的 20 亿个公开可用视频索引中提炼出的数据集;经过筛选后大约得到 200 万段屏幕录制,并借助内部关键帧检测模型去除了冗余帧。训练过程大约需要 30,000 NVIDIA H200 GPU 小时和 4.4 × 10²² 次 FLOPs。每个视频帧通过有限标量量化被压缩为 960 个离散 token,占用仅 2.2 千字节——比现有 OCR 和多模态表征大约小 100 倍——同时仍保留文本、布局以及状态变化。差分潜在编码器以“成对”方式处理帧:编码相邻状态之间的差异,而不是编码帧的绝对内容。模型在学习到的表征空间中使用基于下一潜在 token 的目标,通过自回归方式预测未来帧。Induction Labs 引用的基准结果附带重要免责声明:该基准为内部且未发布,这意味着结果无法被独立复现;而 Gemini 的计算量估计是 Induction Labs 自己的保守推测,而非经过验证的数据。

想象模型的压缩与微调过程

将观察到的知识转化为可运行的智能体需要第二阶段。Induction Labs 使用少于 35,000 条带标注的计算机使用轨迹对 Photon-1 进行微调,以教会其正确的动作格式,并加入特殊 token,使模型能够发出键盘和鼠标命令。在推理阶段,系统以两步方式运行:它首先想象能够推进任务的下一个状态,然后生成旨在到达该状态的动作。随后进行在线强化学习:在跨五种桌面环境的 Linux 虚拟机上实时展开 rollouts,通过程序化验证结果,并用奖励信号驱动进一步改进。当在 20,000 场锦标赛级别的国际跳棋(checkers)游戏上进行微调时,Photon-1 在世界仿真和走子质量两项指标上同时优于视觉编码器基线,以及一个规模相近的语言模型基线。在 10,000 场由合成生成的台球游戏中,它在球位置预测上达到平均绝对误差 0.47,而 LLM 基线为 1.15,视觉基线为 1.44。该模型还从其预训练数据中学到了人类行为模式:能够在虚拟机内提示一个 ChatGPT 克隆、检查其输出,并引导对话直到任务完成。

2026 年的世界模型进展

Photon-1 的到来正值 AI 行业正在转向研究人员普遍所称的“世界模型”:能够构建环境如何在动作作用下演化的内部表征的系统,而不仅仅是预测文本或生成孤立的视频片段。5 月,Google DeepMind 发布了 Genie 3,这是一种实时交互式世界模型:可以在每秒 24 帧的速度下,从文本或图像生成持久性的 3D 环境,并具备自学习到的物理机制,而非硬编码规则。NVIDIA 的 Cosmos 平台提供开放权重的世界基础模型,使用 2000 万小时真实世界数据训练;其下载量已超过 200 万次,并正在被包括 1X、Figure AI 和 Agility 在内的机器人公司用于合成训练数据生成。Fei-Fei Li 的 World Labs 推出了 Marble,这是一个可商业获得的系统,可从文本、图像或视频创建可编辑的 3D 世界。Yann LeCun 的 AMI Labs——据称在发布产品前估值为 30 亿欧元——已融资 5 亿欧元,以推进类似 JEPA 的架构:通过在潜在空间中进行预测来学习抽象表征,而不是在像素空间中学习。其他值得注意的进展还包括 Runway 的 Gen-4.5:该公司明确将其定位为具有逼真物理的“世界模型”;以及 DreamZero,一个 140 亿参数的世界动作模型,它展示了从人类视频到机器人控制的强跨具身迁移,仅使用视觉信息即可完成,而不需要动作标签。

常见问题

Induction Labs 在 2026 年 7 月 23 日发布了什么?

Induction Labs 发布了 Photon-1,这是首个“想象模型”——一个 1060 亿参数的稀疏专家混合(mixture-of-experts)Transformer,包含 50 亿个激活参数,在大约 5.75 亿帧未标注的计算机屏幕录制数据上训练。该模型通过在预训练阶段观察视频、且不使用动作标签来学习如何使用计算机。

Photon-1 的表现如何与谷歌 Gemini 3.1 Flash-Lite 相比?

Induction Labs 声称 Photon-1 在内部计算机使用基准测试中优于谷歌的 Gemini 3.1 Flash-Lite,尽管其训练所用计算量至少少了 30 倍。该公司报告的推理成本为每 100 万个 token 0.11 美元,而 Gemini 为 0.36 美元。该基准为内部且未发布,Gemini 的计算量估计是 Induction Labs 自己的推测。

2026 年发生了哪些世界模型方面的进展?

5 月,Google DeepMind 发布了 Genie 3,一种用于生成持久 3D 环境的实时交互式世界模型,帧率为每秒 24 帧。NVIDIA 的 Cosmos 平台下载量超过 200 万次,并被包括 1X、Figure AI 和 Agility 在内的机器人公司采用。Fei-Fei Li 的 World Labs 推出了用于创建可编辑 3D 世界的 Marble。Yann LeCun 的 AMI Labs 融资 5 亿欧元,以推进类似 JEPA 的架构。

免责声明:以上内容(如有图片或视频亦包括在内)均为平台用户上传并发布,本平台仅提供信息存储服务,对本页面内容所引致的错误、不确或遗漏,概不负任何法律责任,相关信息仅供参考。

本站尊重他人的知识产权、名誉权等法律法规所规定的合法权益!如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到qklwk88@163.com,本站相关工作人员将会进行核查处理回复

(0)
上一篇 2026年7月27日 下午9:29
下一篇 2026年7月27日 下午9:53

相关推荐

风险提示:理性看待区块链,提高风险意识!