OpenAI 发布了 722 篇声称解决了重大问题的数学论文

OpenAI 发布了一个尚未公开的内部模型生成的 722 篇数学论文,这些论文被归入 372 个成果系列,公司声称它们解决或推进了数学领域的重大开放问题。此次发布包括一份声称证明了准黎曼猜想的论文,这是一个关于素数分布的著名 100 万美元问题的变体;其中有 162 篇论文使用 Lean 证明助手进行形式化,该软件允许计算机验证每个证明步骤。Anthropic 数学家 Levent Alpöge 称这一进展“显然是数学史上最重要的时刻”,而 WIRED 的一篇报道详细介绍了部分数学家对发布时间的愤怒。OpenAI 表示,几乎所有新成果只需一个提示词,平均使用 3 小时 ChatGPT Pro;相比之下,上个月的纳维-斯托克斯证明使用了 10,000 个 AI 智能体。这次发布延续了 OpenAI 在 2026 年对数学的关注,继 9 月提出一项千禧年大奖相关主张之后,并在 8 月解决了更早的一些问题。

OpenAI 发布 722 篇数学论文,声称取得重大问题成果

OpenAI 发布了来自一个尚未向公众开放的内部模型的 722 篇数学论文。该公司将这些论文归入 372 个成果系列,声称它们解决或推进了该领域的重大开放问题。

最引人注目的声明涉及一份“准黎曼猜想”的证明,该猜想被描述为数学界著名的 100 万美元素数分布问题的较弱版本。OpenAI 列出了 162 篇论文,其主要成果使用 Lean 进行了形式化;Lean 是一种可以对每个证明步骤进行计算机验证的证明助手。

OpenAI 表示,几乎所有新成果只需一个提示词,平均使用 3 小时 ChatGPT Pro。这与上个月的纳维-斯托克斯证明形成对比,后者使用了 10,000 个 AI 智能体。

Anthropic 的数学家 Levent Alpöge 对此次发布作出回应,称其“显然是数学史上最重要的时刻”。在 OpenAI 宣布这一消息前几小时,WIRED 发布了一篇报道,详细介绍了数学家群体中的不满,其中一些人表示,OpenAI 曾承诺分批发布,而不是一次性大量发布。

Mistral AI 推出 Large 4 开放权重模型

法国的 Mistral AI 推出了 Large 4,这是一款拥有 1 万亿参数的开放权重模型,昵称为“Le Chonk”。该公司声称,该模型以明显优势领先于所有非中国开源系统。

在 Mistral 的编程基准测试中,中国的 Kimi K3 得分为 68%,而 Le Chonk 达到 62%,超过了 Reflection AI 的 Beam(44%)。Beam 于周一作为一款新的美国开放权重模型推出。

Mistral 强调了网络安全表现,声称其全球排名前五,并在一项漏洞测试中取得 82% 的成绩;Claude Opus 5.5 和 GPT-6 Astra 大多拒绝完成该测试。在法律应用方面,Mistral 表示,外部测试机构 Vals 测得该模型在 Harvey 基准测试中的表现接近 GPT-6 Astra 的三倍,领先于所有接受测试的中国开源模型。

网络安全专家和政府机构可在为期三周的预览期内访问安全限制较少的版本。Mistral 计划于 10 月 27 日公开发布模型权重。

Hark 推出主动出击型 AI 助手

Hark 是由 Figure AI 创始人 Brett Adcock 创办的 AI 初创公司,发布了 Hark Pro,这是一款可在网页和移动平台上使用的个人助手。该系统会记住用户偏好、标记待处理任务,并可以代表用户进行研究、购物、预订和构建。

在 Adcock 的发布视频中,一项购买两张电影票的请求让 Hark 选择座位、将影片添加到日历,并提供预订停车位的选项。任务在 Handoff 上运行,Handoff 是 Hark 的专有云端计算机;公司表示,它可以同时运行多达 36 个浏览器,同时在聊天界面中展示其操作。

该应用拥有一个带有小组件和待办事项建议的主屏幕,以及用户创建的自定义小应用“面板”。Hark 提供免费和付费层级。该公司宣布将于 2027 年推出一系列集成硬件设备,并通过与 AT&T 的合作提供连接服务。

前 iPhone Air 设计师 Abidur Chowdhury 负责 Hark 的设计。Hark 将进入一个竞争激烈的领域,竞争者包括 Muse、Grok Bot、Instinct 和 Dots。

其他 AI 进展

犹他州批准了 Nolla Health 的申请,允许其通过面部扫描诊断痤疮并直接开具皮肤药膏处方,成为首个赋予 AI 开具处方能力的州。

AI 语音初创公司 Sesame 推出了 Personal Agents,这些助手配备专用计算机,可通过文字和语音进行交互。该公司宣布,采用这些智能体的 AI 眼镜将于 2027 年推出。

OpenAI 正在为 ChatGPT 的 Mac 桌面应用测试 Meetings 插件,该插件可将会议转换为笔记和后续步骤,并根据每位用户的工作历史进行定制。

Vals AI 使用 Claude Opus 5.5 智能体搜索下一代计算机内存材料,模拟结果确定了两种与室温超导体问题相关的磁性候选材料。

Anthropic 为付费套餐推出了 Google Docs、Sheets 和 Slides 内置的 Claude 侧边栏测试版,可直接编辑文件,或在每次更改前请求授权。

常见问题

OpenAI 在最新的数学公告中发布了什么?

OpenAI 发布了一个尚未公开的内部模型生成的 722 篇数学论文,并将其整理为 372 个成果系列。该公司声称,这些论文解决或推进了数学领域的重大开放问题,包括准黎曼猜想的证明。在这些论文中,有 162 篇的主要成果使用 Lean 证明助手进行了形式化;OpenAI 表示,几乎所有成果只需一个提示词,平均使用 3 小时 ChatGPT Pro。

Mistral 的 Large 4 模型是什么?它与其他系统相比如何?

Mistral AI 的 Large 4 昵称为“Le Chonk”,是一款拥有 1 万亿参数的开放权重模型。Mistral 声称,它以明显优势领先于所有非中国开源系统。在编程基准测试中,该模型得分为 62%,中国的 Kimi K3 得分为 68%,Reflection AI 的 Beam 得分为 44%。Mistral 强调了其强大的网络安全表现,在一项漏洞测试中达到 82%;该公司还表示,外部测试显示,该模型在 Harvey 法律基准测试中的表现接近 GPT-6 Astra 的三倍。模型权重将于 10 月 27 日公开发布。

Hark Pro 为用户提供哪些能力?

Hark Pro 是一款面向网页和移动平台的个人助手,能够记住用户偏好、识别待处理任务,并代表用户执行研究、购物、预订和构建任务。该系统运行在 Handoff 上,Handoff 是 Hark 的云端计算机,可以同时运行多达 36 个浏览器,并在聊天中展示操作过程。该应用包括带有小组件和待办事项建议的主屏幕,以及用户创建的自定义小应用面板。Hark 提供免费和付费层级,并计划通过与 AT&T 的合作在 2027 年推出集成硬件设备。

免责声明:以上内容(如有图片或视频亦包括在内)均为平台用户上传并发布,本平台仅提供信息存储服务,对本页面内容所引致的错误、不确或遗漏,概不负任何法律责任,相关信息仅供参考。

本站尊重他人的知识产权、名誉权等法律法规所规定的合法权益!如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到qklwk88@163.com,本站相关工作人员将会进行核查处理回复

赞 (0)
上一篇 2026年10月7日 下午8:09
下一篇 2026年10月7日 下午8:14

相关推荐

风险提示:理性看待区块链,提高风险意识!