未删节文件中,微软高管称 AI 抓取是“最大规模的劳动力盗窃”

微软和 OpenAI 高管曾私下将 AI 训练实践描述为盗窃,并称其对出版商构成生存威胁。根据《纽约时报》三年前对两家公司提起的版权诉讼中最新解封的信息,解封材料显示,一名微软高管在内部备忘录中称 AI 抓取是“人类历史上最大的劳动力盗窃”,而 ChatGPT 负责人则写道,这项技术对那些作品被用于训练它的出版商构成“生存威胁”。这些披露发生之际,各法院正在权衡 AI 公司是否可以依据合理使用原则合法使用受版权保护的材料,而截至目前,法官总体上更倾向于支持 AI 公司的论点。

微软数据显示《纽约时报》点击率下降 93%

根据诉讼文件,微软自己的数据显示,与传统 Bing 搜索相比,其 Copilot“答案引擎”导致《纽约时报》域名的点击率最高下降 93%。微软应用科学部门总监 Brent Hecht 于 2024 年 1 月撰写的一份内部演示文稿将这一降幅描述为一个“末日循环”,并称这将“同时损害我们模型和整个网络的表现”。微软文件写道:“终端产品威胁其核心供应商的经济基础是极不寻常的,但这正是我们为 LLM 业务打造其‘内容供应链’时所造成的局面。”

微软首席执行官 Satya Nadella 在今年早些时候的一次证词中表示,“任何设置了付费墙的内容,都应由任何想要使用它的人获得许可……用于基础或训练。”Nadella 表示,如果他“当时知道 OpenAI 抓取并使用了付费墙后的信息进行训练”,他就会“行使[微软要求 OpenAI 重新训练其模型的权利]”。OpenAI 总裁 Greg Brockman 称这些模型“非常擅长新闻”,而 Nadella 在今年早些时候宣誓作证时同意,与聊天机器人对话“已经取代了……在 AI 平台上直接为你提供网站上的信息,而不再需要访问底层来源”。

OpenAI 训练数据集包含超过 91,692 份出版商作品副本

文件首次披露,仅 OpenAI 的中期训练数据集就包含超过 91,692 份由《纽约时报》、Daily News 和调查报道中心出版的作品副本。一个源自 Common Crawl 的数据集仅来自 nytimes.com 的文档就超过 200 万份。在 2023 年 1 月的一份内部备忘录中,Hecht 称这是“一场规模前所未有、令人震惊的盗窃”,也是“人类历史上最大的劳动力盗窃”。

ChatGPT 负责人 Nick Turley 在内部通信中写道,出版商正面临来自聊天机器人等产品的“生存威胁”,这些产品“在很大程度上具有替代性”,并且“随着它们变得更好,替代性会越来越强”。一份微软文件称,生成式 AI 存在“真实风险”,可能会“严重扰乱那些生成了基础模型训练数据的人员的就业”。

据称两家公司绕过付费墙并移除版权声明

诉讼文件列出了 OpenAI 和微软据称获取原告内容的方式,包括从 Bing Index 抓取内容。文件写道:“OpenAI 将完整的 GPT-3 训练数据集交付给微软,微软利用该数据集评估如何在自己的商业产品中实施 OpenAI 的模型。”“微软也通过名为 Project Taxi 和 Project Mango 的计划向 OpenAI 提供了训练数据。”据称,两家公司将 Project Mango 数据汇编成一个训练数据集,其中包含新闻出版商至少 160,903 部独特作品的副本。

诉讼文件显示,当 OpenAI 研究员 Nick Ryder 告诉 OpenAI 总裁 Greg Brockman 有一种“绕过 nytimes 付费墙的黑客方法”时,Brockman 回复道:“啊,不错。”据称,OpenAI 员工还构建了 WebText 和 WebText2 等训练数据集,这些数据集不成比例地依赖抓取的新闻内容。调查结果描述了在训练数据进入模型之前有意移除版权声明的做法,因为研究人员“不希望模型向用户输出”“版权声明”。

“这里首次披露的证据表明,OpenAI 和微软知道自己的所作所为是错误的,”《纽约每日新闻》的法律顾问 Steven Lieberman 在一份声明中表示。OpenAI 和微软没有回应置评请求。

常见问题

微软高管在内部文件中如何评价 AI 抓取?
微软应用科学部门总监 Brent Hecht 在 2023 年 1 月的一份内部备忘录中称,AI 抓取是“人类历史上最大的劳动力盗窃”。2024 年 1 月,Hecht 还在一份内部演示文稿中将其描述为“一场规模前所未有、令人震惊的盗窃”。

OpenAI 的训练数据集包含多少份出版商作品副本?
根据诉讼中披露的文件,仅 OpenAI 的中期训练数据集就包含超过 91,692 份由《纽约时报》、Daily News 和调查报道中心出版的作品副本。一个源自 Common Crawl 的数据集仅来自 nytimes.com 的文档就超过 200 万份。

微软首席执行官 Satya Nadella 就付费墙内容作了什么证词?
Nadella 在今年早些时候的一次证词中表示,“任何设置了付费墙的内容,都应由任何想要使用它的人获得许可……用于基础或训练。”他表示,如果当时知道 OpenAI 抓取了付费墙内容,他就会行使微软要求 OpenAI 重新训练其模型的权利。

免责声明:以上内容(如有图片或视频亦包括在内)均为平台用户上传并发布,本平台仅提供信息存储服务,对本页面内容所引致的错误、不确或遗漏,概不负任何法律责任,相关信息仅供参考。

本站尊重他人的知识产权、名誉权等法律法规所规定的合法权益!如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到qklwk88@163.com,本站相关工作人员将会进行核查处理回复

(0)
上一篇 2026年9月18日 下午5:47
下一篇 2026年9月18日 下午5:48

相关推荐

风险提示:理性看待区块链,提高风险意识!