《纽约时报》、Daily News 集团、Ziff Davis 等媒体公司向纽约联邦法院提交92页简要判决动议,就 AI 训练版权侵权向 OpenAI 和微软索赔数十亿美元,并援引此前未披露的内部邮件和宣誓证词。这份动议不是泛泛指控,而是把矛头对准了「合理使用」抗辩的核心漏洞:如果被告自己人都知道这件事有问题,那公开场合的法律辩护还有什么说服力?

内部言论的杀伤力:从合规主张到主观认知

动议的核心策略是转移焦点。过去这场诉讼的讨论围绕「大规模抓取是否属于合理使用」展开,但原告现在试图把争论升级为「被告是否明知故犯」。

微软应用科学总监布伦特·赫希特(Brent Hecht)在内部文件中写道,将新闻内容用于AI训练是「人类历史上规模最大的劳动力盗窃」,并直接质疑合理使用抗辩的正当性。这不是外部批评,而是科技公司内部工程师的原话。更具杀伤力的是OpenAI产品负责人Nick Turley的证词:ChatGPT正对新闻业构成「生存威胁」,且随着性能提升替代性将越来越强。

程序员 reaction:MeusingAlagentstocodewith

当内部警告撞上外部诉讼

动议的逻辑链条很清晰:合理使用抗辩依赖「被告善意认为自己的行为合法」,而内部记录证明被告管理层明知存在重大争议仍继续推进,这在版权法的四个要素审查中会直接影响第三和第四要素的判断。

合理使用四要素在 AI 训练场景的适用

美国版权法第107条的合理使用审查涉及四个要素,每个要素在AI训练场景都有复杂的适用空间。

第一要素是「使用的目的和性质」。模型训练是否具有转换性?这是双方分歧最大的地方。原告主张模型训练是商业性使用,输出内容与原文形成市场替代;被告主张训练过程不复制原文,只是学习语言规律,具有高度转换性。

第二要素是「原作品的性质」。新闻作品具有事实性,比虚构作品获得的保护较弱,但《纽约时报》的独家调查报道、深度特稿显然具有高度的创造性投入。

第三要素是「使用的数量和实质性」。这里的问题是,虽然模型不存储原文,但训练过程中接触了数百万篇完整作品,这在数量上是否构成实质性使用?

第四要素是「对市场的影响」。这是最具破坏力的要素。如果ChatGPT等工具确实替代了用户访问新闻网站的行为,那么训练数据的使用就在直接侵蚀权利人的市场份额。

合理使用四要素在AI训练中的张力

合理使用四要素在AI训练中的张力

合规工程的取舍

动议对AI公司的实际影响取决于案件走向,但合规工程已经需要提前布局。

数据获取路径有两个方向。一是授权采购,典型案例是Anthropic与Wiley达成的15亿美元和解协议,这为内容授权定价提供了可参照的基准。二是构建自有数据源,例如爬取公共领域内容、生成合成数据、或与愿意合作的媒体签订授权协议。

程序员反应图:真正的程序员

授权采购 vs 自建数据源的取舍

工程侧的迁移成本体现在三个方面。一是最直接的财务成本,按现有授权单价估算,覆盖主流新闻媒体的训练数据可能需要数亿美元;二是数据管道改造,需要建立来源追踪、许可管理、授权过期检测的完整体系;三是模型微调成本,经过清洗和授权验证的数据集规模可能显著小于当前训练集。

对从业者的启示

这场诉讼的意义不在于单一判决结果,而在于确立了AI训练数据合规的司法审查框架。

首先,「合理使用」不再是默认选项。法院正在逐步细化四个要素的具体适用标准,未来每个案件的胜负可能取决于证据的质量而非原则的抽象论证。其次,内部沟通记录的法律风险被重新评估——员工的内部邮件、会议记录都可能成为诉讼证据,技术团队的合规意识需要从「这样做技术上可行」转向「这样做法律上站得住脚」。最后,数据供应链透明度将成为核心竞争力,拥有完整授权链条的公司将在合规审查中占据优势。

今日可执行的三件事:第一,盘点现有训练数据的来源清单和授权状态,识别无明确授权的来源;第二,评估授权采购成本模型,建立按内容类型分级的预算框架;第三,修订内部技术文档的合规措辞,避免内部记录成为未来诉讼的负面证据。

这一招的狠辣之处在于,它把胜负手从抽象的道德论证转移到了可核验的证据链上。过往媒体起诉 AI 公司,最常见的叙事是"你们抢了我的读者"——这是一个经济学命题,很难量化,也很难让陪审团产生强烈的负面印象。这次动议换了一条路径:用被告自己留下的内部言论,来证明他们从一开始就知道问题所在。坦白讲,这比任何公开声明都更有杀伤力。原告代理律师史蒂文·利伯曼的一句话概括了这套策略的核心:"这些证据表明,OpenAI 和微软从一开始就知道其所作所为是错误的。"

内部言论的材料集中在几份关键证词上。微软应用科学总监布伦特·赫希特在内部文件中将新闻内容用于 AI 训练描述为"规模空前的劳动盗窃",并公开质疑此举与"合理使用"理念的兼容性。OpenAI 高级高管尼克·特利则直接写道:"我们的产品在很大程度上具有替代性。"格雷格·布罗克曼在 2020 年的一封内部信中记录了 ChatGPT 前身对新闻文本的预测能力测试——"每当让它接续纽约时报文章中的半句话时,它似乎都能准确无误地完成句子。"

还没解释就先被安排转身背锅时的表情

这锅不该我们背

这些言论与 OpenAI 和微软在法庭上的公开立场形成了鲜明反差。公司层面一贯主张:训练数据来自公开互联网,AI 学习的是语言规律而非复制原文,整个过程具有高度转换性,属于合理使用的经典场景。但内部记录显示,至少在部分高管的认知中,这种做法的法律边界并非毫无争议——赫希特本人就是在微软内部提出了质疑的人。微软发言人后来的回应是"个人观点不代表公司立场",但这句话在法庭上的分量,与其说是澄清,不如说是坐实了内部确实存在过反对声音的事实。

程序员 reaction:柯南00089 找到你了

内部邮件不会撒谎

更关键的一环是 DMCA 第 1202 条的适用空间。大规模数据爬取通常在清洗阶段剥离作者署名、来源信息、版权声明和网站条款——这些被工程团队视为"噪声"的信息,从版权法视角恰恰是权利边界的载体。美国 Copyright Office 在 2025 年发布的报告中明确指出:如果训练数据集包含 pirated 或非法获取的作品,应当作为不利因素考量;而版权管理信息被系统性剥离,会进一步削弱合理使用的正当性。

AI 训练数据版权四要素分析框架

AI 训练数据版权四要素分析框架

这份动议背后的策略升级,值得从业者关注。过去媒体公司的诉讼路径大致是两条:一是证明商业替代,二是主张道德侵权。前者依赖流量数据,后者依赖情绪共鸣——两者都有一个共同的弱点,就是难以让陪审团形成确定的因果判断。这次动议引入了一条新路径:通过证据开示获取的内部记录,证明被告在行为发生时就已意识到法律风险,从而动摇"善意使用"这一合理使用抗辩的隐含前提。

这不是简单的"你偷了我的内容",而是"你在心里已经知道这件事有问题,但你还是做了"。从工程角度看,这就像是代码审查中发现了一个已知漏洞却没有修复——责任认定的逻辑完全不同。

程序员 reaction:柯南00022 你说我在听

证据链闭合了

对于模型供应商而言,这条路径释放了一个明确信号:内部通信记录在版权诉讼中不再是安全的避风港。过去公司内部的技术讨论、风险评估邮件、产品决策备忘录,都可以成为法庭上的关键证据。这意味着合规工作不能只停留在对外声明层面,还需要渗透到内部的技术评审和决策流程中——一个在 Slack 上的随口评价,可能在三年后的法庭上变成对方的弹药。

对于内容方而言,策略也在变化。从最初的"保护付费墙流量"转向"保护内容本身的版权完整性",后者在法律上的站脚点更扎实。但这也带来了一个新的博弈成本:证据开示周期长、成本高,需要持续投入法律资源。OpenAI 与 Anthropic 的选择已经给出了参考——前者走大规模公开网络数据路线,后者走主动授权路线。这两条路在法律风险敞口上的差距,正在被这套新的诉讼策略进一步放大。

这篇案例最值得跟踪的落点,不是最终判赔金额,而是法院对"内部言论 + 合理使用"这个组合的认定方式。如果四要素分析中,法院将内部知情因素纳入权重,那么整个行业的训练数据合规框架都需要重估。如果法院坚持只看公开立场和商业效果,那这套策略的长期影响力会受限。无论哪种走向,都已经改变了现有博弈的底线。

这一招的狠辣之处在于,它把胜负手从抽象的道德论证转移到了可核验的证据链上。过往媒体起诉 AI 公司,最常见的叙事是「你们抢了我的读者」——这是一个经济学命题,很难量化,也很难让陪审团产生强烈的负面印象。这次动议换了一条路径:用被告自己留下的内部言论,来证明他们从一开始就知道问题所在

内部言论如何重塑合理使用抗辩

美国版权法第107条规定的合理使用抗辩,依赖四个要素的综合判断:使用的目的和性质、原作品的性质、使用部分的数量和实质性、以及对原作品潜在市场的影响。这个框架原本是开放性的利益平衡工具,但在AI训练场景下,内部言论的存在会直接改变每个要素的分析权重。

四要素分析框架下的主观认知

微软应用科学总监布伦特·赫希特的内部证词称,将新闻内容用于AI训练是「规模空前的劳动盗窃」,并公开质疑此举与「合理使用」理念的兼容性。这句话出现在法庭文件中,对四要素中的第一个——使用的目的和性质——产生实质性影响。

合理使用的第一个要素关注使用是否具有「转换性」,即是否在原作品基础上增加了新的表达、意义或功能。AI公司一贯的主张是:训练过程只是学习语言模式和知识关联,并非复制原文,因此具有高度转换性。这个逻辑本身有成立空间。但赫希特的内部言论揭示了另一个维度:公司内部对这种行为性质存在明确分歧。

当决策者自己在内部邮件中将某行为描述为「盗窃」时,法院很难再接受「我们完全相信这是合法合理使用」的主观善意主张。这不是说内部言论能直接否定转换性,而是它会削弱「善意使用者」的可信度。在法律实践中,主观认知状态往往影响法官对证据的证明力的裁量。

替代效应证据的具体化

OpenAI 高级高管尼克·特利在内部文件中写道:「我们的产品在很大程度上具有替代性。」格雷格·布罗克曼在2020年的内部信中记录,ChatGPT 能准确接续《纽约时报》文章的半句话。这些证词直接作用于第四个要素——对市场的影响。

合理使用分析的第四个要素关注使用行为对原作品潜在市场或价值的影响。在普通版权案件中,这一要素通常需要原告提供市场损失的具体证据。但AI训练场景的特殊性在于:替代效应往往是功能性的,而非直接的销量替代。用户不再访问新闻网站获取信息,而是通过聊天机器人获得摘要。

特利和布罗克曼的内部言论,相当于被告自己承认了替代效应的存在。这在法律上形成了「自认」效果——被告在内部文件中的陈述,可以被用作对其不利的证据。原告代理律师史蒂文·利伯曼的总结切中要害:「这些证据表明,OpenAI 和微软从一开始就知道其所作所为是错误的。」

更准确地说,内部言论的价值不在于证明「错误」,而在于证明「明知」。合理使用抗辩的核心争议点往往不是事实认定,而是价值判断。当被告内部存在明确认知与公开主张之间的张力时,陪审团更容易作出有利于原告的推断。

程序员 reaction:bearugpullsomehow

当内部认知与公开立场产生分歧时

版权管理信息的工程陷阱

这起案件的深层技术争议,涉及 AI 训练数据 pipeline 中的一个常见工程实践:清洗。

大规模数据处理通常经过抓取、清洗、去重、切片、向量化等环节。很多工程系统会把作者信息、来源链接、版权声明、网站条款视为「噪声」,在清洗过程中一并删除。这种做法在技术上可以提高模型训练效率,减少数据维度。但从版权合规角度看,这些信息恰恰不是噪声,而是权利边界。

DMCA 版权管理信息规则关注的不是「你有没有拿走作品」,而是「你是不是在拿走作品之前,先把权利标签撕掉」。AI 训练场景中,批量剥离版权管理信息的行为,可能同时触发版权侵权和 DMCA 违规的双重责任。

AI训练数据pipeline中的版权合规边界

AI训练数据pipeline中的版权合规边界

微软 CEO Satya Nadella 在证词中表示,付费墙内容应获得授权才能用于AI训练,并称若早知 OpenAI 曾抓取付费墙内容,将要求其重新训练模型。这一表态间接承认了数据采集环节可能存在合规瑕疵。

对AI从业者的合规启示

这起案件的法律意义,不仅在于结果本身,更在于它暴露了 AI 训练产业链中的一个结构性风险:数据采集的合规验证机制普遍缺失。

对于 AI 公司而言,合规工程需要从三个层面加强:

第一,建立数据采集前的来源评估机制。不是所有公开可访问的内容都可以无授权使用。网站的 Terms of Service、robots.txt 规则、付费墙设置都是合法使用的边界信号。忽略这些信号的工程团队,本质上是在进行「合规盲操作」。

第二,重构数据清洗逻辑。版权管理信息不应被视为噪声。一个可行的方案是在清洗流程中保留元数据的副本,即使这些数据不进入模型训练。这样可以同时满足技术效率和法律合规的双重需求。

第三,建立内部言论的管理机制。当高管在内部文件中对某项业务提出法律风险质疑时,这些文件可能成为未来诉讼的关键证据。微软发言人将赫希特的言论定性为「员工个人观点,不代表公司立场」,但这种切割在法律上的效力存疑。内部文件一旦进入证据开示程序,就很难被排除。

坦白讲,这起案件反映出 AI 行业的一个普遍问题:技术推进速度远超合规能力建设速度。当「先做后说」成为工程文化,内部讨论中产生的诚实评估,反而会成为日后法律风险的最大来源。

从实务角度,建议在以下条件下调整策略:在数据规模优先的场景中,选择已建立授权合作的数据源,避免依赖未经清理的公开抓取;在模型性能优先的场景中,明确标注数据来源的合规状态,并为潜在的版权清算预留预算。当条件变化为监管收紧或诉讼风险上升时,及时切换到授权驱动的数据策略。

这篇文章揭示了一个现实:内部言论的杀伤力不在于它能证明什么法律结论,而在于它能证明什么主观认知。合理使用抗辩的成功,从来不只需要技术上的「转换性」论证,还需要伦理上的「善意」证明。当两者之间出现裂痕时,法律的天平自然会倾斜。

内部言论的证据效力

这套策略的狠辣之处,在于把胜负手从抽象的道德论证转移到了可核验的证据链上。过往媒体起诉 AI 公司,最常见的叙事是「你们抢了我的读者」——这是一个经济学命题,很难量化,也很难让陪审团产生强烈印象。这次换了一条路径:用被告自己留下的内部言论,来证明他们从一开始就知道问题所在。

原告代理律师史蒂文·利伯曼的总结一针见血:「这些证据表明,OpenAI 和微软从一开始就知道其所作所为是错误的。」

合理使用四要素的主观认知维度

美国版权法的合理使用抗辩需要综合考察四个要素:使用目的与性质、原作品性质、使用部分的数量与实质性、以及市场影响。内部言论主要攻击的是第一个和第四个要素。

微软应用科学总监布伦特·赫希特在内部文件中质疑大规模抓取新闻内容是否与合理使用理念兼容。OpenAI 高级高管尼克·特利则直接承认:「我们的产品在很大程度上具有替代性。」格雷格·布罗克曼 2020 年的内部信件记录显示,ChatGPT 能准确接续纽约时报文章的半句话。

版权局 2025 年的报告明确指出,「明知使用由盗版或非法获取作品组成的数据集」将对合理使用的认定产生负面影响。这不是道德评判,而是法律要件。

替代效应的具体化路径

更关键的是替代效应不再停留在理论层面。微软 CEO 萨提亚·纳德拉在证词中表示,与聊天机器人的对话已「替代」了用户访问出版商网站的行为。OpenAI 高管的预测更为直白:随着性能提升,替代性将越来越强。

这意味着原告可以同时论证两个事实:被告主观上知道存在问题,且客观上造成了市场替代。两者结合,合理使用抗辩的空间被大幅压缩。

工程合规的边界

这场诉讼暴露了一个被工程实践忽视的问题:数据清洗过程中的版权管理信息处理。

数据清洗中的版权管理信息陷阱

AI训练数据流水线与权利信息处理

AI训练数据流水线与权利信息处理

大规模数据处理通常要经过抓取、清洗、去重、切片、标注、向量化等环节。很多工程系统会把作者、来源、版权声明、网站条款视为噪声,在清洗过程中一并删除。

但从版权合规角度看,这些信息恰恰不是噪声。AI 训练不是把数据洗得越干净越好。有些「脏信息」,是权利人的保护边界。

从合规主张到主观认知的落差

微软发言人回应赫希特的言论时称,这反映的是「一名员工的个人观点,并非法律层面的分析,也不代表公司的立场」。

这种切割在法律上能站住脚吗?坦白讲,悬。因为公司不能一边在内部邮件里讨论训练的伦理争议,一边在法庭上主张「我们不知道自己在做什么」。主观认知的证据一旦落地,组织层面的免责声明就会显得苍白。

对 AI 从业者的可执行启示

当前策略的取舍

在 X 条件下(训练数据主要来自授权获取或公共领域),现有商业模式可以维持。在 Y 条件下(依赖未经授权的互联网抓取),必须建立权利信息管理的基础设施。

这不是技术方案的选择问题,而是合规成本的内化问题。Anthropic 与 Reddit 达成的 15 亿美元和解协议提供了一个参考坐标:提前建立授权通道的成本,低于事后支付赔偿金和诉讼成本。

下一步的行动清单

可以今天就做的三件事:

第一,审查现有训练数据管道的元数据保留机制,确认版权管理信息是否被清洗。

第二,建立内部言论管理的合规检查点,避免工程讨论在证据开示阶段成为不利证据。

第三,评估与内容提供方的授权合作路径,哪怕从小规模试点开始。

这场诉讼的意义不在于单个案件的胜负,而在于确立了「内部言论可作为合理使用抗辩反证」的先例。对从业者来说,这不是一个可以等待判决结果再行动的问题。当你今天写下一封内部邮件时,它可能明天就会出现在法庭记录里。

参考文献

[1] 法庭文件:微软高管承认AI可能破坏新闻业,是“规模空前的劳动盗窃”_搜狐网. https://m.sohu.com/a/1077703018_260616?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334 [2] 法庭文件:微软高管承认AI可能破坏新闻业,是“规模空前的劳动盗窃”__财经头条__新浪财经. https://t.cj.sina.cn/articles/view/5044281310/12ca99fde02002kyv2 [3] 法庭文件:微软高管承认AI可能破坏新闻业,是“规模空前的劳动盗窃”_全球速报_澎湃新闻-The Paper. https://www.thepaper.cn/newsDetail_forward_34094833 [4] 法庭文件曝光:OpenAI、微软高管承认AI正在对新闻业构成威胁. https://wallstreetcn.com/articles/3782021 [5] 纽约时报等400家媒体起诉微软:谁是AI侵权的“共犯”?. https://www.zhichanli.com/p/1238646075 [6] 微软及OpenAI内部文件曝光:高管曾警告AI可能对新闻机构 .... https://www.21jingji.com/article/20260918/herald/58cb3e7758bd7c422b6d911feaea7513.html [7] AI訓練屬合理使用? OpenAI、微軟內部言論成著作權訴訟新焦點. https://www.digitimes.com.tw/tech/dt/n/shwnws.asp?id=[REDACTED] [8] “最大规模的劳动盗窃”!OpenAI和微软高管承认AI或破坏新闻业. https://www.jiemian.com/article/15112996.html

点这里一键关注『计算机魔术师』

如果浏览器无法直接唤起微信,可在微信内打开公众号主页:计算机魔术师

上一篇:
AI 幻觉导致的错误情报险些引发美军拦截中国船只
下一篇:
还在单线程跟 AI 聊天?Claude Code 并行多会话让你一个人干三个人的活

分享到这些地方