← 返回每日热点
BiFish original · 2026-10-03

刚判了!用版权内容训练AI不算合理使用,大模型公司要集体失眠了

你上周是不是刚用AI画了张图,或者让ChatGPT帮你改了一段文案?先别急着高兴。美国第三巡回上诉法院上周四出了个裁定,直接给所有靠版权内容吃饭的AI公司泼了盆冷水:**用受版权保护的材料训练AI,不

你上周是不是刚用AI画了张图,或者让ChatGPT帮你改了一段文案?先别急着高兴。美国第三巡回上诉法院上周四出了个裁定,直接给所有靠版权内容吃饭的AI公司泼了盆冷水:用受版权保护的材料训练AI,不构成合理使用。

消息是Courthouse News先报的,Hacker News上讨论才13个点,但这事的影响,我赌比表面看起来大十倍。

01

之前是怎么玩的


简单讲,过去几年大模型公司一直靠一个叫“合理使用”的法律挡箭牌活着。这个原则在美国版权法里本来是为了保护评论、教学、 parody 这类场景,结果被AI公司拿来当万能盾牌。

有个细节很有意思:OpenAI 的 Sam Altman 去年在参议院听证会上被问到训练数据时,原话是“我们用的是公开可用的数据”。但公开可用不等于可以随便用,这个区别法院现在终于开始较真了。

技术上来说,训练一个像GPT-4这样的模型,需要爬取海量网页、书籍、论文、代码。Common Crawl 这个数据集就包含了数十亿个网页,其中大量内容受版权保护。以前法院对这类案子大多含糊其辞,或者以“原告举证困难”为由驳回。但第三巡回这次明确说了:训练本身不是转化性使用。

什么意思?就是你拿别人的小说去训练模型,模型学会了写类似风格的小说,这不叫“转化”,这叫衍生。

02

这次改了什么


第三巡回的裁定书里,法官用了很直白的逻辑:合理使用四要素里,第一要素“使用的目的和性质”最关键。AI训练是商业性质的,而且模型输出直接和原作品形成市场竞争关系。

我上周刚试过让Claude写一段《冰与火之歌》风格的文字,它写得有模有样。如果这都不算侵权,那乔治·R·R·马丁可以直接退休了。

法院这次没留模糊空间:商业性、非转化性、影响原作品市场,三个条件全占,合理使用不成立。

但注意,这个裁定是第三巡回的,不是最高法院。所以它只对宾夕法尼亚、新泽西、特拉华三个州有约束力。可问题是,大模型公司不可能只在这三个州做生意。一旦这个逻辑被其他巡回采纳,或者最高法院最终确认,整个行业的数据策略就得推倒重来。

对比一下:欧盟的《AI法案》早就要求披露训练数据版权状态,日本今年也收紧了AI训练数据的版权例外。美国之前一直被认为是AI公司最宽松的避风港,现在这个优势正在消失。

03

谁最慌


OpenAI 和 Anthropic 首当其冲。这两家都承认用了大量受版权保护的书籍和网页。OpenAI 去年和新闻集团、美联社签了授权协议,但那只覆盖了很小一部分。Anthropic 的 Claude 训练数据里,据估计有超过10% 是受版权保护的图书。

Meta 的 Llama 系列也跑不掉。扎克伯格去年还在财报会上说“我们用的是公开数据”,但公开数据里有多少是盗版电子书,大家心里有数。

Google 稍微好一点,因为它有YouTube和搜索引擎的授权协议,但Google Books那个案子当年也是靠合理使用赢的,现在这个判例可能被推翻。

有个细节很有意思:第三巡回的裁定里专门提到了“市场替代效应”。就是说,如果AI能生成和原作品竞争的内容,原作者的潜在收入就受损了。这个逻辑对图片生成模型更致命。Midjourney、Stable Diffusion 这些,直接拿Getty Images的图训练,现在Getty的诉讼还在英国打,但美国法院这个裁定等于给Getty递了把刀。

那谁相对安全?Adobe Firefly。因为它从一开始就只用Adobe自有版权库和公开授权内容训练。虽然效果可能不如Midjourney惊艳,但法律风险低得多。这就是典型的“慢就是快”。

04

跟你有什么关系


如果你是个普通用户,短期没啥感觉。你继续用ChatGPT、继续用Midjourney,它们不会明天就关停。

但中期来看,成本会转嫁到你头上。大模型公司要么花大钱买版权,要么花大钱打官司,要么花大钱重新训练。这三种“花大钱”最后都会变成API涨价、订阅费涨价。

如果你是从业者,特别是做AI应用层的,现在就得开始查你的上游模型供应商有没有版权风险。我认识一个做AI写作工具的团队,上周刚把底层模型从GPT-4换成了自研的小模型,就是因为怕哪天OpenAI被禁了,自己的产品跟着完蛋。

依赖单一模型供应商的AI创业公司,现在应该立刻做两件事:备份方案、法律审查。

还有一个场景:如果你是做企业知识库的,用公司内部文档训练AI,这个裁定其实对你有利。因为内部文档是你自己的版权,不涉及第三方。但如果你爬了行业报告、竞品文档去训练,那就踩线了。

05

之后会怎么走


我判断接下来会有三个连锁反应。

第一,版权集体诉讼会暴增。第三巡回这个裁定等于给了原告律师一把尚方宝剑,以前不敢接的案子现在敢接了。我赌三个月内会有针对OpenAI或Meta的新集体诉讼,而且索赔金额会创纪录。

第二,授权市场会爆发。就像当年音乐行业从盗版走向Spotify授权一样,AI公司会开始大规模和出版商、图库、作者协会签协议。价格会先高后低,但中间会有个混乱期。

第三,技术路线会分化。一部分公司转向合成数据,另一部分转向完全授权数据。合成数据的问题是“模型训练模型”会导致性能退化,这个坑已经有人踩过了。授权数据的问题是贵,而且覆盖不全。

有个细节很有意思:第三巡回的裁定书最后留了个口子,说“如果训练过程不保留原作品表达,可能构成合理使用”。这意味着差分隐私和数据蒸馏技术会变得很值钱。谁能证明自己的模型没有“记住”原作品,谁就能躲过这一刀。

我赌半年内至少有两家头部大模型公司会宣布“完全使用授权数据训练”的新模型,哪怕性能差一点,也要把法律风险降到零。同时,我赌一年内美国最高法院会受理相关案件,因为巡回法院之间已经出现分歧了——第九巡回之前有个案子就判了合理使用成立。

最后说句实在的,这个裁定不是AI的丧钟,而是AI从“野蛮生长”进入“合规竞争”的分水岭。那些靠盗版数据堆出来的模型,接下来两年会很难受。而那些早早布局授权数据的公司,反而会迎来一波红利。

你问我站哪边?我站创作者这边。因为如果AI公司可以随便拿别人的作品去训练,那以后谁还愿意认真写书、拍照、画图?这个裁定,长远看是在保护创新的源头。

本文基于 developer 公开报道编译解读

本文基于 developer 公开报道编译解读,查看原文

公开来源
  1. 美国第三巡回上诉法院裁定:用受版权保护材料训练AI不构成合理使用