WikiHow 把 OpenAI 告了:1.1 万篇教程白嫖,AI 连怎么系鞋带都要抄?
三个月前我还夸它 三个月前我测试 ChatGPT 的教程生成能力时,还觉得它'有点东西',能写出像模像样的步骤指南。现在回头看,这'东西'可能是从 WikiHow 上扒下来的。8 月 21 日
三个月前我还夸它
三个月前我测试 ChatGPT 的教程生成能力时,还觉得它'有点东西',能写出像模像样的步骤指南。现在回头看,这'东西'可能是从 WikiHow 上扒下来的。8 月 21 日,WikiHow 正式在美国曼哈顿联邦法院起诉 OpenAI,指控其未经许可抓取了超过 11,000 篇教程文章,用于训练 ChatGPT 和 GPT 模型,涉及至少 1,200 项已注册版权。作为被各种 AI 工具坑过无数次的人,我第一反应是:终于有人站出来收拾这烂摊子了。
之前:AI 的'知识'从哪来?
这事得从 AI 训练数据的'原罪'说起。OpenAI 的训练数据来源一直是个灰色地带——公开网页、书籍、维基百科,什么都吃。WikiHow 作为全球最大的'怎么做'指南网站,积累了数百万篇经过人工审核的教程,覆盖从'怎么系鞋带'到'怎么进行心肺复苏'的方方面面。这些内容质量高、结构化强,简直是 AI 训练的'黄金食材'。
但问题是,WikiHow 的内容是用户和编辑团队辛辛苦苦写出来的,每一篇都凝结了时间和精力。OpenAI 直接爬取,连招呼都不打,这就像你辛辛苦苦做了一桌菜,邻居翻墙进来吃了,还打包带走,最后连句'谢谢'都没有。
从数据来看,OpenAI 的模型确实在教程生成上表现出色,但背后可能是对 WikiHow 的'深度借鉴'。WikiHow 在诉状里说,ChatGPT 能根据用户提示复现 WikiHow 的文本,甚至生成相同主题的教程。这已经不是'借鉴',而是'复制'了。
这次:诉讼的细节和 OpenAI 的回应
WikiHow 在诉状里说的很直白:这些模型吸收了 wikiHow 的文章后,能以远低于人工成本的方式生成竞争性内容,这减少了 WikiHow 的收入,甚至让它失去继续创作的动力。这话听着有点惨,但确实是现实。如果 AI 能免费生成教程,谁还愿意看 WikiHow?谁还愿意贡献内容?
OpenAI 的回应也很典型:'我们使用公开数据训练,基于合理使用原则。'这逻辑我熟,每次 AI 公司被起诉都这么说。但'合理使用'不是万能挡箭牌,尤其当涉及 1,200 项已注册版权时,法院可能不会轻易放过。

我查了一下,WikiHow 要求赔偿,但没具体说金额,还要求法院发布禁令,阻止 OpenAI 继续侵权。这招够狠,如果禁令通过,OpenAI 可能得删掉相关训练数据,或者重新训练模型。
对行业的影响
这案子不只是 WikiHow 和 OpenAI 的事,它可能改变整个 AI 行业的游戏规则。目前,AI 公司普遍靠爬取公开数据训练,但版权问题一直是悬在头上的剑。如果 WikiHow 胜诉,那其他内容平台(比如 Reddit、Stack Overflow)可能都会跟进,AI 公司要么付费授权,要么自己创作数据,成本会大幅上升。
对竞争对手来说,这倒是个机会。比如 Google 的 Gemini、Anthropic 的 Claude,他们也在用公开数据训练,但可能已经提前和内容平台签了授权协议。如果 OpenAI 被罚,反而可能让竞争对手的'合规'优势凸显。不过目前还不好说,需要看法院怎么判。
跟你有什么关系
你可能觉得这是公司之间的扯皮,但这事跟你我都有关系。如果你是内容创作者,这案子决定了你的作品会不会被 AI 白嫖。如果你是普通用户,以后用 AI 生成教程时,可能得留个心眼:它写的内容可能是从某个网站抄的,而且可能不准确。
我试过让 ChatGPT 写'怎么换轮胎',它给出的步骤看着像那么回事,但细节错误不少。如果它是从 WikiHow 抄的,那还好;如果是自己编的,那就危险了。作为从业者,我的建议是:用 AI 生成的教程,最好再人工核对一遍,别全信。

我的判断
从数据来看,WikiHow 的指控有事实基础,1.1 万篇文章不是小数目,而且 ChatGPT 生成的教程确实和 WikiHow 高度相似。但 OpenAI 的'合理使用'抗辩也不是没可能成功,毕竟美国法院对'转换性使用'的判定比较宽松。目前还不好说谁能赢,需要更多样本验证。
我的个人判断是:这案子大概率会和解,OpenAI 花钱消灾,WikiHow 拿钱撤诉。毕竟打官司耗时长、成本高,而且对双方都没好处。但和解金额可能会成为行业标杆,以后 AI 公司用内容平台的数据,可能都得付费。
可能的发展
短期看,OpenAI 可能会调整训练数据的来源,避免再惹上官司。长期看,AI 公司和内容平台的博弈会加剧,可能会出现更多授权协议,或者内容平台自己开发 AI 工具,用自己的数据训练模型,形成闭环。
这案子也可能推动立法,明确 AI 训练数据的版权边界。如果法律能跟上,那 AI 行业会更规范,内容创作者也能得到应有的回报。不过,这可能需要好几年,现在只能走一步看一步。
好了,不吹了,我得回去继续搬砖了,今天的代码还没写完呢。
本文基于 media 公开报道编译解读
本文基于 media 公开报道编译解读,查看原文