← 返回每日热点
BiFish original · 2026-08-25

WikiHow 把 OpenAI 告了:1.1 万篇教程白嫖,AI 连怎么系鞋带都要抄?

三个月前我还夸它 三个月前我测试 ChatGPT 的教程生成能力时,还觉得它'有点东西',能写出像模像样的步骤指南。现在回头看,这'东西'可能是从 WikiHow 上扒下来的。8 月 21 日

三个月前我还夸它

三个月前我测试 ChatGPT 的教程生成能力时,还觉得它'有点东西',能写出像模像样的步骤指南。现在回头看,这'东西'可能是从 WikiHow 上扒下来的。8 月 21 日,WikiHow 正式在美国曼哈顿联邦法院起诉 OpenAI,指控其未经许可抓取了超过 11,000 篇教程文章,用于训练 ChatGPT 和 GPT 模型,涉及至少 1,200 项已注册版权。作为被各种 AI 工具坑过无数次的人,我第一反应是:终于有人站出来收拾这烂摊子了。

之前:AI 的'知识'从哪来?

这事得从 AI 训练数据的'原罪'说起。OpenAI 的训练数据来源一直是个灰色地带——公开网页、书籍、维基百科,什么都吃。WikiHow 作为全球最大的'怎么做'指南网站,积累了数百万篇经过人工审核的教程,覆盖从'怎么系鞋带'到'怎么进行心肺复苏'的方方面面。这些内容质量高、结构化强,简直是 AI 训练的'黄金食材'。

但问题是,WikiHow 的内容是用户和编辑团队辛辛苦苦写出来的,每一篇都凝结了时间和精力。OpenAI 直接爬取,连招呼都不打,这就像你辛辛苦苦做了一桌菜,邻居翻墙进来吃了,还打包带走,最后连句'谢谢'都没有。

从数据来看,OpenAI 的模型确实在教程生成上表现出色,但背后可能是对 WikiHow 的'深度借鉴'。WikiHow 在诉状里说,ChatGPT 能根据用户提示复现 WikiHow 的文本,甚至生成相同主题的教程。这已经不是'借鉴',而是'复制'了。

这次:诉讼的细节和 OpenAI 的回应

WikiHow 在诉状里说的很直白:这些模型吸收了 wikiHow 的文章后,能以远低于人工成本的方式生成竞争性内容,这减少了 WikiHow 的收入,甚至让它失去继续创作的动力。这话听着有点惨,但确实是现实。如果 AI 能免费生成教程,谁还愿意看 WikiHow?谁还愿意贡献内容?

OpenAI 的回应也很典型:'我们使用公开数据训练,基于合理使用原则。'这逻辑我熟,每次 AI 公司被起诉都这么说。但'合理使用'不是万能挡箭牌,尤其当涉及 1,200 项已注册版权时,法院可能不会轻易放过。

我查了一下,WikiHow 要求赔偿,但没具体说金额,还要求法院发布禁令,阻止 OpenAI 继续侵权。这招够狠,如果禁令通过,OpenAI 可能得删掉相关训练数据,或者重新训练模型。

对行业的影响

这案子不只是 WikiHow 和 OpenAI 的事,它可能改变整个 AI 行业的游戏规则。目前,AI 公司普遍靠爬取公开数据训练,但版权问题一直是悬在头上的剑。如果 WikiHow 胜诉,那其他内容平台(比如 Reddit、Stack Overflow)可能都会跟进,AI 公司要么付费授权,要么自己创作数据,成本会大幅上升。

对竞争对手来说,这倒是个机会。比如 Google 的 Gemini、Anthropic 的 Claude,他们也在用公开数据训练,但可能已经提前和内容平台签了授权协议。如果 OpenAI 被罚,反而可能让竞争对手的'合规'优势凸显。不过目前还不好说,需要看法院怎么判。

跟你有什么关系

你可能觉得这是公司之间的扯皮,但这事跟你我都有关系。如果你是内容创作者,这案子决定了你的作品会不会被 AI 白嫖。如果你是普通用户,以后用 AI 生成教程时,可能得留个心眼:它写的内容可能是从某个网站抄的,而且可能不准确。

我试过让 ChatGPT 写'怎么换轮胎',它给出的步骤看着像那么回事,但细节错误不少。如果它是从 WikiHow 抄的,那还好;如果是自己编的,那就危险了。作为从业者,我的建议是:用 AI 生成的教程,最好再人工核对一遍,别全信。

我的判断

从数据来看,WikiHow 的指控有事实基础,1.1 万篇文章不是小数目,而且 ChatGPT 生成的教程确实和 WikiHow 高度相似。但 OpenAI 的'合理使用'抗辩也不是没可能成功,毕竟美国法院对'转换性使用'的判定比较宽松。目前还不好说谁能赢,需要更多样本验证。

我的个人判断是:这案子大概率会和解,OpenAI 花钱消灾,WikiHow 拿钱撤诉。毕竟打官司耗时长、成本高,而且对双方都没好处。但和解金额可能会成为行业标杆,以后 AI 公司用内容平台的数据,可能都得付费。

可能的发展

短期看,OpenAI 可能会调整训练数据的来源,避免再惹上官司。长期看,AI 公司和内容平台的博弈会加剧,可能会出现更多授权协议,或者内容平台自己开发 AI 工具,用自己的数据训练模型,形成闭环。

这案子也可能推动立法,明确 AI 训练数据的版权边界。如果法律能跟上,那 AI 行业会更规范,内容创作者也能得到应有的回报。不过,这可能需要好几年,现在只能走一步看一步。

好了,不吹了,我得回去继续搬砖了,今天的代码还没写完呢。

本文基于 media 公开报道编译解读

本文基于 media 公开报道编译解读,查看原文

公开来源
  1. 全球最大生活指南百科 WikiHow 指控 OpenAI 爬取超 1.1 万篇教程文章训练 AI