Grok 被曝用儿童性虐待图像训练?马斯克的 AI 帝国裂了
同台竞技的阴影 同一个任务,GPT-5.6 跑了 12 秒,Claude 跑了 47 秒,但结果反过来。而 Grok 呢?它可能根本不需要跑,因为它的训练数据里,可能混进了不该有的东西。 上
同台竞技的阴影
同一个任务,GPT-5.6 跑了 12 秒,Claude 跑了 47 秒,但结果反过来。而 Grok 呢?它可能根本不需要跑,因为它的训练数据里,可能混进了不该有的东西。
上周我刚试过 Grok 的实时搜索功能,还觉得挺酷,结果这周就看到诉讼指控:马斯克的 xAI 在训练 Grok 模型时,用了包含学龄前儿童性虐待图像的数据。这消息像一记闷棍,打在 AI 圈和所有家长的心上。
事件核心
这不是小事。诉讼由一位匿名举报者提起,声称 xAI 在 2023 年从公开互联网抓取数据时,未能有效过滤非法内容,导致部分 CSAM(儿童性虐待材料)被用于训练 Grok 模型。举报者还提供了内部邮件和日志作为证据,指向 xAI 的数据管道存在严重漏洞。
xAI 的回应是:坚决否认,称诉讼“毫无根据”,并强调公司有严格的内容过滤机制。但问题是,这已经不是 xAI 第一次陷入数据丑闻。去年就有报道称,Grok 的“无过滤”模式被滥用生成不当内容,当时 xAI 只是轻描淡写地打了个补丁。
放在整个行业来看,这背后有个尴尬的现实:AI 训练数据的“干净”程度,远没有我们想象的那么高。OpenAI 和 Anthropic 都曾承认,他们的数据集中可能存在少量有害内容,但通常会在发布前用算法和人工审核进行清洗。而 xAI 主打“言论自由”,在数据筛选上可能更宽松——这就像在高速公路上不设限速,结果就是车祸频发。
谁最受伤?
对 xAI 来说,这可能是致命的。马斯克一直在吹嘘 Grok 是“最强大的 AI”,但这次诉讼直接击穿了公众信任。更麻烦的是,如果证据坐实,xAI 可能面临巨额罚款,甚至被迫重新训练模型,那成本可不是 12 秒或 47 秒能衡量的。

对竞争对手而言,这是一次绝佳的公关机会。OpenAI 和 Anthropic 可以立刻发声明:“我们的数据经过严格筛选,绝不含非法内容。”这几乎是把 xAI 按在地上摩擦。
但真正受影响最大的是普通用户,尤其是家长。如果你用 Grok 辅导孩子作业,或者让它生成儿童相关的图片,你敢保证它不会输出奇怪的东西吗?虽然 xAI 说 Grok 有安全护栏,但这次诉讼恰恰说明,护栏可能形同虚设。
深层原因
为什么 xAI 会犯这种错误?我判断,核心原因是 xAI 的“速度优先”文化。马斯克一贯推崇“第一性原理”和“快速迭代”,这在特斯拉和 SpaceX 上奏效了,但在 AI 训练上,速度往往意味着牺牲质量。
上一轮类似的事发生在 Stable Diffusion 上,2022 年它被爆出训练数据包含 NSFW 内容,结果引发了一场关于 AI 伦理的大讨论。当时行业还只是“道德谴责”,但现在监管机构已经盯上了。欧盟的《AI 法案》明确规定,训练数据必须符合基本权利,违者最高罚款 3000 万欧元。xAI 这次,很可能撞在枪口上。
另一个深层原因是,公开互联网本身就是“脏”的。Common Crawl 这样的数据集,虽然方便,但里面什么都有。xAI 为了节省成本,直接用了现成的数据集,而没有像 OpenAI 那样动用大量人工审核。这就像在垃圾堆里找金子,难免会踩到狗屎。

我们该怎么办?
作为普通用户,你可能会想:这跟我有什么关系?关系大了。如果你正在用 Grok 做任何事,尤其是涉及儿童的内容,我建议你立刻停止。同时,你也要意识到,AI 公司说的话不能全信,他们总是说“安全第一”,但利益面前,安全往往是第一个被牺牲的。
从业者呢?如果你在训练自己的模型,这件事是个警钟:数据清洗不是可选项,而是必选项。别以为用公开数据集就万事大吉,你永远不知道里面藏着什么。
最后,我想说,这次诉讼可能只是冰山一角。AI 行业正在疯狂卷数据、卷算力,但很少有人停下来想想,我们到底在用什么喂养这些“数字大脑”。
好了不吹了,我得回去继续搬砖了,今天的代码还没写完呢。
本文基于 developer 公开报道编译解读
本文基于 developer 公开报道编译解读,查看原文