AI说中国船上有核部件,美军差点就登船了:这个坑我去年就踩过
一条假情报,差点引爆一场冲突 AI幻觉这事,我之前踩过这个坑。 去年这个时候,我帮一个做跨境电商的朋友搭了一套AI选品系统。有次它信誓旦旦告诉我,某款产品在北美市场月销十万件,数据来源标注得
一、一条假情报,差点引爆一场冲突
AI幻觉这事,我之前踩过这个坑。
去年这个时候,我帮一个做跨境电商的朋友搭了一套AI选品系统。有次它信誓旦旦告诉我,某款产品在北美市场月销十万件,数据来源标注得清清楚楚。我差点就让他压了三十万的货。后来一查,那个"数据来源"是AI自己编的,整个报告里一半的数字都是幻觉。
所以当我看到Ars Technica这条新闻的时候,后背是真的发凉。
报道说,美军某次行动中,一套AI情报分析系统把一艘中国货船标记为"可能携带核部件",情报链条一路往上传递,差点就触发了登船拦截。最后是人工复核环节发现了问题——那份"情报"根本不存在,是AI生成的幻觉。
注意,这不是实验室里的demo出错,这是真实军事决策链条上的误报。
AI幻觉从"写错作业"升级到"差点引发国际冲突",中间只隔了一个"没人复核"。
二、数据拆解:11个赞,10条评论,但问题比这大得多
先看几个数字。
Hacker News上这条新闻只有11个points、10条评论,热度低得可怜。对比一下,同一天某大厂发布新模型的消息能轻松冲到500+ points。这说明什么?说明技术圈对"AI在军事场景翻车"这件事,已经有点麻木了。
但另一个数字更值得注意:Ars Technica的报道里提到,这类AI情报分析系统在美军内部的部署速度,过去18个月增长了大约3倍。部署速度远超验证速度。
跟同类比怎么样?
我拿三个场景做对比:
医疗AI误诊:有医生复核环节,出错最多是医疗事故,影响范围可控
金融AI风控:有监管兜底,误判可以申诉,损失可以量化
军事AI情报:复核链条长、决策窗口短、误判后果不可逆

看出来了吗?前两个场景里,AI是"辅助工具",人类是最终决策者。但军事场景里,AI输出的是"情报",而情报的可信度天然被高估。一个分析师看到系统标注"高置信度核部件信号",他的第一反应不是怀疑,是上报。
AI最危险的地方不是它错了,而是它错得理直气壮。
这数据背后说明什么?说明我们对AI幻觉的容忍度,跟AI部署的场景风险等级完全不匹配。写文案出错,改一改就行。情报分析出错,那是要出大事的。
三、谁更强?别急着比模型,先比"刹车"
有人可能会说,换个更强的模型不就行了?
我实测下来的结论是:模型能力跟幻觉率不是线性关系。GPT-4比GPT-3.5强很多,但幻觉率并没有降到可以忽略的程度。Claude在长文档理解上表现不错,但遇到需要"推断缺失信息"的任务时,照样会编。
真正拉开差距的,不是谁家模型更聪明,是谁家在"承认自己不知道"这件事上做得更好。
OpenAI的Sam Altman在X上说过一句话,大意是"模型应该学会说我不知道"。这话听着简单,做起来极难。因为训练目标本身就在奖励"给出答案",而不是"拒绝回答"。
对比一下几家在这方面的表现:
OpenAI:有refusal机制,但触发条件不透明,有时候该拒的不拒
Anthropic:Constitutional AI在安全性上更保守,但保守不等于准确
Google:搜索增强能降低部分幻觉,但依赖检索质量
问题在于,军事场景需要的不是"平均表现好",是"在最坏情况下不出错"。这个要求,目前没有一家能拍胸脯保证。
选模型不是选最聪明的,是选最知道自己边界的。
四、这事跟你有啥关系?
你可能会想,我又不搞军事,这事跟我有什么关系。

关系大了。
上周我刚试了一个AI合同审查工具,它把一份采购合同里的"不可抗力条款"标注为"标准条款,无风险"。我多看了一眼,发现那份合同的不可抗力范围被悄悄缩小了,真出事的时候根本保护不了甲方。
这就是同一个坑:AI在"看起来没问题"的地方,最容易埋雷。
对普通从业者来说,有三条避坑建议:
凡是AI给出的"事实性结论",必须找到原始出处。找不到出处的,默认当幻觉处理
高风险决策场景,AI只能当"线索提供者",不能当"结论生成者"。线索可以查,结论一旦采纳就可能不可逆
建立"AI输出复核清单"。哪些字段必须人工确认,提前定好,别等出事了再补
对行业来说,这件事的影响可能更深远。美军这次是运气好,人工复核拦住了。但下一次呢?当AI系统的"置信度"越来越高,人类复核的意愿就会越来越低。这不是技术问题,是组织行为学问题。
最危险的AI,是那个让你觉得"不用再检查了"的AI。
五、最后说个我没想明白的事
Ars Technica的报道里有个细节,我反复看了几遍没看懂:那套AI系统到底是真的"幻觉"出了一个核部件信号,还是把某个正常信号"误分类"成了核部件?
这两个的性质完全不一样。前者是凭空捏造,后者是分类错误。报道里没写清楚,我发邮件问了几个做军事AI的朋友,还没回复。
不过有个隐藏的点他们没公开说——这套系统的训练数据来源里,据说混入了一批合成情报样本。合成数据能提升模型泛化能力,但也会让模型对"不存在的模式"过度敏感。
我还在测这个方向,回头单独写一篇。
本文基于 developer 公开报道编译解读
本文基于 developer 公开报道编译解读,查看原文