小米用两台原型机,给所有手机厂商出了一道难题
一个被忽略的数字 295 Tokens 每秒。 如果你对这个数字没概念,我换一种说法:目前主流旗舰手机跑端侧大模型,推理速度普遍在 30-80 Tokens 每秒之间。小米玄戒 O100 原
一个被忽略的数字
295 Tokens 每秒。
如果你对这个数字没概念,我换一种说法:目前主流旗舰手机跑端侧大模型,推理速度普遍在 30-80 Tokens 每秒之间。小米玄戒 O100 原型机给出的这个数字,差不多是行业平均水平的 4 到 10 倍。
但问题来了——这是一台砍掉摄像头、塞进主动风冷、主板完全推翻重做的「非正常手机」。
一个不能拍照的手机,还是手机吗?小米到底想干什么?
时间线上的三步棋
要理解这次动作,得先理清楚小米在芯片这条路上的时间线。
2017 年,小米发布澎湃 S1,那是雷军第一次尝试自研 SoC,市场反响平淡,后续产品线也一度沉寂。2021 年之后,小米转向 ISP 芯片(澎湃 C 系列)、充电管理芯片(澎湃 P 系列)和电池管理芯片(澎湃 G 系列),走的是「农村包围城市」的路线——先在非核心芯片上积累经验和口碑。
然后是这次。玄戒 O3、O100、D100 三款芯片同时亮相,覆盖了应用处理器、端侧 AI 加速和数据处理三个关键领域。这不是试探,这是全面出击。
从布局节奏来看,小米用了大约 8 年时间,完成了从「试水」到「全面铺开」的过渡。这个速度算快还是慢?从数据来看,苹果从 A4 到真正建立起芯片壁垒,用了差不多 6 年。考虑到小米中间经历过战略摇摆,8 年时间并不算离谱。
玄戒 O100 原型机最值得注意的地方,不是那 295 Tokens 的速度,而是它采用了 玄戒 O3 与 O100 双芯协同计算 的架构。换句话说,小米不满足于做一个「能跑 AI 的手机芯片」,它要做的是一套专门服务于端侧大模型的异构计算系统。砍掉影像模块、推翻主板设计、加装 10 瓦主动风冷——这些极端做法都指向同一个目标:为 AI 推理让路。
小米的意图很明确:它不是在现有手机上「加一个 AI 功能」,而是在重新定义「手机应该为谁服务」。

那台迷你主机,才是真正的杀招
说实话,玄戒 O100 原型机更像是一个技术宣言,真正让我觉得「这事有点意思」的,是另一款产品——Xiaomi AI Cube。
一台迷你主机,航空铝一体成型,33,874 个 CNC 精密镂空散热孔,150 瓦持续性能释放。内部塞了玄戒 O3、O100 和 D100 三颗芯片,配备 80GB 统一内存,可以部署 120B 参数的大模型和 3B 参数的端侧模型,还能做快慢系统切换。
这台设备瞄准的场景非常具体:个人开发者的本地 AI 工作站。
我举一个实际的例子。我一个做独立开发的朋友,目前每天的工作流大概是这样的:用 Claude 帮他写代码框架,用本地跑的 CodeLlama 做代码补全,偶尔用 GPT-4o 处理一下复杂逻辑。他的机器是一台 M2 Mac Studio,32GB 内存,跑 70B 的模型已经比较吃力,120B 根本跑不动。
如果 AI Cube 真的能在本地流畅跑 120B 模型,而且价格控制在 2-3 万元区间——这是一台可以改变工作方式的设备。不需要联网,没有 API 调用费用,数据不出本地,响应速度取决于硬件而非网络。对于敏感行业的开发者来说,这个价值点非常清晰。
当然,从数据来看,120B 模型在 80GB 内存上能否真正流畅运行,还要看量化精度和实际负载情况。目前还不好说这 80GB 的统一内存在实战中的表现到底如何,需要更多样本验证。
对手们慌不慌?
我们来做个对比分析。
苹果有 M 系列芯片,生态封闭但体验一致。高通有骁龙 X Elite,主攻 PC 端 AI 计算。联发科走的是性价比路线,天玑系列在中高端市场站稳了脚跟。英伟达不用说,专业 AI 计算领域的绝对霸主。
小米这次的打法,和上述所有人都不太一样。
苹果和高通在做的事是「把 AI 能力塞进现有产品」,而小米做的事是「为 AI 能力重新设计产品」。这个区别很关键。玄戒 O100 原型机砍掉摄像头这件事,本质上是一种产品哲学的表达——小米认为,在某些场景下,AI 推理能力比拍照能力更重要。

但我必须指出一个现实问题:芯片设计和芯片量产之间,隔着一条巨大的鸿沟。澎湃 S1 当年的问题不是设计不行,而是量产良率和后续迭代跟不上。这次玄戒系列能否避免同样的坑,目前信息太少,我没法下结论。
作为一个被各种 AI 工具坑过无数次的人,我见过太多「原型机惊艳、量产机平庸」的案例。小米这次能不能跳出这个循环,是决定一切的关键变量。
OpenAI 的 Sam Altman 前段时间在 X 上多次提到端侧 AI 的重要性,认为未来的 AI 体验一定是云端和端侧混合的。小米这两台原型机,某种意义上是在响应这个判断——但它走的路线比 OpenAI 想象的更激进。OpenAI 想的是手机上跑一个小模型做预处理,小米想的是在本地跑一个接近云端能力的大模型。
这种路线差异背后,是两家公司对用户隐私和计算成本的不同理解。小米赌的是:用户愿意为「数据不出设备」这个承诺支付更高的硬件成本。
跟你有什么关系
如果你是普通消费者,短期内玄戒芯片对你影响不大。这两台都是原型机,离量产还有距离。但从中期来看,如果小米成功把这套装进未来的折叠屏手机或平板里,你在本地就能完成的事情会多很多:实时语音翻译、离线照片编辑、本地文档摘要——不需要联网,不需要订阅,不担心隐私泄露。
如果你是从业者,尤其是做 AI 应用开发的,这背后的趋势值得关注。端侧模型推理速度从 30 Tokens 到 295 Tokens,不只是「快了」这么简单——它意味着原本不可能在端侧运行的应用场景,现在变得可能了。实时对话、实时翻译、实时代码补全,这些对延迟敏感的应用,会因为这个量级的速度提升而变得可用。
再往大了说,如果端侧 AI 能力真的突破了某个临界点,目前以云端为主的 AI 服务商业模式都会受到冲击。谁还愿意每个月花 20 美元订阅 API,如果自己的设备就能跑?
当然,这个「如果」目前还很大。从原型到量产,从单一场景到生态覆盖,中间还有很长的路要走。
我赌 18 个月之内,至少会有一家国内大厂跟进,发布类似的「为 AI 推理重新设计」的硬件产品。至于小米自己,如果 2026 年上半年拿不出基于玄戒芯片的量产设备,这次的技术秀就会沦为又一个 PPT 发布会。
本文基于 media 公开报道编译解读
本文基于 media 公开报道编译解读,查看原文