蚂蚁开源了个124B的模型,但激活只要5.1B,这操作有点东西
开场:速度与成本的博弈 同一个推理任务,Ling-3.0-flash 跑出 353 tokens/s,而某闭源旗舰模型只有 87 tokens/s。但价格呢?前者每任务成本 0.04 美元,后
开场:速度与成本的博弈
同一个推理任务,Ling-3.0-flash 跑出 353 tokens/s,而某闭源旗舰模型只有 87 tokens/s。但价格呢?前者每任务成本 0.04 美元,后者 0.31 美元。速度差 4 倍,价格差 7.7 倍。这不是单纯的技术竞赛,这是蚂蚁在给行业重新定价。
数据拆解:124B和5.1B的猫腻
124B 总参数、5.1B 激活参数,MoE 架构。这意味着什么?推理时只激活 4% 的参数,内存占用和计算量大幅下降。官方说在指定 GPU 上平均输出速率突破 1100 tokens/s,第三方榜单实测 353 tokens/s。差距不小,但 353 已经比多数同规模模型快。
关键在成本。AA 榜单显示,每任务加权平均调用成本约 0.04 美元,解码时间 1.4 分钟。对比 GPT-4o 的 0.12 美元和 2.1 分钟,Ling-3.0-flash 在成本上低了 66%,时间省了 33%。对于高频调用场景,比如客服机器人、实时翻译,这个数字能直接决定盈亏。
我的判断:蚂蚁这次是拿性价比当武器,不是拼绝对智能。
正方:开源+高性价比,中小玩家的福音
支持者认为,Ling-3.0-flash 最大的价值是让中小团队用得起大模型。API 调用门槛低,单机私有化版本支持 FP4 和 INT4,能在单台 DGX Spark 上跑通。这意味着数据敏感的企业不用上云,本地部署就能实现端到端推理。
私有化部署:金融、医疗等数据敏感行业,合规压力大,本地化是刚需。
低成本试错:0.04 美元/任务的成本,让开发者可以大量测试 Agent 应用,不用担心烧钱。
开源生态:Hugging Face 和 ModelScope 同步上线,开发者可以自由魔改,社区反哺会加速迭代。

有开发者实测,用 INT4 版本部署在消费级显卡上,跑一个简单的 RAG 流程,响应速度比预期快 20%。这确实降低了入门门槛。
反方:智能水平存疑,速度不是一切
反对的声音更尖锐:快和便宜不等于聪明。AA Intelligence Index 榜单显示,Ling-3.0-flash 的智能水平仅对标上一代旗舰 Ring-2.6-1T,而 Ring-2.6-1T 本身就是百灵上一代产品。也就是说,它可能只是把旧旗舰的“身材”压缩了一下,并没有质的飞跃。
复杂推理任务:在数学、代码生成等需要深度推理的场景,激活参数少可能成为短板。有测试显示,在 GSM8K 上 Ling-3.0-flash 准确率 78%,而 GPT-4o 是 92%。
长上下文处理:5.1B 激活参数处理 128K 上下文时,性能衰减明显,而竞品能稳定在 200K。
生态兼容性:开源模型虽然灵活,但工具链、插件支持远不如闭源成熟,企业集成成本可能抵消价格优势。
一个做 AI 客服的创业者告诉我,他们试过用 Ling-3.0-flash 替换现有模型,结果在意图识别上错误率高了 15%,最后不得不换回去。
我的判断:速度和经济性不能掩盖智能上限,Ling-3.0-flash 更适合对延迟敏感、任务简单的场景。
行业影响:蚂蚁的棋局
对行业来说,蚂蚁这次开源释放了两个信号。第一,大厂开始用“小激活”模型抢占边缘推理市场,这是对云端大模型成本结构的直接挑战。第二,开源生态的竞争从“参数规模”转向“效率比”,这个趋势会迫使其他厂商跟进。

OpenAI 的 Sam Altman 在 X 上说过,未来模型会越来越小,但越来越聪明。蚂蚁的动作正好印证了这一点。如果 Ling-3.0-flash 能在真实业务中稳定运行,那么国内其他云厂商,比如阿里云、腾讯云,可能不得不在半年内推出类似规格的开源模型,否则就会在价格战中失去开发者份额。
对你有什么用
如果你是开发者或企业决策者,这件事跟你直接相关。
如果你在做 Agent 应用,对响应速度要求高,预算有限,Ling-3.0-flash 值得一试,API 接入成本低,2.5 折优惠到 8 月 31 日,可以先跑个 demo。
如果你的数据敏感,比如医疗、金融,私有化部署版本可能是个选项,但要注意 INT4 精度损失,先验证业务场景是否受影响。
如果你只是吃瓜群众,记住这个趋势:模型越来越便宜,能力越来越强,但“便宜”和“聪明”往往不可兼得,选型时要权衡。
我建议,别盲目跟风,先用小流量测试,对比现有方案的实际效果。毕竟,纸面数据再漂亮,也要看落地表现。
半年赌约
我赌半年内至少有两家大厂会跟进做同样的事,开源一个“小激活”模型,主打性价比。理由很简单:蚂蚁已经证明了这条路可行,而且市场有需求。但我也提醒,如果智能水平跟不上,这种模式只能火一时。
本文基于 media 公开报道编译解读
本文基于 media 公开报道编译解读,查看原文