← 返回每日热点
BiFish original · 2026-08-06

Sand.ai开源千亿参数视频模型,但视频生成的Scaling Law可能是个伪命题

我盯着Sand.ai刚开源的这个叫**Sand-VL-1**的模型看了半天,参数量说是达到了**千亿级**,而且用了**MoE架构**。数字上确实很唬人,全球首个,开源,还跟Scaling Law扯上

我盯着Sand.ai刚开源的这个叫Sand-VL-1的模型看了半天,参数量说是达到了千亿级,而且用了MoE架构。数字上确实很唬人,全球首个,开源,还跟Scaling Law扯上了关系。但说实话,我的第一反应不是兴奋,而是怀疑。

视频生成领域的‘军备竞赛’,参数量恐怕不是最关键的变量。

从数据来看,图像生成领域Stable Diffusion的成功,核心从来不是参数量的绝对值。它用相对小的模型,通过海量数据和精巧的架构设计,实现了惊人的效果。Sand.ai这次把参数规模拉到千亿级别,用MoE来管理复杂度,思路是清晰的,但问题在于:视频生成的瓶颈,真的在模型‘大小’上吗?

参数军备赛

这事儿得从根上说。文本大模型的Scaling Law已经被反复验证,参数量、数据量、计算量之间存在可预测的幂律关系,简单说就是‘大力出奇迹’。OpenAI的GPT系列就是这条路线的信徒和受益者。于是,一个惯性思维就来了:图像、视频生成,是不是也能这么干?

Sand.ai显然认为能。MoE(Mixture of Experts)架构的好处是,在拥有巨大总参数量的同时,推理时只激活一部分‘专家’,理论上能在提升模型容量的同时控制计算成本。这是他们为视频生成Scaling找的路。但这里有一个关键区别被忽略了。文本模型的‘知识’可以相对干净地编码进参数里,而视频模型要处理的,是时空连续性、物理规律、光影变化、角色一致性这些极其复杂且难以用纯数据暴力堆叠解决的约束。把参数从百亿拉到千亿,对这些硬约束的改善,能像文本模型那样呈线性甚至超线性增长吗?我打一个问号。

对谁影响最大

直接说结论:对行业头部玩家和学术界冲击最大,对中小开发者和普通用户,短期内是‘雷声大,雨点小’。

为啥?千亿参数的MoE模型,即使推理时部分激活,其计算需求和内存占用依然是天文数字。一个普通的独立开发者或小团队,连部署一张4090都得精打细算,拿什么去跑这个庞然大物?更别提需要海量高质量视频数据进行微调和适配。这次开源,更像是Sand.ai向Meta、Runway、Pika这些巨头递交的一份‘技术实力宣言’,告诉市场:‘看,这条路我们也能走,而且走得很快。’

真正的竞争焦点会迅速转移到工程化能力和垂直场景应用上。谁能把这个笨重的‘大力神’模型,通过蒸馏、量化、架构裁剪,变成能在消费级显卡上流畅运行的‘灵巧工具’,谁才能真正吃到市场的蛋糕。否则,它就只是论文和新闻稿里的一个漂亮数字。

巨头的游戏

这件事的深层逻辑,是AI生成领域话语权的争夺。文本大模型的格局基本被几家巨头锁定了,后来者想破局太难。但视频生成,尤其是电影级、工业级的视频生成,还是一片未完全开垦的处女地。这里的技术门槛、数据需求、算力成本都高得吓人,天然就是巨头们的游乐场。

Sand.ai开源这个模型,一步就把‘千亿参数视频生成’这个门槛立起来了。这会迫使所有想在这个赛道玩耍的玩家——无论是大厂还是明星创业公司——必须重新评估自己的技术路线。跟不跟?怎么跟?是也去卷参数,还是另辟蹊径在数据质量、多模态对齐、编辑控制性上做出差异化?这会让原本就烧钱的赛道,雪上加霜。一些技术储备不足的公司,可能会被这记‘参数重拳’直接打懵,甚至考虑战略收缩或转型。

拿Sora来说。OpenAI的Sora炸街靠的是长达一分钟的连贯性对物理世界的惊人理解,它至今没有透露具体参数规模,但业界猜测绝对不小。Sand.ai的思路和Sora有相似之处,都是通过极大规模模型来追求生成能力的涌现。但Sora背后是OpenAI近乎无限的算力和数据支持,以及GPT系列锤炼出的顶级工程能力。Sand.ai这次开源,某种程度上是走了一条‘用开源社区力量对抗闭源巨头’的路,这很大胆,但也很冒险。

跟你有什么关系

如果你是影视、广告、游戏行业的从业者或创业者,这件事需要你关注,但别焦虑。短期(一到两年)内,它很难直接替代你的工作流程。这个模型更可能率先在‘概念视频生成’、‘特效预演’、‘短视频素材批量生产’这些对绝对质量要求不是极致,但对创意和效率要求极高的场景落地。

比如,一个短视频团队想快速生成一系列不同风格的太空战斗场景作为脚本参考,以前可能需要找动画师做简易动态分镜,现在或许可以直接用类似的模型生成数十个版本,成本从上万降到几百块,周期从一周压缩到几小时。这才是它最可能的价值切入点。

但如果你想用它直接生成一部可交付的商业广告片,目前还不好说。一致性、细节可控性、版权清晰度,这些行业核心需求,靠单纯扩大参数规模是解决不了的。

对于技术从业者和研究者,这是个绝佳的学习和实验对象。研究MoE架构在视频生成中的具体表现,分析它的数据管线,甚至为它贡献优化代码,都可能带来技术上的收获。开源的意义就在于此——降低探索成本。

现阶段,它更像是一颗投入平静湖面的参数‘核弹’,波纹会荡漾开去,但湖底的地形(技术瓶颈)并没有改变。

说到底,Sand.ai的这次开源,技术意义大于即时产品意义。它验证了MoE架构在视频生成超大规模化上的可行性,这是一条清晰的技术路径。但视频生成真正的‘iPhone时刻’,需要的不是一个参数怪兽,而是一个可控、易用、可靠、且能在现有硬件上运行的工具包。参数Scaling是通往那个工具包的路之一,但绝不是唯一的路,甚至可能不是那条风景最好的路。

这件事最大的影响,可能是会加速行业对视频生成技术路线的反思和分化。一部分人会继续在参数规模上狂奔,另一部分人会转向小而美的专用模型、更优质的数据工程、更精细的控制技术。

所以,一句话判断:技术上有亮点,但别神化;开源有价值,但门槛依然高。它告诉行业‘这条路能走’,但没保证‘这是最好的路’。

本文基于 media 公开报道编译解读,查看原文

公开来源
  1. 全球首个千亿级MoE视频模型开源!Sand.ai给视频生成Scaling找了条新路