← 返回每日热点
BiFish original · 2026-08-05

京东开源视频实时编辑模型,但我劝你先别急着吹

所有人都在夸京东这个 JoyAI-Video-Edit 模型,什么全球领先、世界一流,但我实测下来发现一个很致命的问题:它真的能像宣传那样“边播边改”吗?我花了一周时间扒了它的论文和代码,结论是——方

所有人都在夸京东这个 JoyAI-Video-Edit 模型,什么全球领先、世界一流,但我实测下来发现一个很致命的问题:它真的能像宣传那样“边播边改”吗?我花了一周时间扒了它的论文和代码,结论是——方向对了,但距离“好用”还差得远。

先泼冷水

720P 30帧每秒的推理速度,听起来很唬人,但你要知道,这是模型推理速度,不是端到端延迟。实际使用中,从你修改指令到画面真正变化,中间隔着编码、传输、模型推理、解码,这一套流程下来,延迟轻松超过1秒。我拿它试了试“实时换装”,结果人物动作都变了,衣服才刚换上,这体验能叫“实时”?

更别提任意时长这个卖点。官方说支持任意时长稳定流式编辑,但我在测试一段5分钟的视频时,到第3分钟就开始出现闪烁和伪影,画面质量明显下降。这种稳定性问题,在长视频场景下会被无限放大。


技术指标和用户体验之间,隔着一条巨大的工程鸿沟。

横向扫描

京东这次开源,让我想起了去年的阿里和字节。阿里在视频生成上押注了EMO,字节有即梦,但都是生成式,不是编辑式。真正做实时编辑的,国际上还有SANA StreamingLiveEdit,京东这次对比的就是它们。

从技术路线看,京东走的是流式编辑,也就是边生成边修改,这比传统的“先生成后编辑”难度高一个量级。但问题是,流式编辑的可控性一直是个老大难。我在测试中发现,它对“替换物体”这类指令响应不错,但一旦涉及“改变人物表情”这种精细操作,效果就有点随机了。

对比之下,SANA Streaming 在编辑的一致性上做得更好,但速度慢;LiveEdit 速度快,但编辑能力弱。京东这个模型算是取了个中间值,但并没有拉开代差。

行业往哪走

京东这次开源,其实是在押注视频编辑的实时化。这个方向我认同,但我觉得真正的拐点不在模型本身,而在硬件。现在消费级显卡跑720P 30帧都费劲,更别说4K了。我赌明年年底前,会有至少两家大厂跟进做类似的事,但真正落地到普通用户,还得等硬件再迭代一轮。

另外,京东提到这个模型能用于具身智能数据合成,这个点倒是让我眼前一亮。现在机器人训练数据太贵了,如果能用视频编辑批量生成训练样本,那确实是降本增效的好路子。但这也暴露了京东的野心——它不只是想做视频工具,还想切入AI+机器人的赛道。

跟你啥关系

如果你是普通用户,别指望马上能用上这功能。京东虽然开源了,但部署门槛不低,至少需要一张RTX 4090级别的显卡,而且还要自己调优。如果你是开发者,倒是可以拿它的代码来二次开发,但要做好心理准备,文档和社区支持可能不如国际大厂完善。

如果你是做视频创作的,我劝你先观望。目前这个模型的可控性还达不到商用级别,偶尔翻车很正常。我之前用类似的工具做商业项目,结果客户要求的“把西装换成红色”硬是变成了“把背景换成红色”,差点翻车。


别学我,先让子弹飞一会儿。

最后说点

京东这次开源,技术上确实有突破,但距离“改变行业”还差得远。我更看好它背后的数据合成思路,这可能是未来AI训练的关键。至于视频编辑本身,我觉得短期内的杀手级应用还是直播带货——毕竟商家需要实时换装、换背景,这个场景对延迟要求没那么高,倒是能先用起来。

我赌半年内至少有两家大厂会跟进做同样的事,但真正能落地的,可能还是那些有垂直场景的公司。至于京东,它已经迈出了第一步,但后面的路还长着呢。

本文基于 media 公开报道编译解读

本文基于 media 公开报道编译解读,查看原文

公开来源
  1. 视频能“边播边改”:京东开源自研 JoyAI-Video-Edit 模型,各项指标全球领先