京东开源视频编辑模型实现“边播边改”
本报讯(融媒体中心 李玉凤)近日,北京经开区企业京东宣布开源自研的实时流式视频编辑模型JoyAI-Video-Edit。该模型让用户无需等待整段视频生成完成,即可在播放过程中实时修改人物、场景与画面风格,且支持任意时长视频的持续流式编辑,真正实现视频“边播边改”。
“视频实时编辑首先要解决速度问题。视频由一帧帧连续画面组成,如果模型处理速度跟不上播放速度,就会出现卡顿与延迟。JoyAI-Video-Edit基于京东全自研JoyAI-Video模型,在720P分辨率下实现每秒30帧的模型推理速度,能够在保持较高画面清晰度的同时,跟上常见影视视频的播放节奏。”京东有关负责人介绍道。
视频长度也是流式编辑的一道门槛。此前的流式编辑模型只能处理几秒或分钟级片段,而JoyAI-Video-Edit支持任意时长的稳定流式编辑,可以随着视频持续播放、持续处理。用户不必等待整段视频生成完成,就能在播放过程中实时修改场景、替换物体、调整人物形象或改变画面风格,实现“边观看边创作”。
该负责人表示,JoyAI-Video-Edit的实时流式编辑能力,可为零售营销、家装设计、影视制作等大量真实场景带来新的技术支持:服装与商品展示视频可以快速更换人物穿搭、商品和背景;家装视频可以实时切换家具与装修风格;影视创作者也可以更快尝试人物造型、场景和视觉效果,减少重复拍摄与整段返工。
据介绍,为了评估模型能力,研究团队将JoyAI-Video-Edit与SANA Streaming、LiveEdit、Xmax-X2.0等国际上有代表性流式视频编辑模型进行对比。结果显示,在覆盖典型视频编辑场景的评测数据中,JoyAI-Video-Edit整体效果全面领先。在业界权威的OpenVE-Bench通用评测中,JoyAI-Video-Edit超越了目前市场现有的流式编辑方法,在全局风格、局部替换、局部删除和字幕编辑等任务中优势突出,领先行业同类模型。
不止视频创作,JoyAI-Video-Edit还为具身智能数据大规模合成提供了新的技术路径。机器人训练需要大量物体抓取、搬运与操作视频,但真机数据采集成本较高,危险或少见场景也难以反复采集。依托对场景、物体与画面内容的可控编辑能力,JoyAI-Video-Edit可将人手操作视频转化为机械手或机械臂操作素材,并在保留物体位置、空间关系与动作轨迹的基础上,替换场景、物体与机器人形态,让一段视频扩展出更多训练样本。
当前,京东正在加速建设全球最大物理世界运营中心,并已经形成面向物理世界的JoyAI模型矩阵:JoyAI-Image-Edit让AI理解与编辑空间,JoyAI-Echo面向长音视频生成,JoyAI-VL-Interaction让AI持续观察并实时回应,JoyAI-Talker提供实时语音交互能力,JoyAI-RA面向机器人操控,形成覆盖语音、图像、视频、实时交互与具身智能的基础模型体系。JoyAI-Video-Edit模型的开源,标志着京东物理世界模型矩阵进一步完善,也为具身智能大规模数据合成积累了关键的底层技术能力。