技术进展

京东开源实时视频编辑模型JoyAI-Video-Edit

Heooo 08月06日01时02分 28 阅读

「京东开源自研实时流式视频编辑模型JoyAI-Video-Edit,支持720P下每秒30帧推理,实现边播边改,任意时长稳定编辑,各项指标领先国际同类模型,并为具身智能数据合成提供新路径。」

京东近日宣布开源自研的实时流式视频编辑模型JoyAI-Video-Edit,这一创新工具允许用户在观看视频的同时,实时修改人物与场景,将视频创作从传统的“先有素材再修改”模式,转变为可实时互动编辑的新体验。该模型基于全自研的JoyAI-Video基础模型,在720P分辨率下实现了每秒30帧的模型推理速度,能够跟上常见影视视频的播放节奏,同时保持较高的画面清晰度,有效解决了视频实时编辑中的速度瓶颈。

视频长度一直是流式编辑的一大挑战。此前,业界流式编辑模型通常只能处理几秒或分钟级的片段,而JoyAI-Video-Edit支持任意时长的稳定流式编辑,能够随着视频持续播放、持续处理。用户无需等待整段视频生成完毕,即可在播放过程中实时修改场景、替换物体、调整人物形象或改变画面风格,真正实现“边观看边创作”。例如,创作者可以让视频中的人物连续更换服装,在直播中把普通街道变成动画世界,也可以在家装设计中尝试不同的家具、墙面和灯光效果,极大提升了创作灵活性和效率。

为了验证模型性能,研究团队将JoyAI-Video-Edit与SANA Streaming、LiveEdit、Xmax-X2.0等国际代表性流式视频编辑模型进行了对比。结果显示,在覆盖典型视频编辑场景的评测数据中,JoyAI-Video-Edit整体效果全面领先。在业界权威的OpenVE-Bench通用评测中,该模型超越了目前所有的流式编辑方法,尤其在全局风格、局部替换、局部删除和字幕编辑等任务中优势突出,大幅领先行业同类模型。

除了视频创作,JoyAI-Video-Edit还为具身智能数据的大规模合成提供了新的技术路径。机器人训练需要大量物体抓取、搬运与操作视频,但真机数据采集成本高昂,且危险或少见场景难以反复采集。依托对场景、物体与画面内容的可控编辑能力,JoyAI-Video-Edit可将人手操作视频转化为机械手或机械臂操作素材,并在保留物体位置、空间关系与动作轨迹的基础上,替换场景、物体与机器人形态,让一段视频扩展出更多训练样本,为机器人学习提供丰富且低成本的数据源。

目前,JoyAI-Video-Edit已开源,开发者可通过Hugging Face和GitHub获取模型代码。这一开源举措不仅展示了京东在AI视频技术领域的研发实力,也为全球开发者社区提供了强大的工具,有望推动视频编辑和具身智能领域的进一步创新。

# 京东 # 视频编辑 # 开源模型

来源:Heooo AI工具导航