开源项目

京东开源实时视频编辑模型,实现边看边改

Heooo 08月05日12时35分 27 阅读

「京东宣布开源自研实时流式视频编辑模型JoyAI-Video-Edit,支持720P分辨率下每秒30帧的推理速度,可对任意时长视频进行实时编辑。该模型在OpenVE-Bench评测中全面领先国际同类模型,覆盖全局风格、局部替换等任务,并为机器人训练数据合成提供新路径。」

京东近日宣布开源其自研的实时流式视频编辑模型JoyAI-Video-Edit,这一模型允许用户在视频播放过程中实时修改人物与场景,将传统“先有素材再修改”的创作流程转变为“边观看边创作”的互动体验。官方表示,在流式实时视频编辑方向,该模型对比当前业内代表性模型各项指标全面领先,达到世界一流水平。

视频实时编辑的核心挑战在于处理速度。视频由连续帧画面组成,若模型推理速度无法跟上播放速度,便会出现卡顿与延迟。JoyAI-Video-Edit基于全自研的JoyAI-Video模型,在720P分辨率下实现了每秒30帧的模型推理速度,能够保持较高画面清晰度的同时,跟上常见影视视频的播放节奏,为实时编辑提供了技术基础。

视频长度同样是流式编辑的关键门槛。此前,流式编辑模型通常只能处理几秒或分钟级的片段,而JoyAI-Video-Edit支持任意时长的稳定流式编辑,可随着视频持续播放而持续处理。用户无需等待整段视频生成完成,即可在播放过程中实时修改场景、替换物体、调整人物形象或改变画面风格,极大提升了创作灵活性与效率。

为了评估模型能力,研究团队将JoyAI-Video-Edit与SANA Streaming、LiveEdit、Xmax-X2.0等国际代表性流式视频编辑模型进行了对比。结果显示,在覆盖典型视频编辑场景的评测数据中,JoyAI-Video-Edit整体效果全面领先。在业界权威的OpenVE-Bench通用评测中,该模型超越了目前所有的流式编辑方法,尤其在全局风格、局部替换、局部删除和字幕编辑等任务中优势突出,大幅领先行业同类模型。

具体应用场景方面,创作者可以让视频中的人物连续更换服装,在直播中把普通街道变成动画世界,也可以在家装设计中尝试不同的家具、墙面和灯光效果。这些功能不仅适用于娱乐创作,也为专业视频制作提供了高效工具。

值得注意的是,JoyAI-Video-Edit还为具身智能数据的大规模合成提供了新的技术路径。机器人训练需要大量物体抓取、搬运与操作视频,但真机数据采集成本高,危险或少见场景也难以反复采集。依托对场景、物体与画面内容的可控编辑能力,该模型可将人手操作视频转化为机械手或机械臂操作素材,并在保留物体位置、空间关系与动作轨迹的基础上,替换场景、物体与机器人形态,使一段视频扩展出更多训练样本。

从视频创作到机器人训练数据合成,JoyAI-Video-Edit的开源有望为多个赛道带来新的发展机遇。其技术突破不仅提升了视频编辑的实时性与交互性,也为AI在创意产业和机器人领域的应用拓展了边界。

# 京东 # 视频编辑 # 开源模型 # 实时推理 # 具身智能

来源:Heooo AI工具导航