直播间里,服饰主播试完白色上衣,观众又想马上看到蓝色款是什么效果,可蓝色款不在身边。视频聊天时,和朋友畅想穿越到古代当侠客,想让美好的想象瞬间变为精美视频呈现出来。类似这样的问题,今后都能轻松解决。8月5日,京东宣布开源自研的实时流式视频编辑模型JoyAI-Video-Edit,用户可以一边观看视频,一边修改人物与场景,让视频创作从“先有素材再修改”变为可实时互动编辑。
视频实时编辑首先要解决速度问题。技术人员表示,视频由一帧帧连续画面组成,如果模型处理速度跟不上播放速度,就会出现卡顿与延迟。JoyAI-Video-Edit基于全自研JoyAI-Video模型,在720P分辨率下实现每秒30帧的模型推理速度,能够在保持较高画面清晰度的同时,跟上常见影视视频的播放节奏。
视频长度也是流式编辑的一道门槛。此前的流式编辑模型只能处理几秒或分钟级片段,而JoyAI-Video-Edit支持任意时长的稳定流式编辑,可以随着视频持续播放、持续处理。用户不必等待整段视频生成完成,就能在播放过程中实时修改场景、替换物体、调整人物形象或改变画面风格,实现“边观看边创作”。
例如,创作者可以让视频中的人物连续更换服装,在直播中把普通街道变成动画世界,也可以在家装设计中尝试不同的家具、墙面和灯光效果……视频创作由一次性生成变成了可以持续调整的过程。
视频能够“边播边改”,究竟能在哪些行业发挥作用?据了解,这种能力将为零售营销、家装设计、影视制作等大量真实场景带来新的技术支持:服装与商品展示视频可以快速更换人物穿搭、商品和背景;家装视频可以实时切换家具与装修风格;影视创作者也可以更快尝试人物造型、场景和视觉效果,减少重复拍摄与整段返工。
不止视频创作,JoyAI-Video-Edit还为具身智能数据大规模合成提供了新的技术路径。过去,机器人训练需要大量物体抓取、搬运与操作视频,但真机数据采集成本较高,危险或少见场景也难以反复采集。依托对场景、物体与画面内容的可控编辑能力,JoyAI-Video-Edit可将人手操作视频转化为机械手或机械臂操作素材,并在保留物体位置、空间关系与动作轨迹的基础上,替换场景、物体与机器人形态,让一段视频扩展出更多的训练样本,为具身智能大规模数据合成积累底层技术。
来源:北京日报客户端
记者:孙奇茹