谷歌 DeepMind 发布 GenCeption 模型,基于阿里 Wan2.1 打造
谷歌 DeepMind 发布 GenCeption 模型,将预训练视频生成器逆向改造为可理解世界的视觉分析引擎,打破传统计算机视觉「一个任务一个专用模型」的格局,仅凭单一模型就能完成深度估计、图像分割等多项核心视觉任务。该模型基于阿里巴巴开源视频模型通义万相 Wan2.1 系列训练,一次前向传播即可完成预测以提升处理速度,通过文本提示指定任务并输出对应结果。其训练数据以 7500 段由数字人体模型、动作捕捉序列结合 Blender 渲染生成的单人合成视频为主,却可处理真实多人视频,还能迁移到动物和类人机器人类别,部分输出细节超渲染结果。性能上,小模型处理 81 帧视频约需 6 秒,140 亿参数量的大模型处理同样长度视频约需 10 秒。
