您的位置:首页 > 互联网

Pika、Gen-2、ModelScope、SEINE……AI视频生成哪家强?这个框架一测便知

发布时间:2024-01-22 20:31:47  来源:互联网     背景:

声明:本文来自于微信公众号 机器之心(ID:almosthuman2014),作者:机器之心,授权转载发布。

AI 视频生成,是最近最热门的领域之一。各个高校实验室、互联网巨头 AI Lab、创业公司纷纷加入了 AI 视频生成的赛道。Pika、Gen-2、Show-1、VideoCrafter、ModelScope、SEINE、LaVie、VideoLDM 等视频生成模型的发布,更是让人眼前一亮。v⁽ⁱ⁾

大家肯定对以下几个问题感到好奇:

  • 到底哪个视频生成模型最牛?

  • 每个模型有什么特长?

  • AI 视频生成领域目前还有哪些值得关注的问题待解决?

为此,我们推出了 VBench,一个全面的视频生成模型的评测框架,来告诉你 视频模型哪家强,各家模型强在哪。

  • 论文:https://arxiv.org/abs/2311.17982

  • 代码:https://github.com/Vchitect/VBench

  • 网页:https://vchitect.github.io/VBench-project/

  • 论文标题:VBench: Comprehensive Benchmark Suite for Video Generative Models

VBench 不光能全面、细致地评估视频生成的效果,而且还特别符合人们的感官体验,能省下一大堆评估的时间和精力。

  • VBench 包含16个分层和解耦的评测维度

  • VBench 开源了用于文生视频生成评测的 Prompt List 体系

  • VBench 每个维度的评测方案与人类的观感与评价对齐

  • VBench 提供了多视角的洞察,助力未来对于 AI 视频生成的探索

AI 视频生成模型 - 评测结果

奥特曼卡片坑钱

已开源的 AI 视频生成模型

各个开源的 AI 视频生成模型在VBench 上的表现如下。

各家已开源的 AI 视频生成模型在 VBench 上的表现。在雷达图中,为了更清晰地可视化比较,我们将每个维度的评测结果归一化到了0.3与0.8之间。

各家已开源的 AI 视频生成模型在 VBench 上的表现。

在以上6个模型中,可以看到 VideoCrafter-1.0和 Show-1在大多数维度都有相对优势。

创业公司的视频生成模型

VBench 目前给出了 Gen-2和 Pika 这两家创业公司模型的评测结果。

Gen-2和 Pika 在 VBench 上的表现。在雷达图中,为了更清晰地可视化比较,我们加入了 VideoCrafter-1.0和 Show-1作为参考,同时将每个维度的评测结果归一化到了0.3与0.8之间。

Gen-2和 Pika 在 VBench 上的表现。我们加入了 VideoCrafter-1.0和 Show-1的数值结果作为参考。

可以看到,Gen-2和 Pika 在视频质量(Video Quality)上有明显优势,例如时序一致性(Temporal Consistency)和单帧质量(Aesthetic Quality 和 Imaging Quality)相关维度。在与用户输入的 prompt 的语义一致性上(例如 Human Action 和 Appearance Style),部分维度开源模型会更胜一筹。

视频生成模型 VS 图片生成模型

视频生成模型 VS 图片生成模型。其中 SD1.4,SD2.1和 SDXL 是图片生成模型。

视频生成模型在8大场景类别上的表现

下面是不同模型在8个不同类别上的评测结果。

VBench 现已开源,一键即可安装

目前,VBench 已全面开源,且支持一键安装。欢迎大家来玩,测试一下感兴趣的模型,一起推动视频生成社区的发展。

开源地址:https://github.com/Vchitect/VBench

我们也开源了一系列 Prompt List:https://github.com/Vchitect/VBench/tree/master/prompts,包含在不同能力维度上用于评测的 Benchmark,以及在不同场景内容上的评测 Benchmark。

左边词云展示了我们 Prompt Suites 的高频词分布,右图展示了不同维度和类别的 prompt 数量统计。

VBench 准不准?

针对每个维度,我们计算了 VBench 评测结果与人工评测结果之间的相关度,进而验证我们方法与人类观感的一致性。下图中,横轴代表不同维度的人工评测结果,纵轴则展示了 VBench 方法自动评测的结果,可以看到我们方法在各个维度都与人类感知高度对齐。

VBench 带给 AI 视频生成的思考

VBench 不仅可以对现有模型进行评测,更重要的是,还可以发现不同模型中可能存在的各种问题,为未来 AI 视频生成的发展提供有价值的 insights。

时序连贯性以及视频的动态程度:不要二选一,而应同时提升

我们发现时序连贯性(例如 Subject Consistency、Background Consistency、Motion Smoothness)与视频中运动的幅度(Dynamic Degree)之间有一定的权衡关系。比如说,Show-1和 VideoCrafter-1.0在背景一致性和动作流畅度方面表现很好,但在动态程度方面得分较低;这可能是因为生成没有动起来的画面更容易显得 在时序上很连贯。另一方面,VideoCrafter-0.9在与时序一致性的维度上弱一些,但在 Dynamic Degree 上得分很高。

这说明,同时做好 时序连贯性和 较高的动态程度确实挺难的;未来不应只关注其中一方面的提升,而应该同时提升 时序连贯性以及 视频的动态程度这两方面,这才是有意义的。

分场景内容进行评测,发掘各家模型潜力

有些模型在不同类别上表现出的性能存在较大差异,比如在美学质量(Aesthetic Quality)上,CogVideo 在 Food类别上表现不错,而在 LifeStyle类别得分较低。如果通过训练数据的调整,CogVideo 在 LifeStyle这些类别上的美学质量是否可以提升上去,进而提升模型整体的视频美学质量?

这也告诉我们,在评估视频生成模型时,需要考虑模型在不同类别或主题下的表现,挖掘模型在某个能力维度的上限,进而针对性地提升 拖后腿的场景类别。

有复杂运动的类别:时空表现都不佳

在空间上复杂度高的类别,在美学质量维度得分都比较低。例如,LifeStyle类别对复杂元素在空间中的布局有比较高的要求,Human类别由于铰链式结构的生成带来了挑战。

对于时序复杂的类别,比如 Human类别通常涉及复杂的动作、Vehicle类别会经常出现较快的移动,它们在所有测试的维度上得分都相对较低。这表明当前模型在处理时序建模方面仍然存在一定的不足,时序上的建模局限可能会导致空间上的模糊与扭曲,从而导致视频在时间和空间上的质量都不理想。

难生成的类别:提升数据量收益不大

我们对常用的视频数据集 WebVid-10M 进行了统计,发现其中约有26% 的数据与 Human有关,在我们统计的八个类别中占比最高。然而,在评估结果中,Human类别却是八个类别中表现最差的之一。

这说明对于 Human这样复杂的类别,仅仅增加数据量可能不会对性能带来显著的改善。一种潜在的方法是通过引入 Human相关的先验知识或控制,比如 Skeletons 等,来指导模型的学习。

百万量级的数据集:提升数据质量优先于数据量

Food类别虽然在 WebVid-10M 中仅占据11%,但在评测中几乎总是拥有最高的美学质量分数。于是我们进一步分析了 WebVid-10M 数据集不同类别内容的美学质量表现,发现 Food 类别在 WebVid-10M 中也有最高的美学评分。

这意味着,在百万量级数据的基础上,筛选 / 提升数据质量比增加数据量更有帮助。

待提升的能力:准确生成生成多物体,以及物体间的关系

当前的视频生成模型在 多对象生成(Multiple Objects)和 空间关系(Spatial Relationship)方面还是追不上图片生成模型(尤其是 SDXL),这凸显了提升组合能力的重要性。所谓组合能力指的是模型在视频生成中是否能准确展示多个对象,及它们之间的空间及互动关系。

解决这一问题的潜在方法可能包括:

  • 数据打标:构建视频数据集,提供对视频中多个物体的明确描述,以及物体间空间位置关系以及互动关系的描述。

  • 在视频生成过程中添加中间模态 / 模块来辅助控制物体的组合和空间位置关系。

  • 使用更好的文本编码器(Text Encoder)也会对模型的组合生成能力有比较大的影响。

  • 曲线救国:将 T2V 做不好的 物体组合问题交给 T2I,通过 T2I+I2V 的方式来生成视频。这一做法针对其他很多视频生成中的问题或许也有效。


返回网站首页

本文评论
VIFA将于8月17日发布全球首款ChatGPT音箱“ChatMini”_vtc音响
8月11日 消息:智度股份宣布,全球首个内置 ChatGPT 智能音箱Vifa ChatMini 将于8月17日发布,售价为259美元。天府可乐又停产了么4款折叠屏正面对比gmv最大的电商该智能音箱具有...
日期:08-11
Arm虚拟硬件正式上线百度智能云,加速本土开发者实现创新「arm虚拟化部署云手机」
通信世界网消息(CWW)Arm 今日宣布 Arm 虚拟硬件 (Arm® Virtual Hardware) 正式上线百度智能云,旨在助力更多的本土开发者,简化并加速智能、安全的物联网和嵌入式设备的软件开...
日期:08-17
免费在线AI工具LeiaPix:一键将图片转3D动画_在线ai转png
8月14日 消息:Leia 是一家总部位于美国的领先供应商,专注于裸眼3D 显示硬件和软件解决方案。他们旗下的 LeiaPix Converter 是一款由 AI 技术驱动的图像处理工具,可以将静态的...
日期:08-14
报告:56%的专业人士不确定他们公司是否有使用AI的道德准则
10月10日 消息:根据Deloitte一份调查显示,74%的公司正在测试生成式AI,65%的公司正在内部使用AI。然而,令人担忧的是,超过半数受访者表示他们的公司“没有或不确定是否有AI使用的...
日期:10-10
facebook私密对话如何取消_Facebook周五将推全新的隐私控制功能
新浪科技讯 北京时间8月24日凌晨消息,Facebook今天宣布,将在北京时间周五推出全新的隐私控制功能。 Facebook产品副总裁克里斯·考克斯(Chris Cox)表示,Facebook计划针对用户...
日期:07-22
谷歌视频网站正对网站进行重要的改造 以便围绕频道组织内容
  4月7日消息,据国外媒体报道,据两位知情人士称,谷歌的YouTube视频网站正在对网站进行重要的改造以便围绕频道组织内容,因为YouTube要使自己适应互联网连接的电视崛起,允许人...
日期:07-27
小米11不超级快充「终于要补齐短板!小米13 Ultra快充或提升至百瓦水平」
下半年以来,随着小米12S系列以及小米MIX Fold2等旗舰新品的陆续火爆上市并持续受到了数码圈和用户的广泛好评,进一步让小米在高端市场站稳了脚跟,同时也让大家对接下来的新一代...
日期:09-29
京东商城电风扇竟然比一家一户贵500元!_京东电风扇多少钱一台
泉城在线讯 最近一直被报道投资人压力过大的京东商城,看来已经不复当年风采,在北京最近一年崛起的新秀-一家一户购物网却在价格上替代了京东商城过去的低价策略,记 者发现一...
日期:07-29
百度香港上市融资_消息称百度最快在 2022 年上半年在港上市,至少募资 35 亿美元
  据报道,百度据悉计划最快在 2021 年上半年在港上市,至少募资 35 亿美元。   早在 2020 年 7 月,有报道称包括李彦宏在内的高管分批见了些投行,正式启动回港二次上市计划...
日期:07-10
万网成为国内IDC行业第一家通过ISMS认证企业_idc认证机构
  近日,北京万网志成科技有限公司(以下简称中国万网),成功通过了国家质检总局直属中国信息安全认证中心(ISCCC)的体系审核认证,取得了GB/T 22080-2008/ISO/IEC 27001:2005信息安...
日期:07-26
选择困难选手看这里!京东带来多款潮玩数码装备为中秋送上仪式感
每逢佳节临近,大家都希望通过合适的礼品来表达对亲朋好友的祝福之情。随着节礼的种类越来越多,除月饼礼盒外,又新又潮的3C数码产品成为许多人中秋礼的新选择。正值中秋节即将到...
日期:09-26
女子投简历被告知不招豫籍 直呼地域歧视很不公平:网友力挺河南人
1月27日,上海。有网友发视频称,她在网站投简历应聘,被对方告知不招豫籍。当事人表示,该公司在网上对职位的具体信息没有介绍,她询问时被告知不招豫籍,她认为这样的做法是地域歧视,...
日期:01-28
售价万元?小米13 Ultra 6月8日海外发布「小米miui13发布时间」
近日,小米在海外上线了专题页面,倒计时信息显示,小米13 Ultra将于6月8日在海外发布。针对新用户,小米公司免费赠送了3个月的YouTube Premium订阅和6个月的100GB Google One云存...
日期:06-02
破局之年,控客获恒大高科技集团战略投资_恒大高科技集团总裁
  近日,恒大高科技集团正式宣布战略投资控客,正式成为控客战略投资方,将整合控客在智能家居领域优势及恒大产业链优势,共同发力深度布局万亿蓝海。   作为世界五百强、中...
日期:07-10
Google AI Studio官网体验入口 AI应用部署开发软件app免费下载地址_谷歌中国ai研发中心
Google AI Studio是一个基于Vertex AI在Google Cloud上构建和部署AI应用程序的平台。它提供了一个无代码界面,使开发人员、数据科学家和业务分析师能够快速构建、部署和管理A...
日期:12-15
天玑9300星速引擎强力加持,玩手游帧率更高,续航更长_天玑900频段
近期,联发科发布了最 新的天玑 9300 旗舰芯片,引起数码圈和手游圈的广泛关注。天玑 9300 的全大核CPU架构设计,带来性能、能效的全面升级,同时这次还在游戏技术和游戏生态方面带...
日期:11-10
airpods电量异常「AirPods Pro 2又出Bug:低电量时用户将遭遇“信息轰炸”」
和其他品牌的产品一样,苹果在此前发布的iPhone 14、AirPods Pro 2等一系列新品,也存在不少发售前没有发现的问题。近日,就有用户反馈,表示自己遭到了AirPods Pro 2的信息轰炸”...
日期:10-11
日本universal拉链「实拍日本拉链式交替通行 还会双闪感谢后车 网友感叹素质真高」
7月6日消息,近日有网友在日本东京街头拍到了拉链式交替通行的视频,两个车道的车辆依次汇入一个车道,秩序井然。视频中,侧道车辆需要驶入主干道,两个车道的车辆交替通行,没有一辆车...
日期:07-06
华为智慧屏新品将于 9 月 29 日 发布「华为智慧屏新品最新消息」
9 月 28 日讯:今日,华为官方宣布,华为智慧屏新品将于 9 月 29 日 19:00 发布。华为9月发布会华为荣耀7出厂价网易新游戏钢铁侠...
日期:10-01
国际化探索丨西普尼金表首次海外亮相马来西亚国际黄金宝石珠宝展
2023 年 8 月 18 日,马来西亚国际黄金宝石珠宝展于马来西亚槟城Setia SPICE 会展中心正式拉开序幕,槟城每年都举办国际黄金贸易展览会,专为黄金及珠宝商而设的黄金贸易展览,将国...
日期:08-21