您的位置:首页 > 互联网

苹果“套娃”式扩散模型,训练步数减少七成!_什么是套娃模式

发布时间:2023-10-26 02:13:47  来源:互联网     背景:

声明:本文来自于微信公众号 量子位 (ID:QbitAI),作者:克雷西 ,授权转载发布。

苹果的一项最新研究,大幅提高了扩散模型在高分辨率图像上性能。

利用这种方法,同样分辨率的图像,训练步数减少了超过七成。

在1024×1024的分辨率下,图片画质直接拉满,细节都清晰可见。

苹果把这项成果命名为MDM,DM就是扩散模型(Diffusion Model)的缩写,而第一个M则代表了套娃(Matryoshka)。

就像真的套娃一样,MDM在高分辨率过程中嵌套了低分辨率过程,而且是多层嵌套。

高低分辨率扩散过程同时进行,极大降低了传统扩散模型在高分辨率过程中的资源消耗。

amd干掉intel

对于256×256分辨率的图像,在批大小(batch size)为1024的环境下,传统扩散模型需要训练150万步,而MDM仅需39万,减少了超七成。

另外,MDM采用了端到端训练,不依赖特定数据集和预训练模型,在提速的同时依然保证了生成质量,而且使用灵活。

不仅可以画出高分辨率的图像,还能合成16×256²的视频。

有网友评论到,苹果终于把文本连接到图像中了。

那么,MDM的“套娃”技术,具体是怎么做的呢?

整体与渐进相结合

在开始训练之前,需要将数据进行预处理,高分辨率的图像会用一定算法重新采样,得到不同分辨率的版本。

然后就是利用这些不同分辨率的数据进行联合UNet建模,小UNet处理低分辨率,并嵌套进处理高分辨率的大UNet。

通过跨分辨率的连接,不同大小的UNet之间可以共用特征和参数。

MDM的训练则是一个循序渐进的过程。

虽然建模是联合进行的,但训练过程并不会一开始就针对高分辨率进行,而是从低分辨率开始逐步扩大。

这样做可以避免庞大的运算量,还可以让低分辨率UNet的预训练可以加速高分辨率训练过程。

训练过程中会逐步将更高分辨率的训练数据加入总体过程中,让模型适应渐进增长的分辨率,平滑过渡到最终的高分辨率过程。

什么是套娃模式

不过从整体上看,在高分辨率过程逐步加入之后,MDM的训练依旧是端到端的联合过程。

在不同分辨率的联合训练当中,多个分辨率上的损失函数一起参与参数更新,避免了多阶段训练带来的误差累积。

每个分辨率都有对应的数据项的重建损失,不同分辨率的损失被加权合并,其中为保证生成质量,低分辨率损失权重较大。

在推理阶段,MDM采用的同样是并行与渐进相结合的策略。

此外,MDM利还采用了预训练的图像分类模型(CFG)来引导生成样本向更合理的方向优化,并为低分辨率的样本添加噪声,使其更贴近高分辨率样本的分布。

那么,MDM的效果究竟如何呢?

更少参数匹敌SOTA

图像方面,在ImageNet和CC12M数据集上,MDM的FID(数值越低效果越好)和CLIP表现都显著优于普通扩散模型。

其中FID用于评价图像本身的质量,CLIP则说明了图像和文本指令之间的匹配程度。

和DALL E、IMAGEN等SOTA模型相比,MDM的表现也很接近,但MDM的训练参数远少于这些模型。

不仅是优于普通扩散模型,MDM的表现也超过了其他级联扩散模型。

消融实验结果表明,低分辨率训练的步数越多,MDM效果增强就越明显;另一方面,嵌套层级越多,取得相同的CLIP得分需要的训练步数就越少。

而关于CFG参数的选择,则是一个多次测试后再FID和CLIP之间权衡的结果(CLIP得分高相对于CFG强度增大)。

论文地址:

https://arxiv.org/abs/2310.15111

—完—

苹果套娃机


返回网站首页

本文评论
埃纳特火山「世界最大!茂纳洛亚活火山或将喷发:当地居民已收到预警」
世界上最大的活火山名为茂纳洛亚,位于美国夏威夷岛,该火山或将再次喷发。据海外媒体报道,隶属于美国地质调查局的夏威夷火山观测站表示,自上个月中旬以来,茂纳洛亚火山一直处于高...
日期:10-30
又一批鸿蒙3.0测试版名单开放,Nova老用户终于等到了_鸿蒙系统升级名单nova
鸿蒙Harmony 3开启了新一轮测试招募,招募报名截止到10月 13日,华为MatePad系列和华为Nova系列用户可以通过“我的华为 / 会员中心”App-首页-升级尝鲜入口进入报名。报名成功...
日期:10-24
LG状告惠而浦冰箱专利侵权案 延后半年
  近日,惠而浦公司与LG电子的专利侵权诉讼出现新转机:惠而浦的延后申请获得通过。此前LG电子向美国地方法院提起诉讼,状告惠而浦公司在冰箱产品上侵犯了其专利,但是在诉讼进...
日期:07-23
AI公司云知声将于5月24日发布云知声山海大模型_云知声创始人都有谁
5月15日 消息:国内AI公司云知声宣布,将于5月24日14点发布云知声山海大模型。5g用4g网络会比4g手机更快吗同时,还将发布基于山海大模型的智慧医疗、智慧物联和企业服务的产品与...
日期:05-15
美国将首次试飞“太空发射系统”(美国太空探索技术公司研制的载人发射成功)
来源:中国科学报 弄丢快递要赔多少钱10颗立方体卫星。图片来源:CORY HUSTON/NASA   本报讯 8月底,美国宇航局(NASA)有史以来最强大的运载火箭——太空发射系统(SLS)将进行首次试...
日期:08-20
F1 将在阿布扎比大奖赛试用人工智能技术监控赛道界限违规_f12019阿布扎比正赛视频
11 月 24 日消息:国际汽车联合会(FIA)宣布,在本周末的赛季收官阿布扎比大奖赛中,将试用人工智能(AI)技术来处理赛道界限违规问题。FIA 将使用名为计算机视觉的技术,该技术通过分析...
日期:11-24
哈尔滨现网游传销陷阱 互赠红包发展会员
  近日,哈市警方根据市民对一种新出现的网络游戏的举报,并经过初步调查后,提醒市民:网上出现的名为“前程-ABC”、“前程-320”或“飞车-未来430”的互赠红包游戏,为新型非法...
日期:07-23
民宿一日游「天价民宿7000一晚,周边游拯救OTA?」
声明:本文来自于微信公众号 鞭牛士(ID:bianews8),作者:顾砚,授权转载发布。据文旅部官网消息,2022年国庆节假期7天,全国国内旅游出游4.22亿人次,其中,本地游、周边游是出行首选。据...
日期:10-11
飞智八爪鱼4力反馈精英手柄发布,“力调节+力反馈”两大首创力学技术引关注
(原标题:飞智八爪鱼4力反馈精英手柄发布,“力调节+力反馈”两大首创力学技术引关注) 1月5日,飞智科技正式发布了旗下全新手柄产...
日期:01-09
动物园老虎把孔雀吃了!园区回应:首次发生 没办法_动物园里有老虎和孔雀
4月8日,山东威海一动物园内,一只老虎把一只蓝孔雀给吃了。这一幕被游客拍下来发到网上,引发热议。据悉,事发威海西霞口神雕山野生动物世界。苹果12寸平板电脑该动物园的据丛经理...
日期:04-09
「琉光溢彩 璃所当燃」新品发布会高光启幕 哈曼携手全新品牌代言人成毅共探声音美学
【 2023 年 6 月 15 日 ,横店】沉浸声光奇境,共探声音美学。今日,哈曼倾力开启「琉光溢彩 璃所当燃」 2023 哈曼新品发布会,与音乐爱好者共赴一场凝聚出彩声色与创新科技的视听...
日期:06-19
将发布我国首次火星探测相关成果,中国航天日启动仪式4月24日举办
4 月 18 日消息,国家航天局今日召开新闻发布会,对 2023 年中国航天日活动情况进行了介绍。雅迪 vfly官方宣布,2023 年中国航天日启动仪式将于 4 月 24 日在安徽省合肥市举办,活...
日期:10-02
《数据库发展研究报告(2023年)》正式发布(文末附下载方式)_数据库发展研究报告2021
《数据库发展研究报告(2023年)》正式发布(文末附下载方式) 通信产业网|2023-07-04 20:44:33作者:通文来源:通信产业网7月4日,2023可信数据库发展大会(以下称“大会”)主论坛在北京国...
日期:07-05
全面降价半年,喜茶、奈雪赚更多了吗?「奈雪的茶打新收益」
  作者:章晓莎  随着秋风的临近,茶饮圈集体迎来一波秋季上新潮。  凤梨、榴莲、石榴、柿子……茶饮品牌在原料层面的创意依旧争奇斗艳,但定价却是一水儿的“亲民”。奈雪...
日期:10-02
谷歌发布视频生成模型Lumiere 运动幅度和一致性表现良好_谷歌2014年度视频分析
1月24日 消息:Lumiere 是谷歌发布的第三个视频生成模型,这次的模型演示视频质量非常高,运动幅度和一致性表现也很好。除了视频生成,该模型还支持各种视频编辑和生成控制能力。L...
日期:01-25
苹果m3芯片什么时候出「Gurman:苹果已经在研发配备 M3 芯片的 13 英寸和 15 英寸 MacBook Air」
6月12日消息:据彭博社的 Mark Gurman 报道,苹果已经在开发搭载 M3 芯片的 13 英寸和 15 英寸 MacBook Air 机型。在他今天的「Power On」newsletter 中,Gurman 表示他预计这些...
日期:06-12
博西高层到访苏宁,2020高端冰洗布局再升级
  纵观国内巨大的内需市场,中国零售业可谓充满机遇。在苏宁年货节火热爆发之际,博西家用电器(中国)有限公司高级副总裁兼首席销售官王伟庆一行到访苏宁总部,与苏宁易购总裁...
日期:06-05
同比增长22.9% 好未来2024财年第一季度净收入2.75亿美元
【】7月27日消息, 好未来教育公布其截至2023年5月31日的2024财年第一季度未经审计财务报告。2024财年第一季度业绩摘要● 净收入从上年同期的2.24亿美元上升到本季的2.75亿...
日期:09-19
雅迪电动车与大师合作 成时尚“弄潮儿”出行首选_雅迪电动车评论
  在中国经济高速发展的今天,中国人消费结构与消费偏好正在悄然发生变化,“Z时代”为主体的消费大军异军突起。两轮电动车行业竞争也进入了白热化阶段,消费者除了要求电动车...
日期:07-16
官方租车服务即将上线 电池放坏也保修_极氪电池质保权益政策升级
【】6月16日消息,在2023粤港澳大湾区车展上,极氪汽车宣布电池质保权益政策升级,修改了动力电池的免责条款。其中,删除了以下三条,分别为:1、将车辆暴露在环境温度高于 50°C 的环...
日期:09-23