服务粉丝

我们一直在努力
当前位置:首页 > 财经 >

阿里50亿参数AI画画模型火了!将图像拆分再自由重组,达摩院副院长率队打造

日期: 来源:量子位收集编辑:关注前沿科技
明敏 发自 凹非寺
量子位 | 公众号 QbitAI

AI画画通用模型,新增一员大将!

由阿里达摩院副院长周靖人等人打造的可控扩散模型Composer,一经发布就小火了一把。

这个模型由50亿参数训练而来,和Stable Diffusion原理不同。

更进一步把训练图像拆解成了多个元素,然后基于这些元素训练扩散模型,让它们能够灵活组合。

由此一来,模型的创造能力就比仅基于图像大很多。

如果有100张能拆分成8个元素的图像,那么就能生成一个数量为100的8次方的结果组合。

网友们看了纷纷表示,AI画画发展速度也太快了!

团队表示,模型的训练和推理代码都在路上了。

有限手段的无限使用

该框架的核心思想是组合性(compositionality),模型名字就叫做Composer

观察到现下很多AI画画模型,在细节的可控性上还没有做到很好,比如准确改变颜色、形状等。

研究团队认为,想要实现图像的可控生成,不能依赖于对模型的调节,重点应该放在组合性上,这种方式可以将图像的创造力提升到指数级。

引用语言学大师诺姆·乔姆斯基的经典语录来解释模型,就是:

有限手段的无限使用。

具体来看,该模型就是将每个训练图像拆解成一系列基础元素,如蒙版图、草稿图、文字描述等,用它们来训练一个扩散模型。

然后让这些被拆分的元素,在推理阶段灵活组合,生成大量新的图像输出。

它可以支持多种形式作为输入。比如文字描述作为全局信息,深度图和草图作为局部引导,颜色直方图为低级细节等。

在保证生成图像可控的基础上,作为一个通用框架,该模型还能不用再训练就可以完成大量经典生成任务。

举例来看,图(a)中,最左边的是原图,后面4个是通过对Composer不同子集的表示进行调节而生成的新结果。

图(b)展示的是图像插值的结果。

图像重构的话是酱婶儿的,Composer能够简单地改变图像表示来重新配置图像,比如草稿图和分割图。

还有对图像的特定部分进行编辑。

比如给蛋糕派换口味、把珍珠耳环少女的脸换成梵高、让兔子长一张熊猫脸等。

比较经典的图像生成任务也能挑战,而且无需再训练。


团队表示,现有成果还存在一定局限性,比如在单一条件输入的情况下,生成效果不是很好。以及输入不同语义的图像和文本嵌入时,生成结果会降低对文本嵌入的权重。

而针对AI画画模型都需要面对的风险问题,团队表示为避免被滥用,他们会在公开模型前先创建一个过滤版本。

达摩院副院长带队

该研究由阿里及蚂蚁团队完成。

通讯作者为周靖人

他现任阿里达摩院副院长、阿里云智能CTO,是IEEE Fellow。

2004年于哥伦比亚大学获得计算机博士学位,后加入微软担任研发合伙人。

2015年,周靖人加入阿里巴巴集团,先后负责过达摩院智能计算实验室、大数据智能计算平台、搜索推荐事业部等。

论文一作Huang Lianghua同样来自达摩院,研究方向为扩大模型规模和数据来表示学习和内容生成。

论文地址:
https://arxiv.org/abs/2302.09778

GitHub地址:
https://github.com/damo-vilab/composer

《中国AIGC产业全景报告暨AIGC 50》调研启动

谁会是中国的“ChatGPT”?最有竞争力和潜力的AIGC力量位于何方?

量子位《中国AIGC产业全景报暨AIGC 50》正式启动对外征集,期待有更多优秀的机构、产品、案例与技术能够被大众看到。


点这里

相关阅读

  • ChatGPT 复现方案开源了,好用 !!!

  • 公众号关注 “GitHub 宝典”设为 “星标”,每天带你逛 GitHub!大家好,我是小 G。近日,火爆全网的 ChatGPT,仿佛开启了第四次工业革命,将微软、谷歌等全球科技巨头打得昏天黑地,引得
  • AI作画新高度!谷歌发布imagen,效果惊艳全场

  • 文 | 梦晨 鱼羊 发自 凹非寺源 | 量子位在让AI搞创作这件事上,谷歌和OpenAI正面刚起来了。这不,震惊全网的DALL·E 2才新鲜出炉一个月,谷歌就派出名为Imagen的选手来打擂台。直
  • 没有这些,别妄谈做ChatGPT了

  • 文|卖萌酱ChatGPT破圈爆火后,越来越多人开始问:“啥时候出现中国版的ChatGPT?”国内学术界和工业界,都纷纷躁动起来——百度、阿里、字节等大厂纷纷喊口号,一众创业公司也开始争做
  • OpenAI的GPT-4和 GPT-5,会是怎么样?

  • 来源:内容由半导体行业观察(ID:icbank)编译自nextbigfuture,谢谢。OpenAI 首席执行官 Sam Altman 在一年前的一次会议上接受了关于 GPT4 和其他 AI 主题的采访。按照他的说法,GPT-
  • ChatGPT能否成为互联网后下一个系统性机会?

  • ChatGPT横空出世后,无论巨头大厂还是AI科学家们,都马上进入了一种非常紧张的应对状态,甚至可以说是应激状态。围绕ChatGPT,四位行业大牛展开聊12个问题文 | 李抗 陶芳波 黄旭东
  • 只需10行Python代码,就能实现目标检测!

  • 来源丨大数据文摘编译丨邢畅、宁静计算机视觉是人工智能的一个重要领域,是关于计算机和软件系统的科学,可以对图像和场景进行识别、理解。计算机视觉还包括图像识别、目标检测

热门文章

  • “复活”半年后 京东拍拍二手杀入公益事业

  • 京东拍拍二手“复活”半年后,杀入公益事业,试图让企业捐的赠品、家庭闲置品变成实实在在的“爱心”。 把“闲置品”变爱心 6月12日,“益心一益·守护梦想每一步”2018年四

最新文章

  • 那些省考上岸的人,笔试前一天在干嘛?

  • 那些省考上岸的人笔试前一天在干嘛?刘某畅广州市某局执法监察大队考试前一晚,我听相声入眠。八九点我就睡下了,刚开始确实睡不着,宾馆所在的巷子里太热闹了。睡不着的时候,我就特
  • 申论晨读经典回顾:“心中要有一盏灯”

  • 读文章中可以采撷的知识可以明智的道理写文章中可以积累的素材可以模仿的技巧申论晨读(2023省考特别版)【扫码即可了解详情】内容来源:《每天5分钟 申论70+ 第二季》第九节责编
  • 在城里种乡愁

  • *本文为《半月谈》2023年第4期内容春节过后,江南大地从隆冬中苏醒,半月谈记者来到位于江苏苏州中心城区的浒墅关镇华盛社区花野圩自然村。这个傍水而栖、四城环绕的村落一派生
  • 老饭馆新生记

  • *本文为《半月谈》2023年第4期内容在3年疫情冲击下,改革开放后我国第一家个体餐饮——悦宾饭馆,几度“开了关,关了开”。历经困顿与复苏,这家老饭馆在正月里重新开张。买卖不再