位置: IT常识 - 正文

Stable Diffusion 原理介绍与源码分析(一)(铡刀演示)

编辑:rootadmin
Stable Diffusion 原理介绍与源码分析(一) Stable Diffusion 原理介绍与源码分析(一)文章目录Stable Diffusion 原理介绍与源码分析(一)前言(与正文无关,可以忽略)总览说明Stable Diffusion 整体框架重要论文重要组成模块分析UNetModel 介绍ResBlock 的实现timestep_embedding 实现Prompt 文本 embedding 的实现SpatialTransformer 的实现小结前言(与正文无关,可以忽略)

推荐整理分享Stable Diffusion 原理介绍与源码分析(一)(铡刀演示),希望有所帮助,仅作参考,欢迎阅读内容。

文章相关热门搜索词:铡读什么字,铡刀演示,铡刀的视频,铡头视频,铡刀百科,铡头视频,铡头视频,铡这个字念什么,内容如对您有帮助,希望把文章链接给更多的朋友!

Stable Diffusion 是 Stability AI 公司开源的 AI 文生图扩散模型。之前在文章 扩散模型 (Diffusion Model) 简要介绍与源码分析 中介绍了扩散模型的原理与部分算法代码,满足基本的好奇心后便将其束之高阁,没成想近期 AIGC 的发展速度之快大大出乎我的意料,尤其是亲手跑出下面这张 AI 生成的图像, Stable Diffusion 终又重新回到我的视野:

作为一名算法工程师,需要有一双能看透事物本质的眼睛,这张图片最先吸引我的不是内容,而是其生成质量:图像高清、细节丰富,非之前看到的一些粗陋 Toy 可比,红框中标注出来的不协调之处,也是瑕不掩瑜。因此,进一步分析 Stable Diffusion 整个工程框架的原理,实在是迫在眉睫,期待日后能修复红框中的不协调之处,为 AIGC 的进一步发展做出一个技术人员应有的贡献。

总览

Stable Diffusion 整个框架的源码有上万行,没有必要全部分析。本文以 “文本生成图像(text to image)” 为主线,考察 Stable Diffusion 的运行流程以及各个重要的组成模块,在介绍时采用 “总-分” 的形式,先概括整体框架,再分析各个组件(如 DDPM、DDIM 等),另外针对代码中的部分非主流逻辑,比如 predict_cids、return_ids 这些小细节谈谈我的看法。文章内容较长,准备拆分成多个部分。

源码地址:Stable Diffusion

说明

之前我写过很多代码分析文章,但在我遇到问题重新去翻阅时,发现要快速定位到目标位置并准确理解代码意图,仍然存在很大困难,密密麻麻的整块代码,每一次阅读都仿若初见,不易理解,原因在于摘录时引入过多的实现细节,降低了信息的传播效率。

经过一番思考,我不再图省事,决定采用伪代码的方式记录核心原理。平时我深度分析代码时会采用这种方式,对代码进行额外的抽象,相对会耗些时间,但私以为这是有益处的。举个例子,比如 DDPM 模型前向 Diffusion 的代码,如果我用伪代码的方式去写,将是如下的效果:

可以看到,刨除掉无关的实现细节之后,DDPM 的实现是如此的简洁,倘若再配合一定的注释,可方便快速理解,让人获得一种整体而全面的掌控感。此外还应该在文中多增加框图、模型图等来对代码的实现细节进行更直观的展示。

可以在微信中搜索 “珍妮的算法之路” 或者 “world4458” 关注我的微信公众号, 可以及时获取最新原创技术文章更新.

另外可以看看知乎专栏 PoorMemory-机器学习, 以后文章也会发在知乎专栏中.

Stable Diffusion 整体框架

首先看下 Stable Diffusion 文本生成图像整体框架(文章绘图吐血…希望有一天 AI 能进行辅助):

上图框架内的模块较多,从上到下分为 3 块,我在图中使用 Part 1、2、3 进行了标注。框架包含训练 + 采样两个阶段,其中:

训练阶段 (查看图中 Part 1 和 Part 2),主要包含:

使用 AutoEncoderKL 自编码器将图像 Image 从 pixel space 映射到 latent space,学习图像的隐式表达,注意 AutoEncoderKL 编码器已提前训练好,参数是固定的。此时 Image 的大小将从 [B, C, H, W] 转换为 [B, Z, H/8, W/8],其中 Z 表示 latent space 下图像的 Channel 数。这一过程在 Stable Diffusion 代码中被称为 encode_first_stage;使用 FrozenCLIPEmbedder 文本编码器对 Prompt 提示词进行编码,生成大小为 [B, K, E] 的 embedding 表示(即 context),其中 K 表示文本最大编码长度 max length, E 表示 embedding 的大小。这一过程在 Stable Diffusion 代码中被称为 get_learned_conditioning;进行前向扩散过程(Diffusion Process),对图像的隐式表达进行不断加噪,该过程调用 UNetModel 完成;UNetModel 同时接收图像的隐式表达 latent image 以及文本 embedding context,在训练时以 context 作为 condition,使用 Attention 机制来更好的学习文本与图像的匹配关系;扩散模型输出噪声 ϵθ\epsilon_{\theta}ϵθ​,计算和真实噪声之间的误差作为 Loss,通过反向传播算法更新 UNetModel 模型的参数,注意这个过程中 AutoEncoderKL 和 FrozenCLIPEmbedder 中的参数不会被更新。

采样阶段(查看图中 Part 2 和 Part 3),也就是我们加载模型参数后,输入提示词就能产出图像的阶段。主要包含:

使用 FrozenCLIPEmbedder 文本编码器对 Prompt 提示词进行编码,生成大小为 [B, K, E] 的 embedding 表示(即 context);随机产出大小为 [B, Z, H/8, W/8] 的噪声 Noise,利用训练好的 UNetModel 模型,按照 DDPM/DDIM/PLMS 等算法迭代 T 次,将噪声不断去除,恢复出图像的 latent 表示;使用 AutoEncoderKL 对图像的 latent 表示(大小为 [B, Z, H/8, W/8])进行 decode(解码),最终恢复出 pixel space 的图像,图像大小为 [B, C, H, W]; 这一过程在 Stable Diffusion 中被称为 decode_first_stage。

经过上面的介绍,对 Stable Diffusion 整体会有个较清晰的认识,下面就可以按图索骥,将各个重点模块尽力去弄明白。限于个人精力与有限的空闲时间,目前除了 FrozenCLIPEmbedder 和 DPM 算法 (图中没写),Stable Diffusion 的其他模块都大致看了看,包括:

UNetModelAutoEncoderKL & VQModelInterface (也是一种变分自动编码器,图上没画)DDPM、DDIM、PLMS 算法Stable Diffusion 原理介绍与源码分析(一)(铡刀演示)

后面会简单介绍一下,记录学习过程。

重要论文

在阅读代码的过程中,发现有些重量级的论文必须得阅读一下。扩散模型的理论推导还是有些复杂的,有时候公式推导和代码实现相互结合看,可以加深对知识的理解。这里列一下对我阅读代码有很大帮助的论文:

Denoising Diffusion Probabilistic Models : DDPM,这个是必看的,推推公式Denoising Diffusion Implicit Models :DDIM,对 DDPM 的改进Pseudo Numerical Methods for Diffusion Models on Manifolds :PNMD/PLMS,对 DDPM 的改进High-Resolution Image Synthesis with Latent Diffusion Models :Latent-Diffusion,必看Neural Discrete Representation Learning : VQVAE,简单翻了翻,示意图非常形象,很容易了解其做法重要组成模块分析

下面对 Stable Diffusion 中的重要组成模块进行简要分析。主要包含:

UNetModelDDPM、DDIM、PLMS 算法AutoEncoderKL对部分非主流的逻辑,如 predict_cids、return_ids 等谈谈看法

首先介绍一下 UNetModel 结构,方便后续的文章直接进行引用。

UNetModel 介绍

画了一下 Stable Diffusion 中使用的 UNetModel,就不分析代码了,看图很容易将代码写出来。Stable Diffusion 采用 UNetModel 这种 Encoder-Decoder 结构来实现扩散的过程,对噪声进行预估, 网络结构如下:

模型的输入包含三个部分:

大小为 [B, C, H, W] 的图像 image; 注意不用在意表示大小时所用的符号,应将它们视作接口,比如 UNetModel 接收大小为 [B, Z, H/8, W/8] 的 noise latent image 作为输入时,这里的 C 就等于 Z, H 就等于 H/8, W 就等于 W/8;大小为 [B,] 的 timesteps大小为 [B, K, E] 的文本 embedding 表示 context, 其中 K 表示最大编码长度,E 表示 embedding 大小

模型使用 DownSample 和 UpSample 来对样本进行下采样和上采样,此外出现最多的模块是 ResBlock 以及 SpatialTransformer,其中图中每一个 ResBlock 接收来自上一个模块的输入以及 timesteps 对应的 embedding timestep_emb (大小为 [B, 4*M],M 是可配置的参数);而图中每一个 SpatialTransformer接收来自上一个模块的输入以及 context (Prompt 文本的 embedding 表示),使用 Cross Attention,以 context 为 condition,学习 Prompt 和图像的匹配关系。但图上只在虚线框中显示了两个模块有多个输入,其他模块没有画出来)

可以看到,最后模型的输出大小为 [B, C, H, W], 和输入大小相同,也就是说 UNetModel 不改变输入输出的大小。

下面再分别看看 ResBlock、timestep_embedding、context 以及 SpatialTransformer 的实现。

ResBlock 的实现

ResBlock 网络结构图如下,它接受两个输入,图像 x 以及 timestep 对应的 embedding:

timestep_embedding 实现

timestep_embedding 的生成方式如下,用的是 Tranformer(Attention is All you Need)这篇 paper 中的方法:

Prompt 文本 embedding 的实现

即 context 的实现。Prompt 使用 CLIP 模型进行编码,我没有对 CLIP 模型详细学习,暂时也没有深入看的打算,后续有机会再补充;代码中使用预训练好的 CLIP 生成 context:

SpatialTransformer 的实现

最后再看下 SpatialTransformer 的实现,其模块比较多,在接收图像作为输入时,还使用 context 文本作为 condition 信息,二者使用 Cross Attention 进行建模。进一步展开 SpatialTransformer, 发现包含 BasicTransformerBlock ,它实际调用 Cross Attention 模块,而在 Cross Attention 模块中,图像信息作为 Query,文本信息作为 Key & Value,模型会关注图像和文本各部分内容的相关性:

我觉得可以用一种朴素的想法来理解这里 Cross Attention 的作用,比如训练时给定一张马吃草的图,以及文本提示词:“一匹白色的马在沙漠吃草”,在做 Attention 时,文本中的 “马” 这个关键词和图像中的动物(也是 “马”)的关联性更强,因为权重也更大,而 “一匹”、 “白色”、“沙漠”、 “草” 等权重更低;此时,当模型被训练的很好后,模型不仅将可以学习到图像和文本之间的匹配关系,通过 Attention 还可以学习到文本中的各个关键词想突出图像中哪些主体。

而当我们输入提示词用模型来生成图像时,比如输入 “一匹马在吃草”,由于模型此时已经能捕捉图像和文本的相关性以及文本中的重点信息,当它看到文本 “马”,在黑盒魔法的运作下,会重点突出图像 “马” 的生成;当它看到 “草” 时,便重点突出图像 “草” 的生成,从而尽可能生成和文本进行匹配的图像。

至此,UNetModel 各个重要组件基本介绍完毕。

小结

由于 UNetModel 模型结构并不复杂,看图基本就能写出代码,一图胜千言啊。另外我标注了每个模块输出结果的大小,很方便在大脑中运行模型,哈哈哈。

本文大致介绍了一下 Stable Diffusion 文生图代码的整体框架,列出了扩散模型部分核心论文,简要分析了 UNetModel。后续再分析其他核心组件。

发现 AIGC 的发展实在太快了,学不过来啊… 愈发觉得庄子所言甚是:以有涯随无涯,殆矣!

本文链接地址:https://www.jiuchutong.com/zhishi/298370.html 转载请保留说明!

上一篇:Javascript 基础知识学习(javascript入门基础)

下一篇:Vue3通透教程【三】Vue3代码初体验找不同

  • 微信付款码会不会变(微信付款码会不会更新)

    微信付款码会不会变(微信付款码会不会更新)

  • 美团商户通是什么意思

    美团商户通是什么意思

  • 腾讯视频不能同时登录两个手机吗

    腾讯视频不能同时登录两个手机吗

  • 移动亲情网怎么删除成员(移动亲情网怎么退出成员)

    移动亲情网怎么删除成员(移动亲情网怎么退出成员)

  • 手机管家有必要装吗(手机管家有必要下载吗)

    手机管家有必要装吗(手机管家有必要下载吗)

  • 为什么华为看抖音很卡(为什么华为看抖音模糊)

    为什么华为看抖音很卡(为什么华为看抖音模糊)

  • 华为手机辅助小球在哪(华为手机辅助小球)

    华为手机辅助小球在哪(华为手机辅助小球)

  • 毒上面可以用支付宝支付吗(毒上面可以加入购物车吗)

    毒上面可以用支付宝支付吗(毒上面可以加入购物车吗)

  • 电子计算机上的ac是什么键(电子计算机上的off是什么键)

    电子计算机上的ac是什么键(电子计算机上的off是什么键)

  • 我的抖音为什么没有音集功能(我的抖音为什么没有一键成片)

    我的抖音为什么没有音集功能(我的抖音为什么没有一键成片)

  • a1474是air1还是2(a1474是ipadair几)

    a1474是air1还是2(a1474是ipadair几)

  • excel出现value的原因(excel 出现value)

    excel出现value的原因(excel 出现value)

  • p9plus支持快充吗(华为p9可以快充吗)

    p9plus支持快充吗(华为p9可以快充吗)

  • vivo手机内存卡在哪(vivo手机内存卡怎么存游戏)

    vivo手机内存卡在哪(vivo手机内存卡怎么存游戏)

  • 华为隔空手势设置(华为隔空手势是什么原理)

    华为隔空手势设置(华为隔空手势是什么原理)

  • 一加7T Pro怎么清理后台应用(一加7pro内存清理)

    一加7T Pro怎么清理后台应用(一加7pro内存清理)

  • 抖音人工认证需要几天(抖音实名认证人工认证需要多久)

    抖音人工认证需要几天(抖音实名认证人工认证需要多久)

  • iphone11美版支持双卡吗(iphone11美版支持5g)

    iphone11美版支持双卡吗(iphone11美版支持5g)

  • 抖音怎么上商品橱窗(抖音怎么上商品类目)

    抖音怎么上商品橱窗(抖音怎么上商品类目)

  • icloud账户切换后照片没了(icloud换账号登录后有什么影响)

    icloud账户切换后照片没了(icloud换账号登录后有什么影响)

  • 怎样在手机上修改银行预留手机号(怎样在手机上修改医保卡密码)

    怎样在手机上修改银行预留手机号(怎样在手机上修改医保卡密码)

  • 钉钉在苹果怎么下载不了(钉钉在苹果怎么悬浮桌面)

    钉钉在苹果怎么下载不了(钉钉在苹果怎么悬浮桌面)

  • 微博二级评论是什么意思(微博二级评论算评论数吗)

    微博二级评论是什么意思(微博二级评论算评论数吗)

  • 奥克斯睡眠模式怎么调(奥克斯睡眠模式一晚上多少度电)

    奥克斯睡眠模式怎么调(奥克斯睡眠模式一晚上多少度电)

  • 什么是服务号(什么是服务号入群)

    什么是服务号(什么是服务号入群)

  • 使用u盘安装win7(8)、win10双系统图文教程【也适用单系统安装】(使用U盘安装win7出现找不到任何设备驱动程序)

    使用u盘安装win7(8)、win10双系统图文教程【也适用单系统安装】(使用U盘安装win7出现找不到任何设备驱动程序)

  • 【蓝桥杯Web】第十四届蓝桥杯(Web 应用开发)模拟赛 1 期-职业院校组 | 精品题解(蓝桥杯b组2020)

    【蓝桥杯Web】第十四届蓝桥杯(Web 应用开发)模拟赛 1 期-职业院校组 | 精品题解(蓝桥杯b组2020)

  • 设计合同服务期限怎么写
  • 以个人名义汇货要交税吗
  • 统一机构信用代码查询系统
  • 上月留抵进项本月抵扣会计分录
  • 水利基金申报表减除项填什么
  • 工资可以先计提不发吗
  • 工会费个税税前扣除标准
  • 个人财产租赁所得税计算
  • 出口收入账务处理
  • 结存材料应分摊什么
  • 垫资后转出的会计分录怎么写?
  • 长投损失了如何处理
  • 公司办公室收到上级主管部门的一份
  • 电子承兑汇票是到期日前10天提示承兑吗
  • 低价股权转让是利空还是利好
  • 个税申报系统中年收入不超6万元的确认错了怎么改
  • 一般纳税人装饰装修工程税率
  • 车辆租赁的增值税率
  • 资本收益率的计算公式净资产收益率
  • 房地产企业开具零税率发票
  • 增值税税率调整时间16变13
  • 专票红冲分录
  • 车辆保险车船税怎么计算
  • 对外支付代扣代缴增值税如何申报
  • 发票被盗丢失如何处理
  • linux killall
  • 母公司对子公司减资
  • php的强大功能函数库中都含有哪些常用函数?
  • 既征增值税又征消费税的是
  • 进口增值税公式计算公式
  • 员工重复报销后如何处理
  • 金融业营业税税率
  • php遍历结果集
  • 如何修改php.ini
  • PHP用mysql_insert_id()函数获得刚插入数据或当前发布文章的ID
  • vue区别
  • 变量与数据
  • 需要缴纳企业所得税的企业类型
  • 青苗补偿费归谁所有
  • 与取得收入无关的费用支出可以扣除吗
  • 公司认缴的钱可以动吗
  • 劳务费个税申报流程
  • 垃圾袋发票税收分类编码
  • 会员退费会计分录
  • 企业所得税本年累计
  • 变动成本法的计算步骤
  • 小规模纳税人的增值税计入成本吗
  • 国债利息属于免税吗
  • 企业所得税的税收筹划
  • 利润分配科目是所有者权益科目吗
  • 企业发行债券的优点有哪些
  • 应交税费为负数在资产负债表中的列报
  • 小规模纳税人开专票税率是多少?
  • 当月支付当月租金需要计提吗
  • 固定资产净残值最后怎么处理
  • 委托加工的成本如何核算
  • 帐簿凭证的管理方法
  • mysql多个group by
  • win7资源管理器未响应怎么办
  • win8怎么连接
  • 搜狗浏览器ie8
  • 电脑百度搜索
  • 运维zabbix
  • win10预览版选哪个
  • xpspeak导入数据总是error reading
  • win8.1怎么设置
  • GLSL Tessellation Shader的编程入门介绍
  • [置顶] rwmfqg
  • angular nz
  • input按钮的事件处理大全
  • js domcontentloaded
  • 简单的安卓代码
  • 在电子税务局如何增加税种
  • 四川省网上税务局申报流程
  • 冲红和红冲的区别
  • 社保当月减员当月还可以增加上吗
  • 企业所得税每月怎么算
  • 宝马535车船税
  • 河北省餐饮经营单位安全生产规定
  • 宏酷集团创始人简介
  • 免责声明:网站部分图片文字素材来源于网络,如有侵权,请及时告知,我们会第一时间删除,谢谢! 邮箱:opceo@qq.com

    鄂ICP备2023003026号

    网站地图: 企业信息 工商信息 财税知识 网络常识 编程技术

    友情链接: 武汉网站建设