发布时间:2026/7/25 0:50:47
Stable Diffusion 原理与实战:从DDPM到ControlNet可控生成 Stable Diffusion 原理与实战从DDPM到ControlNet可控生成一、引言2022年 Stable Diffusion 的发布引爆了 AI 图像生成革命。从 DDPM 扩散模型到 Stable Diffusion 的潜空间设计再到 ControlNet/IP-Adapter 的可控生成技术演进之快令人目不暇接。本文将从头推导扩散模型数学原理实现完整的 SD 推理管道并深入 LoRA/DreamBooth/ControlNet 三大可控技术。二、扩散模型数学原理2.1 前向扩散过程importtorchimportnumpyasnpimportmatplotlib.pyplotaspltdefforward_diffusion(x_0,beta,t): 前向扩散q(x_t | x_0) N(x_t; sqrt(ᾱ_t)·x_0, (1-ᾱ_t)·I) 从原始图像 x_0 逐步添加噪声得到 x_t # β 是每个时间步的噪声方差alphas1-beta alpha_barstorch.cumprod(alphas,dim0)# ᾱ_t ∏ α_s# 第t步的累积因子sqrt_alpha_bar_ttorch.sqrt(alpha_bars[t])sqrt_one_minus_alpha_bar_ttorch.sqrt(1-alpha_bars[t])# 采样噪声noisetorch.randn_like(x_0)# q(x_t | x_0)x_tsqrt_alpha_bar_t*x_0sqrt_one_minus_alpha_bar_t*noisereturnx_t,noise2.2 反向去噪过程defreverse_diffusion(model,x_t,t,beta,alpha_bars): 反向去噪p_θ(x_{t-1} | x_t) N(x_{t-1}; μ_θ(x_t,t), σ_t²·I) 模型预测噪声 ε_θ(x_t, t)然后通过以下公式恢复 x_{t-1} x_{t-1} 1/√α_t · (x_t - β_t/√(1-ᾱ_t) · ε_θ(x_t,t)) σ_t·z alpha_t1-beta[t]# 模型预测噪声predicted_noisemodel(x_t,t)# 计算均值coeff11.0/torch.sqrt(alpha_t)coeff2beta[t]/torch.sqrt(1-alpha_bars[t])meancoeff1*(x_t-coeff2*predicted_noise)# 添加随机噪声t1时ift1:noisetorch.randn_like(x_t)sigma_ttorch.sqrt(beta[t])else:noise0sigma_t0x_prevmeansigma_t*noisereturnx_prevdefddpm_sampling(model,img_size,timesteps1000):完整 DDPM 采样从纯噪声生成图像model.eval()# 从 N(0, I) 开始x_ttorch.randn(1,3,img_size,img_size)# 预计算 beta 调度betalinear_beta_schedule(timesteps)alpha1-beta alpha_barstorch.cumprod(alpha,dim0)# 从 T 到 1 逐步去噪fortinreversed(range(1,timesteps)):withtorch.no_grad():x_treverse_diffusion(model,x_t,t,beta,alpha_bars)ift%1000:print(fSampling step{timesteps-t}/{timesteps})# 最终图像t0returnx_t2.3 DDPM vs DDIMDDIM 以更少步数实现更快采样defddim_sampling(model,x_t,timesteps50,eta0.0):DDIM 快速采样只需要 50 步fortinreversed(range(1,timesteps1)):t_tensortorch.tensor([t]).long()# 预测噪声epsmodel(x_t,t_tensor)# DDIM 更新公式alpha_bar_talpha_bars[t]alpha_bar_prevalpha_bars[t-1]ift1else1.0# 预测原始图像 x_0pred_x0(x_t-torch.sqrt(1-alpha_bar_t)*eps)/torch.sqrt(alpha_bar_t)# DDIM 方向directiontorch.sqrt(1-alpha_bar_prev-sigma_t**2)*eps# 更新x_ttorch.sqrt(alpha_bar_prev)*pred_x0directionsigma_t*torch.randn_like(x_t)returnx_t三、Stable Diffusion 架构3.1 潜空间扩散Latent DiffusionSD 的核心创新在压缩的潜空间而非像素空间做扩散。fromdiffusersimportStableDiffusionPipelineimporttorch# 加载 SD 1.5pipeStableDiffusionPipeline.from_pretrained(runwayml/stable-diffusion-v1-5,torch_dtypetorch.float16,safety_checkerNone,)pipepipe.to(cuda)# 生成图像prompta serene lake at sunset, mountains in background, photorealisticnegative_promptblurry, low quality, distortedimagepipe(promptprompt,negative_promptnegative_prompt,num_inference_steps30,# DDIM步数guidance_scale7.5,# CFG引导强度width512,height512,generatortorch.Generator(cuda).manual_seed(42),).images[0]image.save(generated.png)3.2 SDXL 高清生成fromdiffusersimportStableDiffusionXLPipeline pipeStableDiffusionXLPipeline.from_pretrained(stabilityai/stable-diffusion-xl-base-1.0,torch_dtypetorch.float16,variantfp16,use_safetensorsTrue,)pipepipe.to(cuda)imagepipe(promptprofessional product photography of a futuristic smartwatch, studio lighting, 8k,negative_prompttext, watermark, low quality,num_inference_steps40,guidance_scale7.5,height1024,width1024,).images[0]四、LoRA 微调风格/角色定制fromdiffusersimportStableDiffusionPipelineimporttorch# 加载基础模型 LoRA权重pipeStableDiffusionPipeline.from_pretrained(runwayml/stable-diffusion-v1-5,torch_dtypetorch.float16).to(cuda)# 加载角色 LoRApipe.load_lora_weights(path/to/character_lora.safetensors)pipe.fuse_lora(lora_scale0.8)# 融合LoRAscale控制强度# 生成角色图像imagepipe(promptcharacter_name sitting in a coffee shop, detailed illustration,negative_promptbad anatomy, extra limbs,num_inference_steps30,guidance_scale7.0,).images[0]# 切换 LoRApipe.unfuse_lora()pipe.load_lora_weights(path/to/style_lora.safetensors)LoRA 训练脚本fromdiffusersimportStableDiffusionPipelinefrompeftimportLoraConfig,get_peft_modelimporttorch# 1. 准备训练数据10-20张图片 描述文本training_data[{image:person1.jpg,caption:a photo of sks person, portrait},{image:person2.jpg,caption:a photo of sks person, standing},# ...]# 2. LoRA 配置lora_configLoraConfig(r8,# LoRA秩lora_alpha16,target_modules[to_q,to_k,to_v,to_out.0],# 注意力层lora_dropout0.1,)# 3. 训练fromdiffusersimportDPMSolverMultistepScheduler pipe.schedulerDPMSolverMultistepScheduler.from_config(pipe.scheduler.config)forepochinrange(num_epochs):forbatchindataloader:# 编码图像到潜空间latentspipe.vae.encode(batch[image]).latent_dist.sample()latentslatents*pipe.vae.config.scaling_factor# 添加噪声noisetorch.randn_like(latents)timestepstorch.randint(0,pipe.scheduler.num_train_timesteps,(latents.shape[0],))noisy_latentspipe.scheduler.add_noise(latents,noise,timesteps)# 编码文本text_embedspipe.text_encoder(batch[caption])[0]# 预测噪声noise_predpipe.unet(noisy_latents,timesteps,text_embeds).sample# MSE 损失losstorch.nn.functional.mse_loss(noise_pred,noise)optimizer.zero_grad()loss.backward()optimizer.step()五、DreamBooth主体定制fromdiffusersimportStableDiffusionPipelinefromdiffusersimportDreamBoothTrainer,DreamBoothConfigclassDreamBoothTrainer:DreamBooth用少量图片学习新概念def__init__(self,instance_images_dir,class_images_dirNone):self.instance_dirinstance_images_dir# 3-5张目标图片self.class_dirclass_images_dir# 先验保留图片deftrain(self,instance_prompta photo of sks dog,class_prompta photo of a dog):训练步骤# 1. 先验保留损失Preservation Loss# L E[||ε - ε_θ(x_t, c_instance)||²]# λ · E[||ε - ε_θ(x_t, c_class)||²]# 2. 文本编码器微调# 为 sks 学习新的 token embedding# 3. UNet 微调# 同时更新 UNet 权重或仅更新注意力层passdefgenerate(self,pipe,prompt):使用训练好的 DreamBooth 生成pipe.load_dreambooth_lora(trained_model)returnpipe(prompt).images[0]# 使用 HuggingFace diffusers 的 DreamBoothfromdiffusersimportDiffusionPipeline pipeDiffusionPipeline.from_pretrained(sd-dreambooth-library/dog-sks)imagepipe(a photo of sks dog in a bucket).images[0]六、ControlNet可控生成6.1 各种控制条件fromdiffusersimportStableDiffusionControlNetPipeline,ControlNetModelfromdiffusers.utilsimportload_imagefromPILimportImageimportcv2importnumpyasnp# 加载 ControlNet 模型controlnets{canny:ControlNetModel.from_pretrained(lllyasviel/sd-controlnet-canny),depth:ControlNetModel.from_pretrained(lllyasviel/sd-controlnet-depth),pose:ControlNetModel.from_pretrained(lllyasviel/sd-controlnet-openpose),scribble:ControlNetModel.from_pretrained(lllyasviel/sd-controlnet-scribble),seg:ControlNetModel.from_pretrained(lllyasviel/sd-controlnet-seg),ip2p:ControlNetModel.from_pretrained(lllyasviel/sd-controlnet-ip2p),}# Canny 边缘控制pipeStableDiffusionControlNetPipeline.from_pretrained(runwayml/stable-diffusion-v1-5,controlnetcontrolnets[canny],torch_dtypetorch.float16).to(cuda)# 准备控制图像input_imageload_image(sketch.png).convert(RGB)canny_imagenp.array(input_image)canny_imagecv2.Canny(canny_image,100,200)canny_imagecanny_image[:,:,None]canny_imagenp.concatenate([canny_image,canny_image,canny_image],axis2)canny_imageImage.fromarray(canny_image)# 生成imagepipe(prompta beautiful house on a hill, detailed, 8k,imagecanny_image,num_inference_steps20,controlnet_conditioning_scale0.8,# 控制强度).images[0]6.2 多重 ControlNetfromdiffusersimportStableDiffusionControlNetPipeline# 同时使用 Canny Depthcontrolnet_cannyControlNetModel.from_pretrained(lllyasviel/sd-controlnet-canny)controlnet_depthControlNetModel.from_pretrained(lllyasviel/sd-controlnet-depth)pipeStableDiffusionControlNetPipeline.from_pretrained(runwayml/stable-diffusion-v1-5,controlnet[controlnet_canny,controlnet_depth],# 多个ControlNet!torch_dtypetorch.float16).to(cuda)imagepipe(prompta modern office interior,image[canny_image,depth_image],controlnet_conditioning_scale[0.7,0.5],).images[0]6.3 IP-Adapter参考图风格迁移fromdiffusersimportStableDiffusionPipelinefromdiffusersimportIPAdapter pipeStableDiffusionPipeline.from_pretrained(runwayml/stable-diffusion-v1-5,torch_dtypetorch.float16).to(cuda)# 加载 IP-Adapterpipe.load_ip_adapter(h94/IP-Adapter,subfoldermodels,weight_nameip-adapter-plus_sd15.safetensors)# 参考图风格来源style_imageload_image(van_gogh_style.jpg)imagepipe(prompta city street at night,ip_adapter_imagestyle_image,ip_adapter_scale0.6,# 风格强度num_inference_steps30,).images[0]七、推理优化importtorch# 1. xFormers 加速2-3xpipe.enable_xformers_memory_efficient_attention()# 2. FP16 推理pipepipe.to(dtypetorch.float16)# 3. CPU Offload降低显存pipe.enable_model_cpu_offload()# 4. VAE 切片pipe.enable_vae_slicing()# 5. 注意力切片pipe.enable_attention_slicing()# 6. Token Merging (ToMe) 加速importtomesd tomesd.apply_patch(pipe,ratio0.5)# 减少50% token# 性能数据 (512×512, RTX 3090):# 默认: ~4s, 8.5GB VRAM# xFormers: ~1.5s, 6.2GB VRAM# ToMe 0.5: ~1.0s, 5.5GB VRAM八、总结Stable Diffusion 技术栈全景DDPM→DDIM从 1000 步到 50 步采样Latent Diffusion在压缩潜空间工作效率革命LoRA10 张图即可定制风格/角色DreamBooth学习全新概念3-5张图ControlNet边缘/深度/姿态… 精确控制IP-Adapter参考图风格迁移xFormers/ToMe推理加速 2-3x

相关新闻

2026/7/25 0:50:47

基于SpringBoot的地震减灾救援中心系统任务书

一、课题研究背景与意义 地震属于突发性强、破坏力大的自然灾害,一旦发生极易造成人员伤亡、建筑损毁、物资短缺等重大灾害损失。在传统地震减灾救援工作中,救援调度、灾情上报、物资调配、人员安置、救援记录统计多依靠人工汇总、线下沟通、纸质登记的方…

2026/7/25 0:45:47

PPT计时器思维革命:从时间焦虑到演讲掌控者的效率跃迁

PPT计时器思维革命:从时间焦虑到演讲掌控者的效率跃迁 【免费下载链接】ppttimer 一个简易的 PPT 计时器 项目地址: https://gitcode.com/gh_mirrors/pp/ppttimer 你是否曾在重要演讲的最后5分钟,突然意识到时间已悄然流逝?你是否因为…

2026/7/25 2:20:52

Dify 开源 AI 应用开发平台:从零部署到实战应用全解析

Dify 是一个开源的 AI 应用开发平台,由 LangGenius 团队打造。它的核心目标很直接:让你无需编写大量代码,就能快速构建、部署和管理生产级的 AI 应用。无论是想做一个智能客服、一个文档分析助手,还是一个复杂的多步骤 AI 工作流,Dify 都试图通过可视化拖拽的方式,把这件…

2026/7/25 2:20:52

AI辅助学习企业级电商项目:从架构解构到工程实践

最近在技术社区里,总能看到一些标题极具冲击力的“速成”教程,比如“1天刷完”、“比付费强十倍”。作为一个在开发一线摸爬滚打了十几年的人,我第一反应往往是怀疑:一个企业级的电商项目,其价值真的在于“刷完”吗?还是说,我们更应该关注在“刷”的过程中,究竟沉淀下了…

2026/7/25 2:20:52

LMCache:持久化KV Cache管理,破解大模型推理内存瓶颈

在大规模语言模型推理的实际部署中,KV Cache 的内存占用是制约吞吐量和延迟的关键瓶颈。随着上下文长度和并发请求的增加,GPU 显存中的 KV Cache 会迅速耗尽,导致请求排队、首次令牌生成时间(TTFT)飙升,甚至服务中断。传统的解决方案,如 vLLM 的 PagedAttention,虽然优…

2026/7/25 2:20:52

本地语音转写工具Diktafon:磁带式界面与离线转录实战评测

这类工具最值得先看的不是功能列表,而是能不能在普通环境里稳定跑起来。Diktafon 这个项目,核心是把语音备忘录做成磁带录音机的样子,而且转录过程完全在设备本地完成,不依赖网络。如果你经常需要快速记录想法、会议要点或临时灵感…

2026/7/25 2:15:52

猪齿鱼3.0:AI驱动的研发全生命周期管理平台解析

1. 猪齿鱼3.0产品定位解析猪齿鱼3.0作为新一代研发协作平台,其核心突破在于将AI能力深度融入研发全生命周期管理。与市面上常见的"AI低代码"工具不同,猪齿鱼的独特之处在于构建了覆盖需求分析、任务拆解、代码生成、测试验证、部署运维的完整智…

2026/7/23 12:54:51

Unity与Python本地通信:基于Flask的跨语言数据交换实战

1. 项目概述:为什么我们需要一个本地通信服务器?在游戏开发、数字孪生、仿真训练等众多领域,Unity作为强大的实时3D内容创作平台,其核心逻辑通常由C#驱动。然而,当我们需要进行复杂的数据分析、机器学习推理、科学计算…

2026/7/25 0:00:15

C++ string类模拟实现:从深拷贝到内存管理的完整指南

1. 项目概述:为什么我们要“手撕”string类?在C的学习道路上,尤其是从C语言过渡到C的“初阶”阶段,string类绝对是一个绕不开的核心。标准库里的std::string用起来太方便了,、find、substr,几个操作符和函数…

2026/7/25 0:00:15

三角洲寻宝鼠工具:高效文件搜索与资源管理实战指南

1. 先搞清楚“三角洲寻宝鼠”到底是什么工具从名称来看,“三角洲寻宝鼠”更像是一个资源查找或文件检索类工具,而不是游戏或娱乐软件。这类工具的核心价值在于帮助用户快速定位特定资源,比如文档、图片、压缩包或特定格式的文件。如果你经常需…

2026/7/25 0:00:15

VHF 甚高频语音喊话系统(桥梁智能防撞场景)核心优势

一、直达船员,预警链路最短营运船舶强制标配 VHF 船载电台,属于驾驶室常态化值守设备;预警语音直接传递至驾驶人员,区别于岸上声光报警(船员经常听不到)、短信 / 小程序(船员极少主动查看&#…

2026/7/25 0:59:36

3个高效策略:快速掌握Axure中文界面配置

3个高效策略:快速掌握Axure中文界面配置 【免费下载链接】axure-cn Chinese language file for Axure RP. Axure RP 简体中文语言包。支持 Axure 11、10、9。不定期更新。 项目地址: https://gitcode.com/gh_mirrors/ax/axure-cn 还在为Axure RP的英文界面感…