U-Net
U-Net是一种用于图像分割任务的卷积神经网络架构,由Ronneberger等人于2015年提出,最初面向生物医学图像分析设计。其核心结构由对称的编码器(下采样路径)和解码器(上采样路径)组成,并通过跳跃连接(skip connections)融合不同层级的特征信息,能够在少量训练数据下实现精确的像素级分割,广泛应用于医学影像、遥感图像及工业视觉等领域。
Core Facts
Timeline (last 90 days)
在扩散模型中LoRA通常被注入U-Net或Transformer的注意力层(Q、K、V投影矩阵)
研究引入Tiny DiT主干网络(10个epoch,秩取4/8/16)将结论从U-Net推广到Transformer架构的扩散模型
该研究在CIFAR-10数据集上采用DDPM架构的U-Net作为主干网络,测试了{2, 4, 8, 16, 32}五个不同的秩取值
图像分割常借助深度学习中的语义分割模型如U-Net或Mask R-CNN实现,逐像素判断哪些区域属于鸟类主体
Stable Diffusion 模型由变分自编码器(VAE)、U-Net 架构的噪声预测网络和基于 CLIP 的文本编码器三个关键组件构成
放射科AI主要依赖卷积神经网络技术,使用ResNet、U-Net等架构进行医学影像识别
扩散模型核心是马尔可夫链过程,前向过程逐步破坏数据,反向过程通过神经网络(通常是U-Net架构)逐步恢复
扩散模型通常需要数十到上千步推理步骤,且每一步都是对整个图像的全局操作,通常依赖U-Net或DiT架构实现
属性泄漏与扩散模型中交叉注意力图谱的空间分辨率限制密切相关,在U-Net或DiT架构中低分辨率层捕捉全局语义、高分辨率层负责局部细节
Stable Diffusion 的核心原理是在压缩后的潜在空间中进行去噪生成,采用CLIP文本编码器理解提示词、U-Net架构执行去噪、VAE解码器还原图像的三段式流程
9 more timeline events
All Facts (20)
FLUX采用了DiT(Diffusion Transformer)架构,用纯Transformer替代了传统的U-Net结构
80%Verified文本条件向量通过交叉注意力机制注入到U-Net去噪网络中,图像空间特征作为Query、文本编码作为Key和Value
65%Verified扩散模型在生成图像时通常需要数十到数百个去噪步骤,每一步由U-Net或Transformer网络预测噪声分量
65%VerifiedU-Net由Ronneberger等人于2015年提出,最初用于医学图像分割任务
65%Unverified一个Checkpoint文件通常包含完整的U-Net去噪网络权重,文件大小在2-7GB之间
85%Unverified研究引入Tiny DiT主干网络(10个epoch,秩取4/8/16)将结论从U-Net推广到Transformer架构的扩散模型
50%Unverified在扩散模型中LoRA通常被注入U-Net或Transformer的注意力层(Q、K、V投影矩阵)
50%Unverified该研究在CIFAR-10数据集上采用DDPM架构的U-Net作为主干网络,测试了{2, 4, 8, 16, 32}五个不同的秩取值
50%Unverified图像分割常借助深度学习中的语义分割模型如U-Net或Mask R-CNN实现,逐像素判断哪些区域属于鸟类主体
50%UnverifiedStable Diffusion 模型由变分自编码器(VAE)、U-Net 架构的噪声预测网络和基于 CLIP 的文本编码器三个关键组件构成
50%Unverified放射科AI主要依赖卷积神经网络技术,使用ResNet、U-Net等架构进行医学影像识别
50%Unverified扩散模型核心是马尔可夫链过程,前向过程逐步破坏数据,反向过程通过神经网络(通常是U-Net架构)逐步恢复
50%Unverified扩散模型通常需要数十到上千步推理步骤,且每一步都是对整个图像的全局操作,通常依赖U-Net或DiT架构实现
50%Unverified属性泄漏与扩散模型中交叉注意力图谱的空间分辨率限制密切相关,在U-Net或DiT架构中低分辨率层捕捉全局语义、高分辨率层负责局部细节
50%UnverifiedStable Diffusion 的核心原理是在压缩后的潜在空间中进行去噪生成,采用CLIP文本编码器理解提示词、U-Net架构执行去噪、VAE解码器还原图像的三段式流程
50%UnverifiedSpleeter 基于 U-Net 架构,在频谱图域上工作,通过短时傅里叶变换转换音频后预测频谱掩膜来分离声部
50%UnverifiedStable Diffusion基于LAION-5B数据集训练,采用U-Net架构作为去噪骨干网络,配合CLIP文本编码器实现文本到图像的语义映射
50%Unverified潜在扩散模型将图像生成从像素空间转移到压缩后的潜在空间进行,包含编码器压缩图像、U-Net在潜在空间执行迭代去噪、解码器还原为像素图像三个关键组件
50%Unverified标准U-Net在极端低对比度场景下存在感受野受限、跳跃连接传递的低层特征可能是噪声、无内置注意力机制等固有限制
50%Unverified扩散模型的反向过程通常使用U-Net或DiT(Diffusion Transformer)架构来预测每一步应去除的噪声量
50%