[KongchangAI]
Model

U-Net

U-Net是一种用于图像分割任务的卷积神经网络架构,由Ronneberger等人于2015年提出,最初面向生物医学图像分析设计。其核心结构由对称的编码器(下采样路径)和解码器(上采样路径)组成,并通过跳跃连接(skip connections)融合不同层级的特征信息,能够在少量训练数据下实现精确的像素级分割,广泛应用于医学影像、遥感图像及工业视觉等领域。

Core Facts

Timeline (last 90 days)

Sep 12

在扩散模型中LoRA通常被注入U-Net或Transformer的注意力层(Q、K、V投影矩阵)

Unverified50%
Sep 12

研究引入Tiny DiT主干网络(10个epoch,秩取4/8/16)将结论从U-Net推广到Transformer架构的扩散模型

Unverified50%
Sep 12

该研究在CIFAR-10数据集上采用DDPM架构的U-Net作为主干网络,测试了{2, 4, 8, 16, 32}五个不同的秩取值

Unverified50%
Sep 11

图像分割常借助深度学习中的语义分割模型如U-Net或Mask R-CNN实现,逐像素判断哪些区域属于鸟类主体

Unverified50%
Sep 10

Stable Diffusion 模型由变分自编码器(VAE)、U-Net 架构的噪声预测网络和基于 CLIP 的文本编码器三个关键组件构成

Unverified50%
Sep 9

放射科AI主要依赖卷积神经网络技术,使用ResNet、U-Net等架构进行医学影像识别

Unverified50%
Sep 7

扩散模型核心是马尔可夫链过程,前向过程逐步破坏数据,反向过程通过神经网络(通常是U-Net架构)逐步恢复

Unverified50%
Sep 5

扩散模型通常需要数十到上千步推理步骤,且每一步都是对整个图像的全局操作,通常依赖U-Net或DiT架构实现

Unverified50%
Sep 4

属性泄漏与扩散模型中交叉注意力图谱的空间分辨率限制密切相关,在U-Net或DiT架构中低分辨率层捕捉全局语义、高分辨率层负责局部细节

Unverified50%
Sep 1

Stable Diffusion 的核心原理是在压缩后的潜在空间中进行去噪生成,采用CLIP文本编码器理解提示词、U-Net架构执行去噪、VAE解码器还原图像的三段式流程

Unverified50%

9 more timeline events

All Facts (20)

Verified

FLUX采用了DiT(Diffusion Transformer)架构,用纯Transformer替代了传统的U-Net结构

80%
Verified

文本条件向量通过交叉注意力机制注入到U-Net去噪网络中,图像空间特征作为Query、文本编码作为Key和Value

65%
Verified

扩散模型在生成图像时通常需要数十到数百个去噪步骤,每一步由U-Net或Transformer网络预测噪声分量

65%
Verified

U-Net由Ronneberger等人于2015年提出,最初用于医学图像分割任务

65%
Unverified

一个Checkpoint文件通常包含完整的U-Net去噪网络权重,文件大小在2-7GB之间

85%
Unverified

研究引入Tiny DiT主干网络(10个epoch,秩取4/8/16)将结论从U-Net推广到Transformer架构的扩散模型

50%
Unverified

在扩散模型中LoRA通常被注入U-Net或Transformer的注意力层(Q、K、V投影矩阵)

50%
Unverified

该研究在CIFAR-10数据集上采用DDPM架构的U-Net作为主干网络,测试了{2, 4, 8, 16, 32}五个不同的秩取值

50%
Unverified

图像分割常借助深度学习中的语义分割模型如U-Net或Mask R-CNN实现,逐像素判断哪些区域属于鸟类主体

50%
Unverified

Stable Diffusion 模型由变分自编码器(VAE)、U-Net 架构的噪声预测网络和基于 CLIP 的文本编码器三个关键组件构成

50%
Unverified

放射科AI主要依赖卷积神经网络技术,使用ResNet、U-Net等架构进行医学影像识别

50%
Unverified

扩散模型核心是马尔可夫链过程,前向过程逐步破坏数据,反向过程通过神经网络(通常是U-Net架构)逐步恢复

50%
Unverified

扩散模型通常需要数十到上千步推理步骤,且每一步都是对整个图像的全局操作,通常依赖U-Net或DiT架构实现

50%
Unverified

属性泄漏与扩散模型中交叉注意力图谱的空间分辨率限制密切相关,在U-Net或DiT架构中低分辨率层捕捉全局语义、高分辨率层负责局部细节

50%
Unverified

Stable Diffusion 的核心原理是在压缩后的潜在空间中进行去噪生成,采用CLIP文本编码器理解提示词、U-Net架构执行去噪、VAE解码器还原图像的三段式流程

50%
Unverified

Spleeter 基于 U-Net 架构,在频谱图域上工作,通过短时傅里叶变换转换音频后预测频谱掩膜来分离声部

50%
Unverified

Stable Diffusion基于LAION-5B数据集训练,采用U-Net架构作为去噪骨干网络,配合CLIP文本编码器实现文本到图像的语义映射

50%
Unverified

潜在扩散模型将图像生成从像素空间转移到压缩后的潜在空间进行,包含编码器压缩图像、U-Net在潜在空间执行迭代去噪、解码器还原为像素图像三个关键组件

50%
Unverified

标准U-Net在极端低对比度场景下存在感受野受限、跳跃连接传递的低层特征可能是噪声、无内置注意力机制等固有限制

50%
Unverified

扩散模型的反向过程通常使用U-Net或DiT(Diffusion Transformer)架构来预测每一步应去除的噪声量

50%

Source Articles