Unverified50% confidenceFactExact time
在图像生成中LoRA主要作用于U-Net或DiT架构中自注意力与交叉注意力层的Q、K、V投影矩阵,使RTX 3090(24GB显存)等消费级显卡也能完成模型定制训练
1
Sources
50%
Confidence
Long-term
Relevance
7/23/2026
First Seen
Sources
Related Claims
Unverified当前主流 VLM 经过大规模 UI 截图数据训练,能够识别界面元素的层级关系,将视觉布局映射为功能语义69% similarVerified视频扩散模型采用扩散变换器(DiT)架构,通过在时序注意力层引入3D时空注意力机制同时建模空间与时间维度68% similarUnverified商汤科技据悉正在研发多模态图像大模型U1 Pro,内部对标GPT Image 2,主攻设计场景,支持长程生成评审循环并可实现最高8K分辨率输出68% similarUnverified具身智能当前主流技术路线是视觉-语言-动作模型(VLA),将摄像头图像与语言指令共同输入,直接输出机械臂的关节控制信号67% similarUnverified谷歌的PaLI、OpenAI的GPT-4V、Meta的LLaMA Vision均沿用了类似的图文对齐预训练策略67% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/598917API
curl https://kongchang.com/api/v1/knowledge/claims/598917MCP
get_claim(id=598917)