OctLLM
一种3D大语言模型方法,通过显式八叉树占用令牌序列表示三维几何信息,并采用独立参数分支引入3D能力而不破坏预训练语言通路,在参数效率、语言能力保留与3D表达力之间取得平衡
时间轴 (近 90 天)
arXiv论文《Octrees as an Explicit 3D Language》提出了OctLLM,针对3D大模型压缩几何信息和微调损害语言能力两个痛点
OctLLM用显式的八叉树占用令牌序列替代被压缩的隐式表示,并通过独立参数分支引入3D能力而不破坏预训练语言通路
OctLLM设计了稀疏八叉树(S-Octree),随机清空倒数第二层节点并省略其后代,保留形状轮廓以缩短序列
OctLLM将网格令牌路由到部分Transformer块中独立的可训练分支,文本和图像令牌保留在冻结的视觉-语言通路中,两条数据流通过共享自注意力机制交互
OctLLM在统一多模态大模型范畴内以明显更少的训练参数达到了新的最优水平(SOTA)
与ShapeLLM-Omni相比,OctLLM将图像生成3D的FID指标降低了17.4%
与ShapeLLM-Omni相比,OctLLM将基于渲染的图像描述(render-grounded captioning)提升了28.7分
作为新发布的预印本,OctLLM在更大规模数据和更复杂3D任务上的泛化能力仍有待后续工作和社区复现检验
全部知识事实 (8)
arXiv论文《Octrees as an Explicit 3D Language》提出了OctLLM,针对3D大模型压缩几何信息和微调损害语言能力两个痛点
50%待验证OctLLM用显式的八叉树占用令牌序列替代被压缩的隐式表示,并通过独立参数分支引入3D能力而不破坏预训练语言通路
50%待验证OctLLM设计了稀疏八叉树(S-Octree),随机清空倒数第二层节点并省略其后代,保留形状轮廓以缩短序列
50%待验证OctLLM将网格令牌路由到部分Transformer块中独立的可训练分支,文本和图像令牌保留在冻结的视觉-语言通路中,两条数据流通过共享自注意力机制交互
50%待验证OctLLM在统一多模态大模型范畴内以明显更少的训练参数达到了新的最优水平(SOTA)
50%待验证与ShapeLLM-Omni相比,OctLLM将图像生成3D的FID指标降低了17.4%
50%待验证与ShapeLLM-Omni相比,OctLLM将基于渲染的图像描述(render-grounded captioning)提升了28.7分
50%待验证作为新发布的预印本,OctLLM在更大规模数据和更复杂3D任务上的泛化能力仍有待后续工作和社区复现检验
50%