待验证50% 置信权衡取舍精确时间
EmbeddingGemma 2 的文本、图像、视频、音频共用同一个主干网络,在某一模态上训练主干会改变其他模态的表现
1
来源数
50%
置信度
长期有效
时效性
2026/10/8
首次发现
来源
涉及实体
相关事实
待验证EmbeddingGemma 2能够在同一个模型中处理文本、代码、图像、视频和音频等多种类型的任务79% 相似待验证EmbeddingGemma 2 首次把文本、代码、图像、视频和音频统一映射到同一个嵌入空间,并针对端侧优化支持本地部署 RAG70% 相似部分验证EmbeddingGemma2除了文字和图片外还支持音频和视频,把不同模态内容都转换成768维向量70% 相似待验证EmbeddingGemma 2 支持四种模态之间的任意交叉检索,可用文字搜图片、用图片搜视频、用视频搜音频69% 相似待验证OctLLM将网格令牌路由到部分Transformer块中独立的可训练分支,文本和图像令牌保留在冻结的视觉-语言通路中,两条数据流通过共享自注意力机制交互68% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/989452API
curl https://kongchang.com/api/v1/knowledge/claims/989452MCP
get_claim(id=989452)