[控场AI]

#多模态

共 60 篇相关文章

Perplexity开源pplx-embed-v2-late:文本图像多向量嵌入模型
·5 分钟

Perplexity开源pplx-embed-v2-late:文本图像多向量嵌入模型

Perplexity开源多向量嵌入模型pplx-embed-v2-late,提供9B索引版与0.6B端侧版,共享嵌入空间,支持免OCR的PDF页面检索,MADQA达92.4%,权重已上线Hugging Face。

阅读全文 →
MambaXray-PRB:CheXpert Plus上的X光报告生成新基准
·5 分钟

MambaXray-PRB:CheXpert Plus上的X光报告生成新基准

arXiv论文提出MambaXray-PRB框架,在CheXpert Plus数据集上构建X光报告生成标准化基准,通过多阶段大模型预训练与多模态思维链推理提升性能与可解释性,并已开源代码。

阅读全文 →
谷歌EmbeddingGemma 2开源:端侧多模态嵌入新选择
·6 分钟

谷歌EmbeddingGemma 2开源:端侧多模态嵌入新选择

谷歌发布 EmbeddingGemma 2 多模态嵌入模型并开放权重,支持端侧低内存运行;同时盘点 OpenAI 海量数学成果争议、Anthropic 网络安全核验计划、Nano Banana 2.1 及智能体落地瓶颈等每日 AI 要闻。

阅读全文 →
谷歌EmbeddingGemma 2:轻量开放的多模态嵌入模型
·4 分钟

谷歌EmbeddingGemma 2:轻量开放的多模态嵌入模型

谷歌发布 EmbeddingGemma 2,一款开放轻量的多模态嵌入模型,统一映射文本、图像、视频和音频。最大7.4亿参数、支持端侧离线运行与RAG管线,兼顾性能与隐私。

阅读全文 →
Google EmbeddingGemma 2:首个原生多模态端侧嵌入模型解析
·5 分钟

Google EmbeddingGemma 2:首个原生多模态端侧嵌入模型解析

谷歌发布 EmbeddingGemma 2,740M 参数的原生多模态端侧开源嵌入模型,支持文字、代码、图片、音频、视频映射到同一向量空间。本文解析其模块化架构、跑分表现、8K 上下文及端侧部署要点。

阅读全文 →
EmbeddingGemma 2实测:手机就能跑的多模态检索模型
·8 分钟

EmbeddingGemma 2实测:手机就能跑的多模态检索模型

Google开源的EmbeddingGemma 2把文本、图像、视频、音频映射进同一向量空间,小到能在手机运行。本文解析其架构原理,并通过Colab实测图片、语音、视频、文档的多模态检索效果与短板。

阅读全文 →
EmbeddingGemma 2 浏览器端图文检索:WebGPU 本地推理实践
·5 分钟

EmbeddingGemma 2 浏览器端图文检索:WebGPU 本地推理实践

EmbeddingGemma 2 将图像与文本映射到同一 768 维向量空间,实现图文检索。开发者借助 WebGPU 推理库 ruNNtime,让图片语义搜索完全在浏览器 GPU 本地运行,兼顾隐私与零部署成本。

阅读全文 →
MiniCPM-V-4.7-35B-A3B 现身 HuggingFace:MoE 多模态新动向
·4 分钟

MiniCPM-V-4.7-35B-A3B 现身 HuggingFace:MoE 多模态新动向

HuggingFace 平台现身 MiniCPM-V-4.7-35B-A3B 新模型条目,命名暗示其采用总参数 35B、激活 3B 的 MoE 多模态架构。本文解读命名含义与技术趋势,目前模型卡尚未发布。

阅读全文 →
OpenAI推出Decisions API:毫秒级决策的轻量模型
·6 分钟

OpenAI推出Decisions API:毫秒级决策的轻量模型

OpenAI 发布 Decisions API,基于 GPT-6 Luna 模型,让 AI 在毫秒级内完成文本与图像的多选决策,响应低于100毫秒,可用于工单分类、实时视觉动作与机器人控制等低延迟场景。

阅读全文 →
EmbeddingGemma 2发布:端侧多模态嵌入模型新标杆
·6 分钟

EmbeddingGemma 2发布:端侧多模态嵌入模型新标杆

Google DeepMind 发布 EmbeddingGemma 2,一款开源轻量级多模态嵌入模型。仅 7.4 亿参数即可在手机端统一处理文本、代码、图像、音频和视频,支持 8K 上下文与离线 RAG,Apache 2.0 许可证商用友好。

阅读全文 →
Aplomb 1:53亿参数决策模型,1M上下文四模态输入
·5 分钟

Aplomb 1:53亿参数决策模型,1M上下文四模态输入

EmpirioLabs 发布开放权重决策模型 Aplomb 1,基于 Qwen3.5-4B,仅 53 亿参数却支持 1M token 上下文、文本图像视频音频四模态输入,并为工具调用参数返回概率,在 4B 级别 Decision Index 榜单登顶。

阅读全文 →
Transformers v5.19.0 发布:EmbeddingGemma 2 多模态嵌入与 MoE 重大变更
·7 分钟

Transformers v5.19.0 发布:EmbeddingGemma 2 多模态嵌入与 MoE 重大变更

Hugging Face Transformers v5.19.0 发布,新增谷歌 EmbeddingGemma 2 多模态嵌入模型,并对 MoE 路由 logits、注意力机制、持续批处理和专家并行引入多项破坏性变更与性能优化。

阅读全文 →
OctLLM:用八叉树让大模型看懂3D几何结构
·6 分钟

OctLLM:用八叉树让大模型看懂3D几何结构

arXiv论文OctLLM提出用八叉树作为显式3D语言,通过稀疏八叉树和独立参数分支,让大模型在不牺牲语言能力的前提下理解和生成3D几何,图像生成3D的FID降低17.4%,刷新统一多模态LLM的SOTA。

阅读全文 →
多模态AI转录开罗genizah:右向左语言的VLM微调实践
·4 分钟

多模态AI转录开罗genizah:右向左语言的VLM微调实践

一篇技术文章探讨如何通过微调多模态视觉语言模型(VLM)自动转录开罗genizah中世纪手稿,解决希伯来语等右向左语言的OCR难题,为数字人文研究提供新工具。

阅读全文 →
DeepSeek 4.1 Flash发布:多模态加持的高速推理模型
·4 分钟

DeepSeek 4.1 Flash发布:多模态加持的高速推理模型

DeepSeek 4.1 Flash多模态开源模型发布,支持图像理解、文本处理与编程任务,采用新架构提升推理速度与效率。本文介绍其核心特性及如何通过模型目录与无服务器推理快速体验。

阅读全文 →
macOS本地AI搜图新尝试:照片与视频逐帧语义检索
·3 分钟

macOS本地AI搜图新尝试:照片与视频逐帧语义检索

一款macOS本地AI搜索工具亮相Hacker News,支持对每张照片和视频每一帧进行语义检索。本文解析其逐帧检索的技术逻辑、本地化隐私优势及早期阶段的局限。

阅读全文 →
GLM 5.3 Flash 上线 Serverless 训练 API:支持视觉与文本微调
·3 分钟

GLM 5.3 Flash 上线 Serverless 训练 API:支持视觉与文本微调

GLM 5.3 Flash 现已登陆 Serverless Training API,面向所有用户开放,支持视觉与文本双模态微调。该模型在智能体编程、文档分析和工具调用等基准上表现优异,且服务成本低,适合智能体应用开发。

阅读全文 →
Transformers 5.18.0 发布:四款新模型加持多模态与说话人分离
·8 分钟

Transformers 5.18.0 发布:四款新模型加持多模态与说话人分离

Hugging Face Transformers 5.18.0 正式发布,新增 Nemotron 3 Diarization、NemotronH Omni、HyperCLOVAX Vision V2 和 GTE 四款模型,涵盖语音分离、多模态推理与文本检索,同时带来六项破坏性改动及分布式、量化能力增强。

阅读全文 →