#多模态
共 62 篇相关文章

Opus 5.5 用一镜到底动画将人类史浓缩为24小时
Claude Opus 5.5 据称以一镜到底方式生成动画视频,将人类历史浓缩为24小时并配原创音乐。本文分析AI多模态端到端创作能力的意义与需审慎看待之处。

Wity-1推理决策模型:介于全推理与零推理之间的新思路
新模型Wity-1自称为推理决策模型,介于纯决策模型JEV与完全推理LLM之间,只推理到答案达成即停止,并声称在四项基线与Image JEV Bench上领先。本文解析其技术思路并保持审慎评估。

CO₂Jump:解决文图联合生成不一致的自纠正采样方法
Google、DeepMind 与石溪大学联合提出 CO₂Jump 采样方法,通过文本置信度与跨模态注意力解决文图联合生成的不一致问题,支持自纠正且无需额外训练,在图像编辑、迷宫、数织任务上表现优异。

Eclatira:可嵌入任意技术栈的对话式视频AI智能体
Eclatira 是一款登上 Product Hunt 榜单的对话式视频AI开发者工具,提供语音到语音、实时视觉及跨栈执行能力,支持自定义API、MCP和3000+应用集成,帮助开发者快速构建多模态视频智能体。

视觉大模型入门指南:从预训练到下游任务全解析
视觉大模型入门系统教程:解析预训练与下游任务适配两大板块,梳理从BERT到GPT-4V的大模型演进,讲解LLM、VLM分类及从通才到专才的迁移学习路径,附学习前置要求与算力建议。

Gemini 3.8 Live 推出 Live Avatar:谷歌 AI 有了会说话的脸
谷歌 Gemini 3.8 Live 更新推出 Live Avatar 功能,让 AI 拥有会实时唇形同步、变换表情的动画形象,支持 97 种形象切换,目前仅面向 Gemini Enterprise 企业客户开放。

GPT-6 Astra实测:论文配图1:1还原并转可编辑PPT
GPT-6 Astra实测将论文复杂插图1:1还原并转为可编辑PPT,箭头、图标、表格均可编辑。本文解析其混合还原提示词、操作方法及对学术生产力的现实意义。

证据顺序竟能改变判断:多模态大模型的"证据不可交换性"
arXiv 新论文揭示多模态大模型的"证据不可交换性":图像或语音与文本冲突时,感知证据放在后面会显著增加模型依赖度。相同证据、不同顺序即导致不同判断,过往文本偏见研究结论或需重新审视。

Gemini 3.8 文本转语音功能引发关注
谷歌 Gemini 文本转语音(TTS)功能在 Hacker News 引发热议,本文梳理该话题背景、语音合成的行业意义以及评估 TTS 能力的关键维度,帮助读者理性看待多模态语音赛道竞争。

阿里通义Qwen-Audio-3.1发布:五模型音频全栈,ASR降价95%
阿里通义发布Qwen-Audio-3.1,包含ASR、TTS、Realtime及新增TTS-Next、ASR-Next共五个模型,构成完整音频技术栈,并全线降价:TTS降70%、Realtime降85%、ASR最高降95%。

小米发布MiMo-V2.6:350万美元打造的全模态开源模型
小米发布多模态大模型MiMo-V2.6,主打前沿智能、全模态与公开构建,总训练成本仅350万美元,并配备实时评测仪表盘。本文解析其成本、定位与生态意义。

SJR架构:解耦内容理解与策略学习的多模态内容审核新范式
arXiv论文提出SJR(总结-判断-精炼)架构,通过自然语言接口解耦多模态内容理解与策略分类。在误导广告检测中相对F1提升23.6%,且零真实违规样本即可启动新策略,兼具数据效率与可解释性。

MasterGo AI+Cursor实战:一个人搭建多模态AI应用全流程
MasterGo AI与Cursor联合实战课程,带你用AI工具链搭建集成文本聊天、语音交互、图像生成的多模态全栈应用,覆盖需求分析、数据库建模、API设计、前端开发到部署上线全流程,掌握AI与人工协同开发的核心竞争力。

CapMem:用文本字幕解决长视频情景记忆的新基准
CapMem 提出用文本字幕作为可复用情景记忆,解决可穿戴助手处理第一人称长视频的难题。基准含75段视频、33.7小时、1000道问答,实验证明字幕方案在长视频上超越直接VideoQA。

Sierra 多模态智能体:语音、文字、视觉自由切换的客服 AI
Sierra 推出 Multimodal Agents 多模态智能体,能在语音、文字、视觉三种交互模式间自动切换,专为客户成功场景设计。本文解析其产品理念、应用价值与 AI 智能体多模态融合趋势。

TestHallVQA:冗余上下文下大视觉语言模型的文档级推理新基准
TestHallVQA 是一个面向大视觉语言模型(LVLMs)的多图 VQA 新基准,融合文档级规模与科学考试难度,并提出 F1-R² 指标量化模型在冗余上下文下的推理与证据检索鲁棒性,揭示主流模型的潜在缺陷。

Agnes-3.0-Flash 深度解析:33B 混合注意力多模态模型
Agnes-3.0-Flash 是一款 33B 参数的多模态模型,采用 3:1 混合注意力架构,支持 26 万 token 上下文与文本、图像、视频理解。本文深度解析其架构设计,并探讨其在 Artificial Analysis 上的评分疑点。

用选择题重新定义视频字幕质量评估:VLLM新方法解析
针对视觉大语言模型(VLLM)视频字幕评估的难题,研究者提出以信息保真度和多项选择题问答(MCQA)重新定义字幕质量,破解传统词汇匹配指标的一对多困境,实现更公平、细粒度的评估。

