待验证70% 置信事实精确时间
MiMo-V2.6 覆盖文本、图像、语音等多种模态,是全模态模型
2
来源数
70%
置信度
中期 (~90 天)
时效性
2026/9/22
首次发现
有效期至:2026/12/21
来源
涉及实体
相关事实
待验证MIMO 2.5 is a multimodal model focused on visual understanding, with core capabilities in Image Captioning, Visual Question Answering (VQA), and OCR recognition.72% 相似待验证千问(Qwen-VL系列)和小米MiMo支持多模态,可以处理图像输入71% 相似待验证现代模型不再只处理文本,而是同时支持图像、音频、视频等多模态输入69% 相似待验证Imagen的核心架构基于大规模语言模型(如T5-XXL)作为文本编码器,配合级联式扩散模型进行图像生成68% 相似待验证Kun目前还支持图片生成、媒体生成和语音转文字等功能61% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/940227API
curl https://kongchang.com/api/v1/knowledge/claims/940227MCP
get_claim(id=940227)