Unverified70% confidenceFactExact time
MiMo-V2.6 覆盖文本、图像、语音等多种模态,是全模态模型
2
Sources
70%
Confidence
Medium-term (~90 days)
Relevance
9/22/2026
First Seen
Valid until: 12/21/2026
Sources
Related Entities
Related Claims
UnverifiedMIMO 2.5 is a multimodal model focused on visual understanding, with core capabilities in Image Captioning, Visual Question Answering (VQA), and OCR recognition.72% similarUnverified千问(Qwen-VL系列)和小米MiMo支持多模态,可以处理图像输入71% similarUnverified现代模型不再只处理文本,而是同时支持图像、音频、视频等多模态输入69% similarUnverifiedImagen的核心架构基于大规模语言模型(如T5-XXL)作为文本编码器,配合级联式扩散模型进行图像生成68% similarUnverifiedKun目前还支持图片生成、媒体生成和语音转文字等功能61% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/940227API
curl https://kongchang.com/api/v1/knowledge/claims/940227MCP
get_claim(id=940227)