Unverified80% confidenceFactTime unknown
Gemma 4的1B/2B模型自带语音识别功能
1
Sources
80%
Confidence
Long-term
Relevance
6/3/2026
First Seen
Sources
Google Gemma 4实测:手机离线运行+Ollama部署教程
bilibiliAGI_Ananas
Related Entities
Related Claims
UnverifiedGemma E2B 变体具备原生音频理解能力,可直接处理音频频谱特征而无需独立的语音识别模块79% similarUnverifiedGemma 4 新增了音频对话能力,支持 wav、mp3、m4a、flac、webm 等音频格式,并加入「保留思维链」功能73% similarUnverified该项目支持声纹识别和声音克隆功能60% similarUnverified多模态感知集成了计算机视觉(如ViT模型)和语音识别(如Whisper模型),使Agent能同时处理文本、图像、音频、视频等输入格式59% similarUnverifiedVALL-E、VoiceCraft等语音合成模型采用了将语音表示为Token序列并使用自回归生成框架的技术路线58% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/38371API
curl https://kongchang.com/api/v1/knowledge/claims/38371MCP
get_claim(id=38371)