共 32 篇相关文章

深入解析Google Gemini 3.5 Transcribe的智能语音转写能力,探讨其上下文纠错、专业术语识别、口语整理等核心特性,以及在会议记录、内容创作、客服合规等场景的应用前景。

Qwen Scribe是一款专为Apple Silicon优化的本地语音转写与听写工具,基于通义千问模型实现完全离线运行。本文详解其技术特点、隐私优势及与Whisper等同类工具的对比。
用Cloudflare Workers AI免费搭建Whisper语音转写工具
基于Cloudflare Workers AI的开源语音转写工具,无需GPU、零运维成本,免费额度即可运行Whisper模型。适合独立开发者和小团队快速实现语音转文字功能,本文详解技术架构、适用场景与局限。

MosiAI开源MOSS-Transcribe-Diarize-0.9B,一体化实现语音转写与说话人分离,支持128K上下文单次处理90分钟音频,内置热词增强,SGLang Day-0支持,轻量可部署于边缘设备。
每日AI新鲜事·08月28日早间版:Gemini Omni 1.1 Flas…
2026年08月28日(周五)早间版 AI新闻速递+热点深度讨论
每日AI新鲜事·08月27日午间版:Gemini 3.5 Transcrib…
2026年08月27日(周四)午间版 AI新闻速递+热点深度讨论

探索一个仅125M参数的端侧AI钢琴续奏模型,如何在本地设备上实现低延迟、可离线的音乐自动补全。深入分析小模型在垂直音乐生成任务中的技术路径与Edge AI的实践价值。

探讨如何用POMDP框架重新建模低资源机器翻译问题,结合MBR解码与主动消歧机制,解决孟加拉语翻译中的歧义、语码混合与语音噪声等核心难题,提供智能体化翻译系统的完整设计思路。

详解如何用Claude Code搭建具备后端数据库、用户鉴权、多媒体优化的商业级全栈网站。涵盖技能配置、Supabase+ImageKit技术栈选型、MCP集成与增量式构建全流程,打造可复用的高价值SaaS产品。

深入解析SL2T手语转文字AI模型的核心技术原理、应用价值与发展前景。了解这款突破性模型如何通过多模态识别将连续手语实时转换为文字,为聋人和听障群体消除数字沟通鸿沟。

everyone-can-use-english是GitHub上超3.5万Star的开源英语学习工具,集成Whisper语音识别、TTS和大语言模型,提供精听训练、跟读对比、AI对话等功能,帮助开发者和学习者零成本突破哑巴英语。

StoryVoice是一款AI客户案例生成工具,通过发送链接让客户录制5分钟语音访谈,自动生成包含真实引语和量化指标的案例研究,帮助B2B营销团队大幅缩短案例制作周期。

通义千问发布Qwen-Audio-3.0-ASR-Flash语音识别模型,医疗术语召回率95.36%,工业术语93.24%。支持上下文一致性、领域术语识别、自定义热词和语音润色四大核心升级,提供流式识别与文件转写多版本选择。
每日AI新鲜事·08月04日午间版:模型福利与本地AI部署
2026年08月04日午间版 AI新闻速递+热点深度讨论

ViiTor Translate 是一款主打语境理解的实时字幕翻译工具,支持iOS、Android和Chrome三端,为追Vtuber、K-pop和动漫的用户提供悬浮字幕体验。本文深度分析其核心功能、目标人群及潜在挑战。

详解藏汉双语字幕自动生成的完整技术方案,涵盖藏语语音识别(Whisper/wav2vec)、藏中机器翻译(NLLB)、时间轴对齐与字幕导出,为低资源语言内容创作者提供可落地的工作流指南。

SceneNote是一款免费视频反馈工具,审阅者无需注册即可使用。支持时间戳评论、画面标注、语音转写,并可导出EDL标记直接同步到Premiere、DaVinci Resolve等剪辑软件时间线。

Speech To Markdown是一款免费macOS/iOS应用,通过本地大模型将语音实时转换为结构化Markdown笔记。全程离线运行,无需API密钥,支持全局快捷键听写,适合重度笔记用户、开发者及注重隐私的专业人士。