Sorinai:会议中实时填表的AI笔记工具,告别事后整理

会议记录的新范式:从事后整理到实时协作
在远程办公与视频会议成为常态的今天,会议记录工具早已不是新鲜事物。但绝大多数产品的逻辑仍停留在"先录音、后转写、再整理"的线性流程上——你需要在会议结束后花大量时间回听、编辑、归纳,才能得到一份可用的纪要。近期登上 Product Hunt 的新工具 Sorinai 试图打破这一惯性,它的核心卖点是:在会议进行的同时,AI 就已经把你的笔记模板填好了。
传统会议记录工具的技术栈通常包含三个独立模块:ASR(自动语音识别)引擎负责将音频转为文字,NLP(自然语言处理)模块负责断句、标点和说话人分离(Speaker Diarization),最后由摘要算法生成结构化纪要。这种流水线式架构天然存在延迟——每个模块都需要完整的上下文才能达到最优输出。Sorinai 试图将这三个阶段压缩为近乎同步的单一流程,这在工程上意味着必须使用流式推理(Streaming Inference),即模型在接收到部分输入时就开始产出结果,类似于大语言模型的逐 token 生成机制。
据 Product Hunt 页面显示,Sorinai 目前获得 87 票、位列当日榜单第 20 名,被归类为 Productivity(生产力)、Notes(笔记)与 Meetings(会议)三个方向。虽然票数不算爆款,但其产品思路值得关注。

Sorinai 核心功能拆解
导入自有模板,而非被迫使用预设格式
Sorinai 最有辨识度的设计,是允许用户直接导入自己已经在用的模板——无论是 Word 文档、PDF 还是纯文本。工具会读取模板的结构,理解其中的字段(fields),然后在通话过程中自动从对话内容里提取信息、逐一填充。
这一点解决了很多 AI 会议笔记工具的痛点:它们往往强制用户接受平台预设的纪要格式,而现实中每家公司、每个团队都有自己沉淀多年的会议模板(比如销售拜访表、需求评审单、一对一沟通记录等)。Sorinai 的做法是"迁就你的工作流",而不是让你迁就它。
从技术角度看,这种"边听边填"功能属于实时信息抽取(Real-time Information Extraction)范畴。模型需要具备两项核心能力:一是对模板字段的语义理解——模型需要知道"客户预算"这个字段应该从对话中哪类表述中提取;二是流式上下文管理——随着对话推进,早期提取的信息可能需要被后续内容修正(比如客户先说预算50万,后来改口说100万)。这类任务在学术上被称为增量式槽填充(Incremental Slot Filling),是对话系统研究中的经典难题。大语言模型的出现让这一任务的泛化能力大幅提升,但实时场景下的推理延迟和 Token 消耗仍是工程瓶颈。
不派机器人进会议,直接抓取系统音频
另一个技术细节是它的音频捕获方式。市面上不少会议助手(如各类 Meeting Bot)需要以"参会者"身份加入会议,屏幕上会多出一个头像,既尴尬又涉及隐私顾虑。
Sorinai 明确表示 "No bot joins your meeting"——它捕获的是电脑本机的系统音频。这意味着它不局限于某个特定的视频会议平台:Zoom、Teams、Google Meet 等视频通话,电话通话,甚至线下面对面的会议,只要声音能被电脑麦克风或系统音频捕捉到,都可以工作。这种"平台无关"的设计大幅拓宽了实时会议记录的适用场景。
系统音频捕获(System Audio Capture)是指应用程序直接拦截操作系统音频输出流的技术。在 macOS 上,苹果从 macOS 12 Monterey 起提供了 ScreenCaptureKit 框架,允许应用在用户授权后捕获特定应用或整个系统的音频输出,无需虚拟音频设备。在 Windows 上,WASAPI(Windows Audio Session API)的 Loopback 模式可实现类似功能。相比之下,传统的 Meeting Bot 方案(如 Recall.ai、Fireflies 等采用的方式)需要通过会议平台的 API 或以虚拟参会者身份加入,这不仅产生额外的 API 调用成本,还会在参会者列表中暴露机器人的存在。不过,系统音频捕获方案也有其局限:它只能录到本机播放的声音,无法获取会议平台提供的独立音轨或说话人元数据,这对后续的说话人分离精度会带来挑战。
会议中实时向AI提问:下一句该说什么?
最能体现"交互式(Interactive)"定位的功能,是 Sorinai 支持在通话进行中直接向 AI 提问。产品描述中给出的例子是:你可以问它"接下来该说什么"(what to say next)。
Sorinai 不只是被动的会议记录者,更像一个实时的会议副驾。它一边听、一边记、一边还能基于上下文给你提示。对于销售、客户成功、面试官等需要在对话中即时反应的角色,这种实时辅助能力可能比事后的完美纪要更有价值。
单场查询与跨会议知识库检索
在数据层面,Sorinai 支持针对单场会议提问,也支持一次性查询所有历史会议。这实际上把会议记录从"孤立的文档"升级为"可检索的知识库"。当你积累了几十上百场会议后,能够横向追问"这几个客户都提到过哪些共同顾虑"这类问题,价值会随数据量增长而放大。
Sorinai 的差异化定位与商业策略
Sorinai 目前支持 Mac 和 Windows 双平台,并打出了 "Unlimited notes, free"(无限笔记,免费) 的旗号。在会议 AI 赛道普遍采用订阅制、按分钟数或会议场次收费的背景下,免费无限量的策略显然是为了快速获取早期用户、积累使用数据。
从赛道竞争格局来看,AI 会议助手领域在 2023-2024 年经历了爆发式增长。头部玩家包括:Otter.ai(主打转写+摘要,月活超百万)、Fireflies.ai(强调 CRM 集成和会议搜索)、Fathom(以免费策略快速增长,2024年获 HubSpot 注资)、Granola(苹果生态内的极简会议笔记)以及微软 Copilot 内置的 Teams 会议摘要功能。这些产品大多遵循"录制→转写→摘要"的事后处理范式。Sorinai 的实时交互定位更接近于"会议中的 AI Copilot"概念,赛道的核心竞争壁垒正从"转写准确率"转向"工作流集成深度"和"实时智能程度"。
从产品哲学上看,Sorinai 走的是一条清晰的差异化路线:
- 不做另一个转写工具,而是做"实时填表 + 实时问答"的交互式会议助手;
- 不绑定平台,通过系统音频实现全场景覆盖;
- 不强推格式,尊重用户既有的模板资产。
使用 Sorinai 前值得考虑的几个问题
作为一款早期产品,Sorinai 的理念很清晰,但仍有若干现实问题需要验证:
实时性与准确性的平衡。 边听边填字段,对语音识别和信息抽取的实时能力要求极高。一旦在会议中填错关键信息,用户在事后仍需大量核对,反而增加负担。
隐私与合规风险。 捕获系统音频虽然规避了"机器人参会"的尴尬,但录制通话内容在不同司法辖区涉及不同的合规要求,尤其是电话与线下会议。通话录制的合规性在全球各地差异显著:美国采用"一方同意"(One-Party Consent)和"全方同意"(All-Party Consent)两种标准,其中加利福尼亚、伊利诺伊等 12 个州要求所有参与方同意才能合法录制;欧盟 GDPR 框架下,录制通话属于处理个人数据,需要有合法基础(通常是明确同意或合法利益);中国《个人信息保护法》同样要求在收集个人信息前告知并取得同意。特别值得注意的是,当工具捕获系统音频时,对方参会者可能完全不知道对话正在被录制和 AI 处理,这比 Meeting Bot 方案(至少会在参会者列表中可见)带来更大的合规灰色地带。产品能否给出清晰的授权与告知机制,会影响其在企业市场的接受度。
免费模式的可持续性。 无限免费适合冷启动,但 AI 推理成本不菲。以当前市场价格估算,Whisper 级别的 ASR 处理约为每分钟 0.006 美元,而 GPT-4 级别的模型对一场 60 分钟会议的转写文本进行摘要和信息抽取,Token 消耗约为 3-5 万(输入)+ 2000-5000(输出),成本约 0.5-1.5 美元。如果是实时流式处理且支持中途问答,成本可能翻倍。这意味着一个活跃用户每月开 10-20 场会议,仅 AI 推理成本就可能达到 15-40 美元。在"无限免费"承诺下,Sorinai 的早期烧钱速度会与用户活跃度高度相关。常见的后续变现路径包括:高级模板功能收费、团队协作版订阅、CRM/项目管理工具集成的企业版,或者对历史知识库的高级检索功能收费。后续如何在保留免费诱惑的同时找到可持续的收入模型,是团队必须回答的问题。
总结:Sorinai 让AI从会议旁观者变成参与者
Sorinai 代表了 AI 会议笔记工具的一个进化方向:从"事后整理"走向"实时协作"。它用三个巧妙的设计——导入自有模板、系统音频捕获、会议中实时问答——把 AI 从会议的旁观者变成了参与者。对于每天泡在会议里的知识工作者而言,这种"AI 陪你一起做笔记"的体验,或许比一份完美的事后纪要更接近真实需求。当然,产品尚处早期,其在准确性、隐私合规、商业化方面的实际表现,仍有待市场检验。
相关推荐

机器学习研究入门:必读论文清单与研究实习申请路径
为ML初学者整理从零到研究实习的完整路径,包括必读经典论文清单(AlexNet、ResNet、Transformer等)、论文阅读方法、复现技巧及研究实习申请的实用建议。

Claude Code 入门实战教程:安装配置到自动化开发完整指南
详解Claude Code从环境搭建、权限配置、Go目标自主循环、Skills技能系统、MCP协议集成到版本控制的完整开发流程,帮助开发者快速掌握AI编程自动化工具。

Gemini 3.7 Flash发布与GPT-5.6极速模式:AI开源迈向生态时代
谷歌发布Gemini 3.7 Flash专注编程与Agent优化,OpenAI推出GPT-5.6 Ultra-Fast模式实现14倍速度提升。AI开源从开放模型转向开放生态,Agent工具链与成本监控工具密集涌现,智能体工作流进入实用化阶段。