[控场AI]
· 4 分钟阅读· 2,411 字

Perplexity推出Fast Search:基于Rust的Photon引擎230ms极速检索

Perplexity推出Fast Search:基于Rust的Photon引擎230ms极速检索

Perplexity推出Fast Search API,Rust引擎Photon将搜索延迟压至230ms,并由AI Agent协同构建。

Perplexity为其Search API引入Fast Search功能,可在230毫秒内返回95%的搜索结果,核心动力来自用Rust自研的检索排序服务Photon。Rust的无GC机制和精细内存控制使得高并发低延迟成为可能,直接满足了RAG应用和多步AI Agent工作流对实时检索的需求。此次发布还附带一个行业信号:Photon由少数人类工程师与「数百个AI Agent」协作构建,暗示AI辅助编程已能胜任高性能基础设施这类对正确性要求极高的复杂工程任务。对开发者而言,这类毫秒级检索API有望成为构建AI应用的标配外部知识入口。

Perplexity宣布在其Search API中引入全新的Fast Search能力,主打一个「快」字。根据官方披露的数据,Fast Search能够在230毫秒或更短时间内返回95%的搜索结果——这一延迟水平已经接近人类感知的即时反馈边界,对于需要频繁调用搜索的AI应用来说意义重大。

对开发者而言,搜索延迟往往是构建实时问答、检索增强生成(RAG)以及Agent工作流时的关键瓶颈。当一个AI Agent需要在推理链条中多次调用外部检索时,每一次请求的响应时间都会被累加放大。Fast Search把这一环节压缩到毫秒级,直接决定了上层应用的整体体验流畅度。

底层引擎Photon:用Rust重写的检索与排序服务

Fast Search的性能来自Perplexity自研的新一代检索与排序服务Photon。Photon采用Rust语言构建,这一技术选型本身就透露出团队对性能和内存安全的双重追求。

Rust以其接近C/C++的运行效率和无垃圾回收(GC)机制而著称,特别适合对延迟高度敏感的基础设施场景。在检索与排序这样高并发、低延迟的服务中,避免GC停顿、精细控制内存布局往往是把响应时间稳定压在数百毫秒内的关键。Perplexity选择用Rust重写核心检索链路,正是为了在极致速度和系统稳定性之间取得平衡。

从「搜索公司」到「搜索基础设施提供商」

值得关注的是,Perplexity不再只是把搜索作为面向终端用户的产品,而是通过Search API把底层检索能力开放给外部开发者。Photon的出现意味着他们正在把内部积累的检索工程能力,转化为可被广泛调用的基础设施。这与整个行业「AI Agent需要高质量、低延迟的外部知识入口」的趋势高度契合。

检索与排序服务在搜索引擎中承担着两个核心阶段的工作:召回(从海量文档中快速筛选出候选集)和排序(对候选集按相关性重新评分排列)。传统实现中,这两个阶段往往分别依赖倒排索引和机器学习模型,对内存带宽和计算吞吐量要求极高。Rust在这一场景的优势不仅是原始速度,更在于其所有权模型(Ownership Model)允许开发者在编译期消除数据竞争,使得高并发下的内存访问模式更加可预测——这直接影响到尾延迟(tail latency)的控制,而尾延迟恰恰是决定「95%请求在230ms内返回」这类SLA能否兑现的核心指标。

「数百个Agent」参与工程构建的信号

官方描述中有一个耐人寻味的细节:Photon是由「一支小型工程师团队与数百个Agent(hundreds of agents)」共同构建的。

这句话本身就是一个强烈的行业信号。它暗示Perplexity在开发这套核心基础设施的过程中,大规模使用了AI编程Agent来协助编码、测试或优化。少数人类工程师负责架构决策与方向把控,而海量的AI Agent承担具体的实现与迭代工作——这种「人机协作、以Agent为规模化生产力」的开发模式,正在从概念走向真实的生产实践。

如果这一描述属实,它某种程度上验证了「AI辅助软件工程」能够胜任高性能基础设施这类复杂、对正确性要求极高的项目,而不仅限于原型或简单脚本。这对整个软件开发范式都具有参考价值。

「AI编程Agent」在此语境下通常指能够自主读写代码、执行测试、根据反馈迭代修改的自动化系统,代表性工具包括Cursor、GitHub Copilot Workspace、Devin等。与传统代码补全不同,Agent模式强调多步自主执行:Agent可以理解任务目标、拆解子任务、调用工具(如编译器、测试框架、代码搜索),并在失败时自我纠错。在高性能基础设施项目中大规模使用此类Agent,意味着这些工具已经能够处理非平凡的工程任务,如编写Rust的异步并发代码或调优内存分配策略,而不仅限于生成样板代码。这一叙述若能得到更多细节印证,将是AI辅助工程成熟度的重要标志。

对开发者意味着什么

综合来看,Fast Search与Photon的组合为构建AI应用提供了几个直接价值:

  • 实时性提升:230ms级别的延迟让搜索可以嵌入到对话流、Agent推理链中而几乎无感。
  • 可规模化调用:作为API服务,开发者无需自建检索基础设施即可获得工业级检索能力。
  • RAG与Agent友好:低延迟检索是高质量RAG和多步Agent工作流的前置条件。

需要说明的是,目前官方公开的信息仍以性能指标和技术栈为主,关于Photon的具体架构、索引规模、定价以及与竞品的横向对比数据尚未详细展开。开发者在实际接入前,仍需结合自身场景对结果质量、成本与稳定性进行验证。

检索增强生成(RAG)是目前主流的大语言模型落地范式之一:在生成回答之前,先从外部知识库检索相关片段作为上下文注入提示词,从而弥补模型知识截止日期的局限并降低幻觉风险。RAG对检索延迟极为敏感——若检索耗时超过500ms,在多轮对话或多步Agent推理中会产生明显的等待感,且每增加一次检索调用,延迟即线性叠加。Fast Search所提供的230ms级别响应,使得在单次用户请求中串行执行3-5次检索仍可将总延迟控制在1秒以内,这对复杂Agent工作流的用户体验有实质性改善。

小结

Perplexity的Fast Search把搜索API的响应速度推进到毫秒级,其背后的Rust引擎Photon体现了对性能基础设施的严肃投入。而「小团队+数百Agent」的开发叙事,则为AI参与复杂系统构建提供了一个值得持续观察的案例。对于正在搭建AI Agent与RAG应用的团队来说,这类高速检索API很可能成为新的标配组件。

分享:

相关推荐