用 Langfuse 与 OTEL 在 Backstage 中实现 AI Agent 可观测性

开源 Backstage 插件将 OpenTelemetry 与 Langfuse 结合,为 AI Agent 集群提供生产级可观测性。
backstage-plugin-ai-agents 是一个面向 Spotify Backstage 的开源插件,旨在解决 AI Agent 规模化部署后可观测性缺失的问题。插件以 OpenTelemetry 作为遥测数据采集标准,实现与观测后端的解耦,首个支持的后端是专注 LLM 应用的开源平台 Langfuse,能够追踪 Agent 内部每一次模型调用的 prompt、token 消耗和延迟。将 Agent 观测能力集成进 Backstage 而非构建独立系统,可以复用已有的权限体系和服务目录、降低工程师的上下文切换成本,并天然适配自托管场景。项目目前处于早期阶段,后端仅 Langfuse 一个选项,适合已采用 Backstage 并开始规模化落地 Agent 的团队优先试验。
为什么 AI Agent 需要可观测性
随着 AI Agent 从实验走向生产环境,运维团队面临一个新的难题:如何管理和监控成规模的 Agent 集群?传统的日志和指标工具并不能很好地描述 Agent 的决策链路、工具调用和推理过程。一个开源的 Backstage 插件尝试回答这个问题,它把 AI Agent 的观测能力直接集成进开发者平台内部。
这个项目(backstage-plugin-ai-agents)是一个面向 Spotify Backstage 的插件,目标是让团队能够在自托管的 Backstage 中集中管理与观察一整支 Agent「舰队」(fleet of agents)。对于已经采用 Backstage 作为内部开发者门户的组织来说,这意味着无需引入独立的监控系统,就能在熟悉的界面里看到 Agent 的运行状况。
技术架构:OpenTelemetry + Langfuse
该插件的核心设计是依赖 OpenTelemetry(OTEL)信号 作为数据采集标准。OpenTelemetry 是云原生领域事实上的可观测性规范,统一了 traces、metrics 和 logs 三类遥测数据。通过让 Agent 以 OTEL 格式输出信号,插件获得了与后端解耦的能力——理论上可以对接任意支持 OTEL 的观测后端。
首个支持的后端:Langfuse
根据项目说明,插件目前首个可用的后端是 Langfuse。Langfuse 是一个专注于 LLM 应用的开源可观测性平台,擅长记录和分析大模型调用的 trace、prompt、token 消耗以及延迟等指标。把 Langfuse 作为后端意味着开发者可以追踪 Agent 内部的每一次模型调用链路,而不仅仅是黑盒式的成功/失败状态。
这种「OTEL 采集 + Langfuse 展示」的组合,在当前 LLM 工程化实践中是一个较为主流的选型思路:用开放标准收集数据,再用专门为 LLM 优化的工具做分析。
OpenTelemetry 由 CNCF(云原生计算基金会)主导,是 OpenCensus 和 OpenTracing 两个项目合并后的产物。它的核心价值在于"一次埋点,多处消费":开发者只需在应用代码中接入 OTEL SDK,生成的遥测数据就可以通过 Collector 转发给 Jaeger、Prometheus、Datadog 或任何兼容 OTLP 协议的后端,而无需修改业务代码。对于 AI Agent 场景,OTEL 的 Trace 概念尤为关键——一条 Trace 可以跨越"接收用户请求→调用 LLM→执行工具→返回结果"的完整决策链路,每个环节作为独立的 Span 被记录,从而让原本不透明的 Agent 推理过程变得可审计、可调试。
Langfuse 的核心数据模型围绕"Trace → Span → Generation"三层展开:Trace 对应一次完整的 Agent 运行,Span 记录中间步骤(如工具调用、检索),Generation 则专门捕获每次大模型推理的输入 prompt、输出内容、token 用量和耗时。这种粒度使得工程师可以回答"哪一步让 Agent 超时""哪个 prompt 模板导致输出质量下降"等生产问题。Langfuse 提供 self-hosted 版本(基于 Docker Compose 或 Kubernetes),与该插件强调自托管的定位高度契合,数据不需要离开私有环境。
集成进 Backstage 的意义
Backstage 是 Spotify 开源的内部开发者平台框架,被大量企业用于构建统一的服务目录、文档和工具门户。把 Agent 观测能力做成 Backstage 插件,而非独立应用,有几层现实价值:
- 降低上下文切换成本:工程师在同一个门户里就能看到服务、文档和 Agent 运行状态。
- 复用现有权限与目录体系:Agent 可以像微服务一样被纳入 Backstage 的实体模型进行管理。
- 适配自托管场景:项目强调 self-hosted 部署,对数据敏感或有合规要求的团队更友好。
对于正在把 Agent 投入生产的团队,这类插件补上了「可观测性」这块常被忽视的拼图。
Backstage 的插件体系基于 React 前端和 Node.js 后端的"前后端插件对"架构。前端插件负责在 Backstage UI 中渲染自定义页面或卡片,后端插件则可以通过 Backstage 的路由和认证层对外暴露 API,或在服务端聚合来自第三方系统的数据。Backstage 还维护一个软件目录(Software Catalog),以 YAML 格式的实体描述文件管理组织内的服务、API、团队等资源。将 AI Agent 纳入这一目录,意味着每个 Agent 可以拥有明确的归属团队、依赖关系和生命周期状态,与现有的微服务治理流程保持一致,而非游离在运维体系之外。
适用场景与局限
这个插件适合已经在使用 Backstage、并且开始规模化部署 AI Agent 的工程团队。如果你的组织还没有采用 Backstage,单独为此引入一套开发者平台的成本会偏高。
从目前公开的信息看,项目仍处于早期阶段——OTEL 作为采集层已就位,但后端目前仅 Langfuse 一个可用选项。随着 OTEL 的开放特性,未来扩展到其他观测后端是可预期的方向。想要尝鲜的团队可以先在测试环境中验证 Agent 的 trace 能否正常上报并在 Langfuse 中呈现完整链路。
小结
这个开源项目展示了 AI Agent 工程化的一个务实方向:不重新造轮子,而是把成熟的可观测性标准(OpenTelemetry)、LLM 专用工具(Langfuse)和企业级开发者平台(Backstage)拼接起来。对于关注 Agent 生产落地的团队,它提供了一个值得参考的集成范式。
相关推荐

用Python从零构建动量算法交易系统:Massive、SnapTrade与Alpaca实战
跟随这门 Python 实战课程,从零构建动量算法交易系统:用 Massive 拉取行情、SnapTrade 连接券商、Alpaca 纸面账户执行交易,基于 12 减 1 动量策略自动生成信号,全程无需真实资金。

从1块3090到20台DGX Spark:本地大模型玩家的硬件进化史
一位Reddit用户记录了从单块RTX 3090到20台NVIDIA DGX Spark的本地大模型部署进化史,涵盖MoE内存卸载、多卡功耗瓶颈、保险丝跳闸,以及如何在家用集群上跑通Kimi K3等万亿参数开源模型。

Ollama v0.40.0-rc1 发布:MLX 分词器对齐发布者语义
Ollama 发布 v0.40.0-rc1 预览版,核心更新为 MLX 后端分词器对齐发布者语义,涵盖预分词顺序、Unicode 边界、BPE 合并及跨语言测试保障,提升 Apple Silicon 本地推理一致性。