#可观测性
共 18 篇相关文章

智能体变慢或出错时,用Traces在Foundry中精准排查
智能体响应慢或输出错误时该从哪排查?本文详解 Microsoft Foundry 的 Traces 追踪功能,涵盖连接 Application Insights、读懂 span 层级、查看元数据与多种视图,帮助开发者高效定位 AI 智能体问题。

KloudMate 2.0:AI 驱动的全栈可观测性与智能 SRE 运维
KloudMate 2.0 从 AWS 监控工具升级为 AI 驱动的全栈可观测性与 Agentic SRE 运维平台,统一指标、日志、链路追踪,并通过 Assistant、Builder、Investigator、Docs 四大 AI 模块实现智能根因分析与运维自动化。

LangChain回调的盲区:Agent链外API调用如何审计
LangChain 的 callback 能追踪流经链的工具调用,却捕获不到工具内部直连 SDK、复用凭证或共享账号发起的链外 API 调用。本文剖析 Agent 可观测性与可审计性的归因缺口,以及对账下游日志的应对思路。

Agent Gateway 接入 Cloud Trace:AI智能体请求的端到端追踪
Google Cloud 的 Agent Gateway 现已集成 Cloud Trace(预览阶段),可将一次 AI 智能体请求的智能体、网关、工具与 MCP 服务器全部调用收拢到同一条端到端追踪链路,基于 OpenTelemetry 标准实现,帮助开发者精准定位性能瓶颈。

LLM推理成本追踪难题:为什么账单看不清钱花在哪
LLM推理成本追踪为何如此困难?服务商账单只显示花费,却说不清重试、模型回退和agent多步骤流程等行为如何推高成本。本文剖析workload级成本归因的核心难点与MLOps团队的应对思路。

AI Agent调试盲区:为什么Bug根因常常不在Trace里?
AI Agent调试中最棘手的问题之一:Bug的真正根因常常不在trace里。本文剖析「证据被埋藏」与「证据从未被记录」的关键区别,探讨Agent可观测性盲区及应对思路。

绿灯却空转两个月:AI Agent流水线的"成功"陷阱
一条 AI Agent 流水线连续两个月报告成功却零产出,只因"成功"标志衡量的是运行是否完成而非是否有产出。本文剖析这个真实运维案例及其中隐藏的日志误导、退避策略误判等问题,探讨自动化系统该如何正确定义成功。

生产环境中如何验证AI Agent的行为?运行时校验实战指南
AI Agent在生产环境代表用户执行操作时如何验证其行为?本文从非确定性输出、不可逆副作用等挑战出发,梳理策略护栏、人在回路、运行时追踪、LLM评判等验证方法,帮助团队构建分层防御体系。

Axiom:为海量机器数据而生的现代化事件存储平台
Axiom 是一款现代化机器数据平台,提供 PB 级规模、无模式摄取的全托管事件存储,帮助团队保留全量日志与事件数据而无需自建运维。本文解析其核心卖点与适用场景。

wrapture:Python猴子补丁新利器,测试与可观测性一网打尽
wrapture 是 Graham Dumpleton 推出的 Python 猴子补丁新库,将单元测试与可观测性追踪统一到一套工具中,支持零代码 TOML 配置、OpenTelemetry 导出及数十个主流库的开箱插桩,值得开发者提前关注。
深度解读OpenTelemetry完全指南:可观测性三大支柱与DevOps实战
深入讲解OpenTelemetry核心架构、可观测性三大支柱(日志、指标、链路追踪),通过食品配送App崩溃排查实战案例,展示分布式追踪如何定位微服务瓶颈,以及AI如何革新DevOps监控。
行业洞察LangChain Agent开发全生命周期工具链深度解析
LangChain在Interrupt大会上发布Agent开发全生命周期工具链,涵盖Deep Agents 0.6框架、SmithDB可观测性数据库、Context Hub记忆标准、LLM Gateway治理工具及LangSmith Engine智能助手,系统解决AI Agent从原型到生产的核心痛点。
产品体验Tracea:AI Agent可观测性开源平台,自托管部署一键搞定
Tracea是一款开源的AI Agent可观测性平台,提供全链路追踪、成本监控、自动根因分析和团队记忆系统。支持自托管Docker部署,数据不出网,被称为AI Agent的Datadog。
教程攻略Go 1.25飞行记录器Flight Recorder:生产环境诊断利器
Go 1.25引入飞行记录器(Flight Recorder),借鉴黑匣子理念,以低开销持续记录运行时事件。本文详解其技术原理、环形缓冲区设计及在生产环境问题诊断、性能异常追踪、死锁分析中的实际应用场景。
教程攻略OpenAI Agents SDK追踪功能使用指南:零配置实现Agent可观测性
详解OpenAI Agents SDK内置追踪系统的配置与使用方法,包括零配置自动追踪、自定义trace上下文、工具调用追踪等,帮助开发者快速实现AI Agent的全链路可观测性与性能优化。
产品体验Entire CLI:用Git自动记录AI编程过程的开源工具
Entire CLI是一款开源命令行工具,通过Git hooks自动捕获Cursor、Copilot、Claude Code等AI编程助手的对话会话,并与Git提交关联索引,解决AI编程过程不可追溯的问题。本文详解其工作原理、应用场景与技术特点。
产品体验Opik:开源LLM可观测性平台,调试评估监控一站搞定
深度解析Opik开源项目:专为LLM应用打造的全生命周期管理平台,提供链路追踪、自动化评估、幻觉检测和生产监控能力,支持RAG系统和Agent工作流,GitHub星标超19K。
教程攻略Claude Code Hooks:AI编程助手多智能体监控与可观测性实战指南
详解Claude Code Hooks开源项目的Hook事件追踪机制与技术架构,涵盖多智能体实时监控、行为审计、故障排查等核心场景,助你构建AI编程助手的完整可观测性方案。