
技术博客
万卡级算力集群 GPU 监控:基于观测云全链路观测实践
本文介绍如何通过观测云监控万卡级算力集群 GPU,与应用性能 Trace、业务日志、基础设施指标在统一平台中实现全栈关联与跨层下钻,真正构建起从硬件到业务的完整观测链路。
持续分享真实生产环境中的工程经验、产品判断与行业观察。

本文介绍如何通过观测云监控万卡级算力集群 GPU,与应用性能 Trace、业务日志、基础设施指标在统一平台中实现全栈关联与跨层下钻,真正构建起从硬件到业务的完整观测链路。

本期更新主要为观测云更新。

本期更新主要为观测云更新和 DataKit 更新。

本文基于一次可运行的 ASP.NET Framework 4.8 Web API 示例,整理从本地 IIS 验证到 Azure App Service Windows 部署,再到手动初始化 OpenTelemetry SDK 并通过 OTLP 上报到观测云 DataKit 的完整实践。

本期更新主要为观测云更新和部署版更新。

本文通过三个场景实践,介绍观测云 AI Agent Teams 如何将可观测性数据、智能分析与自动化运维能力深度结合,帮助用户更快发现问题、定位问题并解决问题。


从告警触发到证据收集、根因判断、动作审批与结果验证,展示观测 AI 智能体如何完成一次可管控的故障闭环。

在「观测云控制台」-「Agent 监测」,点击右上角「接入 Agent」,选择「Qoder」即可快速接入。

把观测 AI 智能体接入企业工作群,让告警、诊断证据与处置协同进入已有沟通流程,减少跨系统切换与信息丢失。

在「观测云控制台」-「Agent 监测」,点击右上角「接入 Agent」,选择「Claude Code」即可快速接入。

本期更新主要为观测云更新、部署版更新和 DataKit 更新。