應用效能監控(APM)

從慢請求與錯誤,追查至服務、依賴關係與程式碼

觀測雲 APM 連接分散式追蹤、服務拓撲、端點延遲、錯誤、持續剖析(Continuous Profiling)、日誌、基礎設施,以及部署與變更事件。團隊可從受影響的請求出發,沿服務與依賴關係逐步檢視證據,並在同一調查流程中驗證修復結果。

從慢請求與錯誤,追查至服務、依賴關係與程式碼

接入觀測雲後,我們打通了端到端交易鏈路:從網絡與伺服器資源、應用服務,到前端頁面與 POS 終端,實現全鏈路效能即時監控。告警發生時,我們能立即看見哪個環節出現效能瓶頸、使用者體驗下降或日誌異常,協助團隊從多個維度定位問題並落實效能優化。

———— 吳鴻欽 · 美宜佳 數據 IT 體系技術總監

APM 解決什麼問題

在完整上下文中調查慢請求與錯誤

開發、SRE 與平台團隊可共用同一個服務健康與單次請求視圖。從延遲或錯誤變化開始,開啟具代表性的 Trace,再直接進入相關日誌、資源狀態、資料庫工作、剖析或部署資訊。

真實調查路徑

從慢請求定位責任服務、依賴關係或程式碼路徑

APM 先找出影響使用者的請求,再以 Trace、日誌、資源與剖析證據收斂原因,形成可修改、可驗證的原因候選。

開啟具代表性的慢 Trace 或失敗 Trace

查看證據回應時間、錯誤狀態、服務路徑與 Span 持續時間

得到結論找出最慢 Span 與首個異常依賴服務

數據接入路徑

語言 Agent / OpenTelemetry → 服務、端點與 Trace → 日誌、基礎設施與剖析上下文

適用場景

適合運營微服務、分散式系統與關鍵請求路徑的開發、SRE 與平台團隊。

使用邊界

需要應用埋點或 OpenTelemetry。真實前端體驗請使用 RUM,深入資源分析請使用基礎設施監控。

錯誤率上升?找出受影響的服務、端點與依賴關係
在服務與端點視圖中對比請求量、延遲分佈、錯誤與下游依賴關係。按環境、版本、地區或標籤切分,區分整體回歸與單一工作負載問題。
查看説明文件
錯誤率上升?找出受影響的服務、端點與依賴關係
把重複延遲與錯誤轉化為 SLO 與可行動監控
把重複延遲與錯誤轉化為 SLO 與可行動監控
根據吞吐量、延遲、錯誤與可用性設置監控器與服務目標,在事件中附上受影響的服務、環境、Trace 與佐證。
查看説明文件
沿用現有 Agent 與 OpenTelemetry,無需重建埋點
透過 DataKit 整合、常用語言 Agent 與 OpenTelemetry 引入 Trace,保留服務、環境、版本與資源屬性,讓新遙測數據進入同一調查模型。
查看説明文件
沿用現有 Agent 與 OpenTelemetry,無需重建埋點

常見問題

什麼是應用效能監控(APM)?

應用效能監控持續量測服務請求、延遲、吞吐量、錯誤、依賴關係與程式碼執行。觀測雲把這些訊號與日誌、基礎設施、RUM 及部署資訊連接,讓團隊不必在多個工具重建上下文。

觀測雲 APM 如何調查慢請求?

從慢端點或服務開始,開啟具代表性的 Trace,對比 Span 持續時間與狀態,再查看相關日誌、基礎設施、資料庫工作或剖析數據,根據證據逐步收斂至責任服務、依賴關係、資源或程式碼熱點。

APM 數據可以與日誌和基礎設施關聯嗎?

可以。共用的 Trace、服務、環境、主機、容器與 Kubernetes 屬性可把應用請求連接至周邊日誌與資源狀態。

觀測雲支援 OpenTelemetry 與常用語言 Agent 嗎?

支援。觀測雲可接收 OpenTelemetry 數據,並透過 DataKit 與相容採集器支援常用語言和框架。實際配置取決於執行時與採集架構。

APM 與基礎設施監控有什麼不同?

基礎設施監控解釋主機、容器、叢集與雲資源的健康和容量;APM 解釋應用請求如何橫跨服務與程式碼。合併使用可判斷使用者問題來自應用邏輯、依賴關係或資源壓力。

繼續瞭解應用效能

連接資料庫、日誌、OpenTelemetry、平台與價格資源。

立即開始 > 查看説明文件 > 查看價格 >