客戶背景
深信服 IT-SRE 團隊面對的是一張支撐數千名員工、遍佈全球業務的龐大 IT 全景圖。核心 ERP、CRM、供應鏈系統承載着高強度業務流轉壓力,每一類日誌、指標和鏈路數據都可能關聯財務回款、客戶交付和內部協同。
深信服的 IT 架構是典型的高可用混合架構:底層既有成熟的超融合、託管雲,也有 K8s 容器化微服務集羣,並保留部分運行多年的 IIS 多站點系統。
隨着業務持續擴展,傳統監控體系逐漸難以支撐跨服務、跨層級的問題定位。業務部門反饋系統響應變慢時,SRE 需要在 Metrics、Logs、Traces 等多個獨立工具之間切換,排查鏈路被拉長。
多代架構並存,觀測視角分散
超融合、託管雲、K8s 微服務和 IIS 歷史系統並行,底層基礎設施、中間件和應用數據分散在不同監控入口。

跨服務問題定位鏈路長
一次響應變慢可能涉及業務應用、數據庫、中間件和底層資源,SRE 需要人工拼接指標、日誌和鏈路上下文。

告警噪音高,核心風險容易被淹沒
過去告警策略偏一刀切,冗餘告警較多,SRE 團隊需要從大量低價值信息中篩選真正需要立即處理的事件。

解決方案
統一 IaaS、PaaS 與 SaaS 數據,構建全鏈路視角
觀測雲幫助深信服將 IaaS 基礎設施、PaaS 中間件和上層 SaaS 應用數據進行多維融合,建立標準化數據標籤與等級劃分體系。
SRE 團隊可以在統一平台中查看指標、日誌、鏈路和業務大盤,從系統視角追蹤到具體業務流轉環節。
分層治理告警策略,降低無效噪音
深信服將應用劃分為 S/A/B/C 四個等級,並將監控項與應用層級解耦,讓核心資源聚焦於 S/A 級關鍵業務。
S 級應用中的邊緣日誌不再觸發高優告警,A 級應用中的致命錯誤則會立即升級,從而讓 Critical 事件更突出。
業務大屏把 IT 指標翻譯成業務語言
圍繞季度末財務與銷售衝刺場景,深信服構建了錢財物監控大屏,將報價、合同、下單、發貨、回款等業務鏈路實時可視化。
當合同流轉出現阻塞或財務報表生成延遲時,系統可以及時預警,讓 IT 運維從資源保障走向業務護航。
客戶收益
告警噪音下降 70%:
通過業務分級和策略解耦,冗餘告警顯著減少,SRE 團隊可以把注意力聚焦在真正需要立即處理的 Critical 事件上。

平均故障定位時間下降 50%:
指標、日誌和鏈路數據在同一平台中關聯分析,跨服務問題不再依賴人工拼接上下文,定位效率明顯提升。

平均故障恢復時長下降 65%:
統一觀測現場幫助團隊更快確認影響範圍、定位根因並推進恢復,減少業務系統異常持續時間。

跨服務性能排查縮短至分鐘級:
通過全鏈路追蹤和業務大屏,SRE 可以從業務流健康度下鑽到具體應用、服務和底層資源,提升複雜問題處理速度。
