跳到主要内容

客户案例 / CASE STUDY

看清计算任务与服务状态
让科研基础设施更可靠

ABOUT XTALPI

客户背景

晶泰科技(XtalPi)创立于 2015 年,将量子物理、人工智能与机器人自动化结合,为药物和材料研发提供技术平台与服务。其业务连接计算研究与实验室自动化,对计算任务、集群资源和应用服务的稳定运行有持续需求。本案例聚焦支撑科研业务的技术平台与运维协作。

AI 科研 所属行业
2015 创立年份
中国 · 深圳 主要运营基地之一

业务挑战

科研任务不断增长,排查上下文却散落在多套工具中

计算任务、集群组件和应用服务共同支撑研发流程。当任务异常或服务性能波动时,团队需要快速判断是资源问题、任务问题,还是应用链路中的异常。

原有观测工具各自保存日志、链路与指标,数据之间缺少连续上下文,故障调查常常停在工具之间的交接处。

多集群与计算池需要统一的健康视图。只看到资源总量,难以进一步掌握 Job 状态、GPU 利用率及它们与业务服务的关系。

监控发现异常后,还需要分级告警、持续跟进与业务可用性验证,让不同团队围绕同一个问题完成协作。

KEY RESULTS / 核心成效指标

数倍

故障定位与根因分析提速

秒级

业务与计算池指标监测

一体化

多集群与应用数据观测

SOLUTION

观测云 × 晶泰科技 XtalPi解决方案

01

在同一视图掌握集群与计算池

汇聚多集群健康状态、计算池 Job 与 GPU 利用率,将资源状态和业务指标关联展示。团队能够从总体运行情况继续深入到具体任务,为容量判断与异常调查提供数据依据。

3

项重点:集群健康、计算任务、GPU 利用率

02

归拢日志、链路与指标

兼容既有采集与观测数据,逐步将分散工具中的日志、链路和指标纳入统一平台。保留对象、时间和调用关系,减少在多个入口重复检索,使故障定位与根因分析提速数倍。

2

类调查提速:故障定位与根因分析

03

把异常发现与协作处理连接起来

通过分级告警、巡检与异常追踪支持问题处理,并以业务拨测从访问侧检查服务可用性。研发与运维围绕同一观测平台共享证据,使调查能从告警继续推进到处置与复查。

4

步衔接:监测、告警、调查、验证

业务效益

让平台团队把更多精力投入科研支撑

01

缩短从异常到线索的距离

统一检索与数据关联减少跨工具切换,支持更快定位故障和分析根因。

02

资源判断更贴近实际任务

结合 Job 与 GPU 利用率查看计算池运行状态,为资源投入和日常优化提供依据。

03

持续保障应用服务可用性

从集群健康到业务拨测形成多层观测,让告警、调查与验证有共同的数据基础。

让科研创新,运行在可靠的数据依据之上

从计算池与 GPU,到任务和应用链路,一起构建适合科研平台的可观测体系。