본문으로 이동

CUSTOMER STORY

컴퓨팅 작업과 서비스를 파악하고,
연구 인프라의 신뢰성을 높입니다

ABOUT XTALPI

XtalPi 소개

2015년에 설립된 XtalPi는 양자 물리학, AI, 로봇 자동화를 결합해 신약·소재 연구를 지원합니다. 계산 연구와 실험실 자동화를 연결하는 사업에는 컴퓨팅 작업, 클러스터, 애플리케이션의 안정적인 운영이 필요합니다. 이 사례는 이를 뒷받침하는 기술 플랫폼과 운영 협업을 다룹니다.

AI 연구 산업
2015 설립 연도
중국 선전 주요 운영 거점 중 하나

비즈니스 과제

늘어나는 작업, 흩어져 있는 조사 정보

컴퓨팅 작업, 클러스터 구성 요소, 앱 서비스가 연구 흐름을 지원합니다. 장애가 발생하면 자원 문제인지, 작업 실패인지, 애플리케이션 오류인지 구분해야 합니다.

로그, 트레이스, 지표가 별도 도구에 있어 시스템을 넘나들 때 조사 정보가 이어지지 않았습니다.

여러 클러스터와 컴퓨팅 풀의 상태를 통합하고 Job 상태와 GPU 사용률까지 파악해야 했습니다.

심각도별 알림, 지속적인 추적, 가용성 검증으로 팀의 대응을 연결할 필요가 있었습니다.

주요 도입 효과

수 배

장애 위치 파악·원인 분석 가속

초 단위

비즈니스·컴퓨팅 풀 지표 모니터링

통합

멀티 클러스터·앱 옵저버빌리티

SOLUTION

XtalPi × Guance — 솔루션

01

클러스터와 컴퓨팅 풀을 한눈에

클러스터 상태, Job, GPU 사용률을 비즈니스 지표와 연결합니다. 전체 운영 현황에서 개별 작업까지 내려가며 같은 데이터로 용량과 장애를 분석합니다.

3

클러스터 상태·연산 작업·GPU 사용률 중점 항목

02

로그·트레이스·지표 통합

기존 수집 방식을 활용해 데이터를 단계적으로 통합합니다. 대상, 시간, 호출 관계를 유지해 반복 검색을 줄이고 장애 위치 파악과 원인 분석을 수 배 빠르게 했습니다.

2

장애 위치 파악·근본 원인 분석 개선 영역

03

탐지·대응·검증 연결

심각도별 알림, 점검, 이상 추적을 활용하고 합성 모니터링으로 접근 측 가용성을 확인합니다. 개발과 운영이 알림부터 복구 검증까지 같은 근거를 공유합니다.

4

모니터링·알림·조사·검증 연결 단계

도입 효과

플랫폼팀이 연구 지원에 집중하도록

01

이상에서 단서까지 빠르게

검색과 연관 분석을 통합해 도구 전환을 줄입니다.

02

실제 작업에 기반한 자원 판단

Job과 GPU 사용률을 함께 확인해 일상적인 최적화를 지원합니다.

03

서비스 가용성을 지속적으로 확인

클러스터와 합성 모니터링을 알림·검증에 함께 활용합니다.

신뢰할 수 있는 인프라 위에서 연구를 발전시키세요

컴퓨팅 풀, GPU, 작업, 앱 트레이스를 연결해 연구 플랫폼에 맞는 관측 체계를 구성합니다.