문의하기

커뮤니티 참여

WeChat으로 스캔
공식 커뮤니티 그룹 참여

Guance 체험

온라인에서 사용량 기반 요금으로 바로 시작하세요.

시작하기

Guance 에디션 선택

코드 저장소

LLM Observability

LLM 관측성 및 대형 모델 모니터링 솔루션

LLM을 활용해 토큰 비용, 응답 지연, 오류, 도구 호출, 온체인 통신을 관찰하고 모니터링하여 LLM 애플리케이션과 대형 모델 호출을 지원하여 AI 애플리케이션을 안정적으로 실행하는 데 도움을 줍니다.

솔루션 개요

LLM의 관측 가능성은 단순히 모델 인터페이스가 성공적인지 여부뿐만 아니라, 프롬프트, 모델 호출, 툴체인, 벡터 검색, 네트워크, 비즈니스 로직 간의 관계를 설명하는 데 있습니다. LLM 관측성 및 대형 모델 모니터링 솔루션Guance OpenTelemetry와 같은 개방형 기능을 기반으로 통화, 토큰, 지연, 오류, 추적, 로그를 수집하여, 팀이 사용자 요청부터 모델 응답까지 전체 과정을 한 세션에서 명확히 볼 수 있도록 돕습니다.

장면 챌린지

모델 콜 프로세스 블랙박스:단일 응답이 검색, 도구 호출, 모델 추론, 비즈니스 서비스를 거칠 수 있어 전통적인 APM이 LLM 요청 내부에서 일어나는 일을 설명하기 어렵습니다.

토큰 비용과 지연 시간은 통제하기 어렵습니다:모델, 프롬프트, 컨텍스트 길이, 호출 횟수 모두 비용과 응답 시간에 영향을 미치며, 세밀한 데이터가 없으면 최적화가 어렵습니다.

오류와 품질 문제는 재현하기 어렵습니다:타임아웃, 속도 제한, 널 응답, 예외 출력, 사용자 피드백 등을 요청 컨텍스트, 프롬프트, 모델 버전과 함께 분석해야 합니다.

AI 애플리케이션과 비즈니스 시스템 간의 단절:LLM 호출은 비즈니스 체인의 한 구간일 뿐이며 사용자 요청, 서비스, 로그, 데이터베이스 및 기타 상류 및 하류 프로세스와 함께 검토되어야 합니다.

Guance 계획

LLM은 시각화를 요구합니다:모델, 요청, 프롬프트, 토큰, 시간, 상태, 오류를 기록하여 팀이 통화량, 성과, 비용 추세를 이해하는 데 도움을 줍니다.

트레이스 링크 및 플레임 다이어그램 분석:모델 호출, 벡터 검색, 툴 호출, 비즈니스 서비스 모두 동일한 트레이스 아래에 묶여 느린 요청과 실패 단계를 식별합니다.

비용 및 이상 현상 경고:토큰 사용량, 통화량, 오류율, 지연 시간, 모델 차원을 모니터링하여 비정상적인 비용과 경험 문제를 증가시키지 않도록 하세요.

오픈 스탠다드 액세스:OpenTelemetry 생태계를 기반으로 한 LLM 애플리케이션 데이터를 통합하면 기존 관측 시스템과의 통합 비용을 줄일 수 있습니다.

해법의 주요 내용

더 많은 콘텐츠

자주 묻는 질문

LLM 관측성과 대규모 모델 모니터링에 대해 어떤 지표에 집중해야 할까요?

모델 통화량, 토큰 소비, 응답 시간, 오류율, 타임아웃, 모델 버전, 프롬프트 컨텍스트, 추적 체인, 비즈니스 영향에 주의를 기울이세요.

대형 모델에서 느린 호출, 실패, 비용 이상 현상을 어떻게 찾아낼 수 있을까요?

통화 추세에서 단일 시간 추적, 모델, 프롬프트, 토큰, 도구 호출, 검색, 서비스 시간 등을 통해 병목 현상을 식별할 수 있습니다.

Guance LLM 애플리케이션 링크에 어떻게 연결하나요?

OpenTelemetry 관련 기능은 LLM 애플리케이션에서 호출, 링크, 로그, 메트릭을 수집하여 기존 서비스 모니터링과 통합적으로 분석할 수 있습니다.

LLM 관측성과 대형 모델 모니터링 솔루션의 구현 경로를 Guance 맞춰 보세요

LLM 관측 시연 일정