splunk background

가시성

전체 에이전트 트레이스 확인

추론부터 기반 GPU까지 에이전트를 트레이스하여 문제가 발생할 때 근본 원인을 신속하게 파악하세요.

무료 에디션 신용카드 등록 없이, 14일간 무료로 체험해 보세요.
가이드식 둘러보기 단 5분! 어떻게 작동하는지 확인해 보세요.
가시성

애플리케이션 계층 아래에서 원인을 찾으세요

에이전트 트레이스와 하드웨어 이벤트를 하나의 타임라인에서 함께 확인하며, 잘못된 답변이나 중단된 실행의 원인을 해당 결과를 생성한 칩까지 추적해 보세요.

코드 아래에서 시작되는 장애 포착

근본 원인은 주로 오케스트레이션 계층 뒤에 숨어 있습니다: 모델이 환각을 일으켰거나, 에이전트가 사용해서는 안 되는 도구를 사용했거나, 인프라로 인해 비용이 인지하지 못한 상태로 과도하게 발생했거나, 하드웨어에 과부하가 발생한 경우 등입니다.

요청부터 응답까지 멀티 에이전트 워크플로우 트레이싱 및 매핑

하나의 요청을 처음부터 끝까지 추적해 보세요. 에이전트가 작업을 어떻게 인계하는지, 어느 단계에서 속도가 느려지는지, 그리고 어디에서 문제가 발생하는지 확인할 수 있습니다. 트레이스를 통해 에이전트의 추론 과정을 확인할 수 있으므로, 단순히 실패했다는 사실뿐 아니라 에이전트가 무엇을 했고 왜 그렇게 했는지도 파악할 수 있습니다.

하나의 타임라인에서 에이전트 및 인프라의 상관관계를 분석

상관 분석된 텔레메트리를 통해 성능 문제의 초기 신호를 시각화할 수 있습니다. 토큰 급증, GPU 포화, 지연 시간 급증, ECC 오류 증가 및 Xid 79 이벤트가 동시에 나타나면 팀은 위험을 더 일찍 파악하고, 문제를 더 빠르게 해결하며, 실행이 중단되기 전에 조치를 취할 수 있습니다.

.conf26 프로모션 이미지

Splunk 직접 체험하기

9월 14일부터 17일까지 미국 콜로라도주 덴버에서 열리는 몰입형 학습 및 네트워킹 이벤트에 참여하세요.

.conf26 등록하기

기능

추론부터 GPU까지 전체 스택 확인

문서 살펴보기
추론부터 GPU까지 하나의 에이전트 트레이스 추론부터 GPU까지 하나의 에이전트 트레이스

추론부터 GPU까지 하나의 에이전트 트레이스

요청부터 응답까지 워크플로우의 도구 호출, 모델 및 검색 단계를 확인한 다음, 해당 동작을 이를 실행한 인프라와 연결하세요. 근본 원인을 서로 단절된 네 개의 도구가 아니라 하나의 타임라인에서 확인할 수 있습니다.

지출 지출

기반 인프라 확인

모델, 벡터 데이터베이스 및 나머지 AI 스택 전반에서 GPU와 메모리 사용량, 전력 및 첫 번째 토큰 생성까지 걸리는 시간을 추적하세요. 토큰 급증과 GPU 포화가 동시에 발생하면 응답이 느려지는 원인을 명확하게 파악할 수 있습니다.

실패한 실행을 단계별로 확인 실패한 실행을 단계별로 확인

실패한 실행을 단계별로 확인

에이전트 트레이스와 GPU 텔레메트리를 나란히 확인하면서 하나의 타임라인을 따라 ECC 급증에서 열 또는 전력 이상, Xid 79, 실행 중단에 이르는 과정을 추적하세요. '왜 실패했는가?'에 대한 답을 하나의 화면에서 확인할 수 있습니다.

트래픽 트래픽

실행이 실패하기 전에 연쇄 장애를 확인하세요

치명적인 장애가 아무런 경고 없이 발생하는 경우는 드뭅니다. 초기 신호를 확인할 수 있으므로, 상관 분석된 텔레메트리를 통해 장애를 사전에 감지하고 실행이 47시간째에 중단되기 전에 복구할 시간을 확보할 수 있습니다.

정상 상태인 항목과 위험 상태인 항목을 파악하세요 정상 상태인 항목과 위험 상태인 항목을 파악하세요

정상 상태인 항목과 위험 상태인 항목을 파악하세요

AI 스택 전반의 가용성과 상태를 모니터링하여 성능 저하를 조기에 파악하세요. ECC 오류 수가 증가하거나 캐시가 포화되는 징후를 포착하여 실행이 47시간째에 중단되기 전에 대응할 수 있습니다.

Splunk 기반 구축, Cisco와 상관 분석 Splunk 기반 구축, Cisco와 상관 분석

Splunk 기반 구축, Cisco와 상관 분석

AI 전문 도구는 프롬프트는 볼 수 있지만 칩까지는 확인하지 못합니다. 범용 모니터링은 GPU는 볼 수 있지만 에이전트의 추론 과정이나 네트워크 패브릭은 확인하지 못합니다. Splunk와 Cisco는 전체 스택을 아우르므로, 잘못된 답변과 그 원인이 된 실리콘을 한곳에서 확인할 수 있습니다.

 

 

리소스
Splunk에 대한 추가 정보

에이전트 옵저버빌리티 및 트레이싱 FAQ

트레이싱은 멀티 에이전트 워크플로우 전반에 걸쳐 단일 요청을 엔드투엔드로 추적하며, 모든 도구 호출, 모델, 검색(retrieval) 단계와 에이전트의 추론 과정을 함께 캡처합니다. 이를 통해 해당 동작을 실제 실행된 인프라와 연계하여 파악할 수 있습니다.

원인은 주로 애플리케이션 계층 아래의 네 가지 영역 중 하나에 숨어 있습니다. 모델이 잘못되었거나, 에이전트가 해서는 안 되는 작업을 수행했거나, 비용이 인지하지 못한 상태로 과도하게 발생했거나, 하드웨어가 한계에 도달한 경우입니다.

네. 토큰 급증, GPU 포화, 지연 시간 급증을 하나의 타임라인에 표시할 수 있으므로, 응답이 느려지거나 실행이 실패했을 때 단순한 증상이 아니라 실제 원인을 파악할 수 있습니다.

자체 하드웨어에서 오픈 웨이트 모델을 실행하는 경우에는 확인할 수 있는 공급업체 상태 페이지가 없습니다. 상관 분석된 텔레메트리를 통해 장애의 원인을 칩까지 추적하고, 장시간 실행이 중단되기 전에 ECC 오류 증가와 같은 초기 신호를 포착할 수 있습니다.

Splunk Agent Observability는 Splunk 데이터 플랫폼을 기반으로 구축되고 Cisco 인프라와 상관 분석되므로, 에이전트의 추론 트레이스, 출력 품질, 비용과 기반 GPU, 벡터 데이터베이스 및 네트워크 패브릭을 하나의 기록 시스템에서 모두 확인할 수 있습니다.

관련 제품

Splunk Cloud Platform

모든 도메인에 걸쳐 데이터, 컨텍스트 및 액션을 통합합니다.

자세히 알아보기

Splunk Enterprise Security

에이전틱 SOC를 위해 위협 탐지, 조사 및 대응을 통합합니다.

자세히 알아보기

Splunk IT Service Intelligence

AI 기반 서비스 모니터링으로 IT 문제를 예측하고 예방합니다.

자세히 알아보기
Splunk 시작하기

추론부터 GPU까지 근본 원인을 파악하십시오.

데모 요청하기
무료 평가판 살펴보기