기능
추론부터 GPU까지 전체 스택 확인
추론부터 GPU까지 하나의 에이전트 트레이스
요청부터 응답까지 워크플로우의 도구 호출, 모델 및 검색 단계를 확인한 다음, 해당 동작을 이를 실행한 인프라와 연결하세요. 근본 원인을 서로 단절된 네 개의 도구가 아니라 하나의 타임라인에서 확인할 수 있습니다.
기반 인프라 확인
모델, 벡터 데이터베이스 및 나머지 AI 스택 전반에서 GPU와 메모리 사용량, 전력 및 첫 번째 토큰 생성까지 걸리는 시간을 추적하세요. 토큰 급증과 GPU 포화가 동시에 발생하면 응답이 느려지는 원인을 명확하게 파악할 수 있습니다.
실패한 실행을 단계별로 확인
에이전트 트레이스와 GPU 텔레메트리를 나란히 확인하면서 하나의 타임라인을 따라 ECC 급증에서 열 또는 전력 이상, Xid 79, 실행 중단에 이르는 과정을 추적하세요. '왜 실패했는가?'에 대한 답을 하나의 화면에서 확인할 수 있습니다.
실행이 실패하기 전에 연쇄 장애를 확인하세요
치명적인 장애가 아무런 경고 없이 발생하는 경우는 드뭅니다. 초기 신호를 확인할 수 있으므로, 상관 분석된 텔레메트리를 통해 장애를 사전에 감지하고 실행이 47시간째에 중단되기 전에 복구할 시간을 확보할 수 있습니다.
정상 상태인 항목과 위험 상태인 항목을 파악하세요
AI 스택 전반의 가용성과 상태를 모니터링하여 성능 저하를 조기에 파악하세요. ECC 오류 수가 증가하거나 캐시가 포화되는 징후를 포착하여 실행이 47시간째에 중단되기 전에 대응할 수 있습니다.
Splunk 기반 구축, Cisco와 상관 분석
AI 전문 도구는 프롬프트는 볼 수 있지만 칩까지는 확인하지 못합니다. 범용 모니터링은 GPU는 볼 수 있지만 에이전트의 추론 과정이나 네트워크 패브릭은 확인하지 못합니다. Splunk와 Cisco는 전체 스택을 아우르므로, 잘못된 답변과 그 원인이 된 실리콘을 한곳에서 확인할 수 있습니다.