splunk background

평가

에이전트 및 모델 평가

샘플 평가가 아닌 프로덕션 환경의 모든 에이전트 상호작용에 대해 정확성, 안전성 및 도구 사용을 평가하세요.

무료 에디션 최대 15개 호스트까지 Observability Cloud를 무료로 사용해 보세요.
가이드식 둘러보기 단 5분! 작동 방식을 확인해 보십시오.
pd-ao-eval-hero-d

문제가 고객에게 도달하기 전에 파악하세요

판단 주체가 프론티어 LLM이 아닌 소형 모델인 경우 모든 상호작용을 합리적인 비용으로 평가할 수 있습니다. 샘플링도, 사각지대도 없습니다.

샘플이 아닌 모든 에이전트 상호작용의 점수화

프런티어 LLM에 의존하는 방식과 달리, Luna는 경량 모델을 활용함으로써 프로덕션 환경에서 일부 표본에만 국한하지 않고 모든 요청에 대한 스코어링을 비용 효율적으로 수행할 수 있도록 지원합니다. 정확성, 안전성 및 도구 사용 여부를 전체 트래픽의 100%에 대해 평가합니다.

특정 기준에 맞게 평가 모델 맞춤 설정

기본 제공되는 메트릭스는 특정 도메인에서 요구하는 좋은 답변의 기준을 충족하지 못하는 경우가 많습니다. Autotune을 사용하면 평가 모델이 일반적인 기준이 아닌 사용자의 기준에 맞게 조정되므로, 평가 점수에 실제로 팀에서 작업을 평가하는 방식이 반영됩니다.

지연 시간, 오류 및 비용과 함께 품질 평가

모든 평가 점수는 지연 시간, 오류 및 토큰 비용과 동일한 트레이스에 기록되므로, 단순히 답변이 잘못되었다는 사실뿐 아니라 그 비용과 소요 시간도 확인할 수 있습니다. 서로 단절된 네 가지 도구를 사용하는 대신, 품질과 성능을 한눈에 볼 수 있는 단일 뷰를 확보하세요.

.conf26 프로모션 이미지

.conf26 기조연설 라이브 시청하기

Splunk 최고 전문가와 업계 리더들의 인사이트를 얻어보세요.

지금 스트리밍 시작

기능

배포 전후로 에이전트가 올바르게 작동하는지 확인하기

문서 살펴보기
지속적 감사 지속적 감사

에이전트가 잘못 처리한 항목 점수 매기기

작업 완료 여부, 도구 선택, 환각, RAG 준수 여부 등을 평가하세요. 기본 제공되는 메트릭스를 사용하거나 직접 메트릭스를 작성하고, 하나의 트레이스에서 지연 시간, 오류, 비용과 함께 평가 점수를 뷰로 확인할 수 있습니다.

블로그 블로그

데이터 사이언티스트 없이 화면내에서 평가 모델 조정

트레이스에서 잘못된 평가 점수를 바로 수정하면 Autotune이 이를 바탕으로 평가 모델을 업데이트합니다. 별도의 라벨링 프로젝트나 프롬프트 엔지니어링 담당자와의 인계가 필요하지 않습니다. 약 5개의 예시만으로 정확도가 약 95%에 달하며, F1 점수가 대략 10~17점 향상되는 효과를 얻을 수 있습니다.

실시간 성능 실시간 성능

실험 및 A/B 테스트 실행

프로덕션 환경에 배포하기 전에 동일한 평가 기준을 사용하여 프롬프트, 모델 및 에이전트 버전을 비교하세요. 일부 샘플만 확인하고 추측하는 대신, 어떤 변경 사항이 정확성과 도구 사용을 실제로 개선했는지 확인할 수 있습니다.

reduce-cyber-security-threats reduce-cyber-security-threats

신뢰하는 평가가 가드레일이 됩니다

테스트에서 안정적으로 점수를 산출하는 평가는 프로덕션 환경에서 제어 기능으로 활용할 수 있습니다. 이를 런타임 검사로 전환하여 도구가 실행되기 전에 잘못된 작업을 차단하세요.

가드레일 보기

 

 

리소스
Splunk에 대한 추가 정보

Eval 엔지니어링이란?

블로그 읽기

에이전트 평가 FAQ

에이전트 평가는 작업 완료 여부와 도구 선택부터 환각 및 RAG 준수 여부에 이르기까지 에이전트가 실제로 수행한 작업을 점수로 평가합니다. 이를 통해 일부 샘플만 확인하고 추측하는 대신 에이전트가 올바르게 작동했는지 확인할 수 있습니다.

샘플링을 사용하면 대부분의 트래픽이 평가되지 않은 상태로 남게 되며, 고객에게 영향을 미치는 오류는 대개 아무도 확인하지 않은 영역에서 발생합니다. 판단 주체가 프론티어 LLM이 아닌 소형 모델이므로, 일부만 선별하여 평가하는 것이 아니라 모든 상호작용을 합리적인 비용으로 평가할 수 있습니다.

네. Autotune을 사용하면 트레이스에서 몇 건의 평가 점수를 직접 수정하기만 해도 평가 모델이 사용자의 기준에 맞게 조정되므로, 별도의 라벨링 프로젝트나 프롬프트 엔지니어링 담당자와의 인계가 필요하지 않습니다.

테스트에서 안정적으로 점수를 산출하는 평가는 런타임 검사로 전환하여 도구가 실행되기 전에 잘못된 작업을 차단하거나 다른 방향으로 유도할 수 있습니다. 따라서 정확성을 판단하기 위한 별도의 모델을 유지할 필요가 없습니다.

네. 동일한 평가를 기준으로 프롬프트, 모델, 에이전트 버전을 비교하는 실험과 A/B 테스트를 실행하여 어떤 변경 사항이 정확성을 개선했는지 확인할 수 있습니다.

관련 제품

Splunk Cloud Platform

모든 도메인에 걸쳐 데이터, 컨텍스트 및 액션을 통합합니다.

자세히 알아보기

Splunk Enterprise Security

에이전틱 SOC를 위해 위협 탐지, 조사 및 대응을 통합합니다.

자세히 알아보기

Splunk IT Service Intelligence

AI 기반 서비스 모니터링으로 IT 문제를 예측하고 예방합니다.

자세히 알아보기
Splunk 시작하기

모든 에이전트 상호작용을 빠짐없이 평가하고, 확신을 가지고 배포하세요.

데모 요청하기
무료 평가판 살펴보기