기능
배포 전후로 에이전트가 올바르게 작동하는지 확인하기
에이전트가 잘못 처리한 항목 점수 매기기
작업 완료 여부, 도구 선택, 환각, RAG 준수 여부 등을 평가하세요. 기본 제공되는 메트릭스를 사용하거나 직접 메트릭스를 작성하고, 하나의 트레이스에서 지연 시간, 오류, 비용과 함께 평가 점수를 뷰로 확인할 수 있습니다.
데이터 사이언티스트 없이 화면내에서 평가 모델 조정
트레이스에서 잘못된 평가 점수를 바로 수정하면 Autotune이 이를 바탕으로 평가 모델을 업데이트합니다. 별도의 라벨링 프로젝트나 프롬프트 엔지니어링 담당자와의 인계가 필요하지 않습니다. 약 5개의 예시만으로 정확도가 약 95%에 달하며, F1 점수가 대략 10~17점 향상되는 효과를 얻을 수 있습니다.
실험 및 A/B 테스트 실행
프로덕션 환경에 배포하기 전에 동일한 평가 기준을 사용하여 프롬프트, 모델 및 에이전트 버전을 비교하세요. 일부 샘플만 확인하고 추측하는 대신, 어떤 변경 사항이 정확성과 도구 사용을 실제로 개선했는지 확인할 수 있습니다.
신뢰하는 평가가 가드레일이 됩니다
테스트에서 안정적으로 점수를 산출하는 평가는 프로덕션 환경에서 제어 기능으로 활용할 수 있습니다. 이를 런타임 검사로 전환하여 도구가 실행되기 전에 잘못된 작업을 차단하세요.