AI 비용은 예산에서 가장 빠르게 증가하는 항목입니다.
토큰당 가격은 계속 하락하고 있지만 에이전트는 훨씬 더 많은 토큰을 소비합니다. 이러한 지출을 관리하려면 별도의 전문적인 접근 방식이 필요합니다.
모든 토큰을 작업에 연결하여 각 모델의 규모를 최적화하고 비용이 청구되기 전에 과도한 지출을 파악하세요.
요청, 모델, 에이전트, 워크플로별 토큰 사용량과 비용을 추적하여 지출 내역을 명확하게 파악할 수 있습니다. 비용은 에이전트가 실행되는 인프라와 연계되며, 평가용으로 특별히 설계된 소형 모델인 Luna가 합리적인 비용으로 에이전트를 평가합니다.
워크플로우별 토큰 사용량을 측정하고 귀속한 다음 임계값과 경고를 설정하여 과도한 지출을 조기에 파악합니다. 에이전트는 계획을 수립하고 재시도하며 컨텍스트를 다시 읽기 때문에 단계별 비용이 낮아 보이는 워크플로우라도 전체 비용이 빠르게 증가할 수 있습니다. Splunk는 사용자가 설정한 예산 범위 내에서 비용을 유지합니다.
더 저렴한 모델이 동일한 품질을 제공한다면 해당 모델로 요청을 라우팅합니다. 모든 모델과 워크플로우의 비용과 품질을 하나의 차트에서 나란히 보여주므로 이러한 결정을 더 쉽게 내릴 수 있습니다.
토크노믹스는 에이전틱 AI 비용을 관리하는 방식입니다. 팀, 앱, 워크플로우별 토큰 지출을 측정하고 귀속하며, 해당 비용을 결과물의 품질과 연결하여 비용 대비 가치가 있었는지 판단할 수 있도록 합니다.
단일 쿼리에는 수백 개의 토큰이 사용되지만, 에이전틱 작업에는 10,000~50,000개의 토큰이 소모될 수 있습니다. 에이전트가 계획을 수립하고 재시도하며 툴을 호출하고 컨텍스트를 다시 읽기 때문이며, 이로 인해 팀이 수십만 달러에 달하는 예상치 못한 인보이스를 받을 수 있습니다.
요청, 모델, 에이전트 및 워크플로우별 품질과 토큰 비용을 나란히 확인합니다. 더 작은 모델이 특정 작업에서 동일한 점수를 받는다면 해당 모델로 요청을 라우팅하여 비용을 절감할 수 있습니다.
아니요. 공급업체 청구 금액은 전체 비용의 일부에 불과하며, 프롬프트 캐싱을 사용하면 더 큰 프롬프트가 오히려 더 저렴할 수 있습니다. GPU, 메모리, 벡터 데이터베이스 및 네트워크에도 비용이 발생하므로 단순 토큰 수보다 실질 비용이 더 중요합니다.
예. 오픈 웨이트 모델을 자체 하드웨어에서 운영할 경우 대조가 필요한 청구서가 존재하지 않으므로, Splunk는 전체 자체 호스팅 환경의 토큰 비용과 인프라 비용을 측정하고 사용자가 설정한 한도 내에서 관리할 수 있도록 지원합니다.