AI 成本是預算中成長最快的項目
每個 Token 的價格持續下滑,然而代理程式消耗的數量卻遠遠超過此數。管理這類支出本身就是一門獨立的專業。
將每個 Token 與動作連結,以便您妥善調整每個模型的規模,並在帳單到來前掌握失控的支出。
追蹤各請求、模型、代理程式和工作流程的 Token 用量與成本,讓支出不再是謎。成本與其執行的基礎架構相關聯,且代理程式由專為評估而建置的小型模型 Luna 進行經濟實惠的評分。
依工作流程計量並歸因 Token 用量,接著設定臨界值與警示,以便及早發現失控的支出。代理程式會進行規劃、重試並重新讀取情境,因此看似單一步驟成本低廉的工作流程,累積起來的費用卻相當可觀。Splunk 可協助您將支出控制在設定的預算內。
如果較便宜的模型能提供相同品質,即將請求路由至該模型。當每種模型和工作流程的成本與品質都能在同一張圖表中並列顯示時,這類決策便更容易做出。
Tokenomics 是管理代理式 AI 成本的實務:依據團隊、應用程式與工作流程來計量並歸因 Token 支出,並將該成本與輸出品質連結,讓您能判斷其是否值得。
單一查詢僅需數百個 Token,但代理式動作可能會消耗 10,000 到 50,000 個 Token,因為代理程式需要進行規劃、重試、呼叫工具並重新讀取內容,這正是團隊收到高達六位數意外帳單的原因。
依請求、模型、代理程式和工作流程,將 Token 成本與品質並列查看。當較小的模型在某項任務上獲得相同分數時,您可以將流量路由至該模型並省下不必要的開銷。
不能。供應商帳單只是支出的一部分,而提示快取意味著內容較多的提示有時反而更便宜。GPU、記憶體、向量資料庫和網路都會產生成本,因此實際有效成本比原始 Token 數量更重要。
可以。當您在自己的硬體上執行開放權重模型時,無需核對帳單,Splunk 會衡量您整個機群的 Token 和基礎架構成本,並將其維持在您設定的限制內。