AI 成本是预算中增长最快的一项
令牌单价持续下降,但代理消耗的令牌数量却远超以往。管控此类支出本身就是一门学问。
将每个令牌与行动关联,以便您针对每个模型合理调整规模,并在收到账单之前确定意外支出。
按请求、模型、代理和工作流跟踪令牌使用情况和成本,让支出一目了然。成本与其运行的基础设施相关,Luna(专为评估而构建的小模型)将以经济高效的方式对代理进行评分。
按工作流计量并统计令牌使用情况,然后设置阈值和警报,尽早识别意外支出。代理会进行规划、重试并重新读取上下文,因此,看似每一步成本低廉的工作流,层层叠加也会让成本随之攀升。Splunk 可将其控制在您设定的预算范围内。
如果更便宜的模型能提供相同的质量,则将请求路由至该模型。当每个模型和工作流的成本与质量在单个图表上并排显示时,这些决策就更容易做出。
令牌经济学是管理代理式 AI 成本的实践:按团队、应用和工作流计量并统计令牌支出,并将该成本与输出质量挂钩,以便您判断其是否物有所值。
单次查询仅需几百个令牌,但一次代理操作可能会消耗 10,000 到 50,000 个令牌,因为代理需要进行规划、重试、调用工具并重新读取上下文。因此,团队会收到高达六位数的意外账单。
按请求、模型、代理和工作流查看令牌成本与质量的对比情况。当规模较小的模型在某项任务中评分相同时,您可以选择该模型以节省支出。
否。提供商账单仅是支出的一部分,提示缓存则意味着大型提示的成本有时反而更为低廉。GPU、内存、向量数据库和网络都会产生成本,因此有效成本比原始令牌数更重要。
能。当您在自有硬件上运行开放权重模型时,无需核对发票。Splunk 会衡量整个集群中的令牌和基础设施成本,并将其控制在您设定的限额内。