予算の中で最も急速に増大しているのがAIのコスト
トークン当たりの価格は下がり続けていますが、エージェントがはるかに多くのトークンを消費しています。こうした支出を統制すること自体が一つの専門領域となっています。
すべてのトークンをアクションに結び付けることで、適切なサイズのモデルをその都度使用し、請求書が届く前に支出の急増を検知できます。
トークンの使用量とコストをリクエスト、モデル、エージェント、ワークフローごとに追跡するので、支出の内訳が曖昧になることは決してありません。コストはAIが稼動するインフラと相関関係にあります。エージェントは、評価用に特別に構築された小規模モデルのLunaによって低コストで評価されます。
ワークフローごとにトークン使用量を計測して各ワークフローに関連付け、しきい値とアラートを設定することで、支出の急騰を早期に把握できます。エージェントは計画、再試行、コンテキストの再読み込みを行うので、ステップ当たりは安価に見えるワークフローでも、積み重なるとすぐにコストが膨らみます。Splunkによって、設定した予算内に支出を維持できます。
安価なモデルで同じ品質を達成できるなら、そのモデルにリクエストをルーティングしましょう。すべてのモデルとワークフローに関してコストと品質が単一のグラフ上に並べて表示されれば、こうした決定が容易になります。
トークノミクスは、エージェンティックAIのコストを統制する手法です。まずチーム、アプリ、ワークフローごとにトークンの支出を測定して、それぞれ関連付けます。次に、それらのコストを出力の品質に結び付け、トークンにそれだけの価値があるかどうかを判定します。
単一のクエリーは数百トークンの消費にとどまりますが、エージェント型のアクションは、1つで10,000~50,000トークンを消費する場合があります。エージェントは計画、再試行、ツール呼出し、コンテキストの再読み込みを行うためです。これが予想外の高額な請求が発生する理由です。
リクエスト、モデル、エージェント、ワークフローごとに、トークンコストと品質を確認できます。より軽量なモデルでもタスクに対するスコアが同じなら、そのモデルにリクエストをルーティングして、削減した支出水準を維持できます。
いいえ。プロバイダーの請求書は支出の一部にすぎません。プロンプトキャッシングにより、プロンプトが長いほうが割安になる場合があります。コストはGPU、メモリー、ベクトルデータベース、ネットワークのすべてで発生するため、単純なトークン数よりも実質的なコストのほうが重要です。
はい。自社のハードウェアでオープンウェイトモデルを実行すれば、照合する請求書が発生しません。Splunkでは、環境全体でトークンとインフラのコストを測定し、ユーザーが設定した限度額内にコストを維持します。