splunk background

トークノミクス

AIのコストとトークノミクス

すべてのトークンをアクションに結び付けることで、適切なサイズのモデルをその都度使用し、請求書が届く前に支出の急増を検知できます。

無料版 14日間無料でご利用いただけます。クレジットカード情報のご登録は不要です。
ガイド付きツアーを見る(英語) 5分ほどで製品の仕組みをご紹介します。
トークノミクス
bg-image

予算の中で最も急速に増大しているのがAIのコスト

トークン当たりの価格は下がり続けていますが、エージェントがはるかに多くのトークンを消費しています。こうした支出を統制すること自体が一つの専門領域となっています。

bg-image

トークノミクスのインサイトを利用してAIコストを最適化する

Splunkは、実際にAIのどこでどれだけコストがかかっているのかを示し、予算内に収まるようにコスト管理を支援します。

エージェントのコストを評価する

トークンの使用量とコストをリクエスト、モデル、エージェント、ワークフローごとに追跡するので、支出の内訳が曖昧になることは決してありません。コストはAIが稼動するインフラと相関関係にあります。エージェントは、評価用に特別に構築された小規模モデルのLunaによって低コストで評価されます。

トークン使用量としきい値を管理する

ワークフローごとにトークン使用量を計測して各ワークフローに関連付け、しきい値とアラートを設定することで、支出の急騰を早期に把握できます。エージェントは計画、再試行、コンテキストの再読み込みを行うので、ステップ当たりは安価に見えるワークフローでも、積み重なるとすぐにコストが膨らみます。Splunkによって、設定した予算内に支出を維持できます。

モデルのコストと品質を比較する

安価なモデルで同じ品質を達成できるなら、そのモデルにリクエストをルーティングしましょう。すべてのモデルとワークフローに関してコストと品質が単一のグラフ上に並べて表示されれば、こうした決定が容易になります。

.Conf 26プロモーション画像

Splunkを体験しましょう

9月14–17日、コロラド州デンバーにて開催。多くの体験ができる会場でネットワーキングイベントにぜひご参加ください。

.conf26の登録はこちら

特長

エージェンティックAIのコストを統制する

ドキュメントを見る(英語)
コストの明確化と削減 コストの明確化と削減

適切なサイズのモデルにルーティング

リクエスト、モデル、エージェント、ワークフローごとに、トークンコストと品質を確認できます。より軽量なモデルでもスコアが同じなら、そのモデルにリクエストをルーティングして、削減した支出水準を維持しましょう。

支出 支出

請求書に表れないコストを算出

プロバイダーの請求書は支出の一部にすぎません。トークンコストと、GPU、メモリー、ベクトルデータベース、基盤となるネットワークとの相関関係を1つのタイムライン上で確認できます。

visibility-into-it-and-industrial-data visibility-into-it-and-industrial-data

環境内でコストを統制

自社のハードウェアでオープンウェイトモデルを実行すれば、照合する請求書が発生しません。自社の運用環境全体についてトークンとインフラのコストを測定できます。

トラフィック トラフィック

支出をネットワークトラフィックのように運用

ワークフローごとに予算を立て、しきい値を設定し、支出が急増したらアラートを出すことができます。トークンの支出を運用シグナルとして扱い、請求書が届く前に限度額、担当者、信頼できる数値を把握できるようにしましょう。

priced-and-packaged-for-small-it-environments priced-and-packaged-for-small-it-environments

トークン数ではなく実質的なコストを測定

プロンプトキャッシュを利用すると、固定されたプレフィックスを通常より大幅に安い料金で再利用できるため、プロンプトが長いほうが割安になる場合があります。トークンの数ではなく、実際の請求額を最適化しましょう。

optimize-incident-response optimize-incident-response

請求書の受領前に支出の急騰を把握

再試行のループや肥大化するコンテキストにより何時間にもわたってトークンが消費されます。ワークフローごとに使用量を監視し、しきい値を設定することで、予想外の高額な請求が発生するのを防ぐことができます。

 

 

リソース
その他の情報

Splunk Observability + Galileo:AIへの信頼の橋を架ける

ブログを読む

AIトークノミクスについてよくある質問

トークノミクスは、エージェンティックAIのコストを統制する手法です。まずチーム、アプリ、ワークフローごとにトークンの支出を測定して、それぞれ関連付けます。次に、それらのコストを出力の品質に結び付け、トークンにそれだけの価値があるかどうかを判定します。

単一のクエリーは数百トークンの消費にとどまりますが、エージェント型のアクションは、1つで10,000~50,000トークンを消費する場合があります。エージェントは計画、再試行、ツール呼出し、コンテキストの再読み込みを行うためです。これが予想外の高額な請求が発生する理由です。

リクエスト、モデル、エージェント、ワークフローごとに、トークンコストと品質を確認できます。より軽量なモデルでもタスクに対するスコアが同じなら、そのモデルにリクエストをルーティングして、削減した支出水準を維持できます。

いいえ。プロバイダーの請求書は支出の一部にすぎません。プロンプトキャッシングにより、プロンプトが長いほうが割安になる場合があります。コストはGPU、メモリー、ベクトルデータベース、ネットワークのすべてで発生するため、単純なトークン数よりも実質的なコストのほうが重要です。

はい。自社のハードウェアでオープンウェイトモデルを実行すれば、照合する請求書が発生しません。Splunkでは、環境全体でトークンとインフラのコストを測定し、ユーザーが設定した限度額内にコストを維持します。

関連製品

Splunk Cloud Platform

ドメインのすべての境界を越えて、データ、コンテキスト、アクションを統合します。

詳細はこちら

Splunk Enterprise Security

エージェンティックSOC向けに、脅威の検出、調査、対応が統合されています。

詳細はこちら

Splunk IT Service Intelligence

AIドリブンのサービス監視によってITの問題を予測し、防ぎます。

詳細はこちら
Splunkを使い始める

すべてのエージェントのコストと価値を見極めましょう。

デモを申し込む
無料トライアル版を探す