splunk background

Luna

Luna評価モデル

評価に特化した小規模言語モデルで、すべてのインタラクションを評価してガードレールを適用し、100%のトラフィックを低コストで監視できます。

無料版 14日間無料でご利用いただけます。クレジットカード情報のご登録は不要です。
ガイド付きツアーを見る 5分ほどで製品の仕組みをご紹介します。
Luna評価モデル
bg-image

98%のコスト減で経済性を向上

100万トークンあたりの評価コストが5ドルから約0.15ドルに下がれば、対象を絞り込む必要はなくなります。サンプリングすることなく、すべてのインタラクションを評価して保護できます。

bg-image

LLM-as-a-judgeは負担が大きい

Lunaは、エージェントのインタラクションを評価するというジョブだけを目的に構築されています。1つの目的に特化することにより、100%のトラフィックをリアルタイムで評価して保護できます。フロンティアLLMを同じように使うとコストが膨大になり、処理にも時間がかかります。

すべてを評価するとコストがかかり過ぎる

フロンティアLLMを使った評価では、対象となる100万トークンあたりのコストが約5ドルにのぼることがあります。本番環境の規模を考えると、すべてのインタラクションを評価するのは費用がかかり過ぎます。そのため、1~5%のみをチェックして、他のインタラクションも同じような結果であるよう願うことになります。しかし、気付かなかったハルシネーションや、検出漏れのインジェクションなど、見逃したものこそ被害をもたらします。

処理が遅すぎて問題を止められない

フロンティアLLMを使った評価では、判定が返されるまでに約3,200ミリ秒かかります。それまでにはツールで処理が実行されてしまうため、判定が示すのはもはや過去の出来事です。これでは監査はできますが、保護はできません。Lunaでは約152ミリ秒で判定が返されるため、ツールで処理が実行される前にアクションを止めることができます。

単一のトークンによる決定論的なスコアリング

Lunaでは、判定が単一のトークンとして返されるため、スコアリングが高速で、再現性も高くなります。同じ入力を2回実行しても同じ答えが返されるので、評価の信頼性を確保できます。また、Lunaは組織のVPC内で実行およびトレーニングされるため、データがファイアウォールの外に出ることはありません。

組織のドメインに合わせたノーコードのチューニング

Lunaでは、標準で用意されたメトリクスで始めることができます。しかし、組織のドメインには独自の判断基準があるでしょう。Luna Studioを使用すれば、Lunaによる判定を少量修正するだけで、基準が学習され、組織のタスクでの精度が95%前後まで向上します。ラベル付けのためのパイプラインも、モデルのトレーニングに関する専門知識も不要です。Luna Studioで判定をレビューし、修正して、チューニングされたメトリクスを適用するだけです。

.Conf 26プロモーション画像

.conf26の基調講演を視聴する

Splunkのエキスパートや業界リーダーからのインサイトをご確認ください。

今すぐ視聴する >

特長

コストを増やさずにリアルタイムの評価を拡大

ドキュメントを見る(英語)
評価 評価

本番環境ですべてのインタラクションを評価

大規模言語モデルを使用した場合に発生するコストやレイテンシーを回避して、評価を常時実行。Luna-2のファインチューニング済みSLMでは、100万トークンあたりのコストをセント単位に抑えながら、判定をミリ秒単位で得て、本番環境での大規模な評価を実現できます。

捕捉 捕捉

リスクの高いエージェントアクションを実行前に捕捉

エージェンティックワークフローでミスがアクションに影響を及ぼす前にガードレールを適用。Luna-2でツールの選択やエージェントの処理フローをリアルタイムで評価して、問題を発生後に検出するのではなく、リスクの高いアクションをツールの実行前に捕捉できます。

visibility-into-it-and-industrial-data visibility-into-it-and-industrial-data

エージェントの速度を維持したまま複数のチェックを実行

レイテンシーを秒単位で引き延ばすことなく、エージェントの挙動を複数のディメンションで同時に評価。Luna-2では、L4 GPU上で10~20種類のチェックを200ミリ秒以下で同時に実行できるため、ガードレールをリアルタイムで大規模に適用できます。

トラフィック トラフィック

本番環境の評価コストを低減

フロンティアLLMですべてのインタラクションを評価して多大なコストをかけることなく、本番環境レベルの評価を実現。Luna-2では、評価コストを100万トークンあたり0.12ドルに抑えながら、高い精度と低レイテンシーを維持できます。

priced-and-packaged-for-small-it-environments priced-and-packaged-for-small-it-environments

エージェントによるジョブの完了状況を確認

最終的な応答以外も測定。Luna-2では、ツールのエラー、ツール選択の品質、アクションの進捗、アクションの完了状況を評価して、エージェントが適切に動作し、ユーザーの目標を達成しているかどうかを確認できます。

optimize-incident-response optimize-incident-response

アプリケーション独自のメトリクスを大規模に展開

それぞれのAIアプリケーションに固有の挙動を評価。Luna-2では、本番環境でのユースケースに合わせてカスタムLLMメトリクスを作成できるとともに、軽量のアダプターによってインフラの負荷を最小限に抑えながら、1つのベースモデルを数百のメトリクスに対応させることができます。

 

 

リソース
その他の情報

Luna評価モデルに関するよくある質問

Lunaは、評価に特化した小規模言語モデルのファミリーです。エージェントのインタラクションを低コストで高速に評価して保護できるため、費用を心配してデータをサンプリングすることなく、トラフィックを100%監視できます。

フロンティアLLMによる評価は高コストで、レイテンシーも大きくなります。そのため、トラフィックの1~5%をサンプリングすることになり、アクションをレビューできるのも実行後になってしまいます。一方、Lunaは、エージェントのインタラクションを評価するという1つのジョブのためだけに構築されているため、コストが低く処理も高速で、すべてのインタラクションをリアルタイムで評価して保護できます。

Lunaで評価とガードレール適用にかかるコストは、LLM-as-a-judgeアプローチと比べて約98%低くなります。この経済性によって、対象を絞り込むことなくすべてのインタラクションを評価できます。

はい。Lunaでは判定が単一のトークンとして返されるため、スコアは決定論的です。同じ入力を2回実行しても同じ答えが返されるので、評価の信頼性を確保できます。

はい。Luna Studioを使用すれば、判定を少量修正するだけで、基準が学習され、組織のタスクでの精度が95%前後まで向上します。ラベル付けのためのパイプラインも、モデルのトレーニングに関する専門知識も不要です。

関連製品

Splunk Cloud Platform

あらゆるドメインを横断して、データ、コンテキスト、アクションを統合します。

詳細はこちら

Splunk Enterprise Security

エージェンティックSOC向けに、脅威の検出、調査、対応が統合されています。

詳細はこちら

Splunk IT Service Intelligence

AIドリブンのサービス監視により、ITの問題を予測して防止します。

詳細はこちら
Lunaをぜひお試しください

すべてのインタラクションを低コストで評価して保護できます。

デモを申し込む
無料トライアル版を探す