splunk background

評估

代理程式與模型評估

對生產環境中的每一次代理互動,就正確性、安全性與工具使用進行評分,而非僅抽樣評估。

免費版 免費取得 Observability Cloud,最多可用於 15 台主機。
參加導覽 只要 5 分鐘,幫助您瞭解作業原理。
pd-ao-eval-hero-d

在問題影響到客戶之前找出問題

當評測模型是小型模型,而非頂尖 LLM 時,對每一次互動進行評分就會變得較為經濟實惠。無需抽樣,絕無盲點。

為每一次代理程式互動評分,而非僅抽樣

Luna 仰賴的不是頂尖 LLM,而是小型模型,讓您能以更具成本效益的方式,對生產環境中的每一項請求進行評分,而非僅抽樣一小部分來評估。就正確性、安全性與工具使用,對所有流量評分。

根據您的特定條件,量身打造評估工具

現成度量比較不容易符合特定領域對好答案的標準。透過 Autotune,評估工具會配合您的標準而非通用標準,因此評分能反映出您的團隊實際評估工作的方式。

將品質與延遲、錯誤和成本並列評估

每項評估分數都與延遲、錯誤和 Token 成本都放在同一條追蹤記錄中,因此您不僅能看見答案是否正確,還能掌握花費成本與耗時。一眼掌握品質與效能,不用使用四種不相連的工具。

.Conf 26 宣傳圖片

即時觀看 .conf26 主題演講

從 Splunk 專家與產業領袖的精彩分享中獲得寶貴洞察。

立即觀看

功能

確保代理程式在您上線前後都正確無誤

探索文件
持續稽核 持續稽核

對代理程式出錯處評分

評分行動完成度、工具選擇、幻覺與 RAG 遵循度等更多項目。直接使用現成指標或自訂指標,並在同一追蹤記錄中將各項評分與延遲、錯誤及成本對照檢視。

部落格 部落格

無需資料科學家,也能直接微調評估工具

直接在追蹤記錄中修正錯誤的分數,Autotune 就會據此更新評估工具。免除標註專案或提示工程交接的需求。僅需約 5 個範例,準確率即可達 95% 左右,且 F1 分數能大幅提升約 10 至 17 分。

即時效能 即時效能

執行實驗和 A/B 測試

在提示詞、模型與代理程式版本進入生產環境前,針對相同的評估基準進行比較。藉由實據釐清哪些變更切實提升了正確性與工具使用成效,不用再靠抽查憑空推測。

reduce-cyber-security-threats reduce-cyber-security-threats

用您信賴的評估機制當成防護機制

在測試階段評分可靠的評估機制,即可轉化為生產環境中的管控措施。將其提升為執行階段檢查,以便在工具觸發前及時攔阻不良動作。

查看防護機制

 

 

資源
深入探索 Splunk

Eval 工程是什麼?

閱讀部落格

代理程式評估常見問題

代理程式評估會根據代理程式實際執行的內容進行評分,涵蓋動作完成度、工具選擇、幻覺及 RAG 遵循度,讓您能判斷行為是否正確,而非根據抽樣檢查猜測。

若使用抽樣法,大部分流量都不會經過評分,而影響到客戶的故障通常都出現在無人確認的部分。由於評測模型是小型模型而非頂尖 LLM,因此您能負擔對每一次互動進行評分,而非僅抽樣一小部分來評估。

可以。透過 Autotune,您只需直接在追蹤記錄上修正少數幾筆評分,評估工具便會自動調整並符合您的標準,無須開展資料標註專案,亦無須進行提示工程交接。

將測試中能可靠評分的評估直接轉為執行期間檢查,於工具呼叫前攔阻或引導異常行為;如此一來,即無須額外維護另一套獨立的正確性判定模型。

可以。執行實驗和 A/B 測試,針對相同評估比較提示、模型和代理程式版本,以了解哪項變更提升了正確性。

相關產品

Splunk Cloud Platform

整合各個領域的資料、內容和行動。

進一步瞭解

Splunk Enterprise Security

為代理式 SOC 打造的統一威脅偵測、調查與回應機制。

進一步瞭解

Splunk IT Service Intelligence

運用 AI 驅動的服務監控,精準預測並預防 IT 潛在問題。

進一步瞭解
開始使用 Splunk

評估每一次代理程式互動,並放心上線。

申請產品示範
瞭解免費試用方案