功能
從推理到 GPU,全面掌握堆疊
從推理到 GPU,追蹤單一代理程式
從要求到回應,完整檢視工作流程中包含工具呼叫、模型運作與檢索步驟的全貌,並進一步將這些行為與其運行的基礎架構相互連接。根本原因會顯示在單一時間表上,不會分散在四個互不關聯的工具中。
查看底層基礎架構
追蹤 GPU 與記憶體使用量、功耗,以及各模型、向量資料庫與整體 AI 軟體堆疊的首個 Token 時間 (TTFT)。當 Token 遽增遇上 GPU 負載過高,回應變慢的原因便一目了然。
逐步檢視執行錯誤
沿著單一時間表,將 ECC 錯誤遽增、溫度或功耗異常、Xid 79 錯誤乃至執行中斷的完整過程一覽無遺,並將代理程式的追蹤記錄與 GPU 遙測資料並排呈現。「為什麼會失敗」的答案盡在單一檢視畫面中。
在執行失敗前掌握連鎖反應
災難性故障通常早有徵兆。早期訊號清晰可見,因此關聯遙測資料能及時發出警示,讓您有充裕的時間搶救任務,不必等到執行了 47 個小時後才眼睜睜看著系統崩潰中斷。
掌握哪些狀況良好,哪些面臨風險
監控整體 AI 軟體堆疊的可用性與健康狀態,讓及早發現效能衰退問題。及時發現攀升的 ECC 計數或即將飽和的快取,不必執行了 47 個小時後才眼睜睜看著系統崩潰中斷。
建構於 Splunk,與 Cisco 建立關聯
純 AI 工具能看見提示詞,卻無法透視底層晶片運作。通用型監控工具能看到 GPU,卻看不到代理程式的推理過程與網路架構。Splunk 與 Cisco 涵蓋全堆疊架構,讓錯誤的回應與造成該問題的晶片資料都能在同一處一目了然。