功能
了解整个堆栈,从推理到 GPU
跟踪单个代理从推理到 GPU
查看从请求到响应的工作流中的工具调用、模型和检索步骤,然后将这些行为与其运行的基础设施关联起来。根本原因显示在同一个时间线上,而不是分散在四个互不关联的工具中。
了解底层基础设施
跟踪模型、向量数据库以及 AI 堆栈其余部分中的 GPU 和内存使用情况、功耗以及首次令牌获取时间。当令牌激增遇上 GPU 饱和,响应迟缓便不再是个谜。
逐步阅读一次失败的运行
在单个时间线上,从 ECC 突增排查到温度或功率异常,再到 Xid 79 以及运行中断,同时并排查看代理跟踪和 GPU 遥测数据。“为什么会失败?”的答案尽在一个视图中。
在运行失败之前查看级联情况
灾难性故障很少会在毫无预警的情况下发生。早期信号是可见的,因此关联的遥测数据可以在运行到 47 小时之前发出警告,以便您还有时间恢复运行。
了解哪些是健康的,哪些存在风险
监控整个 AI 堆栈的可用性和运行状况,以便及早发现性能下降。在第 47 小时之前,及时发现不断上升的 ECC 计数或趋于饱和的缓存,以免运行完全停止。
基于 Splunk 构建,与 Cisco 关联
单一用途的 AI 工具能查看提示,但难以洞察芯片数据。通用监控功能可观测 GPU,但无法了解代理的推理或网络交换矩阵。Splunk 和 Cisco 可覆盖整个堆栈,通过单一界面集中显示错误答案及其背后的芯片问题。