splunk background

可见性

查看完整的代理跟踪轨迹

跟踪代理从推理到底层 GPU,以便在出现问题时快速确定根本原因。

免费版 14 天免费试用——无需信用卡。
参加指导式游览 能抽出 5 分钟时间吗?了解其工作原理
可见性

查找应用层以下的原因

沿着代理跟踪轨迹和硬件事件所在的同一条时间线,一路追溯到生成错误答案或导致运行中断的芯片。

捕获始于代码以下层面的故障

根本原因通常隐藏在编排层背后:模型产生幻觉、代理使用了不该使用的工具、基础设施悄然推高了账单,或是硬件不堪重负。

跟踪并映射多代理工作流,从请求到响应

端到端跟踪单个请求。查看代理如何交接工作、步骤在何处变慢以及何处出错。跟踪轨迹可显示代理的推理过程,以便您了解它执行了什么操作及原因,而不仅仅是知道它失败了。

在同一条时间线上将代理和基础设施关联起来

关联的遥测数据有助于直观呈现性能问题的早期信号。当令牌激增、GPU 饱和、延迟激增、ECC 错误增加,以及 Xid 79 事件同时出现时,团队可以更早识别风险、更快排查故障,并在运行中断前采取行动。

.Conf 26 宣传图片

观看 .conf26 主题演讲直播

9 月 14 日 – 15 日,从 Splunk 顶尖专家和行业领袖处获取见解。

添加到日历

功能

了解整个堆栈,从推理到 GPU

浏览文档
跟踪单个代理从推理到 GPU 跟踪单个代理从推理到 GPU

跟踪单个代理从推理到 GPU

查看从请求到响应的工作流中的工具调用、模型和检索步骤,然后将这些行为与其运行的基础设施关联起来。根本原因显示在同一个时间线上,而不是分散在四个互不关联的工具中。

支出 支出

了解底层基础设施

跟踪模型、向量数据库以及 AI 堆栈其余部分中的 GPU 和内存使用情况、功耗以及首次令牌获取时间。当令牌激增遇上 GPU 饱和,响应迟缓便不再是个谜。

逐步阅读一次失败的运行 逐步阅读一次失败的运行

逐步阅读一次失败的运行

在单个时间线上,从 ECC 突增排查到温度或功率异常,再到 Xid 79 以及运行中断,同时并排查看代理跟踪和 GPU 遥测数据。“为什么会失败?”的答案尽在一个视图中。

流量 流量

在运行失败之前查看级联情况

灾难性故障很少会在毫无预警的情况下发生。早期信号是可见的,因此关联的遥测数据可以在运行到 47 小时之前发出警告,以便您还有时间恢复运行。

了解哪些是健康的,哪些存在风险 了解哪些是健康的,哪些存在风险

了解哪些是健康的,哪些存在风险

监控整个 AI 堆栈的可用性和运行状况,以便及早发现性能下降。在第 47 小时之前,及时发现不断上升的 ECC 计数或趋于饱和的缓存,以免运行完全停止。

基于 Splunk 构建,与 Cisco 关联 基于 Splunk 构建,与 Cisco 关联

基于 Splunk 构建,与 Cisco 关联

单一用途的 AI 工具能查看提示,但难以洞察芯片数据。通用监控功能可观测 GPU,但无法了解代理的推理或网络交换矩阵。Splunk 和 Cisco 可覆盖整个堆栈,通过单一界面集中显示错误答案及其背后的芯片问题。

 

 

资源
了解来自 Splunk 的更多产品

代理可观测性与跟踪常见问题

跟踪功能可在多代理工作流中端到端跟踪单个请求,捕获每次工具调用、模型和检索步骤,以及代理的推理过程,然后将这些行为与其运行所在的基础设施关联起来。

原因通常隐藏在应用层之下,存在于以下四处之一:模型出错、代理执行了不该执行的操作、悄然产生了巨额成本,或者硬件不堪重负。

可以。令牌激增、GPU 饱和以及延迟高峰可置于同一条时间线上,从而使缓慢或失败的运行直接指向其真实原因而非表面现象。

当您在自有硬件上运行开放权重模型时,没有供应商状态页面可供查看。关联的遥测数据可让您将故障一直追踪到芯片级别,并在长时间运行的任务中断之前捕获 ECC 错误增加等早期信号。

Splunk 代理可观测性基于 Splunk 数据平台构建,并与 Cisco 基础设施相关联,因此代理的推理跟踪、输出质量、成本,以及底层 GPU、向量数据库和网络架构都汇集在同一个记录系统中。

相关产品

Splunk Cloud Platform

跨越每个域统一数据、上下文和行动。

了解更多信息

Splunk Enterprise Security

面向智能体 SOC 的统一威胁检测、调查和响应。

了解更多信息

Splunk IT 服务智能

利用 AI 驱动的服务监控预测并预防 IT 问题。

了解更多信息
Splunk 入门指南

从推理到 GPU,找出根本原因。

请求演示
探索免费试用