splunk background

评估

智能体和模型评估

对生产环境中每一次智能体交互的正确性、安全性和工具使用率进行评分,而非仅针对抽样。

免费版 免费获取最多 15 台主机的可观测性云。
参加指导式游览 能抽出 5 分钟时间吗?快速了解其工作原理。
pd-ao-eval-hero-d

在影响您的客户之前解决问题

当评估模型是小模型而非前沿 LLM 时,我们就能有效管控每一次交互的评分成本。无需抽样,消除盲点。

对每一次智能体交互进行评分,而非仅针对抽样

Luna 是一款小模型,无需依赖前沿 LLM,即可经济高效地对生产环境中的每个请求进行评分,而不仅针对抽样片段。对 100% 的流量进行正确性、安全性和工具使用率评分。

根据您的具体标准定制评估模型

开箱即用的指标很少能满足特定领域对优质答案的要求。借助 Autotune,评估模型会根据您的标准而非通用标准进行调整,因此评分能够反映团队对实际成果的评价。

除了延迟、错误和成本之外,还要评估质量

您可以跟踪每个评估分数与延迟、错误以及令牌成本,因此您不仅能了解答案是否有误,还能确定其产生的成本以及所花费的时间。获取质量与性能的统一视图,而非四个互不关联的工具。

.Conf 26 宣传图片

观看 .conf26 主题演讲直播

从 Splunk 专家和行业领袖的精彩分享中获取宝贵洞察。

立即观看

功能

确保智能体在交付前后均准确无误

浏览文档
持续审计 持续审计

对智能体出现错误的环节进行评分

评估操作完成率、工具选择、幻觉以及 RAG 遵循度等。使用开箱即用的指标或自行编写指标,完成一次跟踪,即可对比评分、延迟、错误和成本等指标。

博客 博客

无需数据科学家即可在线调优评估模型

直接在跟踪过程中更正错误评分,Autotune 将据此更新评估模型。无需进行项目标注或提示工程交接。基于约 5 个示例,准确率可达到约 95%,F1 分数可提升约 10 至 17 分。

实时性能 实时性能

运行实验和 A/B 测试

在进入生产环境之前,对照相同的评估比较提示、模型和智能体版本。查看哪项更改切实提高了正确性和工具使用率,而不是通过抽查结果盲目猜测。

reduce-cyber-security-threats reduce-cyber-security-threats

将您信任的评估结果转化为防护机制

在测试中评分表现稳定的评估结果,可转化为生产环境中的控制措施。将其升级为运行时检查,以便在工具触发任务前阻止不当操作。

了解防护机制

 

 

资源
了解来自 Splunk 的更多产品

什么是评估工程?

阅读博客

智能体评估常见问题

智能体评估会对智能体实际执行的操作进行评分,涵盖操作完成率、工具选择、幻觉和 RAG 遵循度,让您能够判断其行为是否正确,而非根据抽查结果盲目猜测。

抽样检测会导致大部分流量未经评级,而最终影响客户的故障通常出现在无人检查的环节。由于评估模型是小模型而非前沿 LLM,您可以对每一次交互进行评分,而不仅针对抽样片段。

能。借助 Autotune,您可以直接在跟踪过程中更正部分评分,评估模型会根据您的标准进行调整,而无需标注项目或完成提示工程交接。

在测试中评分表现稳定的评估结果可以升级为运行时检查,在工具触发任务之前拦截或引导不当操作,因此无需维护单独的正确性模型。

能。您可以运行实验和 A/B 测试,依据相同的评估数据比较提示、模型和智能体版本,以了解哪项更改提高了正确性。

相关产品

Splunk Cloud Platform

跨越每个域统一数据、上下文和行动。

了解更多信息

Splunk Enterprise Security

面向智能体 SOC 的统一威胁检测、调查和响应。

了解更多信息

Splunk IT 服务智能

利用 AI 驱动的服务监控预测并预防 IT 问题。

了解更多信息
Splunk 入门指南

评估每一次智能体交互,充满信心地交付成果。

请求演示
探索免费试用