L’IA est partout. Dans tous les secteurs, l’émergence de l’IA a bouleversé le rythme du développement logiciel, de la création de contenu, de l’assistance client et de bien d’autres workflows et fonctions métiers. Aussi impressionnante soit-elle, la démocratisation de l’IA a également fait émerger du « slop » : des contenus médiocres, fallacieux, erronés et parfois nuisibles. La fréquence et l’intensité de ces problèmes dépendent en grande partie de la robustesse et de la stabilité de l’infrastructure. C’est pour cela que nous ajoutons à Splunk Observability Cloud des capacités d’observabilité de l’IA – AI Infrastructure Monitoring et AI Agent Monitoring – pour apporter visibilité et protection à toute votre pile d’IA.
Le comportement non déterministe et génératif des LLM peut entraîner une multiplication des inexactitudes, des biais et des sophismes dans les résultats. À terme, ces défauts dégradent la confiance des clients et l’expérience des utilisateurs, tout en entraînant une augmentation des coûts. Pour comprendre la véritable origine de ces problèmes et la dégradation des services, il est impératif de comprendre les dépendances et les interactions de ces systèmes. Les équipes désireuses de créer une IA sûre et fiable ont besoin d’une visibilité détaillée et unifiée sur toute leur infrastructure d’IA. C’est le seul moyen de relier les problèmes métiers aux métriques de performance, de qualité et de coût/utilisation que génèrent les interactions des agents et les appels d’outils (ainsi que les composants de l’infrastructure IA) dans les environnements locaux, cloud et hybrides. C’est précisément la fonction d’AI Agent Monitoring.
Prolongement des capacités de dépannage et de supervision de Splunk Application Performance Monitoring (APM), AI Agent Monitoring aide les équipes à fiabiliser leurs applications agentiques. Avec AI Agent Monitoring, les équipes d’ITOps et d’ingénierie sont en mesure de localiser et corréler la cause profonde des problèmes de fiabilité et des dégradations affectant la performance des agents et des modèles d’IA. En intégrant APM à AI Agent Monitoring, les utilisateurs disposeront d’une visibilité à l’échelle de la trace, indispensable pour dépanner les applications IA et classiques.
Avec l’expérience d’observabilité unifiée de Splunk, les équipes obtiennent des informations sur les performances du front-end. Munies d’outils performants de supervision des applications, de l’infrastructure et de l’expérience numérique, qui corrèlent aisément les informations métiers, la sécurité des applications et l’observabilité du réseau, elles ont toutes les cartes en main pour fournir des expériences utilisateur irréprochables. En associant ces outils à d’autres capacités de la plateforme Splunk (analyse des logs, gestion des pipelines de télémétrie et intelligence des événements), les équipes ont la possibilité d’analyser des quantités phénoménales de données machine, de visualiser les logs contextualisés de la plateforme Splunk dans Splunk Observability Cloud et de transmettre les informations d’observabilité à la plateforme.
Autre avantage, AI Agent Monitoring utilise des normes industrielles (OpenTelemetry et Cisco AGNTCY) pour rester indépendant des fournisseurs.
Regarder la démonstration Navattic

Sur la page AI Agents, les équipes peuvent consulter les indicateurs de performance, de coût et de sécurité de tous les agents de leur environnement, sous une forme individualisée ou agrégée. Des indicateurs cruciaux tels que le nombre de requêtes, le nombre et la fréquence des erreurs, la latence, le nombre de tokens d’entrée et de sortie et leur coût respectif, un score de qualité et le niveau de risque, offrent aux équipes une image claire et englobante de l’intégrité et de l’efficacité de chaque agent. Munies de cette vision d’ensemble et de cette liste d’agents IA assortie d’outils de recherche, les équipes savent parfaitement quels agents sont présents et lesquels sont dans un état critique méritant une attention immédiate.

La solution propose des analyses de tendance historiques prêtes à l’emploi pour différents aspects de chaque agent : indicateurs de performance, utilisation des tokens et attribution des coûts, qualité et risque. Cette visibilité permet aux équipes d’établir des profils de référence, de détecter les anomalies et de prendre des décisions d’optimisation des coûts et des ressources étayées par des données. Les utilisateurs peuvent également associer des alertes à ces métriques pour détecter et résoudre rapidement les problèmes.

Les données de trace IA sont utiles pour identifier les problèmes de qualité et les risques qui apparaissent le plus souvent, et elles détaillent les interactions des utilisateurs. La page AI Trace Data relie les prompts (entrées) et les réponses (sorties) des LLM à leur horodatage et à leurs problèmes de qualité (hallucinations, biais, sentiment et toxicité). Grâce à ces informations, les équipes ciblent et investiguent des problèmes spécifiques afin d’atténuer leur impact sur la réputation ou les opérations. AI Agent Monitoring de Splunk s’appuie sur des juges LLM pour mesurer la performance.

La vue des traces donne également des informations sur les spans, l’exécution et la mémoire des appels d’outils, ainsi que de la visibilité sur les workflows des agents et les chemins d’exécution ce qui permet de détecter les baisses de performance et d’optimiser les ressources et les coûts.

Dernière chose, AI Agent Monitoring permettra bientôt aux équipes de détecter et d’atténuer différents risques liés aux LLM, aux agents et aux outils (utilisations abusives, dérives, fuites, menaces, etc.) au moyen d’une intégration avec Cisco AI Defense. Avec cette couche de sécurité supplémentaire, les équipes pourront protéger leurs applications d’IA contre les menaces en temps réel à l’aide de garde-fous bidirectionnels ; elles bloqueront notamment les injections de prompts, les exfiltrations de données sensibles, les contenus nuisibles et bien d’autres risques. Munies d’outils conçus pour respecter les normes de sécurité de l’IA, les équipes pourront créer et déployer des applications et des systèmes d’IA fiables, éviter les failles et préserver la résilience des opérations.
Les infrastructures traditionnelles ont évolué. L’infrastructure d’IA comprend désormais de nouveaux composants : processeurs graphiques (GPU), grands modèles de langage (LLM), bases de données vectorielles, frameworks et bibliothèques d’IA. L’administration de ces workloads IA sur ces nouveaux composants et sur ceux plus traditionnels que sont le calcul, le réseau, la mémoire et le stockage, coûte bien plus cher et réclame davantage de ressources qu’avant. Cette complexité va croissante avec les impératifs de progrès : amélioration de l’entraînement et de l’inférence, réduction de la latence, prise de décision informée, résultats de meilleure qualité, fiabilisation des modèles et des agents, etc.
C’est pour cela que nous avons lancé AI Infrastructure Monitoring l’année dernière. Depuis novembre 2025, les équipes peuvent désormais utiliser AI Infrastructure Monitoring pour afficher des tableaux de bord riches et des détecteurs pour les NIM Nvidia, les bases de données vectorielles Milvus et Pinecone, les services de proxy LiteLLM, les applications GCP VertexAI, les Cisco AI POD et bien d’autres éléments.
Ces tableaux de bord fournissent des indicateurs sur les GPU (utilisation, consommation d’énergie), mais aussi sur l’économie des tokens, ou tokenomics (délai avant le premier token, estimation des coûts, etc.), pour évaluer la consommation et l’efficacité des workloads dans les infrastructures IA hébergées comme les Cisco AI POD.

Comme les Cisco AI POD sont des solutions matérielles prévalidées et full-stack qui comprennent des serveurs Cisco UCS, des switches Nexus série 9000 et des composants logiciels embarqués comme Cisco Intersight, AI Infrastructure Monitoring alimente également ces tableaux de bord en chiffres clés sur la vitesse des ventilateurs des UCS, la température des hôtes et l’alimentation.

Armées d’une visibilité aussi complète, les équipes identifient rapidement les composants qui affectent la stabilité, le coût, la disponibilité et la sécurité de l’infrastructure d’IA, puis corrèlent ces informations avec l’état des services métiers et les tendances d’utilisation pour atténuer les risques qui pèsent sur les performances et la réputation de l’entreprise.
AGNTCY, un projet de la Linux Foundation, travaille à bâtir un Internet des agents. Ouverte et interopérable, cette infrastructure fondamentale doit permettre aux agents de collaborer, quels que soient le framework et le fournisseur. En définissant des protocoles communs, des systèmes d’identité et des services de découverte, AGNTCY invente un avenir où les agents interagissent de façon fluide et sécurisée. Comptant plus de 80 membres (dont Cisco, Google, RedHat, Dell et Oracle), AGNTCY rassemble les grands noms de l’industrie pour développer, normaliser et maintenir les composants critiques qui permettront aux systèmes multi-agents de fonctionner en production.
Fidèle à son engagement à servir les équipes ITOps et d’ingénierie en misant sur des standards ouverts, Splunk continue de contribuer à AGNTCY, un projet de la Linux Foundation, pour que les clients puissent bénéficier d’une télémétrie cohérente et agnostique dans les grands modèles de langage (LLM) et les applications agentiques. D’autre part, Splunk utilise toujours les composants du moteur de calcul de métriques d’AGNTCY pour fournir des métriques de qualité sophistiquées comme la précision factuelle et la cohérence, ainsi que des indicateurs essentiels comme la latence et les taux d’erreur. Lisez cet article de blog pour en savoir plus sur Splunk et AGNTCY.
Configurez AI Agent Monitoring dès aujourd’hui et lisez cet article de blog pour en savoir plus sur les outils Splunk dédiés à l’observabilité de l’IA.
Les plus grandes organisations mondiales font confiance à Splunk, une entreprise de Cisco, pour renforcer en permanence leur résilience numérique grâce à une plateforme unifiée de sécurité et d’observabilité, alimentée par une IA de pointe.
Nos clients se fient aux solutions de sécurité et d’observabilité primées de Splunk pour sécuriser leurs environnements numériques complexes et en renforcer la fiabilité, quelle que soit l’échelle.