AI SRE, votre nouveau collègue agentique

Observability Splunk

À retenir

  1. Les équipes SRE sont submergées par les déluges d’alertes et aux prises avec des outils cloisonnés et des processus de dépannage manuel. Tous ces obstacles font grimper le coût des interruptions, qui représentent une perte moyenne de 300 millions de dollars par an pour les entreprises.
  2. AI SRE met automatiquement en place des détecteurs, identifie les causes profondes en langage naturel et propose un plan de correction détaillé afin de réduire considérablement le temps de résolution.
  3. AI SRE couvre l’ensemble du cycle de vie des incidents, de la détection à la résolution. L’IA laisse les humains aux commandes, mais élimine les tâches répétitives pour que les équipes puissent se consacrer à l’innovation.

Dans le paysage numérique d’aujourd’hui, le rôle de l’ingénieur en fiabilité des sites (SRE) n’est plus seulement la fonction spécialisée qu’il était au départ ; il est la colonne vertébrale de la continuité des activités. Mais avec la complexité croissante des systèmes – environnements multicloud, microservices et architectures distribuées – le volume de données générées est tel qu’il dépasse les capacités humaines. Les SRE passent donc une grande part de leur temps à résoudre des problèmes dans l’urgence. Submergés d’alertes, ils doivent sans cesse passer d’un contexte à l’autre pour faire manuellement le lien entre des systèmes déconnectés et veiller à leur bon fonctionnement.

Il n’a jamais été aussi crucial d’assurer la productivité des services. Selon Les coûts cachés des temps d’arrêt, les entreprises perdent en moyenne 300 millions de dollars par an à cause des interruptions non planifiées et le cours de leur action accuse une baisse de 3,4 % après un seul incident. Et si vous aviez un collègue qui vous libère de ce travail manuel et vous évite cette fatalité ? Il mettrait automatiquement en place des détecteurs, ferait le tri dans les alertes, relierait le tout aux sources de données d’observabilité et vous présenterait une analyse claire des causes profondes ainsi qu’un plan concret pour rétablir la situation.

Nous vous présentons votre nouveau collègue : AI SRE.

Avant de décrire tout ce que ce collègue peut faire à votre place, penchons-nous un instant sur les problèmes courants que rencontrent les équipes d’ingénierie et celles des opérations informatiques :

Ce processus particulièrement frustrant a aussi le défaut d’accaparer du temps qui pourrait être consacré à l’innovation.

Le lancement de ChatGPT en novembre 2022 a marqué le début d’un véritable séisme dans notre manière d’aborder de nombreux aspects de la vie et du travail, de la planification des vacances aux comptes-rendus de réunions. L’observabilité ne fait pas exception.

L’avènement de l’IA générative et des grands modèles de langage (LLM) a fondamentalement changé la donne de l’observabilité. Nous abandonnons la supervision passive et ses tableaux de bord pour une observabilité proactive et agentique. Aujourd’hui, l’IA et les agents participent activement à l’observabilité, de la détection à la remédiation en passant par le dépannage. Les agents savent corréler des informations, résoudre des problèmes et suggérer des actions en temps réel.

L’intérêt d’AI SRE dans Splunk Observability Cloud

Intégrés tout au long du cycle de réponse aux incidents, l’IA et les agents peuvent non seulement raccourcir chaque étape du workflow, mais ils peuvent aussi, dans certains cas, en supprimer certaines. Libérées des urgences incessantes, les équipes peuvent ainsi se concentrer sur la stratégie de haut niveau et l’innovation.

Voyons ce que ce nouveau collègue agentique peut faire pour vous

Détection : du bruit au signal

En tant que première ligne de défense, la détection doit être précise. Splunk Observability Cloud s’appuie sur l’IA pour repousser les limites des seuils statiques en vous aidant à détecter automatiquement les problèmes, à en comprendre l’impact, à localiser les dépendances et à corréler les alertes.

AI SRE vous évite d’avoir à faire des conjectures laborieuses pour savoir quelles métriques comptent ; il établit des performances de référence en déployant des détections d’anomalies et des alertes prédéfinies quelques minutes après avoir acquis des données. Avec sa vision claire des dépendances en amont et en aval, il ne se contente pas de signaler les problèmes : il précise le rayon d’impact, identifie les services touchés et désigne les principaux suspects. Les alertes sont enrichies de contexte métier pour faire le lien entre performance technique et données de transaction. AI SRE aide ainsi les équipes à hiérarchiser le traitement des incidents en fonction de leur impact sur les clients et l’activité.

Dépannage : identification des causes profondes

Lorsque vous ouvrez une alerte dans Splunk Observability Cloud, l’agent de dépannage IA analyse immédiatement tout l’éventail de la télémétrie associée. Pour vous éviter d’interroger manuellement les logs ou d’examiner les traces, l’agent investigue automatiquement, localise les logs utiles, identifie des tendances dans les traces et explique en langage naturel les causes possibles du comportement anormal d’un service. Pour procéder à une analyse plus approfondie, vous pouvez poursuivre l’investigation avec l’AI Assistant d’Observability Cloud, en anglais naturel. Tous ces outils réduisent considérablement la part d’efforts manuels et accélèrent le dépannage.

L’IA ne devrait pas être opaque : l’explicabilité fait partie de nos principes de conception. AI SRE émet et valide plusieurs hypothèses. Il détaille celles qu’il a éliminées et étaye toutes ses conclusions en donnant du contexte, pour inspirer confiance dans son raisonnement et ses recommandations.

Remédiation : transformer les informations en action

La dernière étape est celle de la remédiation. AI SRE ne s’arrête pas à l’identification des causes profondes, il propose un plan structuré de correction ou d’atténuation. En analysant les données d’incident historiques et l’état actuel du système, ce plan guidé suggère la voie de résolution la plus efficace et vous informe en cas de besoin d’authentification et d’action. Qu’il recommande un changement de configuration, une annulation ou l’exécution d’un runbook en particulier, AI SRE fournit les conseils nécessaires pour rétablir rapidement et durablement un service.

Expérience utilisateur IA native

Vous utilisez peut-être AI Assistant pour interroger vos données en langage naturel, ou bien vous créez vos propres agents pour exploiter les outils d’observabilité dans le serveur MCP Splunk. Où que vous en soyez dans votre parcours d’observabilité et d’IA, nous nous adaptons. Notre expérience en IA native vous aide à extraire des informations toujours plus détaillées de vos données, avec ou sans expertise de pointe.

L’objectif d’AI SRE est d’alléger vos efforts, pour que vous passiez moins de temps à « maintenir les voyants au vert » et davantage à créer la prochaine génération d’expériences numériques.

L’avenir de l’observabilité est agentique. Êtes-vous prêts à accueillir votre nouveau collègue ?

Franchissez une nouvelle étape dans votre parcours d’observabilité. N’attendez pas pour découvrir AI SRE dans Splunk Observability Cloud et ce qu’il peut faire pour réduire votre temps moyen de résolution.

Articles similaires

Supervisez la performance des LLM et des agents avec AI Agent Monitoring dans Splunk Observability Cloud
Observabilité
9 min de lecture

Supervisez la performance des LLM et des agents avec AI Agent Monitoring dans Splunk Observability Cloud

Splunk Observability Cloud accueille AI Infrastructure Monitoring et AI Agent Monitoring pour apporter visibilité et protection à toute votre pile d’IA.
OTel(l) Me How to : Ping — ICMP avec le Splunk OpenTelemetry Collector
Observabilité
4 min de lecture

OTel(l) Me How to : Ping — ICMP avec le Splunk OpenTelemetry Collector

Comment contrôler les connexions à l’aide de l’Internet Control Message Protocol, aussi appelé ping, et l’OpenTelemetry Collector ? Et est-il important de le savoir ? Pour tout savoir, lisez le blog du Splunker Andre Pietsch.
Mesurer l’expérience des utilisateurs : deux technos à connaître
Observabilité
9 min de lecture

Mesurer l’expérience des utilisateurs : deux technos à connaître

Mesurer l’expérience utilisateur sur les applications est une demande récurrente autant de la part des équipes techniques que des équipes métiers. Attendre que les utilisateurs se plaignent et compter leurs commentaires du type « ça rame tout le temps », « mon voisin non plus n’a pas réussi » et autres « l’appli est pas dispo » est une approche qui trouve vite ses limites.