AI SRE, votre nouveau collègue agentique
Observability SplunkÀ retenir
- Les équipes SRE sont submergées par les déluges d’alertes et aux prises avec des outils cloisonnés et des processus de dépannage manuel. Tous ces obstacles font grimper le coût des interruptions, qui représentent une perte moyenne de 300 millions de dollars par an pour les entreprises.
- AI SRE met automatiquement en place des détecteurs, identifie les causes profondes en langage naturel et propose un plan de correction détaillé afin de réduire considérablement le temps de résolution.
- AI SRE couvre l’ensemble du cycle de vie des incidents, de la détection à la résolution. L’IA laisse les humains aux commandes, mais élimine les tâches répétitives pour que les équipes puissent se consacrer à l’innovation.
Dans le paysage numérique d’aujourd’hui, le rôle de l’ingénieur en fiabilité des sites (SRE) n’est plus seulement la fonction spécialisée qu’il était au départ ; il est la colonne vertébrale de la continuité des activités. Mais avec la complexité croissante des systèmes – environnements multicloud, microservices et architectures distribuées – le volume de données générées est tel qu’il dépasse les capacités humaines. Les SRE passent donc une grande part de leur temps à résoudre des problèmes dans l’urgence. Submergés d’alertes, ils doivent sans cesse passer d’un contexte à l’autre pour faire manuellement le lien entre des systèmes déconnectés et veiller à leur bon fonctionnement.
Il n’a jamais été aussi crucial d’assurer la productivité des services. Selon Les coûts cachés des temps d’arrêt, les entreprises perdent en moyenne 300 millions de dollars par an à cause des interruptions non planifiées et le cours de leur action accuse une baisse de 3,4 % après un seul incident. Et si vous aviez un collègue qui vous libère de ce travail manuel et vous évite cette fatalité ? Il mettrait automatiquement en place des détecteurs, ferait le tri dans les alertes, relierait le tout aux sources de données d’observabilité et vous présenterait une analyse claire des causes profondes ainsi qu’un plan concret pour rétablir la situation.
Nous vous présentons votre nouveau collègue : AI SRE.
Avant de décrire tout ce que ce collègue peut faire à votre place, penchons-nous un instant sur les problèmes courants que rencontrent les équipes d’ingénierie et celles des opérations informatiques :
- Déluges d’alertes : les équipes reçoivent des milliers d’alertes chaque jour et peinent à distinguer un événement critique dangereux pour l’entreprise du « bruit » de fond. Submergées, elles sont épuisées et les signaux essentiels restent enfouis sous les faux positifs.
- Cloisonnement du dépannage : lorsqu’un problème survient, les équipes doivent naviguer entre d’innombrables onglets et écrans pour consulter les logs, les métriques, les traces, les événements de changement CI/CD et Kubernetes et bien d’autres éléments encore. Le temps perdu à corréler manuellement ces données est le facteur numéro 1 de l’augmentation du temps moyen de résolution (MTTR).
- Effort de résolution : une fois la cause profonde identifiée, la voie de la résolution n’est pas toujours claire, et elle demande souvent des efforts manuels.
Ce processus particulièrement frustrant a aussi le défaut d’accaparer du temps qui pourrait être consacré à l’innovation.
Le lancement de ChatGPT en novembre 2022 a marqué le début d’un véritable séisme dans notre manière d’aborder de nombreux aspects de la vie et du travail, de la planification des vacances aux comptes-rendus de réunions. L’observabilité ne fait pas exception.
L’avènement de l’IA générative et des grands modèles de langage (LLM) a fondamentalement changé la donne de l’observabilité. Nous abandonnons la supervision passive et ses tableaux de bord pour une observabilité proactive et agentique. Aujourd’hui, l’IA et les agents participent activement à l’observabilité, de la détection à la remédiation en passant par le dépannage. Les agents savent corréler des informations, résoudre des problèmes et suggérer des actions en temps réel.
L’intérêt d’AI SRE dans Splunk Observability Cloud
Intégrés tout au long du cycle de réponse aux incidents, l’IA et les agents peuvent non seulement raccourcir chaque étape du workflow, mais ils peuvent aussi, dans certains cas, en supprimer certaines. Libérées des urgences incessantes, les équipes peuvent ainsi se concentrer sur la stratégie de haut niveau et l’innovation.
Voyons ce que ce nouveau collègue agentique peut faire pour vous
Détection : du bruit au signal
En tant que première ligne de défense, la détection doit être précise. Splunk Observability Cloud s’appuie sur l’IA pour repousser les limites des seuils statiques en vous aidant à détecter automatiquement les problèmes, à en comprendre l’impact, à localiser les dépendances et à corréler les alertes.
AI SRE vous évite d’avoir à faire des conjectures laborieuses pour savoir quelles métriques comptent ; il établit des performances de référence en déployant des détections d’anomalies et des alertes prédéfinies quelques minutes après avoir acquis des données. Avec sa vision claire des dépendances en amont et en aval, il ne se contente pas de signaler les problèmes : il précise le rayon d’impact, identifie les services touchés et désigne les principaux suspects. Les alertes sont enrichies de contexte métier pour faire le lien entre performance technique et données de transaction. AI SRE aide ainsi les équipes à hiérarchiser le traitement des incidents en fonction de leur impact sur les clients et l’activité.
Dépannage : identification des causes profondes
Lorsque vous ouvrez une alerte dans Splunk Observability Cloud, l’agent de dépannage IA analyse immédiatement tout l’éventail de la télémétrie associée. Pour vous éviter d’interroger manuellement les logs ou d’examiner les traces, l’agent investigue automatiquement, localise les logs utiles, identifie des tendances dans les traces et explique en langage naturel les causes possibles du comportement anormal d’un service. Pour procéder à une analyse plus approfondie, vous pouvez poursuivre l’investigation avec l’AI Assistant d’Observability Cloud, en anglais naturel. Tous ces outils réduisent considérablement la part d’efforts manuels et accélèrent le dépannage.
L’IA ne devrait pas être opaque : l’explicabilité fait partie de nos principes de conception. AI SRE émet et valide plusieurs hypothèses. Il détaille celles qu’il a éliminées et étaye toutes ses conclusions en donnant du contexte, pour inspirer confiance dans son raisonnement et ses recommandations.
Remédiation : transformer les informations en action
La dernière étape est celle de la remédiation. AI SRE ne s’arrête pas à l’identification des causes profondes, il propose un plan structuré de correction ou d’atténuation. En analysant les données d’incident historiques et l’état actuel du système, ce plan guidé suggère la voie de résolution la plus efficace et vous informe en cas de besoin d’authentification et d’action. Qu’il recommande un changement de configuration, une annulation ou l’exécution d’un runbook en particulier, AI SRE fournit les conseils nécessaires pour rétablir rapidement et durablement un service.
Expérience utilisateur IA native
Vous utilisez peut-être AI Assistant pour interroger vos données en langage naturel, ou bien vous créez vos propres agents pour exploiter les outils d’observabilité dans le serveur MCP Splunk. Où que vous en soyez dans votre parcours d’observabilité et d’IA, nous nous adaptons. Notre expérience en IA native vous aide à extraire des informations toujours plus détaillées de vos données, avec ou sans expertise de pointe.
L’objectif d’AI SRE est d’alléger vos efforts, pour que vous passiez moins de temps à « maintenir les voyants au vert » et davantage à créer la prochaine génération d’expériences numériques.
L’avenir de l’observabilité est agentique. Êtes-vous prêts à accueillir votre nouveau collègue ?
Franchissez une nouvelle étape dans votre parcours d’observabilité. N’attendez pas pour découvrir AI SRE dans Splunk Observability Cloud et ce qu’il peut faire pour réduire votre temps moyen de résolution.
Articles similaires

Supervisez la performance des LLM et des agents avec AI Agent Monitoring dans Splunk Observability Cloud

OTel(l) Me How to : Ping — ICMP avec le Splunk OpenTelemetry Collector
