Page d'accueil d'OpenText.
Sujets techniques

Qu'est-ce que la prévention des incidents ?

Découvrez comment l'AIOps et l'observabilité aident les équipes informatiques à prévenir les incidents, et pas seulement à y réagir.

Aperçu

Concept de transfert de données numériques avec des flux lumineux colorés à fibres optiques sur un fond de circuit imprimé bleu foncé

La prévention des incidents consiste à utiliser l'observabilité, le contexte de service et l'IA pour arrêter les incidents avant qu'ils n'atteignent les utilisateurs, plutôt que de les résoudre plus rapidement après coup.

Elle repose sur quatre capacités, chacune s'appuyant sur la précédente :

  • Une image fiable de ce qui existe dans l'environnement
  • L'observabilité axée sur l'essentiel
  • Analyse rapide des causes profondes
  • Remédiation automatisée et régie

Prévention des incidents

Quels sont les avantages de la prévention des incidents ?

  • Réduisez les temps d'arrêt et le MTTR : détectez les problèmes naissants au plus tôt et réduisez le temps consacré à la recherche de leur cause première.
  • Libérez votre équipe : moins de salles de crise et moins de corrélation manuelle signifient que les ingénieurs consacrent leur temps à des tâches à plus forte valeur ajoutée au lieu de courir après les alertes.
  • Renforcez votre sécurité : le même contexte de changement et de configuration qui accélère l'analyse des causes profondes permet également de détecter plus rapidement les changements non autorisés ou risqués.
  • Renforcer la conformité : des journaux d’audit et des pistes d’audit complets facilitent la démonstration du contrôle des changements et des incidents informatiques.
  • Réduire le coût des interruptions de service : des incidents moins nombreux et plus courts signifient un impact moindre sur les revenus et une réduction des coûts de main-d’œuvre imprévus.
  • Instaurer graduellement la confiance dans l'automatisation : une automatisation encadrée, avec intervention humaine, permet d'acquérir la confiance nécessaire pour accroître son autonomie au fil du temps.

Quels sont les quatre niveaux de prévention des incidents ?

La prévention n'est pas une fonctionnalité isolée. On ne peut pas résoudre automatiquement un problème sans en connaître la cause probable. On ne peut pas établir de cause probable sans les données d'observabilité appropriées. On ne peut observer ce qui compte sans connaître ce qui existe dans son environnement et ce qu'il soutient. Chaque couche alimente la suivante.

  • Fondement de la vérité : une carte toujours à jour et facilement interrogeable des services et de leurs dépendances à travers les applications, l'infrastructure et le réseau, construite à partir de la découverte et maintenue à jour par l'IA plutôt que par un registre tenu manuellement. C'est de ce modèle de service vivant que dépend tout le reste.
  • Observabilité priorisée et intégrée : télémétrie adaptée à ce qui compte le plus, en fonction des ressources qui prennent en charge quels services métiers. C'est ici que les problèmes de formation sont signalés avant qu'un seuil ne soit atteint.
  • Corrélation et cause racine : Corrélation automatisée des événements qui raisonne sur l'ensemble du contexte pour faire émerger la cause probable en quelques minutes, avec des scores de confiance et une logique traçable au lieu d'une multitude d'alertes distinctes.
  • Résolution automatisée : automatisation basée sur des procédures et des politiques, régie par des manuels d’exécution, qui exécute des mesures correctives éprouvées dès l’apparition d’un signal, en utilisant les scripts, les manuels et les outils que vous utilisez déjà.
Diagramme illustrant le processus de prévention des incidents : observabilité, analyse des causes profondes et remédiation automatisée.

Découvrez pourquoi la prévention des incidents est importante.


En quoi la prévention des incidents diffère-t-elle de la réponse traditionnelle aux incidents ?

Les opérations informatiques traditionnelles sont évaluées selon le MTTR, c'est-à-dire la rapidité à laquelle elles se rétablissent après un incident. C'est une mesure inappropriée lorsqu'une plateforme peut identifier les situations qui se forment, déterminer les causes probables en quelques minutes et agir en conséquence dans le cadre d'une gouvernance. La prévention des incidents déplace le score de la rapidité du nettoyage vers le nombre d'incidents et d'heures passées dans la salle de crise que l'on évite en premier lieu.

Réponse traditionnelle Prévention des incidents
Détection après défaillance Détecter avant l'impact
Objectif MTTR Priorité à la prévention des incidents
Réactif Proactivité
Enquête manuelle corrélation assistée par IA

Quel rôle joue l'IA dans la prévention des incidents ?

L'IA intervient à tous les niveaux de la prévention des incidents, même si son rôle diffère selon la fonction.

  • Détection : Les modèles d’apprentissage machine repèrent les anomalies et corrélent les événements connexes pour obtenir une image globale, détectant ainsi les problèmes naissants avant qu’un seuil ne soit atteint.
  • Diagnostic : L'IA analyse la topologie, les changements récents et les données de télémétrie pour identifier la cause racine probable, souvent avec un score de confiance qu'un opérateur peut questionner et affiner.
  • Solution : L’IA peut relier un diagnostic à l’automatisation, en découvrant ou en créant des étapes de remédiation. La plupart des organisations maintiennent un intervenant humain dans le processus à ce stade, en augmentant l'autonomie à mesure que la confiance dans le système se développe.

Le niveau de maturité varie considérablement d'une plateforme à l'autre, et même au sein d'une même plateforme, le diagnostic et la résolution pilotés par l'IA sont généralement plus avancés que la détection entièrement autonome des problèmes qui n'ont pas encore déclenché d'alerte.


Pourquoi le réseau est-il important dans la prévention des incidents ?

Une grande partie des incidents surviennent au sein du réseau ou y transitent, et l'analyse des causes profondes doit suivre une transaction de bout en bout pour être fiable. Cela fait du réseau un élément fondamental, et non une simple considération après coup, au service des applications et de l'infrastructure.

Cela revêt également une importance particulière pour la couche de résolution automatisée. La correction automatisée et sécuritaire repose sur la vérification, la restauration, les garde-fous de politique, la correction des dérives et la génération de plans de changement, des capacités qui résident dans l'automatisation du réseau. Le cycle de vie des technologies émergentes de Gartner pour les SRE présente les opérations réseau agentiques comme une amélioration de l'automatisation du réseau plutôt qu'un remplacement, et ses critères d'exécution correspondent directement à ces mêmes capacités. En termes simples, l'IA représente le raisonnement ; l'automatisation du réseau lui permet d'agir en toute sécurité.


Quels sont les défis rencontrés par les organisations dans la mise en place de la prévention des incidents ?

  • Données fragmentées : les données de télémétrie des applications, de l’infrastructure et du réseau résident souvent dans des outils distincts sans contexte partagé.
  • Enregistrements de service désuets : une CMDB maintenue manuellement devient désuète dès que l’environnement change, ce qui compromet tout ce qui a été construit par-dessus.
  • Fatigue liée aux alertes : sans priorisation liée à l'impact commercial, les équipes se noient sous un flot d'alertes avant de pouvoir agir sur ce qui compte vraiment.
  • Gagner la confiance dans l'automatisation : les équipes veulent légitimement voir l'automatisation fonctionner correctement et de manière prévisible avant d'étendre ce qu'elle est autorisée à faire de manière autonome.

Les organisations qui réussissent dans ce domaine ont tendance à commencer par les fondations (un modèle de service actuel et fiable) avant d'ajouter des couches d'automatisation, à maintenir une présence humaine à mesure que la portée de l'automatisation s'étend et à choisir des outils qui s'intègrent à ce qu'elles utilisent déjà au lieu de nécessiter un remplacement complet.


Comment OpenText peut-il aider à prévenir les incidents ?

OpenText propose aujourd'hui les quatre niveaux de prévention des incidents, appuyés par des résultats clients dans les secteurs des télécommunications, des services financiers et autres.

Comment pouvons-nous vous aider?

Notes de bas de page