Page d'accueil d'OpenText.
Thèmes techniques

Qu'est-ce que la prévention des incidents ?

Découvrez comment l'AIOps et l'observabilité aident les équipes informatiques à prévenir les incidents, et non pas seulement à y réagir

Présentation

Concept de transfert de données numériques avec des flux lumineux colorés issus de fibres optiques sur un fond de circuit imprimé bleu foncé

La prévention des incidents consiste à exploiter l'observabilité, le contexte des services et l'intelligence artificielle pour empêcher les incidents de se produire avant qu'ils n'atteignent les utilisateurs, plutôt que de les résoudre plus rapidement une fois qu'ils se sont produits.

Elle repose sur quatre capacités, chacune s'appuyant sur la précédente :

  • Une image fiable de ce qui existe dans l'environnement
  • Une observabilité axée sur l'essentiel
  • Analyse rapide des causes profondes
  • Correction automatisée régie par des règles

Prévention des incidents

Quels sont les avantages de la prévention des incidents ?

  • Réduisez les temps d'arrêt et le MTTR : détectez rapidement les problèmes de formage et réduisez le temps consacré à l'identification de la cause première.
  • Libérez le potentiel de votre équipe : la réduction du nombre de « war rooms » et des tâches manuelles de corrélation permet aux ingénieurs de consacrer leur temps à des tâches à plus forte valeur ajoutée plutôt que de passer leur temps à donner la chasse aux alertes.
  • Renforcez votre dispositif de sécurité : ce même contexte de modifications et de configurations qui accélère l'analyse des causes profondes permet également de détecter plus rapidement les modifications non autorisées ou à risque.
  • Renforcer la conformité : grâce à une journalisation complète et à des pistes d'audit, il est plus facile de démontrer que les changements informatiques et les incidents sont maîtrisés.
  • Réduire le coût des pannes : des incidents moins nombreux et de plus courte durée se traduisent par un impact moindre sur le chiffre d'affaires et une diminution des coûts de main-d'œuvre imprévus.
  • Instaurez progressivement la confiance dans l'automatisation : une automatisation contrôlée, dans laquelle l'humain reste impliqué, permet de gagner la confiance nécessaire pour accroître l'autonomie au fil du temps.

Quels sont les quatre niveaux de prévention des incidents ?

La prévention n'est pas une fonctionnalité unique. Vous ne pouvez pas résoudre automatiquement un problème sans en connaître la cause probable. Vous ne pouvez pas identifier de cause probable sans disposer des données d'observabilité appropriées. Vous ne pouvez pas observer ce qui compte sans savoir ce qui existe dans votre environnement et ce qu'il abrite. Chaque couche alimente la suivante.

  • Fondement de la vérité : une carte toujours à jour et facilement consultable des services et de leurs dépendances au sein des applications, de l’infrastructure et du réseau, établie à partir d’une analyse automatique et mise à jour par l’IA, plutôt que par un registre géré manuellement. C'est de ce modèle de service dynamique que tout le reste dépend.
  • Une observabilité intégrée et hiérarchisée : une télémétrie ciblée sur l'essentiel, en fonction des ressources qui prennent en charge les différents services métier. C'est à ce stade que les problèmes de formage sont signalés avant qu'un seuil ne soit franchi.
  • Corrélation et cause première : une corrélation automatisée des événements qui analyse l'ensemble du contexte pour identifier la cause probable en quelques minutes, avec des scores de confiance et une logique traçable, au lieu d'une multitude d'alertes isolées.
  • Résolution automatisée : automatisation régie par des guides d'intervention et des politiques, qui met en œuvre des mesures correctives éprouvées dès l'apparition d'un signal, en s'appuyant sur les scripts, les guides d'intervention et les outils que vous utilisez déjà.
Schéma illustrant le processus de prévention des incidents : observabilité, analyse des causes profondes et correction automatisée

Découvrez pourquoi la prévention des incidents est importante


En quoi la prévention des incidents diffère-t-elle de la gestion traditionnelle des incidents ?

Les opérations informatiques traditionnelles sont évaluées en fonction du MTTR, c'est-à-dire de la rapidité avec laquelle vous rétablissez le service après la survenue d'un incident. Ce n'est pas la bonne approche dès lors qu'une plateforme est capable de détecter l'émergence de situations, d'en identifier la cause probable en quelques minutes et d'agir en conséquence dans le respect des règles de gouvernance. La prévention des incidents fait évoluer les critères d'évaluation : l'accent n'est plus mis sur la rapidité avec laquelle vous remédiez aux problèmes, mais sur le nombre d'incidents et d'heures passées en cellule de crise que vous évitez dès le départ.

Réponse traditionnelle Prévention des incidents
Détection après une défaillance Détecter avant l'impact
Priorité au MTTR Priorité à la prévention des incidents
Réactif Proactif
Enquête manuelle Corrélation assistée par l'IA

Quel rôle joue l'IA dans la prévention des incidents ?

L'IA intervient à tous les niveaux de la prévention des incidents, même si son rôle varie selon les fonctions.

  • Détection : les modèles d'apprentissage automatique signalent les anomalies et établissent des corrélations entre les événements associés pour en dresser un tableau d'ensemble, ce qui permet de détecter les problèmes naissants avant qu'un seuil ne soit franchi.
  • Diagnostic : l'IA analyse la topologie, les modifications récentes et les données de télémétrie afin d'identifier la cause première probable, souvent en attribuant un score de confiance que l'opérateur peut remettre en question et affiner.
  • Solution : L'IA peut relier un diagnostic à un processus automatisé, en identifiant ou en élaborant des mesures correctives. La plupart des organisations continuent de faire intervenir un intervenant humain à ce stade, puis élargissent progressivement l'autonomie à mesure que la confiance dans le système s'accroît.

Le niveau de maturité varie considérablement d'une plateforme à l'autre, et même au sein d'une même plateforme, le diagnostic et la résolution assistés par l'IA ont tendance à être plus avancés que la détection entièrement autonome de problèmes n'ayant pas encore déclenché d'alerte.


Pourquoi le réseau joue-t-il un rôle important dans la prévention des incidents ?

Une grande partie des incidents trouvent leur origine dans le réseau ou transitent par celui-ci, et pour être fiable, l'analyse des causes profondes doit suivre une transaction de bout en bout. Le réseau devient ainsi un élément fondamental, et non plus un simple élément secondaire au service des applications et de l'infrastructure.

Cela revêt également une importance particulière pour la couche de résolution automatisée. La mise en œuvre sécurisée de mesures correctives automatisées repose sur la vérification, la restauration, les contraintes de politique, la correction des écarts et la génération de plans de modification, autant de fonctionnalités propres à l'automatisation des réseaux. Le « Hype Cycle » de Gartner consacré au SRE présente les opérations réseau « agentiques » comme une amélioration de l'automatisation du réseau plutôt que comme un remplacement de celle-ci, et ses critères de mise en œuvre correspondent directement à ces mêmes capacités. Pour faire simple, l'IA, c'est le raisonnement ; l'automatisation du réseau, c'est ce qui lui permet d'agir en toute sécurité.


Quels sont les défis auxquels sont confrontées les organisations lorsqu'elles mettent en place des mesures de prévention des incidents ?

  • Données fragmentées : les données de télémétrie relatives aux applications, à l'infrastructure et au réseau sont souvent stockées dans des outils distincts, sans contexte commun.
  • Données de service obsolètes : une base de données de gestion de la configuration (CMDB) gérée manuellement devient obsolète dès que l’environnement évolue, ce qui compromet tout ce qui repose sur celle-ci.
  • Fatigue liée aux alertes : en l’absence de hiérarchisation fondée sur l’impact sur l’activité, les équipes sont submergées par un flot d’informations avant même d’avoir pu agir sur ce qui compte vraiment.
  • Gagner la confiance dans l'automatisation : les équipes souhaitent, à juste titre, s'assurer que l'automatisation fonctionne correctement et de manière prévisible avant d'étendre les tâches qu'elle est autorisée à effectuer de manière autonome.

Les organisations qui appliquent bien cette approche ont tendance à commencer par poser les bases (un modèle de service actuel et fiable) avant d’y ajouter progressivement l’automatisation, à maintenir une intervention humaine à mesure que le champ d’application de l’automatisation s’étend, et à choisir des outils qui s’intègrent à ceux qu’elles utilisent déjà, plutôt que d’imposer un remplacement complet.


Comment OpenText peut-il contribuer à la prévention des incidents ?

OpenText propose aujourd'hui les quatre niveaux de prévention des incidents, comme en témoignent les résultats obtenus par ses clients dans les secteurs des télécommunications, des services financiers et d'autres secteurs d'activité.

  • La solution « OpenText™ AI Operations Management » d'OpenText™ unifie l'observabilité, la corrélation et l'automatisation régulée au niveau des applications, de l'infrastructure et du réseau.
  • OpenText™ Network Observability permet d'intégrer le réseau dans une vue d'ensemble corrélée, car les problèmes de connectivité et les pannes liées aux changements représentent une part importante des interruptions réelles.
  • OpenText™ Automation Center met en œuvre des mesures correctives encadrées, en établissant un lien entre le diagnostic et l'action.

Comment pouvons-nous vous aider ?

Notes de bas de page