OpenText-Startseite.
Technische Themen

Was versteht man unter Vorfallprävention?

Erfahren Sie, wie AIOps und Observability IT-Teams dabei helfen, Vorfälle zu verhindern, anstatt nur auf sie zu reagieren

Übersicht

Konzept zur digitalen Datenübertragung mit farbenfrohen Lichtströmen aus Glasfaser vor dem Hintergrund einer dunkelblauen Leiterplatte

Unter Vorfallprävention versteht man den Einsatz von Observability, Servicekontext und KI, um Vorfälle zu verhindern, bevor sie die Nutzer erreichen, anstatt sie im Nachhinein schneller zu beheben.

Es basiert auf vier Kompetenzen, von denen jede auf der vorherigen aufbaut:

  • Ein verlässliches Bild davon, was in der Umgebung vorhanden ist
  • Observability mit Fokus auf das Wesentliche
  • Schnelle Ursachenanalyse
  • Kontrollierte automatisierte Fehlerbehebung

Prävention von Zwischenfällen

Welche Vorteile bietet die Vorbeugung von Vorfällen?

  • Verringern Sie Ausfallzeiten und die MTTR: Erkennen Sie Formprobleme frühzeitig und verkürzen Sie die Zeit, die für die Ermittlung der Ursache aufgewendet wird.
  • Entlasten Sie Ihr Team: Weniger „War Rooms“ und weniger manuelle Korrelation bedeuten, dass sich die Ingenieure auf wertschöpfendere Aufgaben konzentrieren können, anstatt Alarme nachzugehen.
  • Stärken Sie Ihre Sicherheitslage: Derselbe Änderungs- und Konfigurationskontext, der die Ursachenanalyse beschleunigt, deckt auch unbefugte oder risikobehaftete Änderungen schneller auf.
  • Verbesserung der Compliance: Umfassende Protokollierung und Prüfpfade erleichtern den Nachweis der Kontrolle über IT-Änderungen und Vorfälle.
  • Senkung der Kosten durch Betriebsausfälle: Weniger und kürzere Vorfälle bedeuten geringere Auswirkungen auf den Umsatz und geringere ungeplante Personalkosten.
  • Bauen Sie schrittweise Vertrauen in die Automatisierung auf: Eine kontrollierte Automatisierung, bei der der Mensch stets in den Prozess eingebunden bleibt, schafft das nötige Vertrauen, um die Autonomie im Laufe der Zeit auszuweiten.

Welche vier Ebenen der Vorfallprävention gibt es?

Prävention ist keine einzelne Funktion. Sie können ein Problem nicht automatisch beheben, ohne dessen wahrscheinliche Ursache zu kennen. Ohne die richtigen Observability-Daten können Sie keine hinreichenden Verdachtsgründe ermitteln. Sie können nicht beobachten, was wichtig ist, ohne zu wissen, was in Ihrer Umgebung vorhanden ist und was diese ermöglicht. Jede Ebene bildet die Grundlage für die nächste.

  • Grundlage der Wahrheit: Eine stets aktuelle, leicht abfragbare Übersicht über Dienste und deren Abhängigkeiten über Anwendungen, Infrastruktur und das Netzwerk hinweg, die auf der Basis von Erkennungsprozessen erstellt und durch KI auf dem neuesten Stand gehalten wird, anstatt manuell gepflegt zu werden. Dieses Modell der Lebensbegleitung ist die Grundlage, auf der alles andere aufbaut.
  • Priorisierte, integrierte Beobachtbarkeit: Telemetrie, die sich auf das Wesentliche konzentriert, basierend darauf, welche Ressourcen welche Geschäftsdienste unterstützen. An dieser Stelle werden auftretende Probleme bereits erkannt, bevor ein Schwellenwert überschritten wird.
  • Korrelation und Grundursache: Automatisierte Ereigniskorrelation, die den gesamten Kontext berücksichtigt, um innerhalb weniger Minuten wahrscheinliche Ursachen zu ermitteln – mit Konfidenzwerten und nachvollziehbarer Logik anstelle einer Vielzahl einzelner Warnmeldungen.
  • Automatisierte Fehlerbehebung: Reglementierte, auf Runbooks und Richtlinien basierende Automatisierung, die bewährte Korrekturmaßnahmen unmittelbar nach dem Auftreten eines Signals ausführt und dabei mit den Skripten, Playbooks und Tools arbeitet, die Sie bereits einsetzen.
Diagramm zur Veranschaulichung des Prozesses zur Vorbeugung von Vorfällen: Beobachtbarkeit, Ursachenanalyse und automatisierte Behebung

Erfahren Sie, warum die Vorbeugung von Vorfällen wichtig ist


Inwiefern unterscheidet sich die Vorbeugung von Vorfällen von der herkömmlichen Reaktion auf Vorfälle?

Herkömmliche IT-Betriebsabläufe werden anhand der MTTR bewertet, d. h. danach, wie schnell Sie nach dem Auftreten eines Vorfalls den Normalbetrieb wiederherstellen können. Das ist die falsche Vorgehensweise, sobald eine Plattform erkennen kann, wie sich bestimmte Situationen entwickeln, innerhalb weniger Minuten einen hinreichenden Verdacht benennen und im Rahmen der Governance entsprechend handeln kann. Bei der Vorbeugung von Vorfällen geht es nicht mehr darum, wie schnell Sie Probleme beheben, sondern darum, wie viele Vorfälle und wie viele Stunden in der Krisenzentrale Sie von vornherein vermeiden können.

Traditionelle Reaktion Prävention von Zwischenfällen
Erkennung nach einem Ausfall Erkennen, bevor es zum Aufprall kommt
Schwerpunkt MTTR Schwerpunkt auf der Vermeidung von Zwischenfällen
Reaktiv Proaktiv
Manuelle Untersuchung KI-gestützte Korrelation

Welche Rolle spielt künstliche Intelligenz bei der Vorbeugung von Vorfällen?

Künstliche Intelligenz durchdringt alle Ebenen der Vorfallprävention, wobei ihre Rolle je nach Funktionsbereich unterschiedlich ist.

  • Erkennung: Modelle des maschinellen Lernens weisen auf Anomalien hin und verknüpfen damit zusammenhängende Ereignisse zu einem Gesamtbild, wodurch sich abzeichnende Probleme erkannt werden, bevor ein Schwellenwert überschritten wird.
  • Diagnose: Die KI wertet Topologie, aktuelle Änderungen und Telemetriedaten aus, um die wahrscheinliche Grundursache zu ermitteln, häufig mit einem Konfidenzwert, den ein Bediener hinterfragen und verfeinern kann.
  • Lösung: KI kann eine Diagnose mit Automatisierungsmaßnahmen verknüpfen und dabei Abhilfemaßnahmen ermitteln oder erstellen. Die meisten Organisationen beziehen in dieser Phase weiterhin einen Menschen mit ein und erweitern die Autonomie in dem Maße, wie das Vertrauen in das System wächst.

Der Reifegrad variiert erheblich zwischen den verschiedenen Plattformen, und selbst innerhalb einer bestimmten Plattform sind KI-gestützte Diagnose und Problemlösung in der Regel weiter fortgeschritten als die vollständig autonome Erkennung von Problemen, die noch keinen Alarm ausgelöst haben.


Warum spielt das Netzwerk bei der Vorbeugung von Vorfällen eine Rolle?

Ein großer Teil der Vorfälle hat seinen Ursprung im Netzwerk oder läuft über dieses, und eine Ursachenanalyse muss eine Transaktion von Anfang bis Ende nachverfolgen, um aussagekräftig zu sein. Damit wird das Netzwerk zu einer grundlegenden Komponente und nicht zu einem nachrangigen Aspekt hinter Anwendungen und Infrastruktur.

Dies ist insbesondere auch für die Ebene der automatisierten Problemlösung von Bedeutung. Eine sichere automatisierte Fehlerbehebung hängt von Funktionen wie Verifizierung, Rollback, Richtlinienvorgaben, Behebung von Abweichungen und der Erstellung von Änderungsplänen ab – allesamt Funktionen, die Teil der Netzwerkautomatisierung sind. Gartners „Hype Cycle“ für SRE betrachtet den agentenbasierten Netzwerkbetrieb als Erweiterung der Netzwerkautomatisierung und nicht als deren Ersatz, und die dort genannten Umsetzungskriterien beziehen sich direkt auf eben diese Fähigkeiten. Einfach ausgedrückt: Die KI steht für das logische Denken; die Netzwerkautomatisierung ermöglicht es ihr, sicher zu handeln.


Vor welchen Herausforderungen stehen Unternehmen beim Aufbau von Maßnahmen zur Vorbeugung von Vorfällen?

  • Fragmentierte Daten: Anwendungs-, Infrastruktur- und Netzwerktelemetriedaten werden häufig in separaten Tools erfasst, ohne dass ein gemeinsamer Kontext besteht.
  • Veraltete Service-Datensätze: Eine manuell gepflegte CMDB ist in dem Moment veraltet, in dem sich die Umgebung ändert, was alles untergräbt, was darauf aufbaut.
  • Alarmmüdigkeit: Ohne eine Priorisierung, die sich an den geschäftlichen Auswirkungen orientiert, gehen die Teams im Informationsrauschen unter, noch bevor sie auf das Wesentliche reagieren können.
  • Vertrauen in die Automatisierung gewinnen: Teams möchten verständlicherweise zunächst sicherstellen, dass die Automatisierung korrekt und vorhersehbar funktioniert, bevor sie den Umfang der Aufgaben erweitern, die sie eigenständig ausführen darf.

Unternehmen, die diesen Ansatz gut umsetzen, beginnen in der Regel mit der Grundlage (einem aktuellen, zuverlässigen Servicemodell), bevor sie Automatisierungsebenen hinzufügen; sie beziehen den Menschen weiterhin in den Prozess ein, wenn der Umfang der Automatisierung zunimmt, und wählen Tools, die sich in ihre bestehenden Systeme integrieren lassen, anstatt eine vollständige Erneuerung zu erfordern.


Inwiefern kann OpenText zur Vorbeugung von Vorfällen beitragen?

OpenText deckt bereits heute alle vier Ebenen der Vorfallprävention ab, was durch Kundenergebnisse in der Telekommunikationsbranche, im Finanzdienstleistungssektor und in anderen Branchen belegt wird.

  • OpenText™ AI Operations Management vereint Observability, Korrelation und kontrollierte Automatisierung über Anwendungen, Infrastruktur und das Netzwerk hinweg.
  • OpenText™ Network Observability bindet das Netzwerk in dasselbe korrelierte Gesamtbild ein, da Konnektivitätsprobleme und durch Änderungen verursachte Ausfälle einen großen Anteil an den tatsächlichen Ausfällen ausmachen.
  • OpenText™ Automation Center führt kontrollierte Korrekturmaßnahmen durch und verbindet so die Diagnose mit dem entsprechenden Handeln.

Wie können wir behilflich sein?

Fußnoten