Página de inicio de OpenText.
Temas técnicos

¿En qué consiste la prevención de incidentes?

Descubra cómo AIOps y la observabilidad ayudan a los equipos de TI a prevenir incidentes, y no solo a reaccionar ante ellos

Descripción general

Concepto de transferencia de datos digitales con coloridos haces de luz de fibra óptica sobre un fondo de placa de circuito impreso de color azul oscuro

La prevención de incidentes consiste en utilizar la observabilidad, el contexto del servicio y la inteligencia artificial para evitar que los incidentes afecten a los usuarios, en lugar de resolverlos más rápidamente una vez que se han producido.

Se basa en cuatro capacidades, cada una de las cuales se asienta sobre la anterior:

  • Una imagen fiable de lo que hay en el entorno
  • Observabilidad centrada en lo que realmente importa
  • Análisis rápido de las causas fundamentales
  • Corrección automatizada regulada

Prevención de incidentes

¿Cuáles son las ventajas de la prevención de incidentes?

  • Reduzca el tiempo de inactividad y el tiempo medio de reparación (MTTR): detecte a tiempo los problemas de conformado y reduzca el tiempo dedicado a identificar la causa raíz.
  • Libere a su equipo: un menor número de salas de crisis y una menor correlación manual permiten que los ingenieros dediquen su tiempo a tareas de mayor valor en lugar de tener que estar persiguiendo alertas.
  • Refuerce su nivel de seguridad: el mismo contexto de cambios y configuraciones que agiliza el análisis de las causas raíz también permite detectar más rápidamente los cambios no autorizados o que entrañan riesgos.
  • Reforzar el cumplimiento normativo: los registros exhaustivos y las pistas de auditoría facilitan la demostración del control sobre los cambios e incidentes informáticos.
  • Reducir el coste de las interrupciones del servicio: un menor número de incidencias y de menor duración se traduce en un menor impacto en los ingresos y en menores costes de mano de obra no planificados.
  • Fomente la confianza en la automatización de forma gradual: la automatización controlada y con intervención humana se gana la confianza necesaria para ampliar la autonomía con el paso del tiempo.

¿Cuáles son las cuatro capas de prevención de incidentes?

La prevención no es una característica aislada. No se puede resolver automáticamente un problema sin conocer su causa probable. No es posible determinar una causa probable sin disponer de los datos de observabilidad adecuados. No se puede observar lo que es importante sin saber qué existe en su entorno y qué es lo que este sustenta. Cada capa da lugar a la siguiente.

  • Base de la veracidad: un mapa siempre actualizado y de fácil consulta de los servicios y sus dependencias en todas las aplicaciones, la infraestructura y la red, creado a partir de la detección y mantenido al día mediante inteligencia artificial, en lugar de un registro actualizado manualmente. Este modelo de servicio activo es la base sobre la que se sustenta todo lo demás.
  • Observabilidad priorizada e integrada: telemetría centrada en lo más importante, en función de qué activos dan soporte a qué servicios empresariales. Es aquí donde se detectan los problemas de conformación antes de que se alcance un umbral.
  • Correlación y causa raíz: Correlación automatizada de eventos que analiza el contexto completo para identificar la causa probable en cuestión de minutos, con puntuaciones de confianza y una lógica trazable, en lugar de una serie de alertas inconexas.
  • Resolución automatizada: automatización regulada mediante guías de procedimientos y basada en políticas que ejecuta medidas correctivas de eficacia probada en el momento en que aparece una señal, trabajando con los scripts, las guías de procedimientos y las herramientas que ya utiliza.
Diagrama que ilustra el proceso de prevención de incidentes: observabilidad, análisis de la causa raíz y corrección automatizada

Descubra por qué es importante la prevención de incidentes


¿En qué se diferencia la prevención de incidentes de la respuesta tradicional ante incidentes?

Las operaciones de TI tradicionales se evalúan en función del MTTR, es decir, la rapidez con la que se recupera el sistema una vez que se produce un incidente. Esa medida no es la adecuada cuando una plataforma es capaz de detectar situaciones que se están gestando, identificar la causa probable en cuestión de minutos y actuar en consecuencia, dentro del marco normativo. La prevención de incidentes cambia el criterio de evaluación: ya no se trata de la rapidez con la que se resuelve un problema, sino del número de incidentes y de horas de reunión de crisis que se evitan desde el principio.

Respuesta tradicional Prevención de incidentes
Detectar tras un fallo Detectar antes del impacto
Enfoque en el MTTR Enfoque en la prevención de incidentes
Reactivo Proactivo
Investigación manual Correlación asistida por IA

¿Qué papel desempeña la inteligencia artificial en la prevención de incidentes?

La inteligencia artificial está presente en todos los ámbitos de la prevención de incidentes, aunque su papel varía en función del ámbito concreto.

  • Detección: Los modelos de aprendizaje automático señalan las anomalías y correlacionan los eventos relacionados para ofrecer una visión global, detectando así los problemas incipientes antes de que se alcance un umbral de activación.
  • Diagnóstico: La IA analiza la topología, los cambios recientes y los datos de telemetría para identificar la causa raíz probable, a menudo con una puntuación de confianza que el operador puede cuestionar y perfeccionar.
  • Solución: La IA puede vincular un diagnóstico con la automatización, descubriendo o elaborando medidas correctivas. La mayoría de las organizaciones mantienen a una persona al tanto de lo que ocurre en esta fase, ampliando la autonomía a medida que crece la confianza en el sistema.

El grado de madurez varía considerablemente de una plataforma a otra, e incluso dentro de una misma plataforma, el diagnóstico y la resolución basados en la inteligencia artificial suelen estar más avanzados que la detección totalmente autónoma de problemas que aún no han activado ninguna alerta.


¿Por qué es importante la red en la prevención de incidentes?

Una gran parte de los incidentes se originan en la red o transitan por ella, y para que el análisis de la causa raíz sea fiable, debe seguir el recorrido de una transacción de principio a fin. Esto convierte a la red en un elemento fundamental, y no en un aspecto secundario respecto a las aplicaciones y la infraestructura.

Además, reviste especial importancia para la capa de resolución automatizada en concreto. Una corrección automatizada segura depende de la verificación, la reversión, los límites de las políticas, la corrección de desviaciones y la generación de planes de cambio, capacidades que forman parte de la automatización de redes. El «Hype Cycle» de Gartner para SRE define las operaciones de red proactivas como una mejora de la automatización de redes, más que como un sustituto de esta, y sus criterios de ejecución se corresponden directamente con estas mismas capacidades. En pocas palabras, la IA es el razonamiento; la automatización de la red es lo que le permite actuar de forma segura.


¿A qué retos se enfrentan las organizaciones a la hora de implantar medidas de prevención de incidentes?

  • Datos fragmentados: La telemetría de las aplicaciones, la infraestructura y la red suele encontrarse en herramientas independientes que carecen de un contexto común.
  • Registros de servicio obsoletos: una base de datos de gestión de configuraciones (CMDB) que se mantiene manualmente queda desactualizada en el momento en que cambia el entorno, lo que socava todo lo que se ha construido sobre ella.
  • Fatiga por alertas: si no se establecen prioridades en función del impacto en el negocio, los equipos se ven abrumados por el exceso de información antes de poder actuar sobre lo que realmente importa.
  • Ganarse la confianza en la automatización: Es lógico que los equipos quieran comprobar que la automatización funciona de forma correcta y predecible antes de ampliar el alcance de lo que puede hacer de forma autónoma.

Las organizaciones que gestionan este proceso de forma adecuada suelen partir de una base sólida (un modelo de servicio actualizado y fiable) antes de incorporar la automatización, mantienen la participación humana a medida que se amplía el alcance de la automatización y eligen herramientas que se integran con los sistemas que ya utilizan, en lugar de optar por una sustitución completa.


¿De qué manera puede OpenText contribuir a la prevención de incidentes?

OpenText ofrece actualmente las cuatro capas de prevención de incidentes, respaldadas por los resultados obtenidos por sus clientes en los sectores de las telecomunicaciones, los servicios financieros y otros sectores.

  • OpenText™ AI Operations Management unifica la observabilidad, la correlación y la automatización controlada en todas las aplicaciones, la infraestructura y la red.
  • La solución OpenText™ Network Observability integra la red en una visión global correlacionada, ya que la conectividad y los fallos provocados por cambios representan una gran parte de las interrupciones reales del servicio.
  • OpenText™ Automation Center lleva a cabo una corrección regulada, vinculando el diagnóstico con la acción.

Notas al pie