Detección de anomalías multivariante en Microsoft Fabric: información general

¿Qué es la detección de anomalías multivariante?

Detección de anomalías univariante, que implementa la función KQL series_decompose_anomalies(), supervisa y detecta anomalías en una sola variable a lo largo del tiempo. La detección de anomalías multivariante amplía este enfoque mediante la detección de anomalías en la distribución conjunta de varias variables a lo largo del tiempo, lo que significa que analiza cómo se relacionan las variables y se influyen entre sí como un grupo, en lugar de examinar cada variable de forma aislada. La detección de anomalías multivariante es útil para supervisar el estado de sistemas IoT complejos, detectar fraudes en transacciones financieras e identificar patrones inusuales en el tráfico de red.

Por ejemplo, considere un sistema que supervisa el rendimiento de una flota de vehículos. El sistema recopila datos sobre varias métricas, como la velocidad, el consumo de combustible y la temperatura del motor. Al analizar estas métricas juntas, el sistema puede detectar anomalías que no serían aparentes mediante el análisis de cada métrica individualmente. Por sí solo, un aumento del consumo de combustible podría deberse a varias razones aceptables. Sin embargo, un aumento repentino del consumo de combustible combinado con una disminución en la temperatura del motor podría indicar un problema con el motor, incluso si cada métrica por sí misma está dentro de un intervalo normal.

¿Cómo puede detectar anomalías multivariante en Microsoft Fabric?

La detección de anomalías multivariante en Fabric aprovecha las ventajas de los potentes motores Spark y Eventhouse sobre una capa de almacenamiento persistente compartida. Los datos iniciales se pueden ingerir en un centro de eventos y exponerlos en OneLake. Después, el modelo de detección de anomalías se puede entrenar mediante el motor de Spark y las predicciones de anomalías en los nuevos datos de streaming se pueden realizar en tiempo real mediante el motor de Eventhouse. La interconexión de estos motores que pueden procesar los mismos datos en el almacenamiento compartido permite un flujo sin problemas de datos de la ingesta, a través del entrenamiento del modelo, a la predicción de anomalías. Este flujo de trabajo es sencillo y eficaz para la supervisión en tiempo real y la detección de anomalías en sistemas complejos.

Hay disponibles dos rutas de acceso de un extremo a otro y puede elegir en función de la complejidad de su escenario:

  • Detección de anomalías nativa de Eventhouse en datos en directo: ejecute la detección de anomalías directamente en los datos históricos y de streaming en tablas de Eventhouse, sin entrenamiento personalizado ni configuración del modelo. Comience con esta ruta de acceso cuando los modelos integrados satisfagan sus necesidades y desee la ruta de acceso más sencilla a la información.
  • Detección multivariante personalizada mediante un modelo entrenado en un cuaderno: Use el paquete de Python basado en GAT descrito en este artículo para entrenar un modelo personalizado en un cuaderno con datos históricos y, a continuación, evaluar nuevos datos de streaming en tiempo real a través de Eventhouse y KQL. Elija esta ruta de acceso cuando necesite un algoritmo personalizado o un escenario especializado que no cubran los modelos nativos.

Detección nativa de anomalías de Eventhouse

Eventhouse admite la detección de anomalías nativa en tablas dinámicas, por lo que puede analizar datos de streaming e históricos directamente sin mover datos ni entrenar un modelo personalizado. Use esta opción cuando necesite un inicio rápido con algoritmos integrados; Elija la ruta de acceso multivariante personalizada que sigue cuando necesite un algoritmo personalizado o una configuración especializada.

Componentes de la solución

Esta solución se basa en los siguientes componentes:

  • Centro de eventos: los datos se ingieren inicialmente en un centro de eventos, que es un motor de procesamiento de datos en tiempo real que puede controlar flujos de datos de alto rendimiento.
  • OneLake: los datos de Eventhouse se exponen en OneLake, que es una capa de almacenamiento persistente compartida que proporciona una vista unificada de los datos.
  • Paquete de detección de anomalías multivariante: la solución usa el paquete python time-series-anomaly-detector , implementando un algoritmo avanzado basado en una red de atención de grafos (GAT) que captura las correlaciones entre diferentes series temporales y detecta anomalías en tiempo real. El modelo GAT se entrena en datos históricos para aprender las relaciones entre diferentes series temporales. El modelo entrenado se puede aplicar para predecir anomalías en nuevos datos de streaming. Tenga en cuenta que este algoritmo es el que se utiliza en el servicio de detección de anomalías de IA que se va a retirar. Para obtener más información sobre el algoritmo, consulte el blog y el documento.
  • Cuadernos de Fabric: se usan para el entrenamiento fuera de línea del modelo de detección de anomalías con datos históricos y para almacenar el modelo entrenado en el registro de modelos de MLflow de Fabric. Los cuadernos admiten el uso de KQL, T-SQL, Python y Spark en la misma área de trabajo, lo que permite una exploración unificada, las transformaciones, el entrenamiento (para modelos personalizados) y la validación de las anomalías sobre los mismos datos respaldados por Eventhouse.
  • Conjunto de consultas KQL: se usa para la predicción en tiempo real de anomalías en los datos entrantes.
  • Extremo de análisis de SQL: expone una interfaz administrada de T-SQL alineada con el modelo de datos de Eventhouse. Puede consultar las anomalías detectadas y las métricas relacionadas mediante T-SQL para su análisis posterior e integración con herramientas de BI o de generación de informes bajo la gobernanza de Fabric.
  • Integración de agentes de datos: las anomalías detectadas en Eventhouse pueden ser consumidas por los agentes de datos de Fabric para razonar a partir de señales en directo e históricas. La combinación de la detección de anomalías con agentes de datos permite el análisis conversacional y los flujos de trabajo automatizados a través de los mismos datos de Eventhouse.

Paso siguiente