Energía solar / Energía renovable

/

Enact Systems Inc.

Energía solar / Energía renovable

Cómo Enact Systems está automatizando la detección de fallos en equipos solares en AWS

98.77%

Recuperación frente a fallos confirmados en 3,7 millones de registros

100%

Detección de ambos fallos de inversor confirmados, frente al 9 % anterior

80%

Tasa de falsos positivos previa resuelta mediante clasificación LLM

Cliente

Enact Systems Inc.

Ubicación

San Ramon, California

Industria

Energía solar / Energía renovable

Servicios y tecnología

DynamoDB, Amazon Kinesis Data Streams, Amazon Kinesis Firehose, AWS Glue, Amazon S3, Amazon SageMaker, Amazon Bedrock, AWS Lambda, AWS Step Functions, Amazon EventBridge, Amazon RDS, Amazon SNS, AWS Secrets Manager, Terraform

Resumen del proyecto

Enact Systems opera una plataforma de gestión de activos y rendimiento solar que da servicio a miles de instalaciones residenciales y comerciales en Estados Unidos. Los fallos de equipos se identificaban de forma reactiva mediante tickets de atención al cliente, creando un ciclo de alertas falsas, clasificación lenta y pérdida de ingresos. Avahi diseñó e implementó una plataforma de mantenimiento predictivo nativa en la nube en AWS que utiliza modelado estadístico de Teoría de Valores Extremos combinado con clasificación basada en LLM para detectar automáticamente instalaciones con bajo rendimiento, clasificarlas por gravedad y distinguir fallos reales de hardware de lagunas en la comunicación de datos. La solución alcanzó un 98,77 % de recuperación frente a fallos confirmados y resolvió una tasa de falsos positivos del 80 % que había hecho que el sistema de alertas anterior fuera operativamente inutilizable.

Acerca del cliente

Enact Systems es una empresa de tecnología de energía solar con sede en San Ramon, California. La compañía opera una plataforma que agrega telemetría en tiempo real de inversores, baterías y contadores de servicios públicos en miles de instalaciones solares residenciales y comerciales, proporcionando servicios de monitorización de rendimiento y gestión de activos a operadores de energía solar y equipos de servicio de campo.

El problema

Los sistemas de energía solar fallan de formas difíciles de detectar automáticamente. Una instalación puede experimentar una interrupción repentina del inversor, una disminución gradual de eficiencia durante meses o fallos intermitentes que aparecen y desaparecen. El equipo de operaciones de Enact dependía de que los clientes abrieran tickets de soporte antes de que comenzaran las investigaciones. Ese modelo reactivo significaba que los fallos reales pasaban desapercibidos durante semanas o meses, se enviaban técnicos a instalaciones sin ningún problema de hardware y se perdían sistemáticamente oportunidades de sustitución proactiva de equipos.

El desafío iba más allá del flujo de trabajo. Las reglas de umbral simples que el equipo había evaluado no podían distinguir un fallo genuino del inversor de una laguna de comunicación, un período en el que una instalación deja de transmitir datos debido a problemas de conectividad en lugar de daños en el equipo. El análisis interno mostró que el 80 % de las alertas generadas por un modelo de detección anterior eran lagunas de comunicación en lugar de fallos de hardware. Los fallos reales, por el contrario, se estaban pasando por alto: un evento confirmado de sustitución de inversor se había detectado solo durante el 9 % de su período de fallo antes de que la línea base móvil del modelo se contaminara por la interrupción prolongada, y un segundo fallo confirmado se pasó por alto por completo.

¿Por qué AWS?

Enact ya operaba su infraestructura de telemetría en AWS, con datos de inversores fluyendo hacia DynamoDB en intervalos de 15 minutos y cada hora. Construir la capa de mantenimiento predictivo de forma nativa dentro de ese entorno permitió a Avahi conectarse directamente al pipeline de datos existente sin sobrecarga de replicación o migración. Amazon SageMaker proporcionó el entorno de computación gestionado para cargas de trabajo bayesianas MCMC estadísticamente intensivas a escala. Amazon Bedrock ofreció una ruta de integración directa para clasificación basada en LLM sin requerir una infraestructura de servicio de modelos separada. La orquestación basada en eventos mediante Amazon EventBridge, la transformación de datos escalable a través de AWS Glue y la captura en tiempo real mediante Amazon Kinesis hicieron posible automatizar el pipeline completo desde la ingesta diaria de telemetría hasta informes operativos priorizados.

Por qué Enact Systems eligió Avahi

Avahi aportó experiencia en el diseño de soluciones de ML e IA de extremo a extremo en AWS para entornos complejos y ricos en datos. Enact necesitaba un socio que pudiera conectar el modelado estadístico riguroso sobre telemetría de series temporales con las restricciones prácticas de una operación de servicio de campo solar. La posición de Avahi como socio Premier de AWS proporcionó confianza en las decisiones arquitectónicas y en la capacidad del equipo para entregar un sistema automatizado listo para producción dentro del plazo del proyecto.

Solución

Avahi construyó un pipeline de detección y clasificación de tres capas completamente en AWS, diseñado para ejecutarse automáticamente con una cadencia diaria sin intervención manual.

La base es un modelo estadístico de Teoría de Valores Extremos (EVT) que calcula un umbral de anomalía específico para cada instalación solar. En lugar de comparar instalaciones con un promedio global, el modelo pregunta si una instalación determinada está produciendo significativamente menos que su propia línea base histórica, teniendo en cuenta las condiciones meteorológicas locales y los patrones estacionales. La estimación bayesiana MCMC calcula no solo dónde se sitúa el umbral sino cuán confiado está el modelo, dando a las instalaciones con historial limitado límites de incertidumbre apropiadamente más amplios y volviéndose más preciso a medida que se acumulan datos. El modelo prueba automáticamente cuatro configuraciones de covariables por instalación utilizando datos diarios de irradiancia solar y meteorológicos ingeridos desde la API NASA POWER, seleccionando el mejor ajuste mediante pruebas de razón de verosimilitud para que el umbral de cada instalación se adapte a su clima específico y comportamiento estacional.

EVT maneja anomalías de corta duración de forma efectiva, pero los fallos de equipos que duran 30 días o más exponen un punto ciego estructural: un promedio móvil entrenado en el período de fallo eventualmente trata la producción cercana a cero como normal, y la señal de detección se desvanece. Avahi resolvió esto con cuatro reglas de detección complementarias que operan contra una línea base estable de 90 días calculada solo a partir de días de producción saludable. Estas reglas se activan independientemente de la señal EVT y garantizan que las interrupciones prolongadas, la degradación gradual y las desconexiones completas se detecten durante todo el período de fallo, no solo al inicio.

La tercera capa utiliza Amazon Bedrock para invocar un modelo de lenguaje grande para cada racha de anomalías detectada. El modelo recibe el comportamiento de producción antes, durante y después de la racha junto con métricas de gravedad y duración, luego clasifica el evento en uno de ocho tipos de fallo y asigna un nivel de confianza. Lo más importante es que marca si el evento representa un fallo real de hardware o una laguna de comunicación, la distinción operativa que más necesita el equipo de servicio de campo. Este paso de clasificación preserva una alta recuperación en la capa de detección al tiempo que hace que las alertas sean accionables.

Cada día, el pipeline ingiere la última telemetría mediante Amazon Kinesis, transforma e ingenia características a través de trabajos de AWS Glue, ejecuta el pipeline de inferencia EVT en Amazon SageMaker y entrega una lista de instalaciones clasificada y puntuada por gravedad como informe Excel y PDF con alertas de Amazon SNS al equipo de operaciones.

Resultados clave

  • Modelos de detección de anomalías bayesianas EVT específicos por instalación que cubren las flotas de dispositivos Enphase y SolarEdge
  • Pipeline de inferencia diaria automatizado en Amazon SageMaker con programación de Amazon EventBridge
  • Sistema de detección de fallos complementario de cuatro reglas para interrupciones prolongadas y degradación gradual utilizando una línea base estable de 90 días
  • Clasificación de fallos basada en LLM mediante Amazon Bedrock, distinguiendo fallos de hardware de lagunas de comunicación en ocho categorías de fallo con puntuación de confianza
  • Puntuación de gravedad y priorización de instalaciones clasificadas combinando duración de anomalía, intensidad de desviación y pérdida de producción
  • Informes semanales automatizados en Excel y PDF con entrega de alertas de Amazon SNS al equipo de operaciones
  • Pipeline de ingesta meteorológica de la API NASA POWER orquestado mediante AWS Step Functions y AWS Glue
  • Documentación técnica completa y transferencia de conocimiento

Impacto del proyecto

La plataforma se validó frente a aproximadamente 3,7 millones de registros de producción históricos y dos eventos confirmados de sustitución de inversor. El enfoque combinado de EVT y reglas complementarias alcanzó un 98,77 % de recuperación frente a anomalías etiquetadas. Ambos fallos de inversor confirmados se detectaron durante el 100 % de sus períodos de fallo, uno de los cuales se había detectado previamente solo durante el 9 % de su duración y el otro se había pasado por alto por completo. La capa de clasificación LLM aborda directamente la tasa de falsos positivos anterior del 80 %, permitiendo al equipo de operaciones filtrar a eventos confirmados de fallo de hardware y priorizar por puntuación de gravedad antes de enviar el servicio de campo.

  • Recuperación del 98,77 % en aproximadamente 3,7 millones de registros de producción históricos
  • Detección del 100 % de ambos fallos de sustitución de inversor confirmados durante sus períodos de fallo completos (frente al 9 % y 0 % con el enfoque anterior)
  • Tasa de falsos positivos anterior del 80 % (48 de 60 instalaciones marcadas eran lagunas de comunicación) abordada mediante clasificación de rachas basada en LLM
  • Un fallo confirmado rastreado durante 263 días consecutivos con una caída de producción del 97,3 %, detectado desde la fecha exacta del registro de servicio

Su migración, sin riesgos

¿Va a dejar Azure o está planeando su propia migración de IA empresarial?

Avahi lleva a las empresas desde la idea hasta la producción en AWS en cuestión de semanas, no meses, con una paridad validada y transiciones sin tiempo de inactividad. Permítanos evaluar su proyecto.

Seguir leyendo

Más historias sobre sanidad y migración

Cómo Enact Systems está automatizando la detección de fallos en equipos solares en AWS

Cliente

Enact Systems Inc.

Ubicación

San Ramon, California

Industria

Energía solar / Energía renovable

Servicios y tecnología

DynamoDB, Amazon Kinesis Data Streams, Amazon Kinesis Firehose, AWS Glue, Amazon S3, Amazon SageMaker, Amazon Bedrock, AWS Lambda, AWS Step Functions, Amazon EventBridge, Amazon RDS, Amazon SNS, AWS Secrets Manager, Terraform

Resumen del proyecto

Enact Systems opera una plataforma de gestión de activos y rendimiento solar que da servicio a miles de instalaciones residenciales y comerciales en Estados Unidos. Los fallos de equipos se identificaban de forma reactiva mediante tickets de atención al cliente, creando un ciclo de alertas falsas, clasificación lenta y pérdida de ingresos. Avahi diseñó e implementó una plataforma de mantenimiento predictivo nativa en la nube en AWS que utiliza modelado estadístico de Teoría de Valores Extremos combinado con clasificación basada en LLM para detectar automáticamente instalaciones con bajo rendimiento, clasificarlas por gravedad y distinguir fallos reales de hardware de lagunas en la comunicación de datos. La solución alcanzó un 98,77 % de recuperación frente a fallos confirmados y resolvió una tasa de falsos positivos del 80 % que había hecho que el sistema de alertas anterior fuera operativamente inutilizable.

Acerca del cliente

Enact Systems es una empresa de tecnología de energía solar con sede en San Ramon, California. La compañía opera una plataforma que agrega telemetría en tiempo real de inversores, baterías y contadores de servicios públicos en miles de instalaciones solares residenciales y comerciales, proporcionando servicios de monitorización de rendimiento y gestión de activos a operadores de energía solar y equipos de servicio de campo.

El problema

Los sistemas de energía solar fallan de formas difíciles de detectar automáticamente. Una instalación puede experimentar una interrupción repentina del inversor, una disminución gradual de eficiencia durante meses o fallos intermitentes que aparecen y desaparecen. El equipo de operaciones de Enact dependía de que los clientes abrieran tickets de soporte antes de que comenzaran las investigaciones. Ese modelo reactivo significaba que los fallos reales pasaban desapercibidos durante semanas o meses, se enviaban técnicos a instalaciones sin ningún problema de hardware y se perdían sistemáticamente oportunidades de sustitución proactiva de equipos.

El desafío iba más allá del flujo de trabajo. Las reglas de umbral simples que el equipo había evaluado no podían distinguir un fallo genuino del inversor de una laguna de comunicación, un período en el que una instalación deja de transmitir datos debido a problemas de conectividad en lugar de daños en el equipo. El análisis interno mostró que el 80 % de las alertas generadas por un modelo de detección anterior eran lagunas de comunicación en lugar de fallos de hardware. Los fallos reales, por el contrario, se estaban pasando por alto: un evento confirmado de sustitución de inversor se había detectado solo durante el 9 % de su período de fallo antes de que la línea base móvil del modelo se contaminara por la interrupción prolongada, y un segundo fallo confirmado se pasó por alto por completo.

Por qué AWS

Enact ya operaba su infraestructura de telemetría en AWS, con datos de inversores fluyendo hacia DynamoDB en intervalos de 15 minutos y cada hora. Construir la capa de mantenimiento predictivo de forma nativa dentro de ese entorno permitió a Avahi conectarse directamente al pipeline de datos existente sin sobrecarga de replicación o migración. Amazon SageMaker proporcionó el entorno de computación gestionado para cargas de trabajo bayesianas MCMC estadísticamente intensivas a escala. Amazon Bedrock ofreció una ruta de integración directa para clasificación basada en LLM sin requerir una infraestructura de servicio de modelos separada. La orquestación basada en eventos mediante Amazon EventBridge, la transformación de datos escalable a través de AWS Glue y la captura en tiempo real mediante Amazon Kinesis hicieron posible automatizar el pipeline completo desde la ingesta diaria de telemetría hasta informes operativos priorizados.

Por qué Enact Systems eligió Avahi

Avahi aportó experiencia en el diseño de soluciones de ML e IA de extremo a extremo en AWS para entornos complejos y ricos en datos. Enact necesitaba un socio que pudiera conectar el modelado estadístico riguroso sobre telemetría de series temporales con las restricciones prácticas de una operación de servicio de campo solar. La posición de Avahi como socio Premier de AWS proporcionó confianza en las decisiones arquitectónicas y en la capacidad del equipo para entregar un sistema automatizado listo para producción dentro del plazo del proyecto.

Solución

Avahi construyó un pipeline de detección y clasificación de tres capas completamente en AWS, diseñado para ejecutarse automáticamente con una cadencia diaria sin intervención manual.

La base es un modelo estadístico de Teoría de Valores Extremos (EVT) que calcula un umbral de anomalía específico para cada instalación solar. En lugar de comparar instalaciones con un promedio global, el modelo pregunta si una instalación determinada está produciendo significativamente menos que su propia línea base histórica, teniendo en cuenta las condiciones meteorológicas locales y los patrones estacionales. La estimación bayesiana MCMC calcula no solo dónde se sitúa el umbral sino cuán confiado está el modelo, dando a las instalaciones con historial limitado límites de incertidumbre apropiadamente más amplios y volviéndose más preciso a medida que se acumulan datos. El modelo prueba automáticamente cuatro configuraciones de covariables por instalación utilizando datos diarios de irradiancia solar y meteorológicos ingeridos desde la API NASA POWER, seleccionando el mejor ajuste mediante pruebas de razón de verosimilitud para que el umbral de cada instalación se adapte a su clima específico y comportamiento estacional.

EVT maneja anomalías de corta duración de forma efectiva, pero los fallos de equipos que duran 30 días o más exponen un punto ciego estructural: un promedio móvil entrenado en el período de fallo eventualmente trata la producción cercana a cero como normal, y la señal de detección se desvanece. Avahi resolvió esto con cuatro reglas de detección complementarias que operan contra una línea base estable de 90 días calculada solo a partir de días de producción saludable. Estas reglas se activan independientemente de la señal EVT y garantizan que las interrupciones prolongadas, la degradación gradual y las desconexiones completas se detecten durante todo el período de fallo, no solo al inicio.

La tercera capa utiliza Amazon Bedrock para invocar un modelo de lenguaje grande para cada racha de anomalías detectada. El modelo recibe el comportamiento de producción antes, durante y después de la racha junto con métricas de gravedad y duración, luego clasifica el evento en uno de ocho tipos de fallo y asigna un nivel de confianza. Lo más importante es que marca si el evento representa un fallo real de hardware o una laguna de comunicación, la distinción operativa que más necesita el equipo de servicio de campo. Este paso de clasificación preserva una alta recuperación en la capa de detección al tiempo que hace que las alertas sean accionables.

Cada día, el pipeline ingiere la última telemetría mediante Amazon Kinesis, transforma e ingenia características a través de trabajos de AWS Glue, ejecuta el pipeline de inferencia EVT en Amazon SageMaker y entrega una lista de instalaciones clasificada y puntuada por gravedad como informe Excel y PDF con alertas de Amazon SNS al equipo de operaciones.

Resultados clave

  • Modelos de detección de anomalías bayesianas EVT específicos por instalación que cubren las flotas de dispositivos Enphase y SolarEdge
  • Pipeline de inferencia diaria automatizado en Amazon SageMaker con programación de Amazon EventBridge
  • Sistema de detección de fallos complementario de cuatro reglas para interrupciones prolongadas y degradación gradual utilizando una línea base estable de 90 días
  • Clasificación de fallos basada en LLM mediante Amazon Bedrock, distinguiendo fallos de hardware de lagunas de comunicación en ocho categorías de fallo con puntuación de confianza
  • Puntuación de gravedad y priorización de instalaciones clasificadas combinando duración de anomalía, intensidad de desviación y pérdida de producción
  • Informes semanales automatizados en Excel y PDF con entrega de alertas de Amazon SNS al equipo de operaciones
  • Pipeline de ingesta meteorológica de la API NASA POWER orquestado mediante AWS Step Functions y AWS Glue
  • Documentación técnica completa y transferencia de conocimiento

Impacto del proyecto

La plataforma se validó frente a aproximadamente 3,7 millones de registros de producción históricos y dos eventos confirmados de sustitución de inversor. El enfoque combinado de EVT y reglas complementarias alcanzó un 98,77 % de recuperación frente a anomalías etiquetadas. Ambos fallos de inversor confirmados se detectaron durante el 100 % de sus períodos de fallo, uno de los cuales se había detectado previamente solo durante el 9 % de su duración y el otro se había pasado por alto por completo. La capa de clasificación LLM aborda directamente la tasa de falsos positivos anterior del 80 %, permitiendo al equipo de operaciones filtrar a eventos confirmados de fallo de hardware y priorizar por puntuación de gravedad antes de enviar el servicio de campo.

  • Recuperación del 98,77 % en aproximadamente 3,7 millones de registros de producción históricos
  • Detección del 100 % de ambos fallos de sustitución de inversor confirmados durante sus períodos de fallo completos (frente al 9 % y 0 % con el enfoque anterior)
  • Tasa de falsos positivos anterior del 80 % (48 de 60 instalaciones marcadas eran lagunas de comunicación) abordada mediante clasificación de rachas basada en LLM
  • Un fallo confirmado rastreado durante 263 días consecutivos con una caída de producción del 97,3 %, detectado desde la fecha exacta del registro de servicio

¿Listo para transformar su negocio con la IA?

Exploremos juntos sus oportunidades de IA de alto impacto en una sesión gratuita