Recuperación frente a fallos confirmados en 3,7 millones de registros
Detección de ambos fallos de inversor confirmados, frente al 9 % anterior
Tasa de falsos positivos previa resuelta mediante clasificación LLM
Enact Systems Inc.
San Ramon, California
Energía solar / Energía renovable
DynamoDB, Amazon Kinesis Data Streams, Amazon Kinesis Firehose, AWS Glue, Amazon S3, Amazon SageMaker, Amazon Bedrock, AWS Lambda, AWS Step Functions, Amazon EventBridge, Amazon RDS, Amazon SNS, AWS Secrets Manager, Terraform
Enact Systems opera una plataforma de gestión de activos y rendimiento solar que da servicio a miles de instalaciones residenciales y comerciales en Estados Unidos. Los fallos de equipos se identificaban de forma reactiva mediante tickets de atención al cliente, creando un ciclo de alertas falsas, clasificación lenta y pérdida de ingresos. Avahi diseñó e implementó una plataforma de mantenimiento predictivo nativa en la nube en AWS que utiliza modelado estadístico de Teoría de Valores Extremos combinado con clasificación basada en LLM para detectar automáticamente instalaciones con bajo rendimiento, clasificarlas por gravedad y distinguir fallos reales de hardware de lagunas en la comunicación de datos. La solución alcanzó un 98,77 % de recuperación frente a fallos confirmados y resolvió una tasa de falsos positivos del 80 % que había hecho que el sistema de alertas anterior fuera operativamente inutilizable.
Enact Systems es una empresa de tecnología de energía solar con sede en San Ramon, California. La compañía opera una plataforma que agrega telemetría en tiempo real de inversores, baterías y contadores de servicios públicos en miles de instalaciones solares residenciales y comerciales, proporcionando servicios de monitorización de rendimiento y gestión de activos a operadores de energía solar y equipos de servicio de campo.
Los sistemas de energía solar fallan de formas difíciles de detectar automáticamente. Una instalación puede experimentar una interrupción repentina del inversor, una disminución gradual de eficiencia durante meses o fallos intermitentes que aparecen y desaparecen. El equipo de operaciones de Enact dependía de que los clientes abrieran tickets de soporte antes de que comenzaran las investigaciones. Ese modelo reactivo significaba que los fallos reales pasaban desapercibidos durante semanas o meses, se enviaban técnicos a instalaciones sin ningún problema de hardware y se perdían sistemáticamente oportunidades de sustitución proactiva de equipos.
El desafío iba más allá del flujo de trabajo. Las reglas de umbral simples que el equipo había evaluado no podían distinguir un fallo genuino del inversor de una laguna de comunicación, un período en el que una instalación deja de transmitir datos debido a problemas de conectividad en lugar de daños en el equipo. El análisis interno mostró que el 80 % de las alertas generadas por un modelo de detección anterior eran lagunas de comunicación en lugar de fallos de hardware. Los fallos reales, por el contrario, se estaban pasando por alto: un evento confirmado de sustitución de inversor se había detectado solo durante el 9 % de su período de fallo antes de que la línea base móvil del modelo se contaminara por la interrupción prolongada, y un segundo fallo confirmado se pasó por alto por completo.
Enact ya operaba su infraestructura de telemetría en AWS, con datos de inversores fluyendo hacia DynamoDB en intervalos de 15 minutos y cada hora. Construir la capa de mantenimiento predictivo de forma nativa dentro de ese entorno permitió a Avahi conectarse directamente al pipeline de datos existente sin sobrecarga de replicación o migración. Amazon SageMaker proporcionó el entorno de computación gestionado para cargas de trabajo bayesianas MCMC estadísticamente intensivas a escala. Amazon Bedrock ofreció una ruta de integración directa para clasificación basada en LLM sin requerir una infraestructura de servicio de modelos separada. La orquestación basada en eventos mediante Amazon EventBridge, la transformación de datos escalable a través de AWS Glue y la captura en tiempo real mediante Amazon Kinesis hicieron posible automatizar el pipeline completo desde la ingesta diaria de telemetría hasta informes operativos priorizados.
Avahi aportó experiencia en el diseño de soluciones de ML e IA de extremo a extremo en AWS para entornos complejos y ricos en datos. Enact necesitaba un socio que pudiera conectar el modelado estadístico riguroso sobre telemetría de series temporales con las restricciones prácticas de una operación de servicio de campo solar. La posición de Avahi como socio Premier de AWS proporcionó confianza en las decisiones arquitectónicas y en la capacidad del equipo para entregar un sistema automatizado listo para producción dentro del plazo del proyecto.
Avahi construyó un pipeline de detección y clasificación de tres capas completamente en AWS, diseñado para ejecutarse automáticamente con una cadencia diaria sin intervención manual.
La base es un modelo estadístico de Teoría de Valores Extremos (EVT) que calcula un umbral de anomalía específico para cada instalación solar. En lugar de comparar instalaciones con un promedio global, el modelo pregunta si una instalación determinada está produciendo significativamente menos que su propia línea base histórica, teniendo en cuenta las condiciones meteorológicas locales y los patrones estacionales. La estimación bayesiana MCMC calcula no solo dónde se sitúa el umbral sino cuán confiado está el modelo, dando a las instalaciones con historial limitado límites de incertidumbre apropiadamente más amplios y volviéndose más preciso a medida que se acumulan datos. El modelo prueba automáticamente cuatro configuraciones de covariables por instalación utilizando datos diarios de irradiancia solar y meteorológicos ingeridos desde la API NASA POWER, seleccionando el mejor ajuste mediante pruebas de razón de verosimilitud para que el umbral de cada instalación se adapte a su clima específico y comportamiento estacional.
EVT maneja anomalías de corta duración de forma efectiva, pero los fallos de equipos que duran 30 días o más exponen un punto ciego estructural: un promedio móvil entrenado en el período de fallo eventualmente trata la producción cercana a cero como normal, y la señal de detección se desvanece. Avahi resolvió esto con cuatro reglas de detección complementarias que operan contra una línea base estable de 90 días calculada solo a partir de días de producción saludable. Estas reglas se activan independientemente de la señal EVT y garantizan que las interrupciones prolongadas, la degradación gradual y las desconexiones completas se detecten durante todo el período de fallo, no solo al inicio.
La tercera capa utiliza Amazon Bedrock para invocar un modelo de lenguaje grande para cada racha de anomalías detectada. El modelo recibe el comportamiento de producción antes, durante y después de la racha junto con métricas de gravedad y duración, luego clasifica el evento en uno de ocho tipos de fallo y asigna un nivel de confianza. Lo más importante es que marca si el evento representa un fallo real de hardware o una laguna de comunicación, la distinción operativa que más necesita el equipo de servicio de campo. Este paso de clasificación preserva una alta recuperación en la capa de detección al tiempo que hace que las alertas sean accionables.
Cada día, el pipeline ingiere la última telemetría mediante Amazon Kinesis, transforma e ingenia características a través de trabajos de AWS Glue, ejecuta el pipeline de inferencia EVT en Amazon SageMaker y entrega una lista de instalaciones clasificada y puntuada por gravedad como informe Excel y PDF con alertas de Amazon SNS al equipo de operaciones.
La plataforma se validó frente a aproximadamente 3,7 millones de registros de producción históricos y dos eventos confirmados de sustitución de inversor. El enfoque combinado de EVT y reglas complementarias alcanzó un 98,77 % de recuperación frente a anomalías etiquetadas. Ambos fallos de inversor confirmados se detectaron durante el 100 % de sus períodos de fallo, uno de los cuales se había detectado previamente solo durante el 9 % de su duración y el otro se había pasado por alto por completo. La capa de clasificación LLM aborda directamente la tasa de falsos positivos anterior del 80 %, permitiendo al equipo de operaciones filtrar a eventos confirmados de fallo de hardware y priorizar por puntuación de gravedad antes de enviar el servicio de campo.
Enact Systems Inc.
San Ramon, California
Energía solar / Energía renovable
DynamoDB, Amazon Kinesis Data Streams, Amazon Kinesis Firehose, AWS Glue, Amazon S3, Amazon SageMaker, Amazon Bedrock, AWS Lambda, AWS Step Functions, Amazon EventBridge, Amazon RDS, Amazon SNS, AWS Secrets Manager, Terraform
Enact Systems opera una plataforma de gestión de activos y rendimiento solar que da servicio a miles de instalaciones residenciales y comerciales en Estados Unidos. Los fallos de equipos se identificaban de forma reactiva mediante tickets de atención al cliente, creando un ciclo de alertas falsas, clasificación lenta y pérdida de ingresos. Avahi diseñó e implementó una plataforma de mantenimiento predictivo nativa en la nube en AWS que utiliza modelado estadístico de Teoría de Valores Extremos combinado con clasificación basada en LLM para detectar automáticamente instalaciones con bajo rendimiento, clasificarlas por gravedad y distinguir fallos reales de hardware de lagunas en la comunicación de datos. La solución alcanzó un 98,77 % de recuperación frente a fallos confirmados y resolvió una tasa de falsos positivos del 80 % que había hecho que el sistema de alertas anterior fuera operativamente inutilizable.
Enact Systems es una empresa de tecnología de energía solar con sede en San Ramon, California. La compañía opera una plataforma que agrega telemetría en tiempo real de inversores, baterías y contadores de servicios públicos en miles de instalaciones solares residenciales y comerciales, proporcionando servicios de monitorización de rendimiento y gestión de activos a operadores de energía solar y equipos de servicio de campo.
Los sistemas de energía solar fallan de formas difíciles de detectar automáticamente. Una instalación puede experimentar una interrupción repentina del inversor, una disminución gradual de eficiencia durante meses o fallos intermitentes que aparecen y desaparecen. El equipo de operaciones de Enact dependía de que los clientes abrieran tickets de soporte antes de que comenzaran las investigaciones. Ese modelo reactivo significaba que los fallos reales pasaban desapercibidos durante semanas o meses, se enviaban técnicos a instalaciones sin ningún problema de hardware y se perdían sistemáticamente oportunidades de sustitución proactiva de equipos.
El desafío iba más allá del flujo de trabajo. Las reglas de umbral simples que el equipo había evaluado no podían distinguir un fallo genuino del inversor de una laguna de comunicación, un período en el que una instalación deja de transmitir datos debido a problemas de conectividad en lugar de daños en el equipo. El análisis interno mostró que el 80 % de las alertas generadas por un modelo de detección anterior eran lagunas de comunicación en lugar de fallos de hardware. Los fallos reales, por el contrario, se estaban pasando por alto: un evento confirmado de sustitución de inversor se había detectado solo durante el 9 % de su período de fallo antes de que la línea base móvil del modelo se contaminara por la interrupción prolongada, y un segundo fallo confirmado se pasó por alto por completo.
Enact ya operaba su infraestructura de telemetría en AWS, con datos de inversores fluyendo hacia DynamoDB en intervalos de 15 minutos y cada hora. Construir la capa de mantenimiento predictivo de forma nativa dentro de ese entorno permitió a Avahi conectarse directamente al pipeline de datos existente sin sobrecarga de replicación o migración. Amazon SageMaker proporcionó el entorno de computación gestionado para cargas de trabajo bayesianas MCMC estadísticamente intensivas a escala. Amazon Bedrock ofreció una ruta de integración directa para clasificación basada en LLM sin requerir una infraestructura de servicio de modelos separada. La orquestación basada en eventos mediante Amazon EventBridge, la transformación de datos escalable a través de AWS Glue y la captura en tiempo real mediante Amazon Kinesis hicieron posible automatizar el pipeline completo desde la ingesta diaria de telemetría hasta informes operativos priorizados.
Avahi aportó experiencia en el diseño de soluciones de ML e IA de extremo a extremo en AWS para entornos complejos y ricos en datos. Enact necesitaba un socio que pudiera conectar el modelado estadístico riguroso sobre telemetría de series temporales con las restricciones prácticas de una operación de servicio de campo solar. La posición de Avahi como socio Premier de AWS proporcionó confianza en las decisiones arquitectónicas y en la capacidad del equipo para entregar un sistema automatizado listo para producción dentro del plazo del proyecto.
Avahi construyó un pipeline de detección y clasificación de tres capas completamente en AWS, diseñado para ejecutarse automáticamente con una cadencia diaria sin intervención manual.
La base es un modelo estadístico de Teoría de Valores Extremos (EVT) que calcula un umbral de anomalía específico para cada instalación solar. En lugar de comparar instalaciones con un promedio global, el modelo pregunta si una instalación determinada está produciendo significativamente menos que su propia línea base histórica, teniendo en cuenta las condiciones meteorológicas locales y los patrones estacionales. La estimación bayesiana MCMC calcula no solo dónde se sitúa el umbral sino cuán confiado está el modelo, dando a las instalaciones con historial limitado límites de incertidumbre apropiadamente más amplios y volviéndose más preciso a medida que se acumulan datos. El modelo prueba automáticamente cuatro configuraciones de covariables por instalación utilizando datos diarios de irradiancia solar y meteorológicos ingeridos desde la API NASA POWER, seleccionando el mejor ajuste mediante pruebas de razón de verosimilitud para que el umbral de cada instalación se adapte a su clima específico y comportamiento estacional.
EVT maneja anomalías de corta duración de forma efectiva, pero los fallos de equipos que duran 30 días o más exponen un punto ciego estructural: un promedio móvil entrenado en el período de fallo eventualmente trata la producción cercana a cero como normal, y la señal de detección se desvanece. Avahi resolvió esto con cuatro reglas de detección complementarias que operan contra una línea base estable de 90 días calculada solo a partir de días de producción saludable. Estas reglas se activan independientemente de la señal EVT y garantizan que las interrupciones prolongadas, la degradación gradual y las desconexiones completas se detecten durante todo el período de fallo, no solo al inicio.
La tercera capa utiliza Amazon Bedrock para invocar un modelo de lenguaje grande para cada racha de anomalías detectada. El modelo recibe el comportamiento de producción antes, durante y después de la racha junto con métricas de gravedad y duración, luego clasifica el evento en uno de ocho tipos de fallo y asigna un nivel de confianza. Lo más importante es que marca si el evento representa un fallo real de hardware o una laguna de comunicación, la distinción operativa que más necesita el equipo de servicio de campo. Este paso de clasificación preserva una alta recuperación en la capa de detección al tiempo que hace que las alertas sean accionables.
Cada día, el pipeline ingiere la última telemetría mediante Amazon Kinesis, transforma e ingenia características a través de trabajos de AWS Glue, ejecuta el pipeline de inferencia EVT en Amazon SageMaker y entrega una lista de instalaciones clasificada y puntuada por gravedad como informe Excel y PDF con alertas de Amazon SNS al equipo de operaciones.
La plataforma se validó frente a aproximadamente 3,7 millones de registros de producción históricos y dos eventos confirmados de sustitución de inversor. El enfoque combinado de EVT y reglas complementarias alcanzó un 98,77 % de recuperación frente a anomalías etiquetadas. Ambos fallos de inversor confirmados se detectaron durante el 100 % de sus períodos de fallo, uno de los cuales se había detectado previamente solo durante el 9 % de su duración y el otro se había pasado por alto por completo. La capa de clasificación LLM aborda directamente la tasa de falsos positivos anterior del 80 %, permitiendo al equipo de operaciones filtrar a eventos confirmados de fallo de hardware y priorizar por puntuación de gravedad antes de enviar el servicio de campo.
Exploremos juntos sus oportunidades de IA de alto impacto en una sesión gratuita