Use Case
¿Quién manipula tus contadores? Detección de fraude en servicios públicos
Kelwin · 19 de junio de 2020
La manipulación de contadores es una amenaza común para la sostenibilidad económica de los servicios públicos y un riesgo para la seguridad pública, generando ajustes incontrolados que pueden aumentar el riesgo de accidentes. Por lo tanto, la detección de fraude es fundamental para cualquier empresa de servicios públicos.
La presencia de usuarios que manipulan la red típicamente se traduce en un aumento del precio del servicio para los usuarios que cumplen, ya que para mantener la sostenibilidad del servicio, los usuarios restantes absorben los costes adicionales de carga más los costes de inspección asociados con la identificación de estos fraudes.
Este artículo presenta uno de nuestros proyectos de IA anteriores sobre detección de manipulación de contadores en servicios de agua. Sin embargo, puede aplicarse de manera similar en otros tipos de servicios como electricidad, gas y televisión. El desafío que enfrentamos fue identificar usuarios con alta probabilidad de manipulación de contadores.
¿Deseas profundizar en esta idea?
Reserva una reunión con Kelwin Fernandes
Conoce a Kelwin Más información
Modelado de detección de fraude en servicios públicos
El primer problema que enfrentamos fue la confiabilidad de nuestras etiquetas. Si bien teníamos los resultados de inspecciones previas (legales o fraude), las inspecciones con resultado legal podrían resultar, en algunos casos, de sobornos. Por lo tanto, aunque puedas confiar en las etiquetas positivas de fraude, los casos negativos son una mezcla de casos legales reales y corrupción en sí misma. Otra fuente de error en las observaciones legales son las manipulaciones difíciles de detectar, por ejemplo, cuando el fraude no estaba directamente en el contador sino en el desvío del sistema en un punto diferente y oculto de la red.
Podemos modelar esta tarea de aprendizaje con múltiples enfoques.
- En este desafío, la mayoría de las viviendas no tendrán inspecciones. ¿Cómo puedes utilizar estos datos? Podrías considerarlos como negativos para entrenamiento, con la precaución de no introducir demasiado ruido proveniente de fraude oculto, o puedes usar aprendizaje semi-supervisado para regularizar el modelo con estos datos (aquí).
- También discutimos cómo abordar esta tarea con aprendizaje Positive Unlabeled en nuestro post anterior (aquí).
- Dado que en este caso tenemos acceso al conjunto de prueba, las técnicas de Transductive Learning pueden jugar un papel importante. Si no sabes qué es Transductive Learning, tómate tiempo para leer sobre ello, es probable que puedas beneficiarte (aquí).
Finalmente, este problema tiende a ser extremadamente desbalanceado. Consulta uno de nuestros trabajos anteriores sobre cómo reformular el desbalance de clases como tareas de ranking (aquí), que puede combinarse con cualquiera de las soluciones mencionadas anteriormente.
Curso
The Machine Learning Spectrum
¡Domina muchas de estas técnicas de modelado de ML ahora!
Los datos y patrones relevantes para la detección de fraude
Entrenamos nuestros modelos combinando tres categorías de datos: datos contractuales, de consumo y contextuales.
Contractuales:
Incluimos información sobre:
- Categoría del contrato: residencial vs. industrial, tarifa dual vs. tarifa fija, capacidad contratada, datos demográficos en el contrato (por ejemplo, tamaño de la vivienda, tamaño de la familia, etc.).
- El elemento afectado, el contador potencialmente manipulado: marca, modelo, capacidad, especificaciones técnicas, etc. Estas características demostraron ser especialmente valiosas cuando se combinaban con datos contextuales (lo discutiremos más adelante).
Aunque algunas características como el código postal y la capacidad de ingresos de la vivienda pueden estar correlacionadas con fraude, deberíamos tomar esto con prudencia ya que podríamos estar aumentando el sesgo e injusticia en la toma de decisiones (consulta este libro).
Consumo:
La manipulación de contadores a menudo se asocia con caídas dramáticas del consumo. Por lo tanto, extrajimos características del consumo agregado a lo largo del tiempo. Dado que el consumo es estacional y varía de una vivienda a otra, es esencial considerar valores relativos en lugar de absolutos. Por ejemplo, deberías observar el cambio porcentual en el uso entre meses en lugar de la diferencia absoluta. También normalizamos estas características con respecto a la tendencia global entre dos meses cualesquiera para compensar la estacionalidad.
Otros patrones correlacionados con fraude que encontramos fueron consumo con baja variabilidad intermensual (es decir, la desviación estándar del consumo siendo demasiado pequeña) y gasto "limitado" (es decir, durante el último año, el valor máximo se repite varias veces).
Contextual:
Los datos contextuales resultaron ser los más importantes. La manipulación de contadores es como un virus y se propaga entre vecinos, especialmente entre vecinos con el mismo modelo/marca de contador. Por lo tanto, extrajimos información como la densidad de fraude (reciente) dentro de K metros (para múltiples valores de K) con y sin estratificación por modelo de contador. Por favor, presta atención a nuestro énfasis en densidad y no en un número. En este proyecto, relativizar características al contexto local del individuo y la región fue crítico para aprender de manera eficiente. Si no sabes cuál es la densidad de una área (bastante común en países con datos abiertos escasos), considera activos internos como el número de contratos que tienes en la región y la densidad de tus activos internos (por ejemplo, tuberías) como proxy para la densidad.
Estimación confiable del desempeño del modelo
Cuando el tiempo y el espacio forman parte de nuestro sistema de aprendizaje, debemos prestar atención a la forma en que dividimos nuestros datos para la estimación del desempeño. Las divisiones aleatorias tenderán a "filtrar" información en el entrenamiento, lo que sobrestima el desempeño del modelo. En este caso, sugerimos dividir tanto temporal como geográficamente, como se ilustra en el siguiente gráfico.
Otras variables a considerar para dividir entrenamiento y prueba podrían ser las rondas de inspección, el equipo de inspección, entre otros. La división correcta y su granularidad (por ejemplo, división entre meses/años, ciudad/distrito/región) dependen de los requisitos empresariales y de cómo pretendemos desplegar nuestros modelos.
Cómo utilizar estas predicciones
Las predicciones por sí solas no son útiles. Necesitamos combinarlas con un proceso de decisión que considere un KPI. En este caso, podríamos utilizar la información adicional de detección de fraude para construir horarios e itinerarios de inspección rentables, encontrando el equilibrio adecuado entre el beneficio esperado obtenido al inspeccionar una vivienda versus el coste de esa inspección. Cubriremos este tema en un post diferente.
Curso, Plantillas
Data Ignite
Aprende cómo crear soluciones valiosas de IA, desde predicciones hasta acciones.
Otros casos de uso en la industria más allá de la detección de fraude
Aquí discutimos cómo detectar fraude en contadores de agua. Sin embargo, la industria de servicios públicos es un campo vasto para la aplicación de IA, desde la determinación de regiones con alto potencial de valor en la adquisición de clientes, predicción de abandonos, detección de anomalías en la red, entre otros. Si deseas explorar alguna de estas ideas, ¡simplemente envíanos un mensaje!
