Saltar para o conteúdo

Use Case

Quem está a adulterar os seus contadores? Detecção de fraude em Utilities

Kelwin · 19 de junho de 2020

A adulteração de contadores é uma ameaça comum para o lado empresarial dos serviços de utilities e representa um risco de segurança pública, comportando alterações descontroladas que podem aumentar o risco de acidentes. Por isso, a detecção de fraude é fundamental para qualquer empresa de serviços de utilities.

A presença de utilizadores que manipulam a rede traduz-se tipicamente num aumento do preço do serviço para os utilizadores que cumprem as regras, uma vez que para a sustentabilidade dos serviços, os utilizadores restantes absorvem os custos adicionais da carga para além dos custos dos procedimentos de inspeção associados à identificação de tais fraudes.

Este artigo apresenta um dos nossos anteriores projetos de IA sobre detecção de adulteração de contadores de água. No entanto, pode ser utilizado de forma intercambiável noutros tipos de serviços como eletricidade, gás e televisão. O desafio que enfrentámos foi identificar utilizadores com elevada probabilidade de adulteração de contadores.

Pretende discutir melhor esta ideia?

Marque uma reunião com Kelwin Fernandes

Conheça Kelwin Saiba Mais

Modelar detecção de fraude para serviços de utilities

A primeira questão que enfrentámos foi a fiabilidade das nossas etiquetas. Embora tivéssemos os resultados das inspeções anteriores (legal ou fraude), as inspeções com resultado legal podem, em alguns casos, resultar de subornos. Portanto, enquanto pode confiar nas etiquetas positivas de fraude, os casos negativos são uma mistura de casos realmente legais e corrupção em si. Outra fonte de erro nas observações legais são as adulterações difíceis de detectar, por exemplo, nos casos em que a fraude não era diretamente no contador, mas no contorno do sistema num ponto oculto diferente da rede.

Podemos modelar esta tarefa de aprendizagem com múltiplos paradigmas.

  1. Neste desafio, a maioria das casas não terá inspeções. Como pode utilizar estes dados? Talvez considere-os como negativos para treino, com o cuidado de não introduzir demasiado ruído de fraude oculta, ou pode utilizar aprendizagem semi-supervisionada para regularizar o modelo com estes dados (aqui).
  2. Também discutimos como abordar esta tarefa com Positive Unlabeled learning num anterior artigo de blog (aqui).
  3. Uma vez que neste caso temos acesso ao conjunto de teste, técnicas de Transductive Learning podem ter um papel a desempenhar. Se não sabe o que é Transductive Learning, dedique tempo a aprender sobre isto, as probabilidades são de que possa beneficiar (aqui).

Por fim, este problema tende a ser extremamente desequilibrado. Observe um dos nossos anteriores estudos sobre como reformular desequilíbrio de classes como tarefas de ranking (aqui) que pode ser combinado com qualquer uma das soluções mencionadas acima.

Curso

The Machine Learning Spectrum

Domine muitas destas técnicas de modelagem de ML agora!

Saiba Mais

Os Dados e Alguns Padrões Relevantes para Detecção de Fraude

Treinámos os nossos modelos combinando três categorias de dados: dados contratuais, de consumo e contextuais.

Contratuais:

Incluímos informação sobre:

  1. Categoria de contrato: residencial vs. industrial, dupla tarifa vs. tarifa fixa, capacidade contratada, dados demográficos no contrato (por exemplo, tamanho da casa, tamanho da família, etc.).
  2. A vítima em si – o contador potencialmente adulterado: marca, modelo, capacidade, especificações técnicas, etc. Estas características revelaram ser especialmente valiosas quando combinadas com dados contextuais (discutiremos isto mais adiante).

Embora algumas características como o código postal e a capacidade de rendimento da casa possam estar correlacionadas com fraude, devemos ter isto com ressalva uma vez que podemos estar a aumentar enviesamento e injustiça na tomada de decisão (consulte este livro).

Consumo:

A adulteração de contadores está frequentemente associada a quedas dramáticas de consumo. Por isso, extraímos características do consumo agregado ao longo do tempo. Uma vez que o consumo é sazonal e varia de casa para casa, é essencial considerar valores relativos em vez de absolutos. Por exemplo, deve observar a variação percentual de utilização entre meses em vez da diferença absoluta. Também normalizámos estas características em relação à tendência global entre dois meses quaisquer para compensar a sazonalidade.

Outros padrões correlacionados com fraude que encontrámos foram consumo com baixa variabilidade entre meses (ou seja, o desvio padrão do consumo ser demasiado pequeno) e despesa "limitada" (ou seja, durante o último ano, o valor máximo repete-se múltiplas vezes).

Contextuais:

Os dados contextuais revelaram ser os mais importantes. A adulteração de contadores é como um vírus e espalha-se entre vizinhos, especialmente entre vizinhos com o mesmo modelo/marca de contador. Por isso, extraímos informação como a densidade de fraude (recente) dentro de K metros (para múltiplos valores de K) com e sem estratificação por modelo de contador. Por favor, preste atenção à nossa ênfase em densidade e não num número. Neste projeto, relativizar características ao contexto local do indivíduo e da região foi crítico para aprender de forma eficiente. Se não sabe qual é a densidade de uma área (bastante comum em países com dados abertos escassos), considere ativos internos como o número de contratos que tem na região e a densidade dos seus ativos internos (por exemplo, tubagens) como um proxy para densidade.

Estimativa fiável do desempenho do modelo

Quando tempo e espaço fazem parte do nosso sistema de aprendizagem, devemos estar atentos à forma como dividimos os nossos dados para estimativa de desempenho. Divisões aleatórias tenderão a "vazar" informação no treino, dando sobrestimações do desempenho do modelo. Neste caso, sugerimos dividir tanto temporal como geograficamente, tal como ilustrado no gráfico seguinte.

Outras variáveis a considerar para divisão entre treino e teste podem ser rondas de inspeção, equipa de inspeção, entre outras. A divisão correta e a sua granularidade (por exemplo, divisão entre meses/anos, cidade/distrito/região) dependem dos requisitos empresariais e da forma como pretendemos implementar os nossos modelos.

Como utilizar estas previsões?

As previsões por si só não são úteis. Precisamos de as combinar com um processo de decisão considerando um KPI. Neste caso, poderíamos utilizar a informação adicional para detecção de fraude para construir agendas e rotas de inspeção cost-effective, encontrando o equilíbrio adequado entre o benefício esperado obtido pela inspeção de uma casa versus o custo de tal inspeção. Abrangeremos este tópico num artigo de blog diferente.

Curso, Templates

Data Ignite

Aprenda como criar soluções valiosas de IA, desde previsões até ações.

Saiba Mais

Outros casos de uso no setor para além da detecção de fraude

Discutimos aqui como detectar fraude de contador de água. No entanto, o setor de utilities é um vasto campo para a aplicação de IA, desde a determinação de regiões com elevado potencial de aquisição de clientes, previsão de abandono de clientes, detecção de anomalias na rede, entre outros. Se pretende explorar qualquer uma destas ideias, apenas nos contacte!