Saltar para o conteúdo

Technical

Deja de eliminar valores atípicos sin razón

Paulo Maia · 14 de noviembre de 2022

Los valores atípicos son puntos de datos que se destacan por ser diferentes del resto de la distribución de datos. Un valor atípico puede ser:

  • Un valor inusual en una variable
  • Un punto de datos distante del centroide de los datos
  • Un punto de datos en una región de baja densidad, pero entre áreas de alta densidad.

Supongamos que has estado trabajando en ciencia de datos. En ese caso, ya estás familiarizado con el concepto y probablemente hayas integrado diferentes métodos en tus pipelines para detectar, transformar o incluso eliminar valores atípicos de tus datos.

Si es así, ten cuidado. Los valores atípicos no respetan la distribución de los datos, por lo que no deberías pretender que lo hacen eliminando puntos de datos incómodos o transformando sus variables para que se acerquen más al resto de la distribución. Entiendo que necesites gestionarlos para evitar que valores sin sentido afecten a tu pipeline. Sin embargo, también puedes hacer que el modelo sepa que esos puntos de datos son valores atípicos en lugar de ignorar esa información. Las dos preguntas principales aquí son: ¿Por qué? y ¿Cómo?

¿Por qué? Porque nunca sabes la causa de un valor atípico. Puede representar un error en el proceso de adquisición de datos o una anomalía real en tu población. Esto es especialmente relevante cuando se trata de situaciones de Detección de Fraude, Mantenimiento Predictivo o Validación de Cumplimiento. En estos casos de uso, quieres detectar los valores inusuales (valores atípicos) para prevenir riesgos posteriores.

¿Cómo? Creando nuevas variables que representen qué tan inusual es un punto de datos. Si haces que esta información sea clara para el modelo, será capaz de detectar los valores atípicos por sí solo. Pero si los valores atípicos pueden tomar diferentes formas (como se ve en la figura anterior), ¿qué variables pueden representar su rareza? Encuentra la respuesta en la siguiente sección.

Variables para Valores Atípicos

Distancia de Mahalanobis

Puedes usar diferentes algoritmos de distancia para calcular cuánto se aleja un punto de datos del centroide. Recomendamos la distancia de Mahalanobis ya que es mejor para tratar valores atípicos multivariantes que resultan de combinaciones inusuales entre múltiples variables. Por ejemplo, considera estas tres variables: peso, altura y sexo. Una altura de 150 cm no es tan inusual para la población femenina portuguesa, y un peso de 90 kg no es infrecuente para los hombres portugueses. Sin embargo, una mujer portuguesa con 150 cm y 90 kg sería muy única.

Estimación de Densidad

Anteriormente vimos una variable que mide la distancia al centroide, pero ¿y si la distribución de datos tiene una forma como la de la figura siguiente?

En este caso, un valor atípico puede ser un punto de datos ubicado en regiones donde la distribución de densidad tiene una depresión, independientemente de la distancia al centroide. Así que una buena variable para representarlo sería la densidad de datos en la vecindad del punto de datos.

Puedes usar métodos como KDE (Kernel Density Estimation) para estimar la densidad. Sin embargo, este método puede ser demasiado costoso computacionalmente. Por eso proponemos un método más directo y económico: binning.

Hay dos formas de usar binning para estimar la distribución de densidad:

  • Usar bins con ancho igual: Divide los datos en bins de ancho igual y calcula la densidad de cada bin. Cuantos menos puntos tenga el bin, más normal será el punto de datos.
  • Usar bins con frecuencias iguales: Divide los datos en bins de igual frecuencia y calcula el ancho del bin. Cuanto mayor sea el bin, más anómalo será el punto de datos.

Reconstrucción de Autocodificadores

Entrenar un autoencoder con tus datos permitirá que el encoder aprenda la distribución de datos de las diferentes variables y sus relaciones. Luego, cuando el autoencoder recibe un punto de datos que se desvía del resto de los datos, no podrá reconstruir el punto de datos correctamente.

Una buena variable para representar valores atípicos sería la distancia entre la entrada, X, y la salida, X' (por ejemplo, distancia del coseno). Las distancias mayores se correlacionarán con puntos de datos más inusuales.

¿Quieres discutir esta idea más a fondo?

Reserva una reunión con Rafael Cavalheiro

Conoce a Rafael Más información

Observaciones Finales

Ahora que sabes cómo detectar valores atípicos, tienes un nuevo recurso para identificar posibles fraudes, anomalías o errores sin necesidad de recopilar datos de todas esas excepciones. Aquí te presentamos tres formas diferentes de hacerlo.

Para más ideas sobre cómo sacar el máximo provecho de tus datos, suscríbete a nuestro boletín a continuación y mantente atento.