Saltar para o conteúdo

Technical

Introducción al Aprendizaje de Instancias Múltiples

Paulo Maia · 18 de mayo de 2021

El Aprendizaje de Instancias Múltiples (MIL, por sus siglas en inglés) es una forma de aprendizaje débilmente supervisado donde las instancias de entrenamiento se organizan en conjuntos, denominados bolsas, y se proporciona una etiqueta para toda la bolsa, en lugar de para las instancias individuales. Esto permite aprovechar datos débilmente etiquetados, que están presentes en muchos problemas empresariales ya que el etiquetado de datos suele ser costoso:

  • Imágenes Médicas: El diagnóstico asistido por computadora puede entrenarse con imágenes médicas para las que solo está disponible el diagnóstico del paciente para las regiones enfermas, en lugar de anotaciones locales.
  • Vídeo/Audio: Las etiquetas de vídeo o audio solo suelen estar disponibles para el vídeo completo, y es relevante saber cuándo sucede esto (por ejemplo, este vídeo contiene un gato y un humano).
  • Texto: Clasificación de documentos, donde se quiere saber, por ejemplo, si un sitio web determinado (compuesto por varias páginas web) trata sobre un tema específico. Tendrás múltiples páginas con información irrelevante donde ese tema no está presente.
  • Marketing: Frecuentemente, las campañas de marketing se envían a un grupo de personas y no está claro cuál fue impactado por ella.
  • Series Temporales: En algunos casos industriales, donde tienes medidores de gas o agua, y conoces la cantidad total por mes, podrías querer estimar la cantidad en un nivel más granular (por ejemplo, días).

¿Te gustaría saber más sobre Aprendizaje de Instancias Múltiples?

La literatura se enfoca principalmente en aplicaciones de MIL para clasificación. Sin embargo, existen algunas aplicaciones de MIL para regresión, ranking o clustering, que no serán el enfoque aquí. Para recursos sobre esto, consulta este artículo de revisión.

Además, más allá de este artículo, tenemos un curso en línea donde discutimos en profundidad el Aprendizaje de Instancias Múltiples, cómo implementarlo, errores comunes y cómo evitarlos, y algunos ejemplos prácticos de nuestra práctica de consultoría. También aprenderás sobre otras técnicas como Aprendizaje Semisupervisado, Aprendizaje Autosupervisado, entre otras.

Curso

The Machine Learning Spectrum

Domina el Aprendizaje de Instancias Múltiples y varias otras técnicas en nuestro curso.

Más Información

Representación

En el supuesto estándar de MIL, se dice que las bolsas negativas contienen solo instancias negativas, mientras que las bolsas positivas contienen al menos una instancia positiva. Las instancias positivas se etiquetan en la literatura como testigos.

Un ejemplo intuitivo para MIL es una situación donde varias personas tienen un llavero específico que contiene llaves. Algunas de estas personas pueden entrar en una cierta sala, y otras no. La tarea es entonces predecir si una cierta llave o un cierto llavero puede permitirte entrar en esa sala.

Para resolver esto, necesitamos encontrar la llave exacta que es común para todos los llaveros "positivos": la llave verde. Podemos entonces clasificar correctamente un llavero completo: positivo si contiene la llave requerida, o negativo si no la contiene.

Este supuesto estándar puede modificarse ligeramente para adaptarse a problemas donde las bolsas positivas no pueden identificarse por una única instancia, sino por su acumulación. Por ejemplo, en la clasificación de imágenes de desierto, mar y playa, las imágenes de playas contienen tanto segmentos de arena como de agua. Se requieren varias instancias positivas para distinguir una "playa" de un "desierto" o "mar".

Características de los Problemas de Aprendizaje de Instancias Múltiples

Existen algunas características comunes de los problemas de MIL, tal como se definen en la literatura, que se discutirán a continuación.

Tarea/Predicción: Nivel de Instancia vs Nivel de Bolsa

En algunas aplicaciones, como localización de objetos en imágenes (en recuperación de contenido, por ejemplo), el objetivo no es clasificar bolsas, sino clasificar instancias individuales. La etiqueta de la bolsa es la presencia de esa entidad en la imagen.

Ten en cuenta que el desempeño de clasificación de bolsas de un método a menudo no es representativo de su desempeño de clasificación de instancias. Por ejemplo, considerando bolsas negativas, un único Falso Positivo causa que una bolsa se clasifique incorrectamente. Por otro lado, en bolsas positivas, no cambia la etiqueta, lo que no debería afectar la pérdida a nivel de bolsa.

Composición de la Bolsa

La mayoría de los métodos de MIL existentes asumen que las instancias positivas y negativas se muestrean de forma independiente desde una distribución positiva y negativa. Esto a menudo no es el caso, debido a la coocurrencia de varias relaciones:

Similitudes Dentro de la Bolsa

Las instancias que pertenecen a la misma bolsa comparten similitudes que las instancias de otras bolsas no tienen. En aplicaciones de Visión por Computadora, es probable que todos los segmentos compartan algunas similitudes relacionadas con la condición de captura (por ejemplo, iluminación). Otra opción es superponer parches en un proceso de extracción, como se representa a continuación.

Adaptado de aquí

Coocurrencia de Instancias

Las instancias coocurren en bolsas cuando comparten una relación semántica. Este tipo de correlación ocurre cuando el sujeto de una imagen es más probable que se vea en ciertos entornos que en otros, o cuando algunos objetos se encuentran frecuentemente juntos.

Adaptado de aquí

Estructura de Instancia y Bolsa

En algunos problemas, existe una estructura subyacente (espacial, temporal, relacional, causal) entre instancias en bolsas o incluso entre bolsas. Por ejemplo, cuando una bolsa representa una secuencia de vídeo: identificar los fotogramas de un vídeo donde aparece un gato sabiendo solo que hay un gato en ese vídeo, todos los fotogramas o parches están ordenados temporal y espacialmente.

Ambigüedad en las Etiquetas

Ruido en las Etiquetas

Algunos algoritmos de MIL, especialmente aquellos que funcionan bajo el supuesto estándar de MIL, dependen en gran medida de la corrección de las etiquetas de las bolsas. En la práctica, hay muchas situaciones donde instancias positivas pueden encontrarse en bolsas negativas: debido a errores de etiquetado o ruido inherente. Por ejemplo, en aplicaciones de visión por computadora, es difícil garantizar que las imágenes negativas no contengan parches positivos: una imagen que muestra una casa puede contener flores, pero es poco probable que se anote como imagen de flores.

El ruido en las etiquetas también ocurre cuando tienes diferentes bolsas con diferentes densidades de eventos positivos. Por ejemplo, tienes una grabación de audio (R1) de 10 segundos que contiene solo un total de 1 segundo del evento etiquetado y otra grabación de audio (R2) de la misma duración en la que el evento etiquetado está presente durante un total de 5 segundos. R1 es una representación más débil del evento en comparación con R2.

Espacios de Etiquetas Diferentes

Es posible extraer parches de imágenes negativas que caigan en esta región positiva. En el ejemplo que se muestra a continuación, algunos parches extraídos de la imagen de un tigre blanco caen en otra región de concepto debido a que son visualmente similares a ella.

Modelos de Aprendizaje de Instancias Múltiples

Existen múltiples modelos que pueden usarse para MIL: en clasificación a nivel de instancia o de bolsa. Se muestran algunos ejemplos a continuación:

Clasificación a Nivel de Bolsa

Enfoque Bolsa de Palabras

Una bolsa puede representarse por sus instancias, utilizando métodos como un embedding de imagen, y determinando la frecuencia de cada instancia en una bolsa. Se entrena un clasificador en este histograma para determinar si una bolsa es positiva o no.

Máquina de Vectores de Soporte con Distancia de Earth Mover (EMD-SVM)

EMD-SVM es una medida de la disimilitud entre dos distribuciones (por ejemplo, a través de un embedding de imagen también). Cada bolsa es una distribución de instancias y la EMD se usa para crear un kernel usado en una SVM.

Métodos de Espacio de Instancias

(referencia de imagen aquí)

Se desarrollaron aplicaciones alternativas de SVMs (mi-SVM e MI-SVM) para aplicaciones de aprendizaje de instancias múltiples. Clásicamente, las SVMs intentan determinar el margen máximo entre instancias. Para MIL, ya que el objetivo es tener al menos una instancia en una bolsa positiva como positiva, el margen se cambia para que esa condición ocurra: al menos una instancia en una bolsa positiva debe tener un margen positivo grande.

Después de determinar la función de decisión, se puede recuperar la clase de las instancias.

Mixto

Red Neuronal con Pooling

Con una etiqueta a nivel de bolsa, podemos tener un espacio latente que contiene la probabilidad de cada segmento (usando una entrada basada en secuencias). Al aplicar un operador de pooling (max/average pooling), hay solo una puntuación asociada con una bolsa. Después del entrenamiento, si quieres hacer una predicción a nivel de instancia, se puede eliminar la última capa de pooling.

Generalmente, el max pooling se usa para problemas de clasificación, mientras que el average pooling se aplica a problemas de regresión.

Redes Neuronales con Mecanismos de Atención

Los Mecanismos de Atención también pueden aplicarse a este tipo de problemas. Considera la imagen a continuación, para detección de eventos a nivel de audio, que usa tanto un detector como un clasificador (simétricos) con solo la etiqueta a nivel de vídeo para crear dos modelos separados. La salida del clasificador indica cuán probable es que cierto bloque tenga la etiqueta k. La salida del detector indica cuán informativo es el bloque al clasificar la etiqueta k. De esta manera, el modelo determina cuán informativo es un bloque para clasificar una cierta etiqueta.

(referencia de imagen aquí)

eBook GRATUITO: Cómo transformar tu negocio con IA

Descarga nuestro eBook y descubre las dificultades más comunes al implementar proyectos de IA y cómo prevenirlas.

Envíame el eBook

¡Obten Contenido Bonus!

Nombre(Requerido)

Correo Electrónico(Requerido)

submitting form agree policy(Requerido)

Al enviar este formulario, acepto los Términos y la Política de Privacidad.

Comentarios

Este campo es para propósitos de validación y debe mantenerse sin cambios.

¡Envíalo ahora!

Conclusión

Este artículo ha descrito el concepto de Aprendizaje de Instancias Múltiples, sus principales desafíos, y algunos ejemplos de algoritmos que pueden usarse. Aunque aplicar MIL no es ideal, y muy frecuentemente, parece imposible entrenar modelos con anotaciones escasas, existen herramientas diseñadas específicamente para abordar esta barrera y obtener resultados satisfactorios.

Estas son solo algunas de las herramientas que pueden usarse para este propósito. Esperamos haber te dado nuevas ideas para aplicar esto a tus proyectos: inscríbete en nuestro curso en línea para información sobre Aprendizaje de Instancias Múltiples y otros paradigmas de aprendizaje.

Curso

The Machine Learning Spectrum

Domina el Aprendizaje de Instancias Múltiples y varias otras técnicas en nuestro curso.

Más Información