Saltar para o conteúdo

Technical

IA Explicable en Sanidad

Pedro Dias · 24 de noviembre de 2020

La transparencia es fundamental cuando la IA se aplica a problemas de decisión críticos donde se requiere información adicional sobre el proceso subyacente más allá del resultado del modelo. Tomemos como ejemplo la automatización de la aprobación de préstamos: un cliente a quien se le deniega un préstamo querrá saber por qué ocurrió y cómo podría haberse evitado. En este artículo le ofrecemos algunos ejemplos de algoritmos de IA Explicable, con especial atención a la Sanidad. Esta es la primera parte de nuestro mes especial "IA en Sanidad" donde damos un enfoque especial a las aplicaciones más avanzadas de Inteligencia Artificial en Salud.

Este tipo de comprensión puede no ser tan fácil de obtener como uno podría pensar, dado que el principal problema de los modelos de aprendizaje profundo es la falta de representación explícita del conocimiento, incluso cuando se comprenden los principios técnicos de los modelos. De ahí el creciente interés en IA Explicable.

Además, las regulaciones oficiales como el Reglamento General de Protección de Datos (GDPR) e ISO/IEC 27001 fueron creadas en la UE para garantizar que la expansión de técnicas de automatización, como las redes neuronales profundas, se realice de manera confiable, limitando su uso indiscriminado en los negocios. Esto no significa que estos enfoques tengan que explicar cada aspecto en cada momento, sino que los resultados deben poder trazarse bajo demanda, como se explica aquí.

Curso

Los fundamentos del Machine Learning

Domina los conceptos fundamentales de ML en nuestro curso gratuito.

Más información

Estado del arte

Aunque no existe una definición formal del término en el campo, la idea principal es que existen dos tipos diferentes de comprensión: la inteligibilidad e interpretabilidad están relacionadas con la comprensión funcional de un modelo determinado, proporcionando al usuario experto información sobre el modelo de "caja negra". Por otro lado, la explicabilidad está relacionada con proporcionar al usuario medio información algorítmica de alto nivel que le permita responder preguntas como "¿Por qué?" y no directamente "¿Cómo?".

Esquema de un modelo de IA verdaderamente explicable extraído de aquí.

Un concepto interesante fue introducido por Doran et al., defendiendo que un modelo verdaderamente explicable no solo proporciona una decisión y una explicación, sino que también es capaz de integrar razonamiento. En la figura, el modelo debería poder clasificar la imagen proporcionada como una "fábrica" porque contiene ciertos elementos y posteriormente proporciona un razonamiento que respalda la decisión: la asociación entre los elementos y la etiqueta debe hacerse de manera organizada, y no posterior a la clasificación. Con este ejemplo uno puede ver fácilmente que en este modelo ideal se presentan tanto el "¿cómo?" como el "¿por qué?".

Los modelos explicables pueden dividirse en técnicas Post-hoc e Ante-hoc (o integradas en el modelo). La aplicación de los primeros métodos se realiza en un modelo ya entrenado, ajustando explicaciones (por ejemplo, mapas de saliencia), mientras que los segundos son intrínsecos al modelo (por ejemplo, árboles de decisión), como se explica en el trabajo de Holzinger et al.

La tabla contiene algunos ejemplos de técnicas que se utilizan actualmente. Para simplificar, solo se considerarán datos visuales y se detallará un ejemplo de cada grupo para que el lector obtenga una imagen más clara de lo que se puede lograr. Hay mucho más de lo que se discute aquí, por ejemplo, Singh et al. realizó una revisión sobre los métodos que se utilizan actualmente para mejorar la transparencia de los modelos de aprendizaje profundo aplicados al análisis de imágenes médicas.

Post-hocAnte-hoc
Activation MaximizationModelos basados en atención
Layer-wise Relevance PropagationModelos basados en partes

Activation Maximization

Activation Maximization visualiza los inputs preferidos de ciertas neuronas en cada capa. Esto se logra encontrando el patrón de entrada que conduce a la activación máxima de una neurona determinada (cada píxel de entrada se modifica hasta lograr el máximo). El proceso es iterativo y comienza con una imagen de entrada aleatoria que se actualiza. Los gradientes pueden calcularse mediante propagación hacia atrás, manteniendo constantes los parámetros aprendidos por la red neuronal convolucional. De esta manera, cada píxel de las imágenes ruidosas iniciales se modifica iterativamente

Imagen extraída de aquí

para maximizar la activación de la neurona considerada hasta alcanzar la imagen patrón preferida. Como podemos ver en la imagen obtenida del trabajo de Nguyen et al., la imagen de la derecha corresponde a una representación abstracta de las mesas de billar que logra la máxima activación dentro de la red. Reyes et al. concentraron sus esfuerzos en el estado actual del arte en IA Explicable y radiología. En su trabajo muestran cómo se pueden emplear técnicas como esta y otras.

Layer-wise Relevance Propagation

Layer-wise Relevance Propagation (LRP) representa mediante mapas de calor la contribución que cada píxel tiene en la salida, para el caso de modelos basados en kernel. Esta descomposición se basa en una serie de restricciones para garantizar que el mapa de calor sea realista y consistente. Puede formularse formalmente como la representación de la salida mediante la suma de relevancias para cada píxel de la capa de entrada. Estas relevancias pueden calcularse mediante un mecanismo en cadena donde el total de relevancias en una capa anterior es igual al total de relevancias en la siguiente capa. Esto también implica una restricción en la descomposición, garantizando que la relevancia total se mantenga constante desde la capa de salida a la capa de entrada, lo que significa que no se pierde ni se genera relevancia.

Para más ejemplos y detalles sobre esta técnica, consulta el trabajo de Bach et al. de donde se extrajo esta imagen. Esta técnica fue aplicada recientemente por Karim et al. en redes neuronales convolucionales aplicadas a imágenes de rayos X de pulmones para la detección de COVID-19.

Attention Models

Attention Models son métodos basados en el sistema de visión humana y su percepción focal y procesamiento de objetos, aunque no son exclusivos de problemas de visión por computadora, teniendo aplicaciones en Procesamiento del Lenguaje Natural, Aprendizaje Estadístico y Voz (consulta Chaudhari et al. para más información sobre modelos de atención y ejemplos de ellos). Los Attention Models proporcionan una forma de mejorar la interpretabilidad de las redes neuronales y, en algunos casos, reducir el costo computacional seleccionando ciertas partes de la entrada.

Hoy en día, ya existen enfoques que aprovechan esta idea. Por ejemplo, Rio-Torto et al. propusieron una red que contiene tanto un Clasificador como un Explicador. El explicador da mayor peso a la clasificación en las partes relevantes de la entrada, como se puede ver en la imagen siguiente (extraída de su trabajo), donde las rayas de la cebra se resaltan.

Part based networks

Part based networks son una arquitectura reciente que se basa en la forma humana de explicar una imagen en una tarea de clasificación basándose en partes que son similares a lo que, a lo largo de nuestras experiencias, hemos visto previamente.

Prototypical part network es una técnica ante-hoc capaz de obtener explicaciones junto con las predicciones propuestas por Chen et al.. Sin embargo, las explicaciones son en realidad un subproducto de la activación de los prototipos en la entrada de la red. Estos prototipos son representaciones latentes de alguna parte de entrada, de una clase determinada, en la que se basó la decisión considerando una combinación ponderada de estas puntuaciones que dictarán la clase a la que pertenece la imagen. En la tarea de clasificación original, y siguiendo el esquema siguiente, se puede ver que en la capa de prototipo cada uno de los prototipos proviene de una parte de un pájaro: el primero es la cabeza de un gorrión color arcilla, mientras que el segundo es la cabeza de un gorrión de Brewer. Esto significa que la red aprendió, por ejemplo, que la cabeza de un gorrión color arcilla es un patrón distintivo de su clase específica, y que si la imagen de entrada es similar a los patrones dentro del prototipo, contribuirá positivamente a la clasificación de la imagen.

Caso de estudio práctico: IA Explicable aplicada a epilepsia

Durante mi Tesis de Máster, trabajé con el Grupo de Neurofisiología Clínica de la Universidad de Twente en la automatización del diagnóstico explicable de epilepsia mediante modelos de aprendizaje profundo. También merece la pena mencionar al Prof. Luís Teixeira que proporcionó una orientación crucial durante mi trabajo.

La epilepsia es un trastorno neurológico que afecta a más de 50 millones de personas en todo el mundo cuyo diagnóstico se basa en electroencefalografía (EEG), el registro de la actividad eléctrica del cerebro. La práctica clínica actual incluye el análisis de registros EEG por parte de neurólogos entrenados para identificar patrones anormales asociados con convulsiones, caracterizados por anomalías de alta frecuencia en las señales EEG. Sin embargo, este análisis visual, aparte de ser subjetivo, es extremadamente laborioso, ya que requiere que neurofisiólogos altamente entrenados revisen señales EEG que pueden tener horas de grabación.

Un gran obstáculo en la aplicación de modelos de aprendizaje profundo en sanidad es que a menudo se consideran "cajas negras", a pesar de su alto rendimiento. En consecuencia, proporcionan poca o ninguna información sobre los procesos subyacentes a la decisión, lo cual no es aceptable en el contexto médico. Para abordarlo, se utilizaron dos enfoques explicables para la detección de convulsiones donde los modelos no solo identificaban qué porciones de las señales tenían más probabilidades de tener patrones anormales, sino también qué regiones contribuían más a esta decisión (explicaciones visuales).

Los enfoques utilizados fueron los dos descritos anteriormente: la red Clasificador y Explicador (C&E) y la red Prototypical part network (ProtoPNet). Ambos enfoques fueron evaluados con respecto a la tarea de clasificación y las explicaciones proporcionadas, que se compararon directamente con las de expertos. A continuación podemos ver las señales EEG de un montaje multicanal y las explicaciones superpuestas donde las regiones de picos altos se resaltan más. La similitud con las explicaciones proporcionadas por los expertos nos dice que efectivamente ambas redes fueron capaces de proporcionar información relevante sugiriendo correctamente patrones relacionados con convulsiones asociados con la decisión del modelo.

Conclusión

Con la difusión de modelos de aprendizaje automático en diferentes negocios y campos, también se observa un aumento en el número de trabajos realizados en IA Explicable en la literatura. Las decisiones críticas son el principal foco de estos modelos, ya que a menudo requieren más que una decisión o predicción para ser aceptadas e implementadas de manera segura en el entorno deseado, como en este ejemplo con epilepsia. Sin embargo, también se pueden utilizar estos enfoques en varios otros dominios de IA para ayudar a entender realmente qué está impulsando tus decisiones. Si tienes algunas dudas sobre aplicar IA a tu negocio, no dudes en discutir con nosotros este tipo de enfoque más transparente y cómo podría ayudarte.

¿Quieres profundizar en esta idea?

Reserva una reunión con Francisca Morgado

Conoce a Francisca Más información

Referencias

Ras, Gabriëlle, Marcel van Gerven, and Pim Haselager. "Explanation methods in deep learning: Users, values, concerns and challenges." Explainable and Interpretable Models in Computer Vision and Machine Learning. Springer, Cham, 2018. 19-36.

Doran, Derek, Sarah Schulz, and Tarek R. Besold. "What does explainable AI really mean? A new conceptualization of perspectives." arXiv preprint arXiv:1710.00794 (2017).

Holzinger, Andreas, et al. "What do we need to build explainable AI systems for the medical domain?." arXiv preprint arXiv:1712.09923 (2017).

Singh, Amitojdeep, Sourya Sengupta, and Vasudevan Lakshminarayanan. "Explainable deep learning models in medical image analysis." arXiv preprint arXiv:2005.13799 (2020).

Nguyen, Anh, Jason Yosinski, and Jeff Clune. "Multifaceted feature visualization: Uncovering the different types of features learned by each neuron in deep neural networks." arXiv preprint arXiv:1602.03616 (2016).

Reyes, Mauricio, et al. "On the Interpretability of Artificial Intelligence in Radiology: Challenges and Opportunities." Radiology: Artificial Intelligence 2.3 (2020): e190043.

Bach, Sebastian, et al. "On pixel-wise explanations for non-linear classifier decisions by layer-wise relevance propagation." PloS one 10.7 (2015): e0130140.

Karim, Md, et al. "Deepcovidexplainer: Explainable covid-19 predictions based on chest x-ray images." arXiv preprint arXiv:2004.04582 (2020).

Chaudhari, Sneha, et al. "An attentive survey of attention models." arXiv preprint arXiv:1904.02874 (2019).

Rio-Torto, Isabel, Kelwin Fernandes, and Luis F. Teixeira. "Understanding the decisions of CNNs: an in-model approach." Pattern Recognition Letters (2020).

Chen, Chaofan, et al. "This looks like that: deep learning for interpretable image recognition." Advances in neural information processing systems. 2019.