Technical
IA Explicável na Saúde
Pedro Dias · 24 de novembro de 2020
A transparência é essencial quando a IA é aplicada a problemas de decisão crítica, onde pode ser necessária informação adicional sobre o processo subjacente para além do resultado do modelo. Tomando como exemplo a automatização da atribuição de créditos, um cliente que tem um pedido de empréstimo recusado, certamente, quer saber o porquê e de que forma poderia ter sido evitado. Neste artigo, apresentamos alguns exemplos de algoritmos de IA Explicável, com foco na saúde. Este é o primeiro artigo do nosso mês especial "IA na Saúde", onde dedicamos atenção particular às aplicações de Inteligência Artificial mais recentes na área médica.
Este tipo de informação pode não ser tão fácil de obter como se poderia pensar, uma vez que o principal desafio dos modelos de deep learning é a falta de representação explícita do conhecimento, mesmo quando os princípios técnicos dos modelos são compreendidos, daí o interesse crescente em IA Explicável.
Além disso, regulamentos oficiais como o Regulamento Geral sobre a Proteção de Dados (RGPD) e a ISO/IEC 27001 foram criados na UE para garantir que a propagação de técnicas de automatização, como as redes neurais profundas, seja feita de forma segura e confiável, impedindo o seu uso irresponsável em negócios. Isto não significa que estas abordagens tenham de explicar todos os aspetos em todos os momentos; em vez disso, os resultados devem ser rastreáveis por solicitação, conforme explicado aqui.
Formação
Os Fundamentos do Machine Learning
Domine os conceitos fundamentais de ML no nosso curso gratuito.
Estado da Arte
Apesar da falta de uma definição formal do termo no campo, a ideia principal é que existem dois tipos de compreensão diferentes: inteligibilidade e interpretabilidade estão relacionadas com a compreensão funcional de um modelo em particular, fornecendo ao utilizador especialista informações do modelo "caixa negra". Por outro lado, explicabilidade diz respeito ao fornecimento de informação algorítmica de alto nível ao utilizador comum, permitindo responder a perguntas como "Porquê?" e não diretamente relacionada com o "Como?".
Esquema de um modelo de IA verdadeiramente explicável extraído de aqui.
Uma noção interessante foi introduzida por Doran et al., argumentando que um modelo verdadeiramente explicável não apenas fornece uma decisão e uma explicação, mas também é capaz de integrar raciocínio. Na figura, o modelo deveria ser capaz de classificar a imagem fornecida como uma "fábrica" porque contém certos elementos e depois fornece raciocínio que suporta a decisão: a associação entre os elementos e a classificação deveria ser feita de forma organizada, e não após a classificação. Por este exemplo é fácil ver que neste modelo ideal tanto o "como?" como o "porquê?" estão presentes.
Os modelos explicáveis podem ser divididos em Post-hoc e Ante-hoc (ou técnicas in-model). A aplicação dos primeiros métodos é realizada num modelo treinado, ajustando explicações (por exemplo, mapas de saliência), enquanto os últimos são intrínsecos ao modelo (por exemplo, árvores de decisão), conforme explicado no trabalho de Holzinger et al.
A tabela contém alguns exemplos de técnicas que estão a ser utilizadas atualmente. Para simplificar, apenas dados visuais serão considerados e um exemplo de cada grupo será detalhado, para que o leitor obtenha uma compreensão mais clara do que pode ser alcançado. Há muito mais do que foi discutido aqui; por exemplo, Singh et al. fizeram uma análise dos métodos atualmente utilizados para melhorar a transparência de modelos de deep learning aplicados à análise de imagem médica.
| Post-hoc | Ante-hoc |
|---|---|
| Activation Maximization | Modelos baseados em Attention |
| Layer-wise Relevance Propagation | Modelos baseados em partes |
Activation Maximization
O Activation Maximization visualiza as entradas preferidas de certos neurónios em cada camada. Isto é feito encontrando o padrão de entrada que leva à ativação máxima de um certo neurónio (cada pixel de entrada é alterado até que o máximo seja alcançado). O processo é iterativo e começa com uma imagem de entrada aleatória que é atualizada. Os gradientes podem ser calculados usando retropropagação, mantendo constantes os parâmetros aprendidos pela rede neural convolucional. Desta forma, cada pixel das imagens iniciais ruidosas é iterativamente
Imagem extraída de aqui
alterado para maximizar a ativação do neurónio considerado até que o padrão de imagem preferido seja alcançado. Como podemos ver pela imagem, obtida do trabalho de Nguyen et al., a imagem à direita corresponde a uma representação abstrata de mesas de bilhar que alcança a máxima ativação dentro da rede. Reyes et al. concentraram os seus esforços no estado atual da arte relativamente à IA Explicável e radiologia. No seu trabalho, demonstram como técnicas como esta, entre outras, podem ser empregues.
Layer-wise Relevance Propagation
Layer-wise Relevance Propagation (LRP) representa através de mapas de calor a contribuição que cada pixel tem no resultado, no caso de modelos baseados em kernel. Esta decomposição baseia-se numa série de restrições para garantir que o mapa de calor é realista e coerente. Pode ser formalmente descrita como representar o resultado pela soma de relevâncias para cada pixel, na camada de entrada. Estas relevâncias podem ser calculadas através de um mecanismo em cadeia, onde o total de relevâncias numa certa camada anterior é igual ao total de relevâncias na camada seguinte. Isto também implica uma restrição na decomposição, garantindo que a relevância total permanece constante desde a camada de saída até à camada de entrada, significando que nenhuma relevância é perdida ou gerada.
Para mais exemplos e detalhes sobre esta técnica, consulte o trabalho de Bach et al., de onde foi extraída esta imagem. Esta técnica foi recentemente aplicada por Karim et al. em redes neurais convolucionais aplicadas a imagens de raios-X do pulmão para detecção de COVID-19.
Modelos baseados em Attention
Os modelos baseados em Attention são métodos baseados no sistema de visão humano e na sua perceção e processamento focal de objetos, embora não sejam exclusivos de problemas de visão computacional, tendo aplicações em Processamento de Linguagem Natural, Aprendizagem Estatística e Fala (consulte Chaudhari et al para mais informações sobre modelos de Attention e exemplos). Os modelos de Attention fornecem uma maneira de aprimorar a interpretabilidade da rede neural e, em alguns casos, reduzir o custo computacional, selecionando certas partes da entrada.
Atualmente, já existem abordagens que tiram proveito desta ideia. Por exemplo, Rio-Torto et al. propuseram uma rede que contém tanto um Classificador como um Explicador. O explicador atribui maior peso à classificação nas partes relevantes da entrada, conforme pode ser visto na imagem abaixo (extraída do seu trabalho), onde as riscas da zebra estão realçadas.
Redes baseadas em partes
As redes baseadas em partes são uma arquitetura recente que se baseia na forma como os humanos explicam uma imagem numa tarefa de classificação, utilizando partes que são semelhantes ao que, ao longo das nossas experiências, temos visto anteriormente.
A rede de partes prototípicas é uma técnica ante-hoc capaz de obter explicações juntamente com as previsões propostas por Chen et al.. No entanto, as explicações são na verdade o subproduto da ativação dos protótipos na entrada da rede. Estes protótipos são representações latentes de alguma parte de entrada, de uma certa classe, na qual a decisão foi baseada, considerando uma combinação ponderada destas pontuações que ditará a classe a que a imagem pertence. Na tarefa de classificação original, e seguindo o esquema abaixo, pode-se ver que na camada de protótipos cada um dos protótipos é de uma parte de um pássaro, o primeiro é a cabeça de um pardal avermelhado, enquanto o segundo é a cabeça de um pardal de Brewer. Isto significa que a rede aprendeu, por exemplo, que a cabeça de um pardal avermelhado é um padrão distintivo da sua classe específica, e que se a imagem de entrada for semelhante aos padrões dentro do protótipo, contribuirá positivamente para a classificação da imagem.
Caso de estudo prático – IA Explicável aplicada à Epilepsia
Durante a minha Dissertação de Mestrado, trabalhei com o Clinical Neurophysiology Group, da Universidade de Twente, na automatização do diagnóstico explicável de epilepsia através de modelos de deep learning. Vale também a pena mencionar o Prof. Luís Teixeira que forneceu orientação crucial durante o meu trabalho.
A Epilepsia é uma perturbação neurológica que afeta mais de 50 milhões de pessoas em todo o mundo, cujo diagnóstico se baseia em eletroencefalografia (EEG), o registo da atividade elétrica cerebral. A prática clínica atual inclui a análise dos registos de EEG por neurofisiologistas treinados para identificar padrões anormais associados a convulsões, caracterizados por anomalias de alta frequência nos sinais de EEG. No entanto, esta análise visual, para além de ser subjetiva, é extremamente laboriosa, pois requer neurofisiologistas altamente treinados para analisar sinais de EEG que podem ter horas de gravação.
Um grande obstáculo na aplicação de modelos de deep learning na saúde é que frequentemente são vistos como "caixas negras", apesar do seu elevado desempenho. Consequentemente, fornecem pouca ou nenhuma informação sobre os processos subjacentes à decisão, o que no contexto médico não é aceitável. Para resolver isto, foram utilizadas duas abordagens explicáveis para detecção de convulsões onde os modelos não apenas identificaram quais as porções dos sinais com maior probabilidade de apresentarem padrões anormais, como também quais as regiões que mais contribuíram para essa decisão (explicações visuais).
As abordagens utilizadas foram as duas descritas anteriormente: a rede de Classificador e Explicador (C&E) e a rede de partes prototípicas (ProtoPNet). Ambas as abordagens foram avaliadas tanto em relação à tarefa de classificação como às explicações fornecidas, que foram diretamente comparadas com as dos especialistas. Abaixo podemos ver os sinais de EEG de uma montagem multicanal e as explicações sobrepostas, onde as regiões de picos elevados estão mais realçadas. A semelhança com as explicações fornecidas pelos especialistas indica-nos que, de facto, ambas as redes foram capazes de fornecer informações relevantes, sugerindo corretamente padrões relacionados com convulsões associados à decisão do modelo.
Conclusão
Com a propagação de modelos de machine learning através de diferentes negócios e campos, também se verifica um aumento no número de trabalhos realizados em IA Explicável na literatura. As decisões críticas são o foco principal destes modelos, pois frequentemente requerem mais do que uma decisão ou previsão para serem aceites e empregues seguramente no ambiente desejado, como neste exemplo com a Epilepsia. No entanto, pode-se também utilizar estas abordagens em vários outros domínios da IA, para ajudar a compreender realmente o que está a impulsionar as suas decisões. Se tem alguma reserva quanto à aplicação de IA no seu negócio, sinta-se livre para discutir connosco este tipo de abordagem mais transparente e como poderia ajudá-lo!
Gostaria de aprofundar este tema?
Marque uma reunião com Francisca Morgado
Conheça Francisca Saber Mais
Referências
Ras, Gabriëlle, Marcel van Gerven, and Pim Haselager. "Explanation methods in deep learning: Users, values, concerns and challenges." Explainable and Interpretable Models in Computer Vision and Machine Learning. Springer, Cham, 2018. 19-36.
Doran, Derek, Sarah Schulz, and Tarek R. Besold. "What does explainable AI really mean? A new conceptualization of perspectives." arXiv preprint arXiv:1710.00794 (2017).
Holzinger, Andreas, et al. "What do we need to build explainable AI systems for the medical domain?." arXiv preprint arXiv:1712.09923 (2017).
Singh, Amitojdeep, Sourya Sengupta, and Vasudevan Lakshminarayanan. "Explainable deep learning models in medical image analysis." arXiv preprint arXiv:2005.13799 (2020).
Nguyen, Anh, Jason Yosinski, and Jeff Clune. "Multifaceted feature visualization: Uncovering the different types of features learned by each neuron in deep neural networks." arXiv preprint arXiv:1602.03616 (2016).
Reyes, Mauricio, et al. "On the Interpretability of Artificial Intelligence in Radiology: Challenges and Opportunities." Radiology: Artificial Intelligence 2.3 (2020): e190043.
Bach, Sebastian, et al. "On pixel-wise explanations for non-linear classifier decisions by layer-wise relevance propagation." PloS one 10.7 (2015): e0130140.
Karim, Md, et al. "Deepcovidexplainer: Explainable covid-19 predictions based on chest x-ray images." arXiv preprint arXiv:2004.04582 (2020).
Chaudhari, Sneha, et al. "An attentive survey of attention models." arXiv preprint arXiv:1904.02874 (2019).
Rio-Torto, Isabel, Kelwin Fernandes, and Luis F. Teixeira. "Understanding the decisions of CNNs: an in-model approach." Pattern Recognition Letters (2020).
Chen, Chaofan, et al. "This looks like that: deep learning for interpretable image recognition." Advances in neural information processing systems. 2019.
