Explicaciones de Modelos con ECCCo: Contrafactuales con Restricción de Energía
Este artículo presenta ECCCo, una nueva forma de generar explicaciones de modelos de aprendizaje automático (ML) a través de contrafactuales que son tan plausibles como lo permiten los modelos subyacentes. Las explicaciones contrafactuales son intuitivas: sugieren cómo modificar una entrada para obtener un resultado deseado. El desafío principal radica en definir y lograr características deseables, como la plausibilidad, y ECCCo se enfoca en generar contrafactuales que expliquen fielmente el comportamiento del modelo, sin depender de modelos sustitutos.
Existe un debate central en el campo de la XAI: ¿necesitamos realmente explicaciones? Algunos argumentan que la fiabilidad del modelo es suficiente, mientras que otros insisten en la necesidad de accountability, control y contestabilidad. Aunque los modelos fiables son valiosos, la investigación de la TU Delft sugiere que los humanos tienden a ignorar las decisiones de modelos opacos. La explicabilidad no solo mejora la confianza, sino que también puede revelar relaciones causales importantes.
A pesar de los esfuerzos en XAI, las explicaciones a menudo no ayudan o incluso engañan a los usuarios. Esto ha generado escepticismo sobre la efectividad de las explicaciones que buscan agradar al usuario, independientemente del modelo subyacente. ECCCo nace de este escepticismo, proponiendo un enfoque que prioriza la fidelidad al modelo sobre la simple plausibilidad. La clave es evitar una falsa sensación de seguridad proporcionada por explicaciones plausibles pero engañosas.
Un desafío importante es la multiplicidad de explicaciones posibles. A menos que la combinación de características sea única, existen múltiples contrafactuales válidos. El artículo plantea la pregunta: ¿qué explicaciones confiamos? La elección a menudo se basa en la plausibilidad, pero esto puede llevar a una selección sesgada de contrafactuales plausibles, comprometiendo la comprensión del modelo. ECCCo propone priorizar la fidelidad al modelo para asegurar una comprensión más precisa.
ECCCo genera contrafactuales consistentes con lo que el modelo ha aprendido sobre los datos, utilizando ideas de modelado basado en energía y predicción conformista. Esto permite lograr la plausibilidad solo si el modelo ha aprendido algo significativo. El proceso propuesto implica una sobrecarga mínima y es ampliamente aplicable a modelos entrenados con descenso de gradiente estocástico. El objetivo es generar contrafactuales que sean consistentes con la distribución posterior del modelo.
ECCCo se basa en el uso de Stochastic Gradient Langevin Dynamics (SGLD) para muestrear de la distribución posterior del modelo. La plausibilidad se define como la indistinguibilidad de los contrafactuales con los datos observados. Al priorizar la fidelidad y luego buscar la plausibilidad, ECCCo ofrece una nueva forma de entender y explicar el comportamiento de los modelos de aprendizaje automático, superando las limitaciones de los enfoques anteriores.
¿Eres el dueño?
Sugiere un cambio. Lo revisamos antes de publicarlo.