Autoencoder disperso para interpretabilidad
Sparse autoencoder for interpretabilitySAE
También: Sparse autoencoder for interpretability, SAE
Concepto de explicabilidad relacionado con análisis de mecanismos y representaciones internas.
Definición técnica
Autoencoder disperso para interpretabilidad se utiliza para describir o evaluar análisis de mecanismos y representaciones internas, indicando el alcance de la explicación, el método empleado y la relación entre la evidencia mostrada y el comportamiento real del modelo.