UIBAIFED: Un dataset de expresiones faciales generado por IA para visibilizar la diversidad

Autores/as

DOI:

https://doi.org/10.65234/interaccion.139

Palabras clave:

Interacción persona-ordenador , IPO, aprendizaje profundo, conjunto de datos de expresiones faciales, FER

Resumen

Este artículo presenta UIBAIFED, un nuevo conjunto de datos de expresiones faciales compuesto por imágenes realistas y de alta calidad, etiquetadas con grupo de edad, género, etnia y 22 microexpresiones basadas en las expresiones universales de Ekman y la taxonomía de Gary Faigin. El conjunto de datos fue generado mediante modelos de difusión y está diseñado para mejorar la investigación en reconocimiento de expresiones faciales, aumentado la representación étnica, generacional y de complexión física, visibilizando la diversidad existente en el mundo real. La validación inicial mediante una red neuronal convolucional (CNN) alcanzó una precisión del 80% en la clasificación de microexpresiones. Además, se realizó un experimento con participantes humanos con un subconjunto de datos formado por imágenes del grupo de edad de personas mayores (85 años), colectivo tradicionalmente marginado en los conjuntos de datos existentes. Los mejores resultados de clasificación fueron para las emociones de tristeza (94.6%), neutral (92.8%) y alegría (83.8%), mientras que las peores emociones identificadas fueron las emociones de miedo (33.9%) y asco (34.7%), con una precisión global del 74%. UIBAIFED ofrece un nivel de etiquetado más detallado que los conjuntos de datos existentes, lo que facilita el análisis del rendimiento en sistemas de reconocimiento de expresiones faciales en distintos grupos demográficos y contribuye al desarrollo de modelos más robustos y generalizables.

Referencias

Adegun, I. P., & Vadapalli, H. B. (2020). Facial micro-expression recognition: A machine learning approach. Scientific African, 8, e00465. https://doi.org/10.1016/j.sciaf.2020.e00465AUTOMATIC1111. (2022). Stable diffusion web UI [Software]. https://github.com/AUTOMATIC1111/stable-diffusion-webui DOI: https://doi.org/10.1016/j.sciaf.2020.e00465

Buolamwini, J., & Gebru, T. (2018). Gender shades: Intersectional accuracy disparities in commercial gender classification. En Proceedings of the 1st Conference on Fairness, Accountability and Transparency (pp. 77–91). PMLR. https://proceedings.mlr.press/v81/buolamwini18a.html

Chen, Y., & Joo, J. (2021). Understanding and mitigating annotation bias in facial expression recognition. arXiv. https://doi.org/10.48550/arXiv.2108.08504 DOI: https://doi.org/10.1109/ICCV48922.2021.01471

Civitai. (s. f.-a). LoRA Stable Diffusion & Flux AI models. https://civitai.com/tag/lora

Civitai. (s. f.-b). Realistic Vision V6.0 B1 – V5.1 Hyper (VAE). https://civitai.com/models/4201/realistic-vision-v60-b1

Dominguez-Catena, I., Paternain, D., & Galar, M. (2024). Metrics for dataset demographic bias: A case study on facial expression recognition. IEEE Transactions on Pattern Analysis and Machine Intelligence, 46(8), 5209–5226. https://doi.org/10.1109/TPAMI.2024.3361979 DOI: https://doi.org/10.1109/TPAMI.2024.3361979

Ekman, P. (1999). Handbook of cognition and emotion. Wiley.

Faigin, G. (1990). The artist’s complete guide to facial expression. Watson-Guptill. DOI: https://doi.org/10.1097/00006534-199108000-00037

Fan, J., Zhou, J., Deng, X., Wang, H., Tao, L., & Kwan, H. K. (2022). Combating uncertainty and class imbalance in facial expression recognition. En TENCON 2022 – IEEE Region 10 Conference (pp. 1–4). IEEE. https://doi.org/10.1109/TENCON55691.2022.9977693 DOI: https://doi.org/10.1109/TENCON55691.2022.9977693

Goodfellow, I. J., et al. (2013). Challenges in representation learning: A report on three machine learning contests. arXiv. https://arxiv.org/abs/1307.0414 DOI: https://doi.org/10.1007/978-3-642-42051-1_16

Guerdelli, H., Ferrari, C., Barhoumi, W., Ghazouani, H., & Berretti, S. (2022). Macro- and micro-expressions facial datasets: A survey. Sensors, 22(4), 1524. https://doi.org/10.3390/s22041524 DOI: https://doi.org/10.3390/s22041524

Hu, E., et al. (2022). LoRA: Low-rank adaptation of large language models. arXiv. https://arxiv.org/abs/2106.09685

Kollias, D., Schulc, A., Hajiyev, E., & Zafeiriou, S. (2020). Analysing affective behavior in the first ABAW 2020 competition (p. 643). IEEE. https://doi.org/10.1109/FG47880.2020.00126 DOI: https://doi.org/10.1109/FG47880.2020.00126

Li, S., & Deng, W. (2022). Deep facial expression recognition: A survey. IEEE Transactions on Affective Computing, 13(3), 1195–1215. https://doi.org/10.1109/TAFFC.2020.2981446 DOI: https://doi.org/10.1109/TAFFC.2020.2981446

Li, S., Deng, W., & Du, J. (2017). Reliable crowdsourcing and deep locality-preserving learning for expression recognition in the wild. En 2017 IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (pp. 2584–2593). IEEE. https://doi.org/10.1109/CVPR.2017.277 DOI: https://doi.org/10.1109/CVPR.2017.277

Lucey, P., Cohn, J. F., Kanade, T., Saragih, J., Ambadar, Z., & Matthews, I. (2010). The extended Cohn-Kanade dataset (CK+): A complete dataset for action unit and emotion-specified expression. En 2010 IEEE Computer Society Conference on Computer Vision and Pattern Recognition Workshops (CVPRW) (pp. 94–101). IEEE. https://doi.org/10.1109/CVPRW.2010.5543262 DOI: https://doi.org/10.1109/CVPRW.2010.5543262

Mollahosseini, A., Hasani, B., & Mahoor, M. H. (2019). AffectNet: A database for facial expression, valence, and arousal computing in the wild. IEEE Transactions on Affective Computing, 10(1), 18–31. https://doi.org/10.1109/TAFFC.2017.2740923 DOI: https://doi.org/10.1109/TAFFC.2017.2740923

Office of Institutional Research. (s. f.). Race/ethnicity FAQs. Tufts University. https://provost.tufts.edu/institutionalresearch/race-ethnicity-faq/

Psaroudakis, A., & Kollias, D. (2022). MixAugment & Mixup: Augmentation methods for facial expression recognition. arXiv. https://doi.org/10.48550/arXiv.2205.04442 DOI: https://doi.org/10.1109/CVPRW56347.2022.00264

Stable Diffusion AI. (s. f.). Stable diffusion online – Free AI image generator. https://stabledifffusion.com

Yu, J., Liu, Y., Fan, R., & Sun, G. (2024). MixCut: A data augmentation method for facial expression recognition. arXiv. https://doi.org/10.48550/arXiv.2405.10489

Zeng, Y., & Lee, K. (2023). The expressive power of low-rank adaptation. arXiv. https://doi.org/10.48550/arXiv.2310.17513

Zhang, Y., Li, Y., Qin, L., Liu, X., & Deng, W. (2023). Leave no stone unturned: Mine extra knowledge for imbalanced facial expression recognition. arXiv. https://doi.org/10.48550/arXiv.2310.19636 DOI: https://doi.org/10.52202/075280-0634

Descargas

Publicado

2025-12-23