UIBAIFED: Un dataset de expresiones faciales generado por IA para visibilizar la diversidad
DOI:
https://doi.org/10.65234/interaccion.139Palabras clave:
Interacción persona-ordenador , IPO, aprendizaje profundo, conjunto de datos de expresiones faciales, FERResumen
Este artículo presenta UIBAIFED, un nuevo conjunto de datos de expresiones faciales compuesto por imágenes realistas y de alta calidad, etiquetadas con grupo de edad, género, etnia y 22 microexpresiones basadas en las expresiones universales de Ekman y la taxonomía de Gary Faigin. El conjunto de datos fue generado mediante modelos de difusión y está diseñado para mejorar la investigación en reconocimiento de expresiones faciales, aumentado la representación étnica, generacional y de complexión física, visibilizando la diversidad existente en el mundo real. La validación inicial mediante una red neuronal convolucional (CNN) alcanzó una precisión del 80% en la clasificación de microexpresiones. Además, se realizó un experimento con participantes humanos con un subconjunto de datos formado por imágenes del grupo de edad de personas mayores (85 años), colectivo tradicionalmente marginado en los conjuntos de datos existentes. Los mejores resultados de clasificación fueron para las emociones de tristeza (94.6%), neutral (92.8%) y alegría (83.8%), mientras que las peores emociones identificadas fueron las emociones de miedo (33.9%) y asco (34.7%), con una precisión global del 74%. UIBAIFED ofrece un nivel de etiquetado más detallado que los conjuntos de datos existentes, lo que facilita el análisis del rendimiento en sistemas de reconocimiento de expresiones faciales en distintos grupos demográficos y contribuye al desarrollo de modelos más robustos y generalizables.
Referencias
Adegun, I. P., & Vadapalli, H. B. (2020). Facial micro-expression recognition: A machine learning approach. Scientific African, 8, e00465. https://doi.org/10.1016/j.sciaf.2020.e00465AUTOMATIC1111. (2022). Stable diffusion web UI [Software]. https://github.com/AUTOMATIC1111/stable-diffusion-webui DOI: https://doi.org/10.1016/j.sciaf.2020.e00465
Buolamwini, J., & Gebru, T. (2018). Gender shades: Intersectional accuracy disparities in commercial gender classification. En Proceedings of the 1st Conference on Fairness, Accountability and Transparency (pp. 77–91). PMLR. https://proceedings.mlr.press/v81/buolamwini18a.html
Chen, Y., & Joo, J. (2021). Understanding and mitigating annotation bias in facial expression recognition. arXiv. https://doi.org/10.48550/arXiv.2108.08504 DOI: https://doi.org/10.1109/ICCV48922.2021.01471
Civitai. (s. f.-a). LoRA Stable Diffusion & Flux AI models. https://civitai.com/tag/lora
Civitai. (s. f.-b). Realistic Vision V6.0 B1 – V5.1 Hyper (VAE). https://civitai.com/models/4201/realistic-vision-v60-b1
Dominguez-Catena, I., Paternain, D., & Galar, M. (2024). Metrics for dataset demographic bias: A case study on facial expression recognition. IEEE Transactions on Pattern Analysis and Machine Intelligence, 46(8), 5209–5226. https://doi.org/10.1109/TPAMI.2024.3361979 DOI: https://doi.org/10.1109/TPAMI.2024.3361979
Ekman, P. (1999). Handbook of cognition and emotion. Wiley.
Faigin, G. (1990). The artist’s complete guide to facial expression. Watson-Guptill. DOI: https://doi.org/10.1097/00006534-199108000-00037
Fan, J., Zhou, J., Deng, X., Wang, H., Tao, L., & Kwan, H. K. (2022). Combating uncertainty and class imbalance in facial expression recognition. En TENCON 2022 – IEEE Region 10 Conference (pp. 1–4). IEEE. https://doi.org/10.1109/TENCON55691.2022.9977693 DOI: https://doi.org/10.1109/TENCON55691.2022.9977693
Goodfellow, I. J., et al. (2013). Challenges in representation learning: A report on three machine learning contests. arXiv. https://arxiv.org/abs/1307.0414 DOI: https://doi.org/10.1007/978-3-642-42051-1_16
Guerdelli, H., Ferrari, C., Barhoumi, W., Ghazouani, H., & Berretti, S. (2022). Macro- and micro-expressions facial datasets: A survey. Sensors, 22(4), 1524. https://doi.org/10.3390/s22041524 DOI: https://doi.org/10.3390/s22041524
Hu, E., et al. (2022). LoRA: Low-rank adaptation of large language models. arXiv. https://arxiv.org/abs/2106.09685
Kollias, D., Schulc, A., Hajiyev, E., & Zafeiriou, S. (2020). Analysing affective behavior in the first ABAW 2020 competition (p. 643). IEEE. https://doi.org/10.1109/FG47880.2020.00126 DOI: https://doi.org/10.1109/FG47880.2020.00126
Li, S., & Deng, W. (2022). Deep facial expression recognition: A survey. IEEE Transactions on Affective Computing, 13(3), 1195–1215. https://doi.org/10.1109/TAFFC.2020.2981446 DOI: https://doi.org/10.1109/TAFFC.2020.2981446
Li, S., Deng, W., & Du, J. (2017). Reliable crowdsourcing and deep locality-preserving learning for expression recognition in the wild. En 2017 IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (pp. 2584–2593). IEEE. https://doi.org/10.1109/CVPR.2017.277 DOI: https://doi.org/10.1109/CVPR.2017.277
Lucey, P., Cohn, J. F., Kanade, T., Saragih, J., Ambadar, Z., & Matthews, I. (2010). The extended Cohn-Kanade dataset (CK+): A complete dataset for action unit and emotion-specified expression. En 2010 IEEE Computer Society Conference on Computer Vision and Pattern Recognition Workshops (CVPRW) (pp. 94–101). IEEE. https://doi.org/10.1109/CVPRW.2010.5543262 DOI: https://doi.org/10.1109/CVPRW.2010.5543262
Mollahosseini, A., Hasani, B., & Mahoor, M. H. (2019). AffectNet: A database for facial expression, valence, and arousal computing in the wild. IEEE Transactions on Affective Computing, 10(1), 18–31. https://doi.org/10.1109/TAFFC.2017.2740923 DOI: https://doi.org/10.1109/TAFFC.2017.2740923
Office of Institutional Research. (s. f.). Race/ethnicity FAQs. Tufts University. https://provost.tufts.edu/institutionalresearch/race-ethnicity-faq/
Psaroudakis, A., & Kollias, D. (2022). MixAugment & Mixup: Augmentation methods for facial expression recognition. arXiv. https://doi.org/10.48550/arXiv.2205.04442 DOI: https://doi.org/10.1109/CVPRW56347.2022.00264
Stable Diffusion AI. (s. f.). Stable diffusion online – Free AI image generator. https://stabledifffusion.com
Yu, J., Liu, Y., Fan, R., & Sun, G. (2024). MixCut: A data augmentation method for facial expression recognition. arXiv. https://doi.org/10.48550/arXiv.2405.10489
Zeng, Y., & Lee, K. (2023). The expressive power of low-rank adaptation. arXiv. https://doi.org/10.48550/arXiv.2310.17513
Zhang, Y., Li, Y., Qin, L., Liu, X., & Deng, W. (2023). Leave no stone unturned: Mine extra knowledge for imbalanced facial expression recognition. arXiv. https://doi.org/10.48550/arXiv.2310.19636 DOI: https://doi.org/10.52202/075280-0634
Descargas
Publicado
Número
Sección
Licencia
Derechos de autor 2025 Esperança Amengual-Alcover, Maria Francesca Roig-Maimó, Ramon Mas-Sansó, Miquel Mascaró-Oliver

Esta obra está bajo una licencia internacional Creative Commons Atribución-NoComercial 4.0.
