Please use this identifier to cite or link to this item:
https://dspace.sti.ufcg.edu.br/handle/riufcg/44314| Title: | Detecção automática de memes preconceituosos em português brasileiro. |
| Other Titles: | Automatic detection of prejudiced memes in Brazilian Portuguese. |
| ???metadata.dc.creator???: | MENEZES, Hanna França. |
| ???metadata.dc.contributor.advisor1???: | GOMES, Herman Martins. |
| ???metadata.dc.contributor.advisor2???: | PEREIRA, Eanes Torres. |
| ???metadata.dc.contributor.referee1???: | BAPTISTA, Cláudio de Souza. |
| ???metadata.dc.contributor.referee2???: | CAMPELO, Cláudio Elízio Calazans. |
| ???metadata.dc.contributor.referee3???: | PAIVA, Anselmo Cardoso de. |
| ???metadata.dc.contributor.referee4???: | IASULAITIS, Sylvia. |
| Keywords: | Inteligência Artificial;MLLM;Discurso preconceituoso;Meme;Artificial Intelligence;MLLM;prejudiced speech;Meme |
| Issue Date: | 25-Sep-2025 |
| Publisher: | Universidade Federal de Campina Grande |
| Citation: | MENEZES, Hanna França. Detecção automática de memes preconceituosos em português brasileiro. 2025. 146 f. Tese (Doutorado em Ciência da Computação) – Programa de Pós Graduação em Ciência da Computação, Centro de Engenharia Elétrica e Informática, Universidade Federal de Campina Grande, Paraíba, Brasil, 2025. |
| ???metadata.dc.description.resumo???: | Com o crescimento exponencial das plataformas de mídia social, diversos tipos de conteúdo são compartilhados diariamente, destacando-se os memes — artefatos multimodais compostos, geralmente, por texto e imagem. Os memes funcionam como uma forma ágil de comunicação para expressar ideias, críticas, humor, entre outros. Contudo, seu uso tem também promovido a disseminação de mensagens com conteúdo nocivo. Embora nos últimos anos tenha havido avanços significativos na detecção automática desse tipo de conteúdo, a maioria das soluções de ponta concentra-se em memes na língua inglesa. Devido à natureza multimodal, a análise automática de memes é um problema complexo, pois a compreensão do conteúdo de um meme só é possível quando texto e imagem são analisados conjuntamente, sendo também necessário conhecimento externo relacionado ao contexto semântico e cultural em que o mesmo está inserido. A presente tese teve como objetivo propor uma abordagem para a detecção automática de conteúdo preconceituoso em memes de língua portuguesa, especificamente no português brasileiro. O método proposto tem como base a aplicação de técnicas de transferência de conhecimento, por meio do ajuste fino com reparametrização, em um Grande Modelo Multimodal (MLLM) de código aberto. Para fins de treinamento e validação da abordagem proposta, foi construída e rotulada uma base de dados de memes em língua portuguesa. Os resultados da classificação binária (meme preconceituoso versus não preconceituoso), demonstraram que a detecção de memes preconceituosos em português brasileiro é uma tarefa desafiadora, mesmo para modelos de ponta, ao mesmo tempo em que demonstra a eficácia da estratégia adotada ao atingir um desempenho competitivo, com uma pontuação F1 de 0,81, quando comparado com modelos treinados e avaliados com memes de língua inglesa. Adicionalmente, ao comparar a abordagem proposta indiretamente com abordagens destinadas a outros idiomas, observou-se um desempenho superior a abordagens projetadas para Tamil, Bengali e Espanhol. Também foram observados insights relevantes para o contexto linguístico e cultural do português brasileiro. Desta forma, esta pesquisa contribuiu com uma solução para o problema de identificação automática de conteúdo nocivo em mídias sociais na língua portuguesa do Brasil. Além disso, os resultados apresentados fomentam discussão sobre as especificidades linguísticas e culturais do idioma alvo no problema estudado. |
| Abstract: | With the exponential growth of social media platforms, various types of content are shared daily, with memes standing out — multimodal artifacts typically composed of text and image. Memes serve as a fast form of communication to express ideas, critiques, humor, among others. However, their use has also promoted the spread of harmful content. Although significant advances have been made in recent years in the automatic detection of such content, most state-of-the-art solutions focus on memes in the English language. Due to their multimodal nature, the automatic analysis of memes is a complex problem, since understanding a meme's content is only possible when text and image are analyzed together, and external knowledge related to the semantic and cultural context in which it is embedded is also necessary. This thesis aimed to propose an approach for the automatic detection of prejudiced content in Portuguese-language memes, specifically Brazilian Portuguese. The proposed method is based on the application of knowledge transfer techniques through fine-tuning with reparameterization in an open-source Multimodal Large Language Model (MLLM). For training and validation purposes, a dataset of Portuguese-language memes was built and labeled. The results of the binary classification task (prejudiced meme versus non-prejudiced meme) demonstrated that detecting prejudiced memes in Brazilian Portuguese is a challenging task, even for state-of-the-art models, while also demonstrating the effectiveness of the adopted strategy by achieving competitive performance, with an F1 score of 0.81, when compared to models trained and evaluated on English-language memes. Additionally, an indirect comparison of the proposed approach with methods designed for other languages showed superior performance to approaches aimed at Tamil, Bengali, and Spanish. Relevant insights were also observed regarding the linguistic and cultural context of Brazilian Portuguese. Thus, this research contributed a solution to the problem of automatic identification of harmful content on social media in Brazilian Portuguese. Furthermore, the results presented promote discussion about the linguistic and cultural specificities of the target language in the studied problem. |
| Keywords: | Inteligência Artificial MLLM Discurso preconceituoso Meme Artificial Intelligence MLLM prejudiced speech Meme |
| ???metadata.dc.subject.cnpq???: | Ciência da Computação |
| URI: | https://dspace.sti.ufcg.edu.br/handle/riufcg/44314 |
| Appears in Collections: | Doutorado em Ciência da Computação. |
Files in This Item:
| File | Description | Size | Format | |
|---|---|---|---|---|
| HANNA FRANÇA MENEZES - TESE - (PPGCC) 2025.pdf | 18.89 MB | Adobe PDF | View/Open |
Items in DSpace are protected by copyright, with all rights reserved, unless otherwise indicated.
