Use este identificador para citar ou linkar para este item:
https://bia.ifpi.edu.br/jspui/handle/123456789/5856| Tipo: | Trabalho de Conclusão de Curso |
| Título: | Detecção de discurso tóxico em redes sociais brasileiras: um estudo comparativo entre modelos clássicos de aprendizado de máquina e modelos de linguagem pré-treinados |
| Título(s) alternativo(s): | Toxic speech detection in Brazilian social networks: a comparative study between classical machine learning models and pre-trained language models |
| Autor: | Leite, Maria Emília Carvalho |
| Orientador(a): | Sousa, Rogério Figueredo de |
| metadata.dc.contributor.referee1: | Luz, Anthony Irlan Marques |
| metadata.dc.contributor.referee2: | Araújo, Israel Cardoso |
| Resumo: | A disseminação de comentários tóxicos em redes sociais representa um desafio para a moderação de conteúdo digital, especialmente no português brasileiro, idioma marcado pelo uso expressivo de palavrões e gírias que tornam ambígua a distinção automática entre ofensa e informalidade comunicativa. Este trabalho apresenta um estudo comparativo entre quatro abordagens de classificação automática de toxicidade, incluindo TF-IDF com Regressão Logística, TF-IDF com Máquina de Vetores de Suporte (SVM), BERTimbau e XLM-RoBERTa, os dois últimos submetidos a ajuste fino sobre o ToLD-BR, conjunto de dados composto por 21.000 comentários do Twitter anotados quanto à toxicidade. Os modelos foram avaliados pelas métricas de Acurácia, F1-Macro, Precisão e Recall. Os resultados indicaram que os modelos Transformer superaram os métodos clássicos em todas as métricas avaliadas, com o BERTimbau alcançando F1-Macro de 0,77 e Acurácia de 0,77, com ganho de 3,37 pontos percentuais sobre o melhor baseline. O BERTimbau, modelo monolíngue treinado exclusivamente em português, superou o XLM-RoBERTa multilíngue, sugerindo que a especialização no idioma é fator relevante para a tarefa. A análise qualitativa dos erros revelou que o principal desafio consiste na ambiguidade entre uso ofensivo e uso expressivo de linguagem coloquial no português brasileiro. |
| Abstract: | The dissemination of toxic comments on social media platforms represents a significant challenge for digital content moderation, particularly in Brazilian Portuguese, a language characterized by the expressive use of profanity and slang that creates ambiguity in the automatic distinction between genuine offense and communicative informality. This paper presents a comparative study of four automatic toxicity classification approaches, including TF-IDF with Logistic Regression, TF-IDF with Support Vector Machine (SVM), BERTimbau and XLM-RoBERTa, the latter two fine-tuned on the ToLD-BR dataset, comprising 21,000 Twitter comments annotated for toxicity. The models were evaluated using Accuracy, Macro F1-score, Precision and Recall. Results showed that Transformer models outperformed classical methods across all evaluated metrics, with BERTimbau achieving Macro F1-score of 0.77 and Accuracy of 0.77, representing a gain of 3.37 percentage points over the best baseline. BERTimbau, a monolingual model trained exclusively on Brazilian Portuguese, outperformed the multilingual XLM-RoBERTa, suggesting that language specialization is a relevant factor for this task. Qualitative error analysis revealed that the main challenge lies in the ambiguity between offensive and expressive colloquial language use in Brazilian Portuguese. These findings reinforce the importance of language-specific models for automated content moderation. |
| Palavras-chave: | Detecção de toxicidade Processamento de linguagem natural Transformers BERTimbau Português brasileiro Toxicity detection Natural language processing |
| Cnpq: | CNPQ::CIENCIAS EXATAS E DA TERRA::CIENCIA DA COMPUTACAO::METODOLOGIA E TECNICAS DA COMPUTACAO::PROCESSAMENTO GRAFICO (GRAPHICS) CNPQ::CIENCIAS EXATAS E DA TERRA::CIENCIA DA COMPUTACAO::METODOLOGIA E TECNICAS DA COMPUTACAO::SISTEMAS DE INFORMACAO |
| metadata.dc.language: | por |
| País: | Brasil |
| Editor: | Instituto Federal de Educação, Ciência e Tecnologia do Piauí |
| Sigla: | IFPI |
| Unidade: | Campus Picos |
| Tipo de acesso: | Acesso Aberto |
| URI: | https://bia.ifpi.edu.br/jspui/handle/123456789/5856 |
| Data do documento: | 12-Ago-2026 |
| Aparece nas coleções: | Tecnologia em Análise e Desenvolvimento de Sistemas - Picos |
Arquivos associados a este item:
| Arquivo | Descrição | Tamanho | Formato | |
|---|---|---|---|---|
| 2026_termo_mecleite.pdf | 210.08 kB | Adobe PDF | Visualizar/Abrir | |
| 2026_tcc_mecleite.pdf | 1.79 MB | Adobe PDF | Visualizar/Abrir |
Os itens no repositório estão protegidos por copyright, com todos os direitos reservados, salvo quando é indicado o contrário.
