BIA - IFPI Campus Picos Tecnologia Tecnologia em Análise e Desenvolvimento de Sistemas - Picos
Use este identificador para citar ou linkar para este item: https://bia.ifpi.edu.br/jspui/handle/123456789/5856
Tipo: Trabalho de Conclusão de Curso
Título: Detecção de discurso tóxico em redes sociais brasileiras: um estudo comparativo entre modelos clássicos de aprendizado de máquina e modelos de linguagem pré-treinados
Título(s) alternativo(s): Toxic speech detection in Brazilian social networks: a comparative study between classical machine learning models and pre-trained language models
Autor: Leite, Maria Emília Carvalho
Orientador(a): Sousa, Rogério Figueredo de
metadata.dc.contributor.referee1: Luz, Anthony Irlan Marques
metadata.dc.contributor.referee2: Araújo, Israel Cardoso
Resumo: A disseminação de comentários tóxicos em redes sociais representa um desafio para a moderação de conteúdo digital, especialmente no português brasileiro, idioma marcado pelo uso expressivo de palavrões e gírias que tornam ambígua a distinção automática entre ofensa e informalidade comunicativa. Este trabalho apresenta um estudo comparativo entre quatro abordagens de classificação automática de toxicidade, incluindo TF-IDF com Regressão Logística, TF-IDF com Máquina de Vetores de Suporte (SVM), BERTimbau e XLM-RoBERTa, os dois últimos submetidos a ajuste fino sobre o ToLD-BR, conjunto de dados composto por 21.000 comentários do Twitter anotados quanto à toxicidade. Os modelos foram avaliados pelas métricas de Acurácia, F1-Macro, Precisão e Recall. Os resultados indicaram que os modelos Transformer superaram os métodos clássicos em todas as métricas avaliadas, com o BERTimbau alcançando F1-Macro de 0,77 e Acurácia de 0,77, com ganho de 3,37 pontos percentuais sobre o melhor baseline. O BERTimbau, modelo monolíngue treinado exclusivamente em português, superou o XLM-RoBERTa multilíngue, sugerindo que a especialização no idioma é fator relevante para a tarefa. A análise qualitativa dos erros revelou que o principal desafio consiste na ambiguidade entre uso ofensivo e uso expressivo de linguagem coloquial no português brasileiro.
Abstract: The dissemination of toxic comments on social media platforms represents a significant challenge for digital content moderation, particularly in Brazilian Portuguese, a language characterized by the expressive use of profanity and slang that creates ambiguity in the automatic distinction between genuine offense and communicative informality. This paper presents a comparative study of four automatic toxicity classification approaches, including TF-IDF with Logistic Regression, TF-IDF with Support Vector Machine (SVM), BERTimbau and XLM-RoBERTa, the latter two fine-tuned on the ToLD-BR dataset, comprising 21,000 Twitter comments annotated for toxicity. The models were evaluated using Accuracy, Macro F1-score, Precision and Recall. Results showed that Transformer models outperformed classical methods across all evaluated metrics, with BERTimbau achieving Macro F1-score of 0.77 and Accuracy of 0.77, representing a gain of 3.37 percentage points over the best baseline. BERTimbau, a monolingual model trained exclusively on Brazilian Portuguese, outperformed the multilingual XLM-RoBERTa, suggesting that language specialization is a relevant factor for this task. Qualitative error analysis revealed that the main challenge lies in the ambiguity between offensive and expressive colloquial language use in Brazilian Portuguese. These findings reinforce the importance of language-specific models for automated content moderation.
Palavras-chave: Detecção de toxicidade
Processamento de linguagem natural
Transformers
BERTimbau
Português brasileiro
Toxicity detection
Natural language processing
Cnpq: CNPQ::CIENCIAS EXATAS E DA TERRA::CIENCIA DA COMPUTACAO::METODOLOGIA E TECNICAS DA COMPUTACAO::PROCESSAMENTO GRAFICO (GRAPHICS)
CNPQ::CIENCIAS EXATAS E DA TERRA::CIENCIA DA COMPUTACAO::METODOLOGIA E TECNICAS DA COMPUTACAO::SISTEMAS DE INFORMACAO
metadata.dc.language: por
País: Brasil
Editor: Instituto Federal de Educação, Ciência e Tecnologia do Piauí
Sigla: IFPI
Unidade: Campus Picos
Tipo de acesso: Acesso Aberto
URI: https://bia.ifpi.edu.br/jspui/handle/123456789/5856
Data do documento: 12-Ago-2026
Aparece nas coleções:Tecnologia em Análise e Desenvolvimento de Sistemas - Picos

Arquivos associados a este item:
Arquivo Descrição TamanhoFormato 
2026_termo_mecleite.pdf210.08 kBAdobe PDFVisualizar/Abrir
2026_tcc_mecleite.pdf1.79 MBAdobe PDFVisualizar/Abrir


Os itens no repositório estão protegidos por copyright, com todos os direitos reservados, salvo quando é indicado o contrário.