Detecção de discurso tóxico em redes sociais brasileiras: um estudo comparativo entre modelos clássicos de aprendizado de máquina e modelos de linguagem pré-treinados

dc.contributor.advisor1 Sousa, Rogério Figueredo de
dc.contributor.advisor1Lattes http://lattes.cnpq.br/9346694618502913pt_BR
dc.contributor.referee1 Luz, Anthony Irlan Marques
dc.contributor.referee1Lattes http://lattes.cnpq.br/5224279549390467pt_BR
dc.contributor.referee2 Araújo, Israel Cardoso
dc.contributor.referee2Lattes http://lattes.cnpq.br/8618845227516427pt_BR
dc.creator Leite, Maria Emília Carvalho
dc.creator.Lattes https://lattes.cnpq.br/1436619365619826pt_BR
dc.date.accessioned 2026-08-26T12:09:01Z
dc.date.available 2026-08-26T12:09:01Z
dc.date.issued 2026-08-12
dc.description.abstract The dissemination of toxic comments on social media platforms represents a significant challenge for digital content moderation, particularly in Brazilian Portuguese, a language characterized by the expressive use of profanity and slang that creates ambiguity in the automatic distinction between genuine offense and communicative informality. This paper presents a comparative study of four automatic toxicity classification approaches, including TF-IDF with Logistic Regression, TF-IDF with Support Vector Machine (SVM), BERTimbau and XLM-RoBERTa, the latter two fine-tuned on the ToLD-BR dataset, comprising 21,000 Twitter comments annotated for toxicity. The models were evaluated using Accuracy, Macro F1-score, Precision and Recall. Results showed that Transformer models outperformed classical methods across all evaluated metrics, with BERTimbau achieving Macro F1-score of 0.77 and Accuracy of 0.77, representing a gain of 3.37 percentage points over the best baseline. BERTimbau, a monolingual model trained exclusively on Brazilian Portuguese, outperformed the multilingual XLM-RoBERTa, suggesting that language specialization is a relevant factor for this task. Qualitative error analysis revealed that the main challenge lies in the ambiguity between offensive and expressive colloquial language use in Brazilian Portuguese. These findings reinforce the importance of language-specific models for automated content moderation.pt_BR
dc.description.resumo A disseminação de comentários tóxicos em redes sociais representa um desafio para a moderação de conteúdo digital, especialmente no português brasileiro, idioma marcado pelo uso expressivo de palavrões e gírias que tornam ambígua a distinção automática entre ofensa e informalidade comunicativa. Este trabalho apresenta um estudo comparativo entre quatro abordagens de classificação automática de toxicidade, incluindo TF-IDF com Regressão Logística, TF-IDF com Máquina de Vetores de Suporte (SVM), BERTimbau e XLM-RoBERTa, os dois últimos submetidos a ajuste fino sobre o ToLD-BR, conjunto de dados composto por 21.000 comentários do Twitter anotados quanto à toxicidade. Os modelos foram avaliados pelas métricas de Acurácia, F1-Macro, Precisão e Recall. Os resultados indicaram que os modelos Transformer superaram os métodos clássicos em todas as métricas avaliadas, com o BERTimbau alcançando F1-Macro de 0,77 e Acurácia de 0,77, com ganho de 3,37 pontos percentuais sobre o melhor baseline. O BERTimbau, modelo monolíngue treinado exclusivamente em português, superou o XLM-RoBERTa multilíngue, sugerindo que a especialização no idioma é fator relevante para a tarefa. A análise qualitativa dos erros revelou que o principal desafio consiste na ambiguidade entre uso ofensivo e uso expressivo de linguagem coloquial no português brasileiro.pt_BR
dc.identifier.uri https://bia.ifpi.edu.br/jspui/handle/123456789/5856
dc.language porpt_BR
dc.publisher Instituto Federal de Educação, Ciência e Tecnologia do Piauípt_BR
dc.publisher.country Brasilpt_BR
dc.publisher.department Campus Picospt_BR
dc.publisher.initials IFPIpt_BR
dc.rights Acesso Abertopt_BR
dc.subject Detecção de toxicidadept_BR
dc.subject Processamento de linguagem naturalpt_BR
dc.subject Transformerspt_BR
dc.subject BERTimbaupt_BR
dc.subject Português brasileiropt_BR
dc.subject Toxicity detectionpt_BR
dc.subject Natural language processingpt_BR
dc.subject.cnpq CNPQ::CIENCIAS EXATAS E DA TERRA::CIENCIA DA COMPUTACAO::METODOLOGIA E TECNICAS DA COMPUTACAO::PROCESSAMENTO GRAFICO (GRAPHICS)pt_BR
dc.subject.cnpq CNPQ::CIENCIAS EXATAS E DA TERRA::CIENCIA DA COMPUTACAO::METODOLOGIA E TECNICAS DA COMPUTACAO::SISTEMAS DE INFORMACAOpt_BR
dc.title Detecção de discurso tóxico em redes sociais brasileiras: um estudo comparativo entre modelos clássicos de aprendizado de máquina e modelos de linguagem pré-treinadospt_BR
dc.title.alternative Toxic speech detection in Brazilian social networks: a comparative study between classical machine learning models and pre-trained language modelspt_BR
dc.type Trabalho de Conclusão de Cursopt_BR

Files

Original bundle

Now showing 1 - 2 of 2
Loading...
Thumbnail Image
Name:
2026_termo_mecleite.pdf
Size:
210.08 KB
Format:
Description:
Loading...
Thumbnail Image
Name:
2026_tcc_mecleite.pdf
Size:
1.74 MB
Format:
Adobe Portable Document Format
Description:

License bundle

Now showing 1 - 1 of 1
Loading...
Thumbnail Image
Name:
license.txt
Size:
1.82 KB
Format:
Item-specific license agreed upon to submission
Description: