Investigating Methods to Detect Off-Topic Essays

dc.contributor.advisor1 Anchiêta, Rafael Torres
dc.contributor.advisor1Lattes http://lattes.cnpq.br/702189535765436pt_BR
dc.contributor.referee1 Medeiros, Manoel Messias Pereira
dc.contributor.referee1Lattes http://lattes.cnpq.br/3692751461745479pt_BR
dc.contributor.referee2 Sousa, Rogério Figueredo
dc.contributor.referee2Lattes http://lattes.cnpq.br/9346694618502913.pt_BR
dc.creator Silva, Joyce Moura
dc.creator.Lattes http://lattes.cnpq.br/5034898118586859pt_BR
dc.date.accessioned 2026-08-25T11:35:54Z
dc.date.available 2026-08-25T11:35:54Z
dc.date.issued 2025-02-13
dc.description.abstract Automated Essay Scoring is one of the most important educational applications of natural language processing. It helps teachers with automatic assessments, providing a cheaper, faster, and more deterministic approach than humans when scoring essays. Nevertheless, off-topic essays pose challenges in this area, causing an automated grader to overestimate the score of an essay that does not adhere to a proposed topic. Thus, detecting off-topic essays is important for dealing with unrelated text responses to a given topic. This paper explored approaches based on handcrafted features to feed supervised machine-learning algorithms, tuning a BERT model, and prompt engineering with a large language model. We assessed these strategies in a public corpus of Portuguese essays, achieving the best result using a fine-tuned BERT model with a 75% balanced accuracy. Furthermore, this strategy was able to identify low-quality essays.pt_BR
dc.description.resumo A Avaliação Automatizada de Redações (Automated Essay Scoring) é uma das aplicações educacionais mais importantes do processamento de linguagem natural. Ela auxilia os professores na avaliação automática, oferecendo uma abordagem mais barata, rápida e determinística do que a avaliação humana na atribuição de notas às redações. No entanto, redações que fogem do tema proposto representam desafios nessa área, fazendo com que um avaliador automatizado superestime a nota de uma redação que não está de acordo com o tema proposto. Assim, detectar redações fora do tema é importante para lidar com respostas textuais não relacionadas ao tema apresentado. Este artigo explorou abordagens baseadas em características elaboradas manualmente para alimentar algoritmos de aprendizado de máquina supervisionado, o ajuste fino de um modelo BERT e a engenharia de prompts com um modelo de linguagem de grande escala. Avaliamos essas estratégias em um corpus público de redações em português, obtendo o melhor resultado com um modelo BERT ajustado, que alcançou 75% de acurácia balanceada. Além disso, essa estratégia foi capaz de identificar redações de baixa qualidade.pt_BR
dc.description.sponsorship Agência 1pt_BR
dc.identifier.uri https://bia.ifpi.edu.br/jspui/handle/123456789/5839
dc.language porpt_BR
dc.publisher Instituto Federal de Educação, Ciência e Tecnologia do Piauípt_BR
dc.publisher.country Brasilpt_BR
dc.publisher.department Campus Picospt_BR
dc.publisher.initials IFPIpt_BR
dc.rights Acesso Abertopt_BR
dc.subject Automated Essay Scoring, Off-Topic Essays, BERT.pt_BR
dc.subject.cnpq Inteligência Artificialpt_BR
dc.subject.cnpq Computaçãopt_BR
dc.title Investigating Methods to Detect Off-Topic Essayspt_BR
dc.title.alternative Investigando métodos para detectar redações fora do tema.pt_BR
dc.type Trabalho de Conclusão de Cursopt_BR

Files

Original bundle

Now showing 1 - 2 of 2
Loading...
Thumbnail Image
Name:
2025_tcc_jmsilva.pdf
Size:
216.02 KB
Format:
Adobe Portable Document Format
Description:
Loading...
Thumbnail Image
Name:
2025_termo_jmsilva.pdf
Size:
215.73 KB
Format:
Description:

License bundle

Now showing 1 - 1 of 1
Loading...
Thumbnail Image
Name:
license.txt
Size:
1.82 KB
Format:
Item-specific license agreed upon to submission
Description: