BIA - IFPI Campus Piripiri Tecnologia Tecnologia em Análise e Desenvolvimento de Sistemas - Piripiri
Use este identificador para citar ou linkar para este item: https://bia.ifpi.edu.br/jspui/handle/123456789/5793
Tipo: Trabalho de Conclusão de Curso
Título: Benchmark de modelos de linguagem de código aberto para text-to-sql em dados oncológicos brasileiros
Autor: Mota, Fabrício de Carvalho
Orientador(a): Silva, Wanderson de Vasconcelos Rodrigues
metadata.dc.contributor.advisor-co1: Soares, Jeferson do Nascimento
metadata.dc.contributor.referee1: Santos, Iallen Gábio de Sousa
metadata.dc.contributor.referee2: Budaruiche, Ricardo Moura Sekeff
Resumo: Este trabalho apresenta um benchmark experimental para avaliar modelos de linguagem de código aberto na conversão de perguntas em português brasileiro para consultas executáveis sobre dados públicos de atendimentos oncológicos. A fundamentação reúne estudos sobre geração de consultas a partir de linguagem natural, associação entre termos das perguntas e elementos do esquema relacional e avaliação baseada nos resultados obtidos pela execução. Foram comparados os modelos Qwen2.5-Coder 7B, DeepSeek-Coder 6.7B e Llama 3 8B, executados localmente por meio do Ollama, em quatro cenários definidos pela presença ou ausência do esquema do banco de dados e de variações linguísticas controladas nas perguntas. A avaliação considerou a acurácia por execução, as categorias de erro e as latências de geração e execução. O Qwen2.5-Coder 7B apresentou o maior desempenho geral, com acurácia de 80,0%, além da menor latência média de geração. O fornecimento do esquema foi o fator de maior impacto, elevando a acurácia média dos modelos de 53,9% para 93,3%. As variações linguísticas não reduziram o desempenho médio, sugerindo estabilidade diante das alterações superficiais de escrita adotadas. Conclui-se que modelos de linguagem de código aberto podem gerar consultas em cenários controlados, mas seu desempenho depende significativamente do contexto estrutural fornecido e da qualidade da formulação das perguntas.
Abstract: This work presents an experimental benchmark to evaluate open-source language models in the conversion of questions written in Brazilian Portuguese into executable queries over public oncology care data. The theoretical foundation covers studies on query generation from natural language, the association between terms in questions and elements of relational schemas, and evaluation based on execution results. The Qwen2.5-Coder 7B, DeepSeek-Coder 6.7B, and Llama 3 8B models were compared locally through Ollama in four scenarios defined by the presence or absence of the database schema and controlled linguistic variations in the questions. The evaluation considered execution-based accuracy, error categories, and generation and execution latencies. Qwen2.5-Coder 7B achieved the highest overall performance, with an accuracy of 80.0%, as well as the lowest average generation latency. Providing the database schema was the most influential factor, increasing the average accuracy of the models from 53.9% to 93.3%. The linguistic variations did not reduce average performance, suggesting stability under the superficial writing changes adopted in the experiment. The findings indicate that open-source language models can generate queries in controlled scenarios, although their performance depends significantly on the structural context provided and on the quality of question formulation.
Palavras-chave: text-to-SQL
modelos de linguagem
banco de dados
dados oncológicos
avaliação por execução
Cnpq: CNPQ::CIENCIAS EXATAS E DA TERRA
metadata.dc.language: por
País: Brasil
Editor: Instituto Federal de Educação, Ciência e Tecnologia do Piauí
Sigla: IFPI
Unidade: Campus Piripiri
Tipo de acesso: Acesso Aberto
URI: https://bia.ifpi.edu.br/jspui/handle/123456789/5793
Data do documento: 2026
Aparece nas coleções:Tecnologia em Análise e Desenvolvimento de Sistemas - Piripiri

Arquivos associados a este item:
Arquivo Descrição TamanhoFormato 
2026_termo_fcmota.pdf278.53 kBAdobe PDFVisualizar/Abrir
2026_tcc_fcmota.pdf1.15 MBAdobe PDFVisualizar/Abrir


Os itens no repositório estão protegidos por copyright, com todos os direitos reservados, salvo quando é indicado o contrário.