Use este identificador para citar ou linkar para este item:
https://bia.ifpi.edu.br/jspui/handle/123456789/5793| Tipo: | Trabalho de Conclusão de Curso |
| Título: | Benchmark de modelos de linguagem de código aberto para text-to-sql em dados oncológicos brasileiros |
| Autor: | Mota, Fabrício de Carvalho |
| Orientador(a): | Silva, Wanderson de Vasconcelos Rodrigues |
| metadata.dc.contributor.advisor-co1: | Soares, Jeferson do Nascimento |
| metadata.dc.contributor.referee1: | Santos, Iallen Gábio de Sousa |
| metadata.dc.contributor.referee2: | Budaruiche, Ricardo Moura Sekeff |
| Resumo: | Este trabalho apresenta um benchmark experimental para avaliar modelos de linguagem de código aberto na conversão de perguntas em português brasileiro para consultas executáveis sobre dados públicos de atendimentos oncológicos. A fundamentação reúne estudos sobre geração de consultas a partir de linguagem natural, associação entre termos das perguntas e elementos do esquema relacional e avaliação baseada nos resultados obtidos pela execução. Foram comparados os modelos Qwen2.5-Coder 7B, DeepSeek-Coder 6.7B e Llama 3 8B, executados localmente por meio do Ollama, em quatro cenários definidos pela presença ou ausência do esquema do banco de dados e de variações linguísticas controladas nas perguntas. A avaliação considerou a acurácia por execução, as categorias de erro e as latências de geração e execução. O Qwen2.5-Coder 7B apresentou o maior desempenho geral, com acurácia de 80,0%, além da menor latência média de geração. O fornecimento do esquema foi o fator de maior impacto, elevando a acurácia média dos modelos de 53,9% para 93,3%. As variações linguísticas não reduziram o desempenho médio, sugerindo estabilidade diante das alterações superficiais de escrita adotadas. Conclui-se que modelos de linguagem de código aberto podem gerar consultas em cenários controlados, mas seu desempenho depende significativamente do contexto estrutural fornecido e da qualidade da formulação das perguntas. |
| Abstract: | This work presents an experimental benchmark to evaluate open-source language models in the conversion of questions written in Brazilian Portuguese into executable queries over public oncology care data. The theoretical foundation covers studies on query generation from natural language, the association between terms in questions and elements of relational schemas, and evaluation based on execution results. The Qwen2.5-Coder 7B, DeepSeek-Coder 6.7B, and Llama 3 8B models were compared locally through Ollama in four scenarios defined by the presence or absence of the database schema and controlled linguistic variations in the questions. The evaluation considered execution-based accuracy, error categories, and generation and execution latencies. Qwen2.5-Coder 7B achieved the highest overall performance, with an accuracy of 80.0%, as well as the lowest average generation latency. Providing the database schema was the most influential factor, increasing the average accuracy of the models from 53.9% to 93.3%. The linguistic variations did not reduce average performance, suggesting stability under the superficial writing changes adopted in the experiment. The findings indicate that open-source language models can generate queries in controlled scenarios, although their performance depends significantly on the structural context provided and on the quality of question formulation. |
| Palavras-chave: | text-to-SQL modelos de linguagem banco de dados dados oncológicos avaliação por execução |
| Cnpq: | CNPQ::CIENCIAS EXATAS E DA TERRA |
| metadata.dc.language: | por |
| País: | Brasil |
| Editor: | Instituto Federal de Educação, Ciência e Tecnologia do Piauí |
| Sigla: | IFPI |
| Unidade: | Campus Piripiri |
| Tipo de acesso: | Acesso Aberto |
| URI: | https://bia.ifpi.edu.br/jspui/handle/123456789/5793 |
| Data do documento: | 2026 |
| Aparece nas coleções: | Tecnologia em Análise e Desenvolvimento de Sistemas - Piripiri |
Arquivos associados a este item:
| Arquivo | Descrição | Tamanho | Formato | |
|---|---|---|---|---|
| 2026_termo_fcmota.pdf | 278.53 kB | Adobe PDF | Visualizar/Abrir | |
| 2026_tcc_fcmota.pdf | 1.15 MB | Adobe PDF | Visualizar/Abrir |
Os itens no repositório estão protegidos por copyright, com todos os direitos reservados, salvo quando é indicado o contrário.
