Benchmark de modelos de linguagem de código aberto para text-to-sql em dados oncológicos brasileiros

Loading...
Thumbnail Image

Date

Journal Title

Journal ISSN

Volume Title

Publisher

Instituto Federal de Educação, Ciência e Tecnologia do Piauí

Resumo

Este trabalho apresenta um benchmark experimental para avaliar modelos de linguagem de código aberto na conversão de perguntas em português brasileiro para consultas executáveis sobre dados públicos de atendimentos oncológicos. A fundamentação reúne estudos sobre geração de consultas a partir de linguagem natural, associação entre termos das perguntas e elementos do esquema relacional e avaliação baseada nos resultados obtidos pela execução. Foram comparados os modelos Qwen2.5-Coder 7B, DeepSeek-Coder 6.7B e Llama 3 8B, executados localmente por meio do Ollama, em quatro cenários definidos pela presença ou ausência do esquema do banco de dados e de variações linguísticas controladas nas perguntas. A avaliação considerou a acurácia por execução, as categorias de erro e as latências de geração e execução. O Qwen2.5-Coder 7B apresentou o maior desempenho geral, com acurácia de 80,0%, além da menor latência média de geração. O fornecimento do esquema foi o fator de maior impacto, elevando a acurácia média dos modelos de 53,9% para 93,3%. As variações linguísticas não reduziram o desempenho médio, sugerindo estabilidade diante das alterações superficiais de escrita adotadas. Conclui-se que modelos de linguagem de código aberto podem gerar consultas em cenários controlados, mas seu desempenho depende significativamente do contexto estrutural fornecido e da qualidade da formulação das perguntas.

Description

Keywords

text-to-SQL, modelos de linguagem, banco de dados, dados oncológicos, avaliação por execução

Citation

Endorsement

Review

Supplemented By

Referenced By