Use este identificador para citar ou linkar para este item: http://www.monografias.ufop.br/handle/35400000/9501
Registro completo de metadados
Campo Dublin CoreValorIdioma
dc.contributor.advisorReis, Agnaldo José da Rochapt_BR
dc.contributor.authorBosada Júnior, Ângelo César-
dc.date.accessioned2026-08-07T12:06:31Z-
dc.date.available2026-08-07T12:06:31Z-
dc.date.issued2026pt_BR
dc.identifier.citationBosada Júnior, Ângelo César. Modelos de linguagem de grande escala : estudo de caso e perspectiva. 2026. 34 f. Monografia (Graduação em Engenharia de Controle e Automação) – Universidade Federal de Ouro Preto, Ouro Preto, 2026.pt_BR
dc.identifier.urihttp://www.monografias.ufop.br/handle/35400000/9501-
dc.description.abstractEste trabalho investiga os modelos de linguagem de larga escala (LLMs), explorando seus fundamentos, evolução, aplicações e limitações. Partindo de uma revisão histórica da inteligência artificial e do processamento de linguagem natural, o estudo destaca o papel central da arquitetura Transformer (vaswani et al., 2017), que, com seus mecanismos de autoatenção, superou as limitações de modelos anteriores baseados em RNNs e CNNs. Examina-se ainda a contribuição seminal de modelos pré-treinados como GPT-1 (radford et al., 2018), BERT (devlin et al., 2019) e GPT-3 (brown et al., 2020), que estabeleceram o paradigma do pré-treinamento seguido de ajuste fino, potencializando a generalização. A discussão também abrange o surgimento dos modelos de fundação, notáveis por sua esca- labilidade e adaptabilidade, e os fenômenos de aprendizado em contexto e de capacidades emergentes (bommasani et al., 2021). Metodologicamente, o estudo instanciou o modelo Mistral-7B-v0.3, treinando-o com a técnica de otimização QLoRA. A base de dados, composta por 26 artigos científicos, foi convertida em 873 pares de instrução–resposta. O treinamento, realizado em uma GPU NVIDIA RTX A4000 (16 GB de VRAM), ajustou aproximadamente 0,09% dos parâmetros do modelo, culminando em uma perda final média de 1,72 após 7 horas. A avaliação combinou análise quantitativa (função de perda) e qualitativa (comparação de respostas a seis questões de referência). Os resultados indicaram uma certa melhoria em cinco questões, com ganhos em precisão, coerência e citação de referências acadêmicas, enquanto uma questão apresentou piora, evidenciando a dependência crítica da qualidade dos dados de treinamento. Conclui-se que os LLMs constituem uma infraestrutura tecnológica central com potencial para transformar setores como saúde, finanças, direito e educação, democratizando o acesso a ferramentas avançadas. No entanto, persistem desafios urgentes relacionados a vieses, custo computacional, governança e alinhamento ético (ouyang et al., 2022). Este trabalho demonstra a viabilidade de pesquisas experimentais com recursos limitados, evidenciando que é possível realizar treinamento especializado de LLMs em ambientes acadêmicos e obter avanços qualitativos relevantespt_BR
dc.language.isopt_BRpt_BR
dc.subjectInteligência artificial generativapt_BR
dc.subjectModelos de linguagem de larga escalapt_BR
dc.subjectTransformerspt_BR
dc.subjectModelos de fundaçãopt_BR
dc.titleModelos de linguagem de grande escala : estudo de caso e perspectiva.pt_BR
dc.typeTCC-Graduaçãopt_BR
dc.contributor.refereeReis, Agnaldo José da Rochapt_BR
dc.contributor.refereeLuz, Eduardo José da Silvapt_BR
dc.contributor.refereeTavares, Felipe Augustopt_BR
dc.description.abstractenThis work investigates Large Language Models (LLMs), exploring their foundations, evolution, applications, and limitations. Starting from a historical review of artificial intelligence and natural language processing, the study highlights the central role of the Transformer architecture (vaswani et al., 2017), which, through its self-attention mechanisms, overcame the limitations of previous models based on RNNs and CNNs. The study also examines the seminal contributions of pretrained models such as GPT- 1 (radford et al., 2018), BERT (devlin et al., 2019), and GPT-3 (brown et al., 2020), which established the paradigm of pre-training followed by fine-tuning, enhancing generalization capabilities. The discussion also addresses the emergence of foundation models, notable for their scalability and adaptability, as well as the phenomena of in-context learning and emergent capabilities (bommasani et al., 2021). Methodologically, the study instantiated the Mistral-7B-v0.3 model, training it using the QLoRA optimization technique. The dataset, composed of 26 scientific articles, was converted into 873 instruction–response pairs. The training, performed on an NVIDIA RTX A4000 GPU (16 GB of VRAM), adjusted approximately 0.09% of the model’s parameters, resulting in a final average loss of 1.72 after 7 hours. The evaluation combined quantitative analysis (loss function) and qualitative analysis (comparison of responses to six reference questions). The results indicated a certain improvement in five questions, with gains in accuracy, coherence, and citation of academic references, while one question showed a decline, highlighting the critical dependence on the quality of the training data. It is concluded that LLMs constitute a central technological infrastructure with the potential to transform sectors such as healthcare, finance, law, and education, democratizing access to advanced tools. However, urgent challenges remain related to bias, computational cost, governance, and ethical alignment (ouyang et al., 2022). This work demonstrates the feasibility of experimental research with limited resources, showing that it is possible to perform specialized LLM training in academic environments and obtain relevant qualitative advances.pt_BR
dc.contributor.authorID17.1.1111pt_BR
Aparece nas coleções:Engenharia de Controle e Automação

Arquivos associados a este item:
Arquivo Descrição TamanhoFormato 
MONOGRAFIA_ModelosLinguagemGrande.pdf683,42 kBAdobe PDFVisualizar/Abrir


Os itens na BDTCC estão protegidos por copyright, com todos os direitos reservados, salvo quando é indicado o contrário.