Use este identificador para citar ou linkar para este item:
http://www.monografias.ufop.br/handle/35400000/9501| Título: | Modelos de linguagem de grande escala : estudo de caso e perspectiva. |
| Autor(es): | Bosada Júnior, Ângelo César |
| Orientador(es): | Reis, Agnaldo José da Rocha |
| Membros da banca: | Reis, Agnaldo José da Rocha Luz, Eduardo José da Silva Tavares, Felipe Augusto |
| Palavras-chave: | Inteligência artificial generativa Modelos de linguagem de larga escala Transformers Modelos de fundação |
| Data do documento: | 2026 |
| Referência: | Bosada Júnior, Ângelo César. Modelos de linguagem de grande escala : estudo de caso e perspectiva. 2026. 34 f. Monografia (Graduação em Engenharia de Controle e Automação) – Universidade Federal de Ouro Preto, Ouro Preto, 2026. |
| Resumo: | Este trabalho investiga os modelos de linguagem de larga escala (LLMs), explorando seus fundamentos, evolução, aplicações e limitações. Partindo de uma revisão histórica da inteligência artificial e do processamento de linguagem natural, o estudo destaca o papel central da arquitetura Transformer (vaswani et al., 2017), que, com seus mecanismos de autoatenção, superou as limitações de modelos anteriores baseados em RNNs e CNNs. Examina-se ainda a contribuição seminal de modelos pré-treinados como GPT-1 (radford et al., 2018), BERT (devlin et al., 2019) e GPT-3 (brown et al., 2020), que estabeleceram o paradigma do pré-treinamento seguido de ajuste fino, potencializando a generalização. A discussão também abrange o surgimento dos modelos de fundação, notáveis por sua esca- labilidade e adaptabilidade, e os fenômenos de aprendizado em contexto e de capacidades emergentes (bommasani et al., 2021). Metodologicamente, o estudo instanciou o modelo Mistral-7B-v0.3, treinando-o com a técnica de otimização QLoRA. A base de dados, composta por 26 artigos científicos, foi convertida em 873 pares de instrução–resposta. O treinamento, realizado em uma GPU NVIDIA RTX A4000 (16 GB de VRAM), ajustou aproximadamente 0,09% dos parâmetros do modelo, culminando em uma perda final média de 1,72 após 7 horas. A avaliação combinou análise quantitativa (função de perda) e qualitativa (comparação de respostas a seis questões de referência). Os resultados indicaram uma certa melhoria em cinco questões, com ganhos em precisão, coerência e citação de referências acadêmicas, enquanto uma questão apresentou piora, evidenciando a dependência crítica da qualidade dos dados de treinamento. Conclui-se que os LLMs constituem uma infraestrutura tecnológica central com potencial para transformar setores como saúde, finanças, direito e educação, democratizando o acesso a ferramentas avançadas. No entanto, persistem desafios urgentes relacionados a vieses, custo computacional, governança e alinhamento ético (ouyang et al., 2022). Este trabalho demonstra a viabilidade de pesquisas experimentais com recursos limitados, evidenciando que é possível realizar treinamento especializado de LLMs em ambientes acadêmicos e obter avanços qualitativos relevantes |
| Resumo em outra língua: | This work investigates Large Language Models (LLMs), exploring their foundations, evolution, applications, and limitations. Starting from a historical review of artificial intelligence and natural language processing, the study highlights the central role of the Transformer architecture (vaswani et al., 2017), which, through its self-attention mechanisms, overcame the limitations of previous models based on RNNs and CNNs. The study also examines the seminal contributions of pretrained models such as GPT- 1 (radford et al., 2018), BERT (devlin et al., 2019), and GPT-3 (brown et al., 2020), which established the paradigm of pre-training followed by fine-tuning, enhancing generalization capabilities. The discussion also addresses the emergence of foundation models, notable for their scalability and adaptability, as well as the phenomena of in-context learning and emergent capabilities (bommasani et al., 2021). Methodologically, the study instantiated the Mistral-7B-v0.3 model, training it using the QLoRA optimization technique. The dataset, composed of 26 scientific articles, was converted into 873 instruction–response pairs. The training, performed on an NVIDIA RTX A4000 GPU (16 GB of VRAM), adjusted approximately 0.09% of the model’s parameters, resulting in a final average loss of 1.72 after 7 hours. The evaluation combined quantitative analysis (loss function) and qualitative analysis (comparison of responses to six reference questions). The results indicated a certain improvement in five questions, with gains in accuracy, coherence, and citation of academic references, while one question showed a decline, highlighting the critical dependence on the quality of the training data. It is concluded that LLMs constitute a central technological infrastructure with the potential to transform sectors such as healthcare, finance, law, and education, democratizing access to advanced tools. However, urgent challenges remain related to bias, computational cost, governance, and ethical alignment (ouyang et al., 2022). This work demonstrates the feasibility of experimental research with limited resources, showing that it is possible to perform specialized LLM training in academic environments and obtain relevant qualitative advances. |
| URI: | http://www.monografias.ufop.br/handle/35400000/9501 |
| Aparece nas coleções: | Engenharia de Controle e Automação |
Arquivos associados a este item:
| Arquivo | Descrição | Tamanho | Formato | |
|---|---|---|---|---|
| MONOGRAFIA_ModelosLinguagemGrande.pdf | 683,42 kB | Adobe PDF | Visualizar/Abrir |
Os itens na BDTCC estão protegidos por copyright, com todos os direitos reservados, salvo quando é indicado o contrário.
