Pré-treinamento (Pre-training)
Fase inicial em que um modelo aprende padrões gerais a partir de um grande conjunto de dados antes de ser adaptado a tarefas ou domínios específicos. Em LLMs, isso costuma ocorrer por objetivos auto-supervisionados, como prever tokens ausentes ou seguintes, atualizando os pesos para comprimir regularidades da linguagem e do corpus.
Pré-treinamento cria a base estatística sobre a qual prompting, in-context learning e fine-tuning operam. Cobertura ampla não garante fatos atuais, verdade, consentimento sobre os dados ou competência uniforme entre domínios. O corpus, o objetivo e o processo de filtragem determinam parte relevante dos vieses e das lacunas que chegam ao modelo final.