CAG (Cache-Augmented Generation)
Estratégia em que uma base de conhecimento limitada é carregada antecipadamente na janela de contexto do modelo e sua KV cache é reutilizada entre consultas. A pergunta nova consome esse estado pré-computado, dispensando uma busca documental em tempo real. Aqui, CAG significa Cache-Augmented Generation.
O desenho funciona melhor quando o corpus cabe no contexto, muda pouco e o runtime permite reutilizar cache com controle. Ele reduz latência e erros de seleção do retriever, mas introduz custo de pré-carregamento, invalidação, risco de contexto desatualizado e possível diluição de atenção. Bases extensas ou dinâmicas continuam favorecendo RAG; arquiteturas híbridas podem manter conhecimento estável em cache e recuperar apenas o que muda.