RAG privado é uma IA que responde só com base nos documentos que você indexou — as peças, os modelos, os pareceres e os procedimentos do escritório — e que roda na sua máquina ou no seu servidor, sem que esses documentos saiam de lá. É a camada de ferramenta da base de conhecimento do escritório: a base é o que a IA precisa saber; o RAG é o mecanismo que a faz consultar em vez de inventar. Em 2026, o AnythingLLM tornou isso instalável por quem não programa.
Este guia explica o que RAG é, como o AnythingLLM faz, onde os dados ficam, o que o arranjo resolve — e o que não resolve, porque RAG privado tem limites que o marketing esconde. Eu não sou advogado; sou de tecnologia, com mais de dez anos no mercado jurídico, e o RAG é a peça que transforma "temos 400 modelos numa pasta" em "temos uma IA que conhece os 400".
O que é RAG (em português, sem sigla)
RAG — retrieval-augmented generation, geração aumentada por recuperação — é o arranjo em que a IA, antes de responder, busca nos seus documentos os trechos relevantes e responde a partir deles, citando de onde tirou. Em vez de "o que você sabe sobre cláusula de rescisão?", a pergunta vira "o que os nossos contratos dizem sobre cláusula de rescisão?" — e a resposta vem com o documento e o trecho.
Três consequências para o escritório:
A resposta tem fonte. Você vê de qual peça, qual página, qual parágrafo veio. É conferível.
A IA responde no seu padrão, não na média da internet — porque o material é seu.
Quando não há resposta nos documentos, ela pode dizer "não encontrei" — se você configurar para isso. É o que separa RAG de chat.
O RAG não substitui o conector padrão (MCP) que liga a IA ao sistema do escritório — os dois convivem: o RAG é para o acervo de documentos; o MCP, para as bases estruturadas. A diferença está em MCP no Direito.
O que o AnythingLLM faz (e em que versão)
O AnythingLLM é uma aplicação de código aberto (licença MIT) que faz o RAG completo: você cria um espaço de trabalho, arrasta os documentos, ele indexa, e você conversa com o acervo. Segundo a documentação, existe em três formas (AnythingLLM, docs):
Versão | Onde roda | Para quem |
|---|---|---|
Desktop (macOS, Windows, Linux) | No seu computador; os dados ficam numa pasta local da sua máquina | Uso individual; o começo certo |
Self-hosted (Docker) | No servidor do escritório | Equipe; acesso por várias pessoas com controle |
Cloud | Na nuvem do fabricante | Quem aceita o dado fora — para o escritório, não é o caminho |
O detalhe que faz o "privado" ser verdade: o AnythingLLM permite escolher o modelo de linguagem local (Ollama, LM Studio e outros) e o mecanismo de indexação local. Com os dois locais, nada sai da máquina — nem o documento, nem a pergunta, nem a resposta. Se você escolher um modelo em nuvem (OpenAI, Anthropic, Google), o documento continua indexado localmente, mas os trechos relevantes são enviados ao provedor a cada pergunta; aí vale a régua da conta corporativa.
Na versão desktop, a documentação indica a pasta em que todos os dados ficam — banco vetorial, documentos processados, modelos, registros — dentro do perfil do usuário no sistema operacional. É o que você inclui no backup.
Como montar (o caminho de uma tarde)
Instale o AnythingLLM Desktop na máquina dedicada a IA (a mesma da IA local, se houver).
Configure o modelo local (Ollama ou LM Studio) como provedor. Faça uma pergunta desconectado da internet para confirmar que roda local.
Crie um espaço de trabalho por assunto — "contratos", "trabalhista", "procedimentos internos". Nunca um espaço por cliente com dado identificável no começo; comece pelo conhecimento da casa.
Suba as peças campeãs e os modelos aprovados. Não a pasta inteira: o que já foi revisado e vale como padrão.
Escreva a instrução do espaço: "responda apenas com base nos documentos; se não houver resposta neles, diga 'não encontrei'; cite o documento e o trecho".
Teste com perguntas cuja resposta você conhece. Se errar numa que você sabe, ajuste antes de confiar.
O que o RAG privado resolve — e o que não resolve
O RAG privado resolve o problema de memória institucional consultável: a peça que o escritório fez em 2023 e ninguém lembra, o procedimento que só uma pessoa sabe, a posição da casa sobre uma cláusula. Não resolve três coisas que o marketing costuma prometer:
Promessa | Realidade |
|---|---|
"A IA nunca mais vai alucinar" | Reduz muito, porque a resposta vem do documento — mas o modelo ainda pode interpretar mal o trecho ou combinar dois trechos incompatíveis. Conferência continua |
"Suba todos os arquivos e pronto" | Documento mal digitalizado, tabela complexa e PDF escaneado entram mal ou não entram (o erro silencioso). O acervo precisa ser curado |
"Substitui o sistema do escritório" | Não. RAG é para acervo de texto; processo, prazo e cliente vivem no sistema, e a ponte é o conector |
E o limite que ninguém coloca no anúncio: o RAG responde o que está nos documentos que você subiu. Se o acervo tem uma peça errada, a IA responde errado com fonte. Curar o que entra é a metade do trabalho — e é exatamente a camada de "modelos e padrões" da base de conhecimento, que vira também a matéria-prima das skills de revisão.
Onde os dados ficam (e o backup que isso exige)
Na versão desktop, tudo fica numa pasta do seu perfil de usuário; na self-hosted, no servidor onde você instalou. É o desenho certo — e traz a obrigação de sempre: essa pasta entra no backup do escritório, testado por restauração. Base de conhecimento indexada é ativo; ativo sem cópia é esperança.




