Quando a Torá descreve Betzalel, o artesão do Mishkan, ela não fala primeiro das mãos dele. Fala de chochmah, tevunah e da'at: sabedoria, entendimento e conhecimento, e só depois de todo tipo de ofício. Ferramenta de IA segue a mesma ordem. O modelo é a parte fácil de trocar. O que decide se a ferramenta serve para produção é o contexto que ela recebe, o que ela pode fazer e como se mede o resultado.
01As quatro camadas de uma ferramenta de IA
Eu olho qualquer ferramenta de IA em quatro camadas, da mais externa para a mais interna. Controle é a avaliação, o guardrail, a observabilidade e o orçamento. Ação são as ferramentas que o agente pode chamar. Contexto é o que chega ao modelo: documentos, código, histórico. Modelo é o raciocínio propriamente dito.
A maior parte das discussões gasta energia na camada de dentro, que é justamente a que mais muda de um trimestre para o outro. As três de fora são decisões de arquitetura com vida longa, e são elas que determinam se dá para trocar de modelo numa tarde sem quebrar nada.
Figura 1Camadas de uma ferramenta de IA, de fora para dentro
Controle gateavaliação contra conjunto de referência, guardrail de entrada e saída, custo e latência medidos
Ação toolsferramentas com contrato e menor privilégio, aprovação humana para escrita
Contexto RAG · MCPdocumentos, código e dados recuperados com controle de acesso e citação
Modelo LLMraciocínio. Substituível, desde que as camadas de fora estejam firmes
A camada mais larga é a que envolve todas as outras. Trocar o modelo não deveria exigir mexer nas três de fora.
02MCP: um conector com contrato
O Model Context Protocol padroniza como um host de IA, seja IDE, chat ou agente, conversa com sistemas externos. O servidor MCP expõe ferramentas, recursos e prompts com esquema declarado, e o host decide o que oferecer ao modelo. O ganho imediato é parar de escrever integração sob medida para cada par de modelo e sistema.
O risco vem junto do ganho: um servidor MCP é uma credencial com interface amigável. Eu trato cada um como aplicação com identidade própria, com escopo mínimo, token de curta duração quando o sistema permite, separação entre leitura e escrita e registro de cada chamada. Servidor que só lê entra com aprovação automática. Servidor que escreve pede confirmação por chamada.
Figura 2Caminho de uma chamada via MCP, com o controle em cada ponto
01IAHostIDE, chat ou agente em que o modelo raciocina
02Cliente MCPdecide quais servidores e ferramentas o modelo enxerga
03Servidor MCPexpõe tools, resources e prompts com esquema declarado
04SistemaGitHub, AWS, observabilidade, ITSM, com credencial de escopo mínimo
05Auditoriacada chamada registrada com quem pediu, parâmetros e resultado
O protocolo resolve a integração. Privilégio mínimo, aprovação e registro continuam sendo decisão de quem instala o servidor.
03RAG com procedência
RAG sem procedência é um jeito elegante de produzir resposta plausível. Para uso interno em operação e segurança, toda resposta precisa citar de onde veio cada afirmação, com link para o trecho, e o leitor precisa conseguir conferir sem pedir nada a ninguém.
O ponto mais esquecido é permissão. Se o documento tem controle de acesso na origem, esse controle precisa existir no índice vetorial e ser aplicado na recuperação, antes do modelo ver o texto. Filtrar depois da geração é tarde demais, porque o conteúdo já influenciou a resposta.
Figura 3Pipeline de RAG com controle de acesso e citação
01Ingestãodocumento entra com dono, data e lista de acesso
02Fatiamentotrechos com cabeçalho e posição preservados para citar
03Embeddingvetor guardado junto dos metadados de permissão
04Recuperaçãofiltro de permissão aplicado antes da similaridade
05IARerankingordena os trechos pela relevância à pergunta
06IARespostacada afirmação com citação do trecho de origem
07Avaliaçãofidelidade à fonte medida num conjunto de referência
O filtro de permissão na recuperação é o que impede o item LLM08 da OWASP: busca vetorial que devolve documento que o usuário não poderia ler.
04Eval como gate de CI
Qualidade de saída de LLM precisa do mesmo tratamento de qualquer métrica de engenharia: um número, um limiar e um pull request que reprova quando o número piora. Troca de prompt, de modelo ou de parâmetro é mudança de código, e merece o mesmo gate.
No projeto em que estou trabalhando o gate usa respostas gravadas: o PR avalia contra uma cassette versionada, sem rede e sem chave, e roda em segundos. A gravação oficial acontece num workflow separado, com o provider em versão fixa, e a cassette sai com atestação de proveniência assinada. Se qualquer campo do request muda, a resposta gravada deixa de valer e o gate bloqueia, sem cair em resposta antiga.
Figura 4Nota de avaliação por pull request, com o limiar do gate
nota do candidato
baseline determinístico
Ver os dados da figura
pull request
nota do candidato
baseline determinístico
1
0,86
0,81
2
0,87
3
0,87
4
0,88
5
0,88
6
0,89
7
0,89
8
0,9
9
0,78
10
0,89
11
0,9
12
0,91
0,81
Exemplo ilustrativo. O PR 9 trocou o prompt e caiu para 0,78, abaixo do limiar: o merge foi bloqueado e a correção entrou no PR 10. A linha do baseline mostra quanto o modelo agrega sobre a solução sem IA.
05Custo e latência também são qualidade
Uma resposta correta que chega em doze segundos numa tela de atendimento é uma resposta ruim. Uma resposta correta que custa dez vezes mais que a alternativa é um problema de orçamento que vai aparecer no fechamento do mês. Por isso a avaliação de ferramenta de IA precisa de critérios que vão além do acerto.
A tabela abaixo é a que eu uso para comparar candidatos. Cada critério tem um jeito de medir e um gate típico, e o gate é definido antes de olhar o resultado, para ninguém ajustar a régua ao número que saiu.
Figura 5Critérios para aprovar uma ferramenta ou modelo de IA
Critério
Como medir
Gate típico
Acerto
conjunto de referência com resposta conhecida
igual ou acima do baseline, com margem
Fidelidade à fonte
afirmações sustentadas pelo trecho citado
sem afirmação sem fonte em resposta factual
Estabilidade
variância entre execuções repetidas do mesmo caso
variância abaixo da margem do limiar
Latência
p95 medido no fluxo real, com contexto de tamanho real
dentro do SLO da jornada
Custo
custo por mil requisições, com tokens de entrada e saída
dentro do orçamento aprovado
Segurança
casos de prompt injection e de vazamento no conjunto
zero regressão nos casos de segurança
O gate é declarado antes da execução. Mudar o gate depois de ver o número é a forma mais comum de fraude involuntária em avaliação.
Para levar
Ferramenta de IA boa para produção se parece mais com um sistema bem arquitetado do que com um modelo esperto. Contexto com procedência e permissão, ação com menor privilégio, avaliação com limiar declarado e custo medido. O modelo muda a cada trimestre; essas decisões ficam.
Tags
#julianovincedecampos
#IaGenerativa
#MCP
#RAG
#LLMOps
#Evals
#EngenhariaDeSoftware
Quem escreve: Juliano Vince de Campos
Gerente de Operações, Tecnologia e Infraestrutura (SRE) numa central de registros. Trabalho com tecnologia desde 2009 e com cibersegurança em tempo integral desde 2015, em infraestrutura crítica, fintech e banking. Escrevo sobre o que eu opero: confiabilidade, segurança, governança e IA que passa por gate antes de chegar em produção.