Context engineering: os quatro pilares e por que a janela cheia atrapalha
Em 18 modelos testados, o desempenho cai conforme a entrada cresce, antes de a janela encher. Os quatro pilares para manter o contexto pequeno.
- context engineering
- context rot
Engenharia de agentes que aguentam produção: ferramentas, loops de verificação, contexto, guardrails e telemetria, com cada número rastreado até a fonte.
Em 18 modelos testados, o desempenho cai conforme a entrada cresce, antes de a janela encher. Os quatro pilares para manter o contexto pequeno.
Memória cortou os passos de 20 para 5 num estudo da Databricks. E fez o agente repetir o próprio erro com mais confiança. O que guardar e o que apagar.
89% das equipes instrumentaram os agentes e só 52% avaliam. Como montar conjunto de teste, escolher limiar e colocar o portão no CI sem falso alarme.
Juiz LLM concorda com humanos tanto quanto humanos entre si. E erra de formas medidas: só o rótulo de autoria move a nota em 0,43 ponto.
Das falhas documentadas de agentes, 40 em 52 eram evitáveis por camadas do harness. Onde colocar a trava e por que classificador não basta.
Bug de agente não se reproduz: o rastro precisa existir antes do erro. A árvore de spans, os atributos do OpenTelemetry e o que ainda muda.
Com 10 ferramentas o agente acerta tudo; com 107 ele falha por completo. Como desenhar ferramentas que um agente usa bem, com antes e depois.
Perguntar "tem certeza?" faz o modelo trocar de resposta em 46% dos casos e perder 17 pontos. O gargalo é achar o erro, não consertar.
Harness engineering explicado: por que a LangChain subiu 25 posições sem trocar de modelo, as cinco camadas e o que decide numa tarefa longa.
A lista oficial do OWASP Top 10 para agentes de IA, de ASI01 a ASI10, com o incidente real e datado que já explorou cada um dos dez riscos.
Doze defesas contra prompt injection que reportavam taxa quase zero foram quebradas acima de 90%. Por que o problema é estrutural e o que reduz risco.