No nosso último artigo, mostramos como a indirect prompt injection transformou agentes autônomos no “estagiário mais brilhante e ingênuo do mundo”, capaz de entregar as chaves da empresa a um atacante sem disparar um único alarme. A reação natural de qualquer CISO seria puxar o freio de mão, mas no ambiente corporativo, proibir IA não é uma política de segurança e sim um atestado de obsolescência. A decisão de usar agentes autônomos já foi tomada, com ou sem o aval da área de segurança.
A resposta estrutural tem nome: guardrails. Não como uma lista estática de regras, mas como uma arquitetura que assume o pior, que o agente vai errar, vai ser manipulado, vai tentar fazer o que não deveria, e desenha o sistema para que esse erro custe pouco. Três pilares sustentam essa arquitetura: controle de comandos, blindagem de dados e visibilidade. Cada um tem um preço que raramente aparece nos white papers. É sobre esse preço que este texto quer falar.
Calibrando o peso das regras
O primeiro pilar é o mais óbvio: se o agente pode agir na rede, o que impede uma ação destrutiva? A resposta clássica é o princípio do menor privilégio somado ao human-in-the-loop: a IA lê, resume e prepara; a execução crítica fica retida num gateway de aprovação.
O problema é que “human-in-the-loop” virou uma palavra mágica que esconde uma pergunta: quem aprova, e com que critério? Na operação real, quando o volume de requisições cresce, a revisão vira ritual burocrático; o controle existe no papel, não na prática. E o controle mal calibrado não protege ninguém, apenas torna o processo lento o suficiente para que as áreas de negócio encontrem caminhos paralelos e não homologados para fazer o mesmo trabalho.
Trate o controle como decisão de design, não como custo a minimizar:
Ações irreversíveis: apagar dados, escalar privilégios, alterar configurações críticas exigem barreira humana real, com contexto e justificativa.
Ações reversíveis podem ser automatizadas, desde que deixem trilha auditável.
O erro mais comum é aplicar o mesmo nível de controle a tudo, criando uma fila de aprovações que nenhuma equipe consegue sustentar. Guardrail que ninguém consegue operar é pior do que ausência de guardrail, pois dá a falsa sensação de proteção.
Sustentar esse desenho exige uma disciplina que, no papel, já existe há décadas, só que para humanos. A gestão de acessos privilegiados ensinou o mercado que conta de administrador não se empresta, sessão crítica se grava e elevação de privilégio se concede sob medida. O agente autônomo é um usuário privilegiado com outra roupa: herda as mesmas regras que você aplicaria ao humano, com uma diferença: seus “talentos” operam em milissegundos e não respondem a um prompt de MFA.
E essa não é mais uma analogia de palestra. A Identity Defined Security Alliance estima que as identidades não-humanas já superaram os humanos na proporção de 144 para 1, com crescimento anual de 44%. O Gartner, por sua vez, precisou atualizar a própria definição de PAM para abranger, além de pessoas, “sistemas, aplicações e agentes de IA” e os principais fabricantes do mercado já reposicionaram seus portfólios para essa nova classe de identidades. Quando o próprio Gartner, a entidade que define as categorias do mercado, muda a definição de um controle para acomodar o agente, o problema deixou de ser especulativo: o estagiário do nosso último artigo agora tem cadastro, categoria de produto e trilha de auditoria.
O DLP que não enxerga os canais paralelos
O segundo pilar trata do vazamento de dados de clientes seguindo para modelos externos na nuvem. A solução padrão é o proxy de inspeção de saída, um DLP específico para IA que anonimiza, mascara ou substitui dados pessoais por tokens antes de o prompt deixar o ambiente.
Uma observação importante antes de continuar: enviar dados a um LLM externo não é, por si só, violação da LGPD. O risco regulatório depende da base legal, das cláusulas contratuais com o provedor e da natureza do dado. Quem vende esse cenário como “passivo imediato” está vendendo fumaça, e o leitor técnico percebe.
O ponto que os fornecedores não contam é outro: o DLP de saída cobre apenas o caminho mais visível. O agente não precisa vazar o dado no prompt, ele pode ler o dado, chamar uma API interna, disparar um e-mail ou postar num webhook. O vazamento acontece no comportamento do agente, não no texto que chega ao LLM. Blindar a saída para o provedor sem monitorar as ações do agente é trancar a porta da frente com as janelas abertas.
Existe ainda a tensão fundamental entre mascarar e funcionar: se você anonimiza tudo, o modelo perde o contexto que justifica sua existência. O equilíbrio está em mascarar o que é sensível e preservar o que é operacional, uma distinção que depende de entender o fluxo de dados do negócio, não de configurar uma ferramenta.
O que você realmente consegue auditar
O terceiro pilar é a resposta à Shadow AI: rotear todo o tráfego por um AI Gateway corporativo, com registro imutável do prompt, do contexto lido e da decisão tomada. A intenção é correta; sem um ponto único de inspeção, não existe governança possível.
Mas há uma promessa que exige transparência técnica: o “raciocínio da máquina” não é auditável como os artigos de marketing sugerem. A maioria dos provedores não expõe o chain-of-thought dos modelos, e quando expõe, é uma versão sanitizada. O que se audita de fato é o que entrou (o prompt), o que foi lido (o contexto) e o que o agente fez (as chamadas de ferramenta). Isso já é muito, suficiente para reconstruir um incidente, mas é diferente de “entender o que a máquina pensou”. Prometer o segundo é criar uma expectativa que a investigação não vai cumprir.
E há o ponto que quase ninguém discute: o gateway é um novo ponto único de falha e também um novo alvo. Se o guardrail concentra as decisões, concentra também o valor do ataque. A prompt injection não mira apenas o agente; pode mirar a lógica do próprio guardrail, tentando fazer o controlador aprovar o que deveria bloquear. A arquitetura de proteção precisa ser protegida e isso raramente entra no escopo do projeto.
Guardrail é cultura, não configuração
No fim das contas, colaboradores criam agentes paralelos porque o caminho oficial é lento, burocrático ou inexistente pois o gateway resolve a visibilidade, mas não resolve a motivação. Empresas que tratam a Shadow AI apenas como um problema de bloqueio descobrem, algum tempo depois, que ela voltou com outro nome.
O Gartner resumiu a direção do jogo em uma frase que merece ser lida duas vezes: identidades humanas e de máquina emergiram como a principal superfície de ataque. Décadas protegendo pessoas e dispositivos, e o elo mais frágil da cadeia passou a ser algo que não dorme, não erra por cansaço e não pede desculpas.
A pergunta que define a maturidade de uma operação não é “você tem guardrails?”. É “sua operação consegue sustentá-los?” com gente para revisar, critério para calibrar e processo para evoluir. A arquitetura é necessária, mas é a parte fácil. O difícil começa depois que ela é instalada: é aí que se descobre se a empresa construiu uma defesa ou apenas comprou uma ilusão de controle.
Fontes
- Identity Defined Security Alliance – Securing the AI Era: Privileged Access Management for Non-Human Identities. Acesso em: 14 set. 2026. idsalliance.org
- Gartner – What is Privileged Access Management? (definição de PAM para pessoas, sistemas e agentes de IA). Acesso em: 14 set. 2026. gartner.com
- Gartner – 2026 Predicts: Identity and Access Management (identidades humanas e de máquina como principal superfície de ataque). Acesso em: 14 set. 2026. gartner.com