Skip to content

Guardrails

Pensa nos guardrails (em português, "grades de proteção") como as regras de conduta que você dá ao seu atendente antes de ele começar a trabalhar. "Não fale sobre preços sem autorização." "Se o cliente pedir desconto acima de 20%, escala para o gerente." "Nunca fale mal de concorrentes."

No Atende Direito, os guardrails são validações automáticas que o Agent aplica em duas etapas: antes de processar a mensagem do cliente (entrada) e antes de enviar a resposta (saída). Se uma regra for violada, o Agent reage conforme você configurou.

Aba Guardrails do assistente de criação do Agent, com os filtros obrigatórios de saída, as opções de redação de PII e inspeção por LLM Judge, e o toggle de guardrails de entrada.

Aba Guardrails do assistente de criação do Agent, com os filtros obrigatórios de saída, as opções de redação de PII e inspeção por LLM Judge, e o toggle de guardrails de entrada.

Validadores de Entrada

Os validadores de entrada analisam a mensagem do cliente antes de o Agent processá-la.

Exemplos de uso:

  • Bloquear mensagens com linguagem ofensiva
  • Detectar tentativas de manipulação ("ignore suas instruções anteriores...")
  • Filtrar assuntos fora do escopo configurado
Aba Guardrails com a seção 'Guardrails de Entrada' e o toggle para ativar a checagem das mensagens recebidas antes de processá-las.

Aba Guardrails com a seção 'Guardrails de Entrada' e o toggle para ativar a checagem das mensagens recebidas antes de processá-las.

Validadores de Saída

Os validadores de saída analisam a resposta gerada pelo Agent antes de enviá-la ao cliente.

Exemplos de uso:

  • Garantir que a resposta não contenha informações confidenciais
  • Verificar se o tom está alinhado com a identidade da empresa
  • Detectar alucinações (quando o modelo inventa informações)

Configuração de violação:

Quando um validador de saída detecta uma violação, você define o que acontece:

AçãoO que acontece
Enviar mensagem padrãoO Agent descarta a resposta e envia uma mensagem padrão que você definiu
BloquearA resposta é bloqueada e nenhuma mensagem é enviada
Marcar para revisãoA resposta é enviada, mas fica marcada para revisão humana

Mensagem padrão de exemplo:

Só um momento que já te respondo 🙂
Aba Guardrails com a seção 'Guardrails de Saída', o campo 'Ação em caso de violação' e as opções de redação de PII e inspeção por LLM Judge.

Aba Guardrails com a seção 'Guardrails de Saída', o campo 'Ação em caso de violação' e as opções de redação de PII e inspeção por LLM Judge.


Regras Imutáveis — o piso mínimo de segurança

Remover raciocínio interno do modelo

O que faz: Remove da resposta qualquer trecho de raciocínio interno do modelo antes de enviar ao cliente.

Por que existe: Alguns modelos de IA "pensam em voz alta" em blocos de raciocínio que não devem ser expostos ao usuário final. Essa regra garante que o cliente só veja a resposta final, limpa.

Comportamento: o trecho é removido silenciosamente. A resposta é enviada sem o raciocínio.


Não revelar a existência de sub-agents

O que faz: Bloqueia respostas que revelem ao cliente que existem sub-agents ou agentes internos compondo o sistema.

Por que existe: A arquitetura interna do Agent (com múltiplos sub-agents trabalhando juntos) é um detalhe de implementação. Revelá-la ao cliente pode confundir, gerar desconfiança ou criar brechas de segurança.

Comportamento: a resposta é bloqueada se tentar revelar sub-agents.


Não revelar capacidades técnicas internas

O que faz: Bloqueia respostas que descrevam as capacidades técnicas internas do Agent (quais ferramentas usa, como foi configurado, quais modelos rodam por baixo, etc.).

Por que existe: Expor detalhes técnicos internos pode ser usado para manipular o Agent ou extrair informações sensíveis sobre a infraestrutura da plataforma.

Comportamento: a resposta é bloqueada se tentar revelar capacidades internas.


Adicionando seus próprios guardrails

Além das regras imutáveis, você pode adicionar quantas regras quiser para o seu Agent. A plataforma oferece validadores pré-configurados e a opção de criar regras personalizadas.

  1. Acesse a aba Guardrails nas configurações do Agent.

  2. Em Validadores de Entrada ou Validadores de Saída, clique em Adicionar regra.

    Aba Guardrails do assistente de criação do Agent, com as opções de 'Guardrails de Saída' e 'Guardrails de Entrada' disponíveis para configuração.

    Aba Guardrails do assistente de criação do Agent, com as opções de 'Guardrails de Saída' e 'Guardrails de Entrada' disponíveis para configuração.

  3. Escolha o tipo de validação, configure o comportamento em caso de violação e defina a mensagem padrão a ser enviada (se aplicável).

    Aba Guardrails com o campo 'Ação em caso de violação' e as opções de comportamento disponíveis para a regra.

    Aba Guardrails com o campo 'Ação em caso de violação' e as opções de comportamento disponíveis para a regra.

  4. Salve e teste. Tente enviar uma mensagem que deveria ser bloqueada e verifique se o Agent reage conforme esperado.

Dica

Comece simples. Um guardrail mal configurado pode bloquear respostas legítimas e frustrar os clientes. Teste bastante antes de ativar regras restritivas em produção.

Saiba mais