É onde se define o modelo que o agente usa, quando ele passa a conversa para uma pessoa e quanto ele pode escrever. Três decisões que mexem em custo, qualidade e experiência do cliente.
A edição do agente é dividida em quatro seções, no menu à esquerda: Perfil, com identidade e estilo, e as configurações avançadas — Comportamento, Conhecimento e Configurações, descrita nesta página.
No topo dela ficam a versão do agente e os campos de provedor e modelo de raciocínio: o primeiro é a conexão cadastrada, o segundo é o modelo específico que será usado. A escolha afeta três coisas ao mesmo tempo — capacidade de resposta, velocidade e custo por conversa.
Ao lado do campo de modelo há o link Obtenha preços do provedor, que leva à tabela de valores do serviço contratado.
A temperatura, ou nível de criatividade, é um controle deslizante entre dois extremos, com a descrição do efeito exibida abaixo conforme a posição:
| Ajuste | Resultado |
|---|---|
| Restrito | Respostas diretas, previsíveis e presas aos fatos. |
| Criativo | Mais liberdade de linguagem, para uma conversa menos formal. |
Para agente que responde preço, prazo ou condição contratual, o ajuste restrito é o caminho — criatividade em cima de dado factual é como respostas erradas nascem com aparência de certas.
| Configuração | O que faz |
|---|---|
| Habilitar transferência | Vem marcada. Desmarcada, o agente nunca passa a conversa para uma pessoa. |
| Equipe para solicitações | A fila que recebe o cliente quando ele pede para falar com um humano. |
| Enviar mensagem de transferência | Marcada por padrão, avisa o cliente antes de transferir. O texto é personalizável. Desmarcada, a passagem é silenciosa. |
| Equipe para problemas | A fila de contingência, acionada quando o agente falha ou encontra erro técnico. Tem sua própria opção de Enviar mensagem, desmarcada por padrão. |
Desmarcar a transferência prende o cliente no robô. Sem ela, não importa quantas vezes a pessoa peça para falar com alguém: o agente continua respondendo. Só desmarque se o fluxo tiver outra saída prevista — e, mesmo assim, considere o efeito na experiência de quem já está irritado.
A equipe de contingência é o que evita silêncio. Falha técnica acontece — chave expirada, indisponibilidade do provedor, limite estourado. Com a fila de problemas configurada, o cliente cai numa pessoa em vez de ficar sem resposta.
Vem desabilitado. Ligando a chave, aparece o campo numérico para definir o teto — o mínimo aceito é 50 tokens. Token é a unidade de texto que o modelo processa: palavras, pontuação e símbolos.
A própria tela avisa que valores baixos geram respostas mais curtas e rápidas, mas podem interromper a mensagem antes do fim.
O limite não vale só para a resposta final. Ele se aplica a todas as operações internas do modelo — inclusive consultas à base de conhecimento e chamadas de API. Um teto baixo demais pode impedir o agente de encontrar a informação, e não apenas de escrevê-la. O sintoma é um agente que responde curto e errado, como se não soubesse o que está documentado.
| Faixa | Indicada para |
|---|---|
| 100 a 200 | Respostas curtas e diretas — confirmações, sim ou não. |
| 700 ou mais | Explicações detalhadas, resumos e informações complexas. |
Acrescenta um atraso antes de cada resposta, para a conversa não parecer instantânea demais. O padrão é Imediatamente; o intervalo configurável vai de 1 a 40 segundos.
O atraso é o mesmo recurso disponível nos blocos de chatbot, com a mesma finalidade — só que aqui vale para todas as respostas do agente.