Do piloto à produção: por que agentes de IA param no POC
O piloto provou que o agente funciona. O que trava a passagem para produção quase nunca é o modelo: são as perguntas que o piloto não precisou responder.
Time de engenharia da Tessera · 20 out 2026 · 7 min
A demonstração que deu certo
A demonstração correu bem. O agente leu o pedido, consultou dois sistemas, respondeu certo, e a diretoria saiu da sala querendo aquilo rodando no trimestre seguinte.
Três meses depois, o agente ainda é um piloto. Ninguém desistiu dele. Ele está parado numa sequência de reuniões: segurança quer entender o que ele acessa, auditoria quer saber como se reconstitui um caso, finanças pergunta quanto vai custar com o volume real, e operações quer saber quem atende quando ele falhar de madrugada.
Nenhuma dessas perguntas é sobre se o agente funciona. Todas são sobre o que acontece quando ele deixa de ser demonstração e passa a ser operação. É aqui que a maioria dos agentes de IA para antes de chegar à produção.
O que o piloto não precisou responder
Um piloto é desenhado para provar valor. Ele roda com dados escolhidos, usuários que sabem que é um teste, e um time que olha cada resultado. Isso é correto: é o jeito mais barato de descobrir se a ideia presta.
O efeito colateral é que tudo o que não serve para provar valor fica de fora. Credencial fixa no código, porque era só um teste. Log no formato que o desenvolvedor achou útil. Nenhum limite de gasto, porque o volume era pequeno. Nenhum dono formal, porque o dono era o time inteiro, que estava olhando.
Quando chega a hora de ligar para valer, cada um desses atalhos vira uma pergunta. E como ninguém planejou respondê-las, elas são respondidas uma por vez, em reunião.
As quatro perguntas
O que ele pode alcançar. Quais sistemas, quais dados, sob qual identidade. No piloto, o agente usava a credencial de quem o construiu. Em produção, a segurança precisa de uma identidade própria, permissões mínimas e a garantia de que ele não vai ler o que não deveria, inclusive quando alguém tentar induzi-lo a isso.
Como se explica um caso. Quando um cliente contestar uma resposta, alguém vai precisar mostrar qual versão do agente rodou, com qual prompt, qual modelo, quais regras foram avaliadas e o que as ferramentas devolveram. Um log de depuração não responde a isso.
Quanto custa de verdade. O custo do piloto não diz nada sobre o custo da produção. Uma execução que chama o modelo quatro vezes em vez de uma, multiplicada pelo volume real, muda a conta. Finanças quer ver o custo por agente e por caso antes de aprovar, não na fatura do mês seguinte.
Quem opera. Quem é acionado quando o agente falha, como se publica uma versão nova sem derrubar a anterior, como se desliga um agente que começou a se comportar de forma estranha, e em quanto tempo.
Por que o segundo agente não é mais rápido
Suponha que o time responda às quatro perguntas. Cria a identidade, monta a trilha, coloca um limite de custo, define o plantão. O agente vai para produção.
Aí vem o segundo agente, de outro time, feito em outro framework. E as quatro perguntas voltam, do zero. O primeiro time resolveu dentro do próprio projeto, do jeito que fazia sentido para aquele código. Nada daquilo serve para o segundo.
É por isso que muitas empresas têm um ou dois agentes em produção e uma fila de pilotos parados. O custo de passar cada um pela porta é quase o mesmo do primeiro, e a porta tem sempre as mesmas reuniões.
O que muda quando as respostas ficam num lugar só
As quatro perguntas não mudam de um agente para outro. O que muda é o agente. Isso sugere que as respostas não deveriam morar dentro de cada projeto, e sim numa camada comum, por baixo de todos eles.
Nessa camada, o agente novo nasce registrado, com dono e versão. As regras de acesso e de dados já valem para ele, porque são da organização e não do time. Cada execução é registrada no mesmo formato de todas as outras. O custo aparece por agente, por time e por modelo desde a primeira chamada.
O time continua escolhendo o framework, o modelo e o jeito de construir. O que ele deixa de fazer é reinventar a parte que não diferencia o agente dele de nenhum outro.
Pilotos provam valor. Produção exige infraestrutura. A frase é simples, mas a consequência prática é concreta: a pergunta para o próximo piloto deixa de ser "como vamos colocar isso em produção" e passa a ser "o que falta para ele rodar na camada que já existe".
Um teste antes do próximo piloto
Antes de aprovar o próximo piloto, vale fazer as quatro perguntas ao contrário. Se este agente funcionar, sabemos que identidade ele vai usar em produção? Sabemos onde o registro de cada execução vai ficar? Sabemos quanto ele pode gastar por mês e quem vê isso? Sabemos quem é acionado quando ele falhar?
Se as respostas forem "depois a gente vê", o piloto provavelmente vai funcionar e provavelmente vai parar no mesmo lugar dos anteriores.
O que a infraestrutura não resolve
Ela não salva um caso de uso ruim. Se o agente não resolve um problema que alguém paga para resolver, a produção só torna isso visível mais depressa.
Ela não substitui a decisão de risco. Quais jornadas um agente pode assumir continua sendo escolha do negócio e de quem responde pelo risco. A camada garante que a escolha seja aplicada, registrada e medida.
O Tessera AgentOS reúne governança, execução, observabilidade e desenvolvimento numa camada única, para que o agente seguinte não precise passar pelas mesmas reuniões do primeiro. Conheça o Tessera AgentOS.
