Resposta direta

Na semana passada a Anthropic soltou os números na conta oficial dela . Os engenheiros da empresa entregam 8 vezes mais código por trimestre do que entregavam entre 2021 e 2025. O Claude escreve 80% disso.

Na semana passada a Anthropic soltou os números na conta oficial dela. Os engenheiros da empresa entregam 8 vezes mais código por trimestre do que entregavam entre 2021 e 2025. O Claude escreve 80% disso. A quantidade de testes cresceu 10 vezes. E a fila de verificação, o tal do CI, cresceu 25 vezes em seis meses.

Caderno Founder Notebook com um código que vira um funil apontando para uma fila de testes e um relógio, sob o título O gargalo mudou de lugar

Eu leio isso como um aviso para toda empresa que está empurrando IA para dentro do time: escrever nunca foi o gargalo do software. Verificar sempre foi. A IA só deixou isso visível. Neste artigo eu mostro por que o gargalo mudou de lugar e o que fazer hoje, com três passos que não exigem ser engenheiro.

TL;DR:

  • O custo do código com IA não aparece na hora de gerar, aparece na hora de conferir.
  • Remendo não resolve: na Anthropic, cada conserto durou menos que o anterior (70 dias, 29 dias, menos de 1 dia).
  • A saída é meia dúzia de números na mão e roda só o teste que a mudança pode quebrar.

O problema: escrever deixou de ser o gargalo

Por vinte anos, o software foi limitado por quanto código as pessoas conseguiam escrever. Time pequeno, código pouco. Time grande, código muito. A IA quebrou essa corrente: hoje uma pessoa com um agente escreve por oito. Isso é ótimo até a hora em que alguém precisa conferir, testar e aceitar o que chegou.

O relato da Anthropic é direto: o time de CI dela quase afundou porque os agentes geravam mais código, mais PRs e mais testes do que a verificação dava conta. Eles quase não contrataram gente nova. O crescimento veio da automação. Em seis meses, o número de jobs de CI subiu 25 vezes.

Antes de você achar que isso é problema de gigante, repare no mecanismo: máquina que gera mais rápido do que a etapa seguinte consome. Isso acontece no seu time do mesmo jeito, só que em tamanho menor. A única diferença é que a Anthropic publicou a pressão. Você ainda não viu a sua.

O que a Anthropic viu por dentro

Vale descrever o circo, porque ele é uma aula de como não fazer. O serviço que decide quais testes rodam em cada mudança começou a atrasar. Aí veio a sequência de remendos.

Primeiro dobraram a máquina. Funcionou por 70 dias. Depois paralelizaram o processamento por pacote: 29 dias. Depois passaram a reiniciar o serviço todo dia: menos de um dia. Cada remendo durou menos que o anterior porque o volume cresce na frente dele.

O conserto de verdade veio quando redesenharam a peça inteira: um engenheiro, três semanas. Um ano antes, isso teria custado um trimestre. O autor do texto resume a lição assim: sempre planeje para o exponencial.

O que a IA mudou não foi só a quantidade de código. Ela mudou o formato: agentes preferem PRs menores e trabalham de madrugada e no fim de semana. O chão de atividade subiu. Onde antes o sistema descansava, agora ele enfileira. Quem dirige essa roda é gente, mas quem gira ela o tempo todo é agente.

E tem o dado de fora, da METR, que mede quanto tempo de tarefa os modelos aguentam sozinhos: o horizonte de tarefa vem dobrando a cada quatro meses. Código de quatro minutos em 2024, mais de doze horas hoje. Ou seja, a fila de verificação não vai encolher sozinha.

O framework: a Regra do Gargalo Migrante

Quando a máquina acelera, o gargalo anda. Ele não desaparece, ele migra. Toda operação com IA precisa de um dono para essa pergunta: onde o trabalho está esperando agora? A regra tem três passos.

Passo 1: nomeie o gargalo de hoje

Escolha onde o trabalho para: escrever, revisar, testar, integrar ou publicar. Antes da IA a resposta quase sempre era escrever. Agora comece pela revisão e pela verificação. Pergunta simples: o que está na fila hoje? Fila de PR, fila de teste, fila de aprovação. É lá que mora o gargalo.

Passo 2: meça a curva dos últimos 6 meses

Puxe três números: quantos pedidos de mudança entram por semana, quanto tempo leva para um teste rodar inteiro e quantos testes rodam a cada mudança. Compare com três e seis meses atrás. Se qualquer um dobrou, o gargalo migrou e você ainda não confirmou. Se os três subiram, você está na premissa da Anthropic sem saber.

O erro comum é olhar só a velocidade de geração. A IA gera rápido por definição. A régua certa é o tempo entre "está pronto" e "está aceito". Esse intervalo é o seu custo real, e ele não aparece em benchmark nenhum.

Passo 3: dimensione para 25x em dois trimestres

O conselho do engenheiro da Anthropic vale para todo mundo: assuma 25 vezes a carga atual em dois trimestres. Não drible a conta: desenhe o sistema como se ele fosse aguentar 10 a 20 vezes o que você precisa hoje.

Isso não significa comprar máquina para 25x. Significa parar de rodar tudo em todo lugar. A técnica que salvou a Anthropic tem nome: seleção de testes por impacto. Em vez de rodar a suíte inteira a cada mudança, você roda só os testes que aquela mudança pode quebrar. O resto espera. É escolher pelo que a alteração toca, não pelo volume.

Como aplicar hoje na sua empresa

Você não precisa de orçamento de laboratório para começar. Precisa de três números e de uma decisão.

Primeiro, agenda com o time de dev por 20 minutos e escreve: quanto tempo o build leva hoje, quanto levava três meses atrás e quantos testes rodam por mudança. Se a resposta para a terceira é "todos", você já achou a fila.

Segundo, pergunta se existe seleção de testes por impacto rodando. Se não existe, essa é a única melhoria de infraestrutura que importa este mês. Existe mercado maduro de ferramentas para isso, e a lógica é simples: mapear quais arquivos cada teste toca e rodar só o subconjunto afetado. A Anthropic escreveu o passo a passo completo do serviço dela, que serve de referência de desenho até para times pequenos.

Terceiro, decide quem aprova o que entra. Quando o código vem de agente, a revisão precisa de duas camadas: a máquina confere o que a máquina gerou (formato, lint, teste). A pessoa confere o que muda regra de negócio. Não existe humano lendo 8x mais código. Existe humano lendo só o trecho de risco e a máquina segurando o resto.

Se você ainda está formando opinião sobre agentes, eu escrevi sobre a régua certa para avaliar IA no código: o melhor modelo acerta 38,8% das tarefas em um teste real. E tem o outro lado da equação, o gargalo de gente, no caso dos 1.000 engenheiros operando uma operação. Nenhum dos dois muda o diagnóstico: a fila migrou.

Resultados esperados

Na Anthropic, depois do redesenho, a retaguarda do CI ficou estável: a fila que crescia toda semana parou de crescer. O custo foi três semanas de um engenheiro. O retorno foi não ser mais o ponto de afogamento da empresa inteira.

Para uma operação normal, o resultado realista é outro: a fila de testes estabiliza, o tempo entre "pronto" e "aceito" cai e os engenheiros voltam a gastar tempo revisando risco em vez de esperando build. Não é milagre de produtividade. É parar de pagar juros de uma curva que você mesmo acelerou.

Eu não vou te prometer ROI exato, porque número inventado é balela. O que a evidência sustenta é a previsão: se você gera 8x mais código, alguém vai conferir 8x mais código, e essa conta chega. A única escolha é se ela chega como projeto planejado ou como madrugada apagando incêndio.

Perguntas rápidas

Minha empresa já vive esse gargalo?

Olhe para a fila de pedidos de mudança abertos e o tempo de espera de cada um. Se a fila cresce de semana em semana ou se o tempo de espera dobrou nos últimos meses, você já vive. A geração de código não precisa ser 8x para a verificação travar; basta a geração ser mais rápida que a conferência.

Preciso contratar mais gente para revisar?

Não é a primeira alavanca. A primeira é parar de rodar teste demais e concentrar revisão humana onde muda regra de negócio. Contratar gente para acompanhar máquina que gera rápido é tratar o sintoma com mais vontade.

Seleção de testes por impacto é seguro?

Tem risco, e a própria Anthropic lista: se o mapeamento de testes desatualiza, teste quebrado passa, teste novo não roda e regressão escapa. O seguro é o mesmo de sempre: observação. Quando a seleção erra, o erro aparece na suíte que deveria ter rodado.

Isso vale para quem não é empresa de tecnologia?

Vale sempre que existir automação gerando trabalho que outra etapa precisa conferir. Atendimento que resolve 3x mais e responde a humanos? Revisão. Marketing gerando 10x mais peças? Curadoria humana. A regra do gargalo migrante não é sobre software, é sobre máquina mais rápida que o processo seguinte.

A IA vai substituir meu time de dev?

Não é essa a conta. São oito vezes mais trabalho entrando, com uma verificação que ainda pensa em escala de gente. O gargalo deixou de ser código que falta e virou confiança que sobra. Quem resolver isso na frente opera na frente.

Conclusão

O código com IA não vai parar de chegar. A pergunta é se a sua verificação foi desenhada para aguentar o volume ou para repetir a conversa da Anthropic só depois do apagão.

Comece pelo teste dos três números: tempo de build hoje, tempo de build há três meses, testes por mudança. Com isso na mão, a decisão aparece sozinha: parar de rodar tudo, revisar só o risco e planejar para o exponencial.

É exatamente o tipo de decisão que eu mostro para times em palestra: onde a IA muda a operação e onde ela só muda a fila. Se você quer ver a régua inteira aplicada à sua empresa, eu falo sobre isso.

Aplicação executiva

Quer transformar esta ideia em uma palestra, workshop ou advisory conectado ao desafio da sua empresa?

Conversar sobre o resultado esperado