Um agente pode negociar por você, mas só deveria fazê-lo depois de provar duas coisas: que entendeu sua preferência e que sabe onde deve parar. Essa é a lição mais útil do Project Swap , pesquisa publicada pela Anthropic em 24 de setembro de 2026. Em um mercado controlado de livros, agentes conversaram, fizeram ofertas e fecharam trocas para 201 participantes.
Um agente pode negociar por você, mas só deveria fazê-lo depois de provar duas coisas: que entendeu sua preferência e que sabe onde deve parar. Essa é a lição mais útil do Project Swap, pesquisa publicada pela Anthropic em 24 de setembro de 2026. Em um mercado controlado de livros, agentes conversaram, fizeram ofertas e fecharam trocas para 201 participantes. Eles negociaram melhor do que representaram seus donos. Para uma empresa, essa diferença é decisiva.

Eu penso em uma compra de software, uma alteração de prazo com fornecedor ou uma proposta comercial. A negociação não falha apenas quando alguém aceita uma condição ruim. Ela também falha quando a pessoa que negocia não sabe o que realmente importa: prazo, caixa, risco, marca, relacionamento ou uma restrição que não apareceu no briefing. Um agente rápido pode ampliar esse erro com uma eficiência impressionante.
Em uma frase
O Project Swap sugere que agentes já conseguem encontrar e negociar trocas em um ambiente simples, mas a preferência capturada, os limites de ação e o histórico revisável importam mais do que a eloquência da negociação.
Qual pergunta o Project Swap tenta responder?
O experimento montou uma espécie de feira de trocas. Duzentos e um funcionários da Anthropic, em seis escritórios, levaram um livro que queriam passar adiante. Cada pessoa conversou com Claude sobre gostos de leitura e recebeu um agente que representava suas preferências em um pregão digital. Esses agentes podiam propor, aceitar ou recusar trocas de livros, inclusive rotações entre mais de duas pessoas.
O desenho é interessante porque separa dois problemas que geralmente aparecem misturados. O primeiro é representar uma pessoa: entender o que ela busca a partir de uma conversa curta. O segundo é negociar: encontrar a contraparte, fazer proposta, revelar informação suficiente e concluir uma troca. Num mercado real, os dois problemas vêm juntos. No experimento, foi possível medir cada um.
Depois da conversa inicial, os participantes também ordenaram dez livros da própria lista, sem que os agentes vissem essa resposta. Esse ranking serviu como referência independente para avaliar o quão perto a interpretação do agente ficou da preferência real. Não é uma pesquisa representativa de consumidores ou empresas. É um experimento de campo pequeno, com funcionários da própria empresa que constrói o modelo, e com livros em vez de dinheiro, contratos ou reputação comercial.
Mesmo com essa limitação, a pergunta vale para qualquer equipe que imagina colocar agentes para buscar fornecedores, triagem de compras, reagendar compromissos ou fazer acordos comerciais: o agente sabe representar a decisão antes de tentar otimizá-la?
O que os dados mostram sobre preferência e negociação?
Os resultados precisam de contexto. A partir de uma conversa de cerca de oito mensagens e 216 palavras medianas por participante, a ordenação criada pelo agente concordou com o ranking das pessoas em 61% dos pares de livros. Um palpite aleatório alcançaria 50%; ordenar por popularidade chegou a cerca de 53%; o filtro colaborativo usado como comparação chegou a aproximadamente 55%.
Sessenta e um por cento não é desastre, mas também não é autorização para agir sem supervisão. Ele significa que, para muitos pares de livros, o agente acertou a ordem, porém errou uma parcela relevante das preferências. Para um livro de férias, o custo do erro é baixo. Para um contrato, uma campanha ou uma condição de pagamento, o erro pode alterar muito mais do que uma lista de leitura.
Na negociação, o limite maior não foi o pregão. Usando os rankings reais das pessoas, o melhor arranjo possível alcançaria eficiência média de 0,89. Quando o arranjo era calculado a partir dos rankings imperfeitos do agente, chegava a 0,60. O mercado descentralizado de agentes ficou em 0,55. Segundo a decomposição divulgada pelos autores, 85% da distância entre o resultado do mercado e o ótimo veio da representação imprecisa das preferências, enquanto 15% veio do processo de barganha.
Essa é a virada da pesquisa: trocar a regra de negociação não corrigiu, por si só, o que o agente entendeu errado sobre a pessoa. Um modelo mais forte melhorou a eficiência avaliada pelos próprios rankings de Claude, mas a pessoa continua avaliando o resultado a partir do que ela queria, não do que o agente achou que ela queria.
Por que uma boa negociação pode gerar uma decisão ruim?
Negociar é escolher sob restrições. Para fazer isso bem, o representante precisa conhecer as preferências que não são óbvias e as condições que não podem ser violadas. Em uma feira de livros, pode ser evitar um título já lido. Em uma empresa, pode ser nunca aceitar uma cláusula de renovação automática, nunca expor uma margem mínima ou sempre escalar uma exceção jurídica.
Um agente recebe uma instrução inicial e tende a transformá-la em objetivo executável. Isso cria uma armadilha: se o briefing diz apenas “reduza custo”, ele pode favorecer a menor proposta e ignorar implantação, risco de fornecedor, disponibilidade ou suporte. Se diz “feche rápido”, pode revelar urgência demais ou aceitar algo que o time operacional não consegue cumprir. A negociação não está errada. O objetivo está incompleto.
O experimento também comparou agentes instruídos a agir de forma implacável com outros instruídos a considerar o bom resultado de todos. Os agentes implacáveis ficaram ligeiramente à frente, cerca de 0,02 ponto nas métricas baseadas no ranking do agente. A diferença foi bem menor do que a diferença entre modelos. Minha leitura é que trocar o tom do prompt não substitui uma preferência bem especificada nem uma alçada clara.
Há outro alerta. As trocas funcionaram dentro de uma plataforma com participantes identificados, regras de entrada, log público das conversas e mecanismo de execução. No fim, alguns livros físicos nem apareceram na estante. Os autores tiveram de lidar com esse problema manualmente. Em uma operação real, uma troca que não se concretiza exige dono, evidência, política de estorno e consequência. Um acordo registrado não é o mesmo que uma entrega concluída.
O que a pesquisa não prova?
O Project Swap não prova que um agente pode negociar preço, assinar um contrato ou representar legalmente uma empresa. Ele não compara fornecedores independentes competindo por lucro, não testa fraude, não mede privacidade, não traz pessoas afetadas por decisões de alto risco e não reproduz o ambiente regulatório brasileiro.
Também não é um paper revisado por pares. É um relato de pesquisa publicado pela Anthropic. Até a data de corte deste texto, 9 de outubro de 2026, eu não encontrei replicação independente do experimento. Os próprios autores reconhecem limitações importantes: a amostra é formada por empregados da Anthropic, 59% responderam ao questionário final e todos os agentes eram Claudes treinados para comportamento cooperativo. Misturar agentes adversariais, identidades não verificadas e interesses reais provavelmente mudaria o resultado.
Como contexto, o Project Deal, experiência anterior da empresa com agentes comprando e vendendo bens reais, já indicava que interações em mercado produzem comportamentos difíceis de prever. E a pesquisa da Anthropic sobre sistemas multiagentes mostra riscos como conformidade excessiva, coordenação ruim e conflitos de objetivo. São fontes da mesma organização, portanto não são validação externa; eu as uso para situar o programa de pesquisa e não para fingir que existe consenso científico.
Minha análise: o teste PLE antes de delegar uma negociação
Eu usaria o experimento para criar um teste simples, que chamo de PLE: preferência comprovada, limite explícito e evidência de replay. Ele não é um resultado medido pela Anthropic; é a minha tradução do experimento para uma rotina empresarial.
- Preferência comprovada: antes de agir, o agente recebe casos de teste com escolhas reais da pessoa ou do time. Se ele não acerta prioridades básicas entre prazo, custo e risco, ainda não está pronto para negociar.
- Limite explícito: alçadas, informações que não podem ser reveladas, contrapropostas proibidas e condições que exigem humano entram como regra antes da primeira mensagem. Um agente deve saber recusar e escalar.
- Evidência de replay: cada proposta deixa uma trilha com contexto autorizado, objetivo, oferta recebida, motivo de aceitação ou recusa e confirmação posterior do resultado. Se não é possível reconstruir a decisão, não é possível corrigir o sistema.
O primeiro ponto combate o maior gargalo do Project Swap: representação imperfeita. O segundo impede que o agente transforme uma meta estreita em concessão perigosa. O terceiro separa uma conversa convincente de um processo operável.
Esse raciocínio complementa como avaliar agentes de IA e como controlar agentes de IA na empresa. A pergunta não é “o modelo parece capaz?”. É “ele representa a prioridade certa, respeita o limite e deixa prova de cada consequência?”.
Como aplicar a ideia na próxima semana?
Eu começaria por uma negociação reversível e de baixo impacto. Pode ser organizar uma troca de horários entre colaboradores voluntários, pedir informações padronizadas a fornecedores ou preparar uma contraproposta que ainda será enviada por uma pessoa. Eu não começaria por preço final, pagamento, contrato, dados sensíveis ou conversa autônoma com cliente.
Escolha dez casos antigos em que a decisão humana esteja documentada. Peça ao agente para ordenar opções, explicar o motivo e indicar quando recusaria agir. Compare suas escolhas com as decisões reais, mas não trate concordância como suficiente: procure também por quais critérios ele deixou de fora. Depois, deixe o agente rascunhar propostas sem enviá-las. A revisão humana confere se preferências, limites e justificativas sobreviveram à conversação.
O critério de avanço é simples: o agente reduz trabalho de preparação sem aumentar correção, vazamento ou exceções não explicadas. Se ele acerta o texto, mas erra a prioridade, a solução é melhorar a captura de contexto, não liberar mais autonomia. Se ele cumpre a prioridade, mas não deixa rastros, a solução é melhorar a arquitetura e o processo, não elogiar a fluidez.
Perguntas rápidas
O Project Swap prova que agentes sabem negociar?
Ele mostra que agentes podem negociar trocas de livros em um ambiente controlado. Não prova desempenho em contratos, preços, compras ou relações comerciais reais.
Qual foi o principal limite encontrado no experimento?
Representar a preferência da pessoa. A maior parte da distância até o melhor resultado possível veio dos rankings criados a partir da conversa curta, e não do mecanismo de negociação.
Um agente deve sempre agir de forma agressiva para seu dono?
Não. O teste encontrou vantagem pequena para instrução implacável em uma métrica específica. Em empresa, o comportamento adequado depende de limites, relação, reputação e regras que a pessoa responsável precisa definir.
Como saber se um agente está pronto para negociar?
Faça-o demonstrar que entende preferências em casos reais, imponha limites antes da ação e mantenha um registro que permita revisar cada proposta e seu desfecho.
Fontes e data de corte
Dados conferidos em 9 de outubro de 2026. Li o relato completo do Project Swap, publicado pela Anthropic em 24 de setembro de 2026. Consultei o Project Deal e o artigo sobre padrões e problemas em sistemas multiagentes como contexto. Não reproduzi o experimento. PLE, os exemplos de piloto e as recomendações deste texto são minha análise, não conclusões medidas pelos autores.
Eu acompanho esses testes porque eles colocam a conversa certa na mesa: não basta saber se a IA fala bem; precisamos saber se ela representa a decisão, respeita o limite e assume o rastro do que fez. Se você quer levar essa discussão para seu evento, conheça minhas palestras sobre inteligência artificial. Para acompanhar outras análises, assine minha newsletter no Substack.
Quer transformar esta ideia em uma palestra, workshop ou advisory conectado ao desafio da sua empresa?