Semana passada eu passei um tempo olhando a fila de decisões pequenas da minha semana. Não era estratégia. Era triagem: qual mensagem merece uma ligação, qual pedido é urgente de verdade, qual conversa provavelmente não vai virar nada.
Semana passada eu passei um tempo olhando a fila de decisões pequenas da minha semana. Não era estratégia. Era triagem: qual mensagem merece uma ligação, qual pedido é urgente de verdade, qual conversa provavelmente não vai virar nada. Cada uma dessas decisões leva segundos, mas alguém precisa estar lá para tomar.

A Microsoft lançou nesta semana um modelo com um propósito bem estreito: decidir. Ele se chama Microsoft-Decision-1, não escreve texto e não conversa com ninguém. Você manda uma situação, uma pergunta e uma lista fechada de opções, e ele devolve a probabilidade de cada opção. Para quem tem uma operação com centenas de decisões repetidas por semana, isso é mais útil do que parece. Também é mais perigoso do que parece.
Em uma frase
Um modelo de decisão não escreve: ele devolve a probabilidade de cada opção, e é essa probabilidade que permite colocar limite, limiar e revisão humana em uma decisão automatizada.
TL;DR
- A Microsoft lançou o Microsoft-Decision-1, um modelo baseado no Qwen3.5-9B que devolve uma probabilidade para cada opção de resposta, sem gerar texto nem justificativa.
- Ele custa US$ 0,042 por milhão de tokens de entrada, com saída gratuita, e roda em uma única chamada com mediana de 85 milissegundos nos testes da própria Microsoft.
- Antes de automatizar qualquer decisão, eu aplico o teste dos 3C: caixa de opções fechada, critério escrito e cadência de volume. Sem os três, não vale a pena.
O gargalo está nas decisões que ninguém quer tomar
Toda empresa de 30 a 200 pessoas tem uma fila invisível de decisões pequenas. Um formulário chega e alguém decide se aquilo é cliente ou curioso. Um chamado chega e alguém decide se é urgente. Uma nota fiscal chega e alguém decide se o valor bate com o combinado.
Nenhuma dessas decisões entra na reunião de diretoria. Todas elas custam tempo de gente qualificada, e todas elas param quando a pessoa responsável está em outra coisa.
O erro que eu vejo com frequência é tentar resolver essa fila com o mesmo modelo que escreve e-mail, faz resumo e conversa com o cliente. Funciona, mas é caro e lento demais para uma decisão que tem três respostas possíveis. Pedir a um modelo grande para classificar mil chamados é como contratar um advogado para carimbar um recibo.
O que a Microsoft lançou, e o que ele não faz
Segundo o anúncio da Microsoft, o Microsoft-Decision-1 foi construído em cima do Qwen3.5-9B, um modelo de 9 bilhões de parâmetros, e treinado para fazer uma única passada de pontuação. O resultado vem em JSON, com uma probabilidade por opção. O modelo aceita perguntas de sim ou não, escolha entre alternativas, notas em escala e avaliação por rubrica.
Os números divulgados: 83,5% de acurácia média em 36 benchmarks com cerca de 147 mil perguntas, mediana de 85 milissegundos de latência e custo de US$ 0,042 por milhão de tokens de entrada, com saída gratuita. Em testes internos, a Microsoft relata ter classificado mais de 10 mil comentários de jogadores 14 vezes mais rápido e 200 vezes mais barato do que com o GPT-6 Sol.
Agora o que ele não faz, e essa parte importa mais. Ele não explica o motivo da decisão, não recebe imagem e não tem pesos abertos. A documentação da própria Microsoft é explícita: não use o modelo como decisor único em decisões sobre crédito, emprego, moradia, saúde ou direitos legais. E, como todo benchmark de fornecedor, esses números foram medidos por quem vende o modelo.
Por que decidir é um trabalho diferente de escrever
Quando você pede uma redação a um modelo de linguagem, o resultado é texto. Quando você pede uma decisão a um modelo de decisão, o resultado é um número com etiqueta. Parece detalhe técnico, mas é a diferença entre um sistema que você precisa ler e um sistema que você pode programar.
O detalhe que mais me interessa é a calibração. Se o modelo diz 90%, ele deveria acertar cerca de nove vezes em dez em casos parecidos com os seus. Quando essa probabilidade é confiável, ela deixa de ser um enfeite e vira o mecanismo de controle: você define a partir de qual valor o sistema age sozinho e abaixo de qual ele chama uma pessoa. É a mesma lógica de saída estruturada que já uso para amarrar agentes, aplicada ao momento em que a máquina diz sim ou não.
A parte de velocidade também muda a conta, mas não do jeito que o marketing sugere. Um modelo que raciocina por segundos é ótimo para o problema difícil e ruim para a decisão trivial. Eu escrevi sobre isso em tempo de raciocínio: existe custo em pensar demais quando a resposta certa é uma etiqueta.
O teste dos 3C antes de automatizar uma decisão
Eu não saio automatizando decisão porque apareceu um modelo novo. Eu passo qualquer candidata por três perguntas, que eu chamo de teste dos 3C.
Caixa de opções. A resposta é uma etiqueta de uma lista fechada? Urgente, normal ou baixo. Cliente, curioso ou fora do perfil. Aprovar, revisar ou recusar. Se para responder a pessoa precisa escrever um parágrafo com nuance, não é caso para modelo de decisão.
Critério escrito. Você consegue escrever, em uma linha por opção, o que faz um caso cair ali? A própria Microsoft chama esse campo de critério na API. Se o seu time não consegue definir o critério, o modelo também não vai adivinhar. Critério vago produz decisão confiante e errada, que é o pior tipo.
Cadência. Essa decisão aparece dezenas ou centenas de vezes por semana? Decisão rara não paga o trabalho de configuração e validação. Nesse caso, o certo é melhorar o processo, não chamar a IA.
Passar nos três não é autorização para soltar o sistema. É apenas o direito de entrar na etapa seguinte.
Como aplicar isso hoje, em cinco passos
- Separe 20 casos antigos da decisão escolhida, com a resposta correta já registrada por uma pessoa.
- Escreva a pergunta e as opções, com uma linha de critério para cada opção.
- Rode os 20 casos e compare com o histórico. Olhe principalmente os que ficaram perto do meio da escala, porque é ali que mora a dúvida.
- Monte o semáforo de confiança. No meu exemplo: acima de 0,9 o sistema age sozinho, entre 0,6 e 0,9 entra revisão por amostragem, abaixo de 0,6 vai para uma pessoa. Inclua uma opção de abstenção, do tipo "não sei", para o modelo poder recusar. Os números do semáforo são meus, não da Microsoft: o próprio material do modelo recomenda calibrar o limiar pelo custo de errar para cada lado.
- Rode em modo sombra por duas semanas. O sistema decide em paralelo e a pessoa decide de verdade. No fim, compare as duas colunas antes de liberar qualquer ação real.
Um cuidado que vale para qualquer automação de decisão: as pessoas afetadas precisam saber que a IA participou. Isso está na orientação da Microsoft e é o mínimo de decência operacional.
O que esperar em números, com a ressalva certa
Se você tem uma operação de 50 pessoas, não espere cortar 200 vezes o custo do seu gasto com IA. O ganho real é outro: tirar uma fila da mesa de alguém. Foram 200 vezes menos custo para classificar 10 mil comentários, mas o valor ali não está nos centavos economizados, e sim no fato de ninguém ter precisado ler os 10 mil.
Para dar escala ao preço: US$ 0,042 compram um milhão de tokens de entrada. Se cada decisão consome cerca de 300 tokens, isso dá mais de 3 mil decisões por menos de 5 centavos de dólar. O custo deixa de ser o problema. O problema passa a ser acertar o critério e saber quando o sistema deve parar, o que é exatamente o assunto de como controlar agentes de IA na empresa.
Perguntas rápidas
O que é um modelo de decisão?
É um modelo treinado para escolher entre opções fixas e devolver a probabilidade de cada uma, em vez de escrever uma resposta. Ele serve para classificar, rotear, priorizar e avaliar, não para conversar.
O Microsoft-Decision-1 substitui o ChatGPT na minha operação?
Não. Ele faz um trabalho específico: decisões curtas com opções fechadas. O texto, o resumo e a conversa continuam com modelos de linguagem. Em muitos casos, os dois trabalham juntos, com o modelo de decisão escolhendo qual caminho seguir.
Como sei se a minha decisão serve para automatizar?
Aplique o teste dos 3C. Se a resposta é uma etiqueta de lista fechada, se existe critério escrito para cada opção e se a decisão se repete com volume, ela é candidata. Se falta qualquer um dos três, comece por arrumar o processo.
Preciso comprar o modelo da Microsoft para usar essa ideia?
Não. O método funciona com qualquer modelo de decisão, inclusive alternativas abertas, e a Microsoft já indicou que pretende trocar a base do modelo no futuro. O que muda o resultado é o critério bem escrito, o limiar calibrado e a revisão humana na faixa cinza.
Isso serve para decisões sobre pessoas?
Use como apoio, com revisão humana de verdade. A orientação da própria Microsoft é não usar o modelo como decisor único em crédito, emprego, moradia, saúde ou questões legais, e informar quem é afetado quando a IA participa.
Fontes e data de corte
Dados conferidos em 10 de outubro de 2026. Li o anúncio oficial do Microsoft-Decision-1 e a documentação de uso no Microsoft Foundry, que traz os exemplos de pergunta, os tipos de resposta e as recomendações de limiar, abstenção e revisão humana. Consultei também a ficha do modelo no catálogo do Foundry.
Não testei o modelo em produção e não reproduzi os benchmarks. Os percentuais citados são da Microsoft e foram medidos por ela; até esta data eu não encontrei avaliação independente publicada. O teste dos 3C, o semáforo de confiança e os exemplos de piloto são a minha análise, não conclusões dos autores do modelo.
Eu acompanho esse tipo de lançamento porque ele muda a conversa certa: o ponto deixa de ser qual modelo é mais inteligente e passa a ser qual decisão a sua empresa está pronta para delegar. Se você quer levar essa discussão para o seu time ou para o seu evento, conheça minhas palestras sobre inteligência artificial. E se quiser receber as próximas análises antes de todo mundo, assine minha newsletter no Substack.
Quer transformar esta ideia em uma palestra, workshop ou advisory conectado ao desafio da sua empresa?