Lançamento destaca otimização de modelos e redução de custos por token em vários produtos da Microsoft.
A Microsoft, por meio de texto assinado por Mustafa Suleyman, informou que lançou o MAI-Cyber-1-Flash, modelo otimizado para o harness MDASH, que alcançou o primeiro lugar no referente CyberGym. Segundo o comunicado, o sistema superou Mythos por 12 pontos e operou a 50% do custo, e foi também entregue em H100. O anúncio detalha que a estratégia busca maximizar a eficiência por token e reduzir o custo por resultado para clientes.
O foco na eficiência por token
Conforme o texto, o conceito de Tokenmaxxing — maximizar a eficiência de cada token no modelo — tem guiado os últimos meses, e a eficiência de tokens passa a ser o próximo grande foco da indústria. Para construir o que a empresa chama de Frontier Firm, é necessário otimizar desempenho na fronteira em relação ao custo e escolher o ponto da curva que melhor se adapta a cada empresa. Ao ajustar modelos para produtos específicos, afirmam, é possível manter ou superar o desempenho de fronteira com redução significativa dos custos de tokens.
Resultados e aplicações práticas
Nos últimos meses, a Microsoft afirma ter lançado mais de uma docena de novos modelos em imagem, voz, transcrição, programação e segurança, e ter integrado esses modelos em produtos para reduzir o uso de tokens e o custo de GPU.
O texto menciona exemplos de aplicação:
– MAI-Code-1-Flash, desenvolvido com GitHub, tem sido usado por milhões de desenvolvedores desde junio; segundo o comunicado, apresenta 10% a mais na taxa de aceitação de código e 10% menos no uso mediano de tokens em VS Code em comparação com GPT-5.4 Mini e Claude Haiku 4.5.
– O mesmo ponto de controle foi treinado em um ambiente Excel RL para alcançar desempenho comparável ao de GPT-5.6 nas tarefas mais comuns, sendo possível servi-lo em A100 ou H100 com menor custo.
– MAI-Image-2.5-Flash passou a ser o padrão em Bing Image Creator e em produção no PowerPoint, onde, segundo a empresa, reduz os custos de GPU até 84% em comparação com GPT-Image-2; também é padrão em cenários de edição do OneDrive, com aumento de 26% nas taxas de salvamento e até 2,5 vezes mais eficiência de tokens.
– MAI-Voice-2-Flash foi implementado no Centro de Contato Dynamics 365, com clientes como T-Mobile e EasyJet, e reduziria custos de GPU em até 89%.
– MAI-Transcribe-1.5 passou a cobrir o fluxo multilingue do Dragon Copilot em 58 idiomas; o modelo atende 170.000 prestadores médicos que processaram 28 milhões de atendimentos no trimestre passado, e as provas internas apontam redução relativa de 50% nas taxas de erro de transcrição e identificação de idioma.
Adicionalmente, ao combinar seus modelos com seu próprio silício, a empresa relata um ganho de 40% no desempenho por vatio ao rodar modelos MAI no Maia 200.
Estratégia de resiliência e modularidade
O comunicado destaca que, além do benefício do custo, a estratégia busca maior resiliência. Segundo o texto, toda empresa deve assumir que qualquer modelo do qual depende pode desaparecer por incidentes de segurança, mudanças de política ou fatores geopolíticos. Por isso, os modelos em um produto ou sistema agêntico devem ser substituíveis; isso exige construir o harness, o contexto, a memória e o espaço de ações de forma independente de uma única família de modelos.
O documento afirma que essa abordagem representa o início de uma nova curva de desempenho: um sistema mais do que um modelo, que oferece melhor qualidade, menor custo e mais variedade.
Fechamento
Segundo Mustafa Suleyman, este foi “un verano de trabajo duro pero maravilloso” do time; a empresa reconhece que ainda há aprendizados necessários, mas afirma que a direção está definida e que compartilhará resultados e lições à medida que avança.
Assuntos nesse artigo:
#mai-cyber-1-flash, #tokenmaxxing, #mdash, #cybergym, #mythos, #gpt-5.4, #h100, #gpt-5.6, #mai-code-1-flash, #github, #vscode, #a100, #mai-image-2.5-flash, #bing-image-creator, #powerpoint, #onedrive, #mai-voice-2-flash, #dynamics-365, #mai-transcribe-1.5, #maia-200
