A startup chinesa Moonshot AI lançou nesta semana o Kimi K3, um modelo de inteligência artificial com 2,8 trilhões de parâmetros que a empresa apresenta como o maior modelo de código aberto já construído. O sistema entra na disputa direta contra os modelos mais avançados de Anthropic e OpenAI, com benchmarks que colocam a ferramenta chinesa próxima do desempenho do Claude Fable 5 e do GPT-5.6 Sol, por uma fração do preço.

Moonshot programou o lançamento dos pesos completos para 27 de julho de 2026. Até lá, desenvolvedores acessam o modelo pelo site kimi.com, pela API oficial, pelo agente de terminal Kimi Code e pela plataforma Kimi Work. A chegada do K3 reforça uma tendência que vem se consolidando ao longo do último ano: empresas chinesas como Moonshot, Z.ai e MiniMax reduzem cada vez mais a distância técnica que separava seus produtos das gigantes americanas.

Um modelo construído para escala

Kimi K3 usa uma arquitetura de mistura de especialistas que ativa apenas 16 dos 896 blocos disponíveis a cada token processado. Essa combinação permite ao modelo operar com uma fração da capacidade total durante cada inferência, o que reduz o custo computacional sem sacrificar desempenho. A janela de contexto chega a 1 milhão de tokens, número que supera a maioria dos concorrentes diretos e permite ao sistema processar documentos extensos ou bases de código completas em uma única consulta.

O modelo aceita texto, imagem e vídeo como entrada, embora a saída continue restrita a texto. Moonshot também confirmou compatibilidade com o SDK da OpenAI, o que facilita a migração de equipes que já constroem produtos sobre GPT ou Claude.

A engenharia por trás do salto técnico

Atenção mais barata em contextos longos

A Kimi Delta Attention intercala camadas de atenção linear com camadas de atenção completa numa proporção de três para um. As camadas lineares tratam a estrutura local da sequência a um custo baixo, enquanto a camada completa preserva o fluxo global de informação. Segundo a Moonshot, essa combinação corta em até 75% o uso de memória de cache e multiplica por seis a velocidade de decodificação em contextos de 1 milhão de tokens, mantendo resultados equivalentes aos de modelos que usam atenção completa em todas as camadas.

Treinamento mais eficiente

A técnica batizada de Attention Residuals substitui as conexões residuais tradicionais por um mecanismo que recupera representações específicas ao longo da profundidade da rede, em vez de acumulá-las de forma uniforme. Moonshot relata um ganho de eficiência de treinamento próximo de 25%, com aumento de custo computacional inferior a 2%. A empresa combinou essas duas técnicas com um sistema de balanceamento de especialistas chamado Stable LatentMoE, responsável por distribuir a carga entre os 896 blocos do modelo sem depender de ajustes manuais frequentes.

Desempenho nos principais testes

Nos benchmarks de programação, o Kimi K3 lidera no Program Bench com pontuação de 77,8 e no SWE Marathon com 42,0. No Terminal-Bench 2.1, fica muito próximo do GPT-5.6 Sol, com 88,3 contra 88,8 pontos. Em tarefas agênticas, o modelo chinês assume a liderança no BrowseComp, no Automation Bench e no SpreadsheetBench 2, embora ainda fique atrás do Claude Fable 5 em avaliações de produtividade como GDPval-AA v2 e JobBench.

A Artificial Analysis avaliou o modelo de forma independente e o colocou em quarto lugar entre as configurações testadas, o equivalente à terceira posição entre famílias de modelos, atrás apenas de Claude e GPT-5.6 Sol. A diferença de 0,54 ponto em relação ao GPT-5.6 Sol no modo mais avançado está dentro da margem de erro estimada pela própria Artificial Analysis, o que sugere que a distância entre os dois sistemas pode não ser estatisticamente relevante.

Um preço muito abaixo da concorrência americana

Segundo a tabela divulgada pela Moonshot, o preço de entrada do Kimi K3 fica 40% abaixo do GPT-5.6 Sol e a saída custa 50% menos. Comparado ao Claude Fable 5, as duas tarifas caem 70%. Na avaliação da Artificial Analysis, o modelo chinês consumiu quase o dobro de tokens de saída em relação ao Sol para completar as mesmas tarefas, mas o custo total do teste ainda ficou abaixo dos concorrentes, em 2.690 dólares contra 2.824 dólares do Sol e 5.630 dólares do Fable 5.

Demonstrações que chamaram atenção do mercado

Moonshot divulgou uma série de estudos de caso para ilustrar a capacidade do modelo em tarefas complexas. Em um deles, o Kimi K3 projetou um chip físico completo em 48 horas, da arquitetura até a verificação final, usando ferramentas de design eletrônico de código aberto. Em outro teste, o modelo construiu do zero um compilador para GPU batizado MiniTriton, com desempenho equivalente ou superior ao Triton em parte dos testes de referência.

O modelo também reproduziu, em cerca de duas horas, uma relação usada em pesquisas de astrofísica computacional que normalmente exige entre uma e duas semanas de trabalho de um pesquisador experiente. Durante o processo, revisou mais de vinte artigos científicos, avaliou centenas de equações de estado e gerou milhares de linhas de código em Python.

Limites reconhecidos pela própria Moonshot

A empresa admite três pontos fracos do sistema. O primeiro envolve sensibilidade ao histórico de raciocínio: se o ambiente de execução não repassa todo o conteúdo de pensamento anterior, a qualidade das respostas pode oscilar de forma imprevisível. O segundo trata de uma proatividade excessiva, já que a Moonshot treinou o modelo para tarefas longas e complexas e ele pode tomar decisões por conta própria diante de ambiguidades. O terceiro reconhece uma diferença perceptível na experiência de uso em comparação com Claude Fable 5 e GPT-5.6 Sol, mesmo com resultados técnicos competitivos.

O contexto da disputa entre China e Estados Unidos

O lançamento chega poucos dias depois de os Estados Unidos suspenderem temporariamente o acesso aos modelos Fable e Mythos da Anthropic por conta de controles de exportação, medida que o governo revogou no fim de junho. Analistas do Bank of America destacaram que a Moonshot avançou tecnicamente mesmo com acesso limitado aos chips mais avançados. Ações de concorrentes chineses como Zhipu e MiniMax caíram forte na bolsa de Hong Kong no dia do anúncio, reflexo direto da pressão competitiva gerada pelo K3.

Perguntas frequentes

O Kimi K3 já está disponível para uso?

O modelo já funciona em produção pelo site kimi.com, pela API oficial e pelos aplicativos Kimi Code e Kimi Work. Os pesos completos, que permitem baixar e rodar o modelo localmente, chegam apenas em 27 de julho de 2026.

Qual a diferença entre o Kimi K3 e os modelos anteriores da Moonshot?

O K3 quase dobra o tamanho do Kimi K2.6, seu antecessor direto, e introduz duas arquiteturas inéditas, a Kimi Delta Attention e a Attention Residuals, que reduzem o custo computacional e aumentam a eficiência de treinamento.

O Kimi K3 supera o Claude e o GPT em algum teste?

Sim. O modelo lidera categorias como BrowseComp, Program Bench, Automation Bench e a Frontend Code Arena da Arena.ai, embora fique atrás dos concorrentes americanos na pontuação geral consolidada pela Artificial Analysis.

Por que o Kimi K3 custa menos que os concorrentes?

A Moonshot aplica um modelo de mistura de especialistas altamente esparso e otimizações de inferência como a quantização MXFP4, o que reduz o custo computacional por consulta e permite tarifas de API bem abaixo das praticadas por Anthropic e OpenAI.

Existe algum risco em usar o Kimi K3 em produção agora?

A própria Moonshot recomenda cautela com o modo de raciocínio sempre ativo, que consome mais tokens e pode gerar respostas instáveis quando o ambiente de execução não preserva corretamente o histórico de pensamento entre chamadas.

Notícia anteriorInvestimentos em IA impulsionam importações de tecnologia no Brasil