17 de julho de 2026

Kimi K3: A China Lançou o Maior Modelo de IA de Sempre ao Preço de um Sonnet

A Moonshot AI lançou o Kimi K3 a 16 de julho: 2,8 biliões de parâmetros, o maior modelo de pesos abertos de sempre, contexto de 1 milhão de tokens e o preço de um Sonnet 5. Bate o Opus 4.8 em vários testes e lidera o Frontend Arena à frente do Fable 5 e do GPT-5.6 Sol.

Kimi K3: A China Lançou o Maior Modelo de IA de Sempre ao Preço de um Sonnet
Photo by Brett Sayles on Pexels

A Moonshot AI largou uma bomba no dia 16 de julho. O Kimi K3 chega com 2,8 biliões de parâmetros, o maior modelo de pesos abertos alguma vez anunciado, e uma janela de contexto de 1 milhão de tokens. Se andas a pagar fortunas por IA de topo, senta-te: isto custa o mesmo que um Claude Sonnet 5.

O que torna o K3 diferente

Não é só tamanho. A Moonshot construiu uma arquitetura nova, com Kimi Delta Attention (KDA) que promete descodificação até 6,3x mais rápida em contextos de um milhão de tokens, e um esquema LatentMoE que ativa apenas 16 de 896 especialistas. Traduzido: um modelo gigante que corre com uma fração dos custos por token. Os pesos abertos chegam até 27 de julho, e a equipa do vLLM já integrou suporte de raiz.

O preço é a parte que provoca FOMO. 3 dólares por milhão de tokens de entrada e 15 à saída, exatamente o nível do Sonnet 5, com o input em cache a cair 90% para 0,30. Para comparar, um Opus 4.8 sai quase ao dobro por tarefa.

Como se compara à Anthropic

Nos benchmarks independentes da Artificial Analysis, o K3 marcou 57 no Intelligence Index, à frente do Claude Opus 4.8 (56) mas atrás do Claude Fable 5 (60). O custo por tarefa? 0,94 dólares para o K3, contra 1,80 do Opus 4.8. Na prática, apanha o Opus em capacidade bruta e esmaga-o no preço. O Fable 5 continua a mandar no topo da Anthropic, e é aí que o K3 ainda não chega.

Onde o K3 realmente brilhou foi no Frontend Code Arena da Arena.ai, uma arena de preferência humana e não um teste estático. Saltou do 18.º lugar para 1.º, com 1679 pontos, à frente do Fable 5 e do GPT-5.6 Sol, e uma taxa de vitória de 76% contra 63% do Fable.

Como se compara à OpenAI

A OpenAI tinha lançado dias antes a família GPT-5.6 com três níveis: Sol (o topo, 5/30 dólares), Terra (equilibrado, 2,50/15) e Luna (barato e rápido, 1/6). No Intelligence Index, o Sol (59) continua acima do K3, e a própria Moonshot admite uma diferença notável na experiência de utilizador face ao Sol e ao Fable. Mas no custo por tarefa o K3 (0,94) fica praticamente colado ao Sol (1,04), gastando 21% menos tokens de saída que a geração anterior.

O que a comunidade já fez com ele

Aqui é que a coisa fica interessante. Um programador gerou um clone de CS:GO x Portal em 3 tentativas, gastando cerca de 600 mil tokens e 3,24 dólares. Outro deixou o K3 a trabalhar sozinho durante horas sobre quase 1 milhão de tokens para construir um emulador de DOS no browser. Em testes de agente prolongado houve quem o pusesse a correr 48 horas sem partir, a construir o seu próprio compilador de GPU.

Nem tudo são flores. Ethan Mollick resumiu bem: muito bom modelo de pesos abertos, mas não é Sol Max nem Fable. Vários programadores queixam-se de que é verboso e lento (26 a 28 tokens por segundo), que pensa demais, e alguns admitem ter voltado ao Opus quando as tarefas de código falharam. A experiência prática de Simon Willison confirma o custo do excesso de raciocínio, e a Artificial Analysis apanhou outro senão: a taxa de alucinação piorou para 51%, contra 39% na geração anterior.

A leitura da comunidade é quase unânime num ponto: já não é bom para open source. É competitivo com o melhor que o Ocidente fechou atrás de uma API, e a apenas semanas de distância. O próximo capítulo decide-se a 27 de julho, quando os pesos caírem.

Pa burros

  • FOMO: Fear Of Missing Out (medo de ficar para trás)
  • Token: unidade de texto processada por um modelo de IA, aproximadamente 3/4 de uma palavra em inglês
  • Janela de contexto: quantidade máxima de texto que um modelo consegue processar de uma só vez
  • Pesos abertos (open weights): modelo cujos parâmetros ficam disponíveis para descarregar e adaptar
  • MoE (Mixture of Experts): arquitetura que ativa apenas uma parte do modelo em cada tarefa, poupando custos
  • KDA (Kimi Delta Attention): mecanismo de atenção da Moonshot para acelerar contextos longos
  • Benchmark: teste padronizado usado para medir e comparar o desempenho dos modelos
  • Alucinação: quando um modelo gera informação falsa apresentada como verdadeira