Novo modelo de IA: por que este importa de verdade
Nem todo release muda seu PR. Este tipo muda.
Resposta direta
Nem todo release muda seu PR. Este tipo muda — o núcleo do material original é direto: Oh meu Deus, um novo modelo acabou de cair. Espera, não saia ainda. Eu sei que você pode estar cansado de todos esses novos modelos, mas este é realmente importante. Pode não ser o modelo que todos vamos usar para tudo em frente, mas representa um passo massivo em algumas partes muito importantes da maneira que usamos e interagimos com diferentes modelos de AI. O modelo Kimmy K2 para Moonshot é um enorme avanço, particularmente em modelos de genetismo.
O que o material mostra de fato
No material original, o ponto de partida não é teoria abstrata: é uma sequência concreta ligada a «Novo modelo de IA: por que este importa de verdade». Você sabe onde seus usuários estão atingindo erros na sua app? Você pode pensar que você está usando ferramentas de observação existentes, mas eles não estão oferecendo a experiência que você precisa se você está construindo aplicações realmente complexas. Honestamente, eu tenho sido um pouco orgulhoso que o mundo móvel tenha isso resolvido e o mundo da web dev não tem. Isso é até hoje. Embrace tem isso resolvido.
Detalhe do transcript que não pode virar genérico: porque eles estão construindo soluções de observabilidade de melhor classe para o mobile por muito tempo agora e eles agora levaram todo o seu conhecimento e expertise para o web e os resultados são incríveis eu estava tão empolgado quando eles nos acusaram eu estou jogando com isso um monte e estou absolutamente enganado com o que eles construíram instalar é fácil como merda você instala inicialize e você está pronto para ir integra ótimo com todas as ferramentas que você já está usando react next qualquer outra coisa você está quase certamente bem pronto para ir ao web como no mobile, por outro lado, eles apoiam praticamente tudo, React Native, Native iOS, Android, Unity, até Flutter.
Contexto e motivação
O contexto importa porque a mesma ideia muda de preço conforme ferramenta, fase do produto ou disciplina pessoal. o que realmente os faz diferentes é o seu foco em fluxos de usuários nessas aplicações complexas não é só gravar o que um usuário fez mostrando-lhes os fluxos de verdade que os usuários como um todo vão através e onde eles se encararão se este gráfico não te excita, então você não está vivendo a mesma vida que eu estou, cara, eu passei tanto tempo construindo coisas como esta para ver quando os usuários estão encarando o quão longe eles vão para um fluxo coisas como isso ter isso apenas funcionar com um instalamento de um só npm e algumas flagas básicas em torno de sua aplicação é hilariosamente poderosa e vai te dar tanta informação sobre o que está e não está funcionando de tudo, desde os bugs no seu código até os fluxos que você espera que os usuários vão passar.
Detalhe do transcript que não pode virar genérico: Então isso tem que ser super caro, certo? Não. Pronto para começar por mais de um milhão de sessões por ano. O que você tem que perder? Veja hoje em sóitiv.link em embrace. Então vamos descer o que o K2 é realmente. É um modelo de 1 trilhão de parâmetros, mas é uma mistura de expertos, então cada pedido que você faz só usar uma seção desses parâmetros. Com isso... porque há tantos parâmetros, o tamanho do modelo é massivo.
Como funciona na prática
Em vez de colecionar slogans, trate o conteúdo como checklist operacional: o que fazer nesta semana, o que medir, o que descartar. Estamos falando de um download de 960 GB quando você o pega do Hugging Face. Bastante absurdo. Mas o fato de que você possa download em um Hugging Face no primeiro lugar é um grande problema porque é um modelo de peso aberto. Você pode download e usar para basicamente qualquer coisa. Basicamente qualquer coisa é uma peça importante aqui, porque ele tem uma licença. É a licença de MIT modificada. Abusado. Não é uma licença de MIT se você a modificar, mas claro. O ponto importante aqui é...
Detalhe do transcript que não pode virar genérico: é que há uma capa no número de usuários ou quanto dinheiro você pode fazer antes de você ter que mostrar que é Kimmy K2. A única modificação é que se o software ou qualquer trabalho declarado é usado para qualquer de seus produtos ou serviços comerciais que possuem mais de 100 milhões de usuários ativos mensais ou mais de 20 milhões de dólares ou equivalentes a outras criptomoedas em renda mensal, então você deveria prominentemente mostrar Kimmy K2 na interface de usuários de tal produto ou serviço.
Erros comuns e armadilhas
Onde isso quebra na prática: quem tenta atalho sem o mecanismo descrito no transcript perde consistência rápido. Interessante colocar isso aqui, porque alguns dos casos de uso que eu estou pensando para o modelo, isso vai quebrar. Não no sentido tradicional, como se você estivesse fazendo muito dinheiro e não conseguisse usar, mas outros lados que fariam isso assustador. E como as pessoas já estão apontando no chat, não é impossível que isso não seja legalmente santo, tão generoso quanto pode ser. Eu entendo por que eles fizeram isso, mas tem algumas implicações negativas que nós vamos chegar a em breve.
Detalhe do transcript que não pode virar genérico: E como vocês também estão vendo, não é compatível com o GPL, não é uma licença aberta. Fazendo uma mudança assim, não é mais uma licença aberta, mas você tem a liberdade de fazer a maioria das coisas que você gostaria de fazer com ela. Vamos falar sobre o que você não pode fazer com essa mudança em um pouco, porque é importante. Voltando aos aspectos, é um artigo de forma estatal na benchmark verificada da SWE, como bem como a Tau2 e a AceBench, entre modelos abertos.
Checklist de aplicação
Na prática, isso vira rotina: escolha um experimento curto, documente antes/depois e só então escale. Mas não é apenas batendo modelos abertos, não é como, oh, é como R1, mas melhor. É muito melhor em algumas coisas muito específicas. Forte encodamento e outras tarefas agentes. Há um negativo, mas multimodal e modo de pensamento não são suportados neste ponto em tempo. No futuro, ele quase certamente terá um modo de razoabilidade construído, mas todos esses números e toda essa performance são sem razoabilidade, o que é honestamente impressionante.
Detalhe do transcript que não pode virar genérico: API é relativamente barato, isso o faz muito barato do que outros modelos competentes, especificamente na família antropológica. Mas vamos olhar essas benches. Essas são um grande problema. Para K2 Instruct, estar perto de Clod4 Opus é insano. Para ser na cabeça da clave com Clod4 Sonnet é tão insano como na benche da SWE. Puxando todo outro modelo aberto e até outros coisas caras como GPT 4.1. Pode ser o melhor modelo de não-reasonamento para coisas de código. Nunca. No Live Code Bench 6, ele setou um novo alto de tempo.
Information gain
Ganho específico deste material (3388): preserve a especificidade de «Novo modelo de IA: por que este importa de verdade» — números, ferramentas e narrativa do source, sem genificar.
Próximo passo concreto
Feche o ciclo com um próximo passo observável — sem isso, o artigo vira entretenimento e some na timeline. No OJ Bench, que eu não estou familiarizado, ele também setou um novo alto de tempo. GPQA Diamond, eu acho que esse pode ter sido trancado por Grock4 recentemente. Mas AIME também está se apresentando muito bem. Ace Bench, ele está na frente com o melhor performador. E TAO2, novamente, na frente com o melhor performador, Claude4Opus. Eu acho que o TAO2 Bench é provavelmente o que eu me importo mais com esses. a coisa que estamos falando hoje, que é a coisa da agência.
Detalhe do transcript que não pode virar genérico: É uma benchmark que avalia agentes conversacionais em um ambiente de controle onde você está pedindo que faça coisas e o agente tem acesso a ferramentas para olhar coisas no database, por exemplo, e testar tipo de volta e volta onde o modelo pode fazer coisas para receber dados e responder ao usuário, receber um prompt de seguida.