Grok 4: hype, teste pratico e decisao de stack
Como avaliar um modelo novo sem reescrever tudo.
Resposta direta
Como avaliar um modelo novo sem reescrever tudo — o núcleo do material original é direto: Então, o Grock 4 acabou de cair. Normalmente, eu tomaria a oportunidade de divertir um monte de gente, e não se preocupe, vamos fazer isso. Eu não gosto de como a XAI faz as coisas, geralmente. Dito isso, eu não pensei que isso aconteceria. O Grock 4 é o melhor modelo jamais feito. Ele está chegando em primeiro ou segundo lugar em cada um dos benchmark, e eu não pensei que isso Eu... Sim. Aqui estamos. Parece que a XAI é uma competidora real.
O que o material mostra de fato
No material original, o ponto de partida não é teoria abstrata: é uma sequência concreta ligada a «Grok 4 chegou: o que mudou e o que testar primeiro». Porque você sabe como eu sou e os resultados aqui são ainda mais engraçados do que tudo mais. Oh, cara. Nós temos muito a entrar aqui. Como você sabe, não há um mundo em que X ou Grok estão me pagando por cobrir qualquer coisa, muito menos isso. E os custos de inferência para Grok não são baratos. Apenas fazer este teste alone custou-me alguns cento de dólares. Então, uma palavra rápida do sponsor de hoje e depois vamos entrar.
Detalhe do transcript que não pode virar genérico: A AI fez um monte de coisas mais fáceis, mas há algumas que fizeram mais difícil. Uma das maiores... by far is hiring. If you put up an open job listing right now, you'll get more applications than ever. You'll get tens of thousands of AI-generated slop resumes that are people who probably don't even know how to code, and if they do, they're doing themselves a disservice with that AI slop.
Contexto e motivação
O contexto importa porque a mesma ideia muda de preço conforme ferramenta, fase do produto ou disciplina pessoal. If you want to make sure you're hiring the best developers without having to spin up a whole recruiting team to do it for you, today's sponsor is going to help you out a ton. G2i is great. I've talked about them a bunch before, but I'm going to do something a bit different and focus on one of their customers that had a ton of success. They recently partnered with Differential, and I think you'll e eu entendi isso muito rapidamente ouvindo o que eles tinham para dizer.
Detalhe do transcript que não pode virar genérico: Eles contrataram 9 engenheiros de engenharia para front-end, back-end e mobile através do G2i. E isso é o que eles tinham para dizer. O G2i tem uma compreensão profunda de engenheiros e o que precisa para cultivar talentos grandes. Encontrar as pessoas certas não é apenas sobre habilidades técnicas, é sobre alinhamento cultural, dinâmica do time e fit do projeto. Para nós, o G2i operou como uma extensão do nosso time. O canal de Slack compartilhado e a comunicação constante have made it easy to go back and forth quickly.
Como funciona na prática
Em vez de colecionar slogans, trate o conteúdo como checklist operacional: o que fazer nesta semana, o que medir, o que descartar. Esse nível de colaboração realmente nos ajudou a se mover rápido e ficar alinhados. Nosso negócio tem tanto um lado agente com contratos de curto prazo quanto um produto de SaaS com necessidades de curto prazo. G2I tem sido capaz de flexibilizar com a gente em ambos os modelos, ajudando a nos estafar rápido quando precisamos e ficar agilizados enquanto os projetos evoluíram. Não preciso dizer mais nada além disso. Eu acho que você tem a ideia.
Detalhe do transcript que não pode virar genérico: Se você quer contratar curto prazo, curto prazo, senior, junior, qualquer coisa, não há lugar melhor para ir. Veja-o hoje em soydev.link.g2i. Então, o que aconteceu? Bem, há alguns dias atrás, eles fizeram uma destilação de Grock 3 que o causou a ser realmente problemático, então eles revocaram essa destilação. Mas ao mesmo tempo, eles estavam trabalhando com o que originalmente era Grock 3.5, que agora foi lançado como Grock 4.
Erros comuns e armadilhas
Onde isso quebra na prática: quem tenta atalho sem o mecanismo descrito no transcript perde consistência rápido. Eu, honestamente, assumo que eles apenas o renomearam antes de o desligar para que ele se sentisse melhor, mas essas benchmarkas mostram que é realmente um grande deslizamento. Grock 3 era um modelo de não-reasonamento realmente estúpido. Grock 3 Mini era uma modelagem de razão surpreendente que correu muito rápido. Grock 4 é apenas uma modelagem de razão boa. Tipo, tem seus atos, é lenta, não mostra a você a ressonância de Hogan, a menos que você use-a através da nova subcrição de super Grock de 300 dólares por mês.
Detalhe do transcript que não pode virar genérico: Sim, vamos falar disso em um minuto, mas as benches são insano. Não é o melhor em código, então se você está aqui procurando um novo modelo para codificar, aparentemente você tem que esperar um pouco, porque eles teceram a linha de tempo aqui. Supostamente, entre agosto e setembro, haverá um novo modelo de código. E entre setembro e outubro, aparentemente em setembro, um agente multimodal será lançado. E então, em outubro, um modelo de geração de vídeos também. Você sabe de qualquer coisa sobre como a XAI é sobre timelines?
Checklist de aplicação
Na prática, isso vira rotina: escolha um experimento curto, documente antes/depois e só então escale. Você deveria bater tudo nisso entre dois meses e um ano? Sem dúvida, sim, eles são um jogador sério, mesmo se a apresentação fosse como o comum, cringe as shit, the model is good Eu não vou pretender que não seja assim. Eu ainda não tomei muito sentido com isso, mas tudo que eu fiz até agora tem sido sólido e impressionante, menos o quão lento é, mas tem seus perigos também. Como eu disse, eu estava jogando Snitch Bench antes e você vai ver muita estranheza nos output. Veja isso?
Detalhe do transcript que não pode virar genérico: Ele simplesmente outputou centenas de novas linhas como texto enquanto fazendo o trabalho da linha de estilha aqui é um monte de mais linhas novas que apenas saem por razão Eu acabei de passar por 40 a 50 páginas de texto vazio aqui. É um modelo de Grok. É querque, é estranho, é estúpido em suas próprias formas únicas. mas também responde coisas que nenhum outro modelo respondeu antes, incluindo ArcAGI. ArcAGI, se você não já está familiarizado, não tem nada a ver com o browser Arc.
Information gain
Ganho específico deste material (8381): preserve a especificidade de «Grok 4 chegou: o que mudou e o que testar primeiro» — números, ferramentas e narrativa do source, sem genificar.
Próximo passo concreto
Feche o ciclo com um próximo passo observável — sem isso, o artigo vira entretenimento e some na timeline. É uma das principais regras de benchmark que a AI está contra. É uma regrada simplesmente simples se você olhar para ela diretamente. Porque você e eu, como humanos, provavelmente podemos resolver todas essas coisas. Qualquer agente que as pessoas tenham contra meus vídeos para resumir, isso vai fazer você ficar muito confuso sobre como resolver essas Problemas. Os problemas são, novamente, coisas que nós, como humanos, podemos entender muito bem. Você pode ver aqui o padrão visual que está sendo criado, onde todas essas coisas verdes acabam ligadas nas diagonais.
Detalhe do transcript que não pode virar genérico: O padrão aqui com o vermelho e o vermelho é consistente, então o vermelho ficará no topo e o vermelho vai subir e depois abaixar as linhas direitas, mas há pegadinhas estranhas aqui que são intuitivas para nós, como humanos, como podemos ver o padrão as it forms. Mas a AI não é tão boa nesses tipos de padrões estranhos. Então, mesmo que um humano geralmente obtenha 100% neste exame, a AI tem, históricamente, realmente, realmente, realmente, lutado com isso.
Perguntas frequentes
Por que «Contexto e motivação» importa agora em Grok 4 chegou: o que mudou e o que testar primeiro?
Operação curta: O contexto importa porque a mesma ideia muda de preço conforme ferramenta, fase do produto ou disciplina pessoal. If you want to make sure you're hiring the best developers without having to spin up a whole recruiting team to do it for you, today's sponsor is. Revise com evidência, não com feeling.
Como isolar «Como funciona na prática» sem montar um plano de 30 dias — recorte `grok-4-lancamento-o-que-mudou`?
Do texto: Em vez de colecionar slogans, trate o conteúdo como checklist operacional: o que fazer nesta semana, o que medir, o que descartar. Esse nível de colaboração realmente nos ajudou a se mover rápido e ficar alinhados. Nosso negócio tem tanto um lado agente com.
Qual restrição «Erros comuns e armadilhas» deixa explícita — recorte `grok-4-lancamento-o-que-mudou`?
Onde isso quebra na prática: quem tenta atalho sem o mecanismo descrito no transcript perde consistência rápido. Eu, honestamente, assumo que eles apenas o renomearam antes de o desligar para que ele se sentisse melhor, mas essas benchmarkas mostram que é. Em «Erros comuns e armadilhas», trate como experimento com dono e prazo — não como lista de intenções.
O que falha se você pular «Checklist de aplicação» — recorte `grok-4-lancamento-o-que-mudou`?
Comece pelo mecanismo: Na prática, isso vira rotina: escolha um experimento curto, documente antes/depois e só então escale. Você deveria bater tudo nisso entre dois meses e um ano? Sem dúvida, sim, eles são um jogador sério, mesmo se a apresentação fosse como o comum, cringe as.