Grok 4: A Surpreendente Virada da XAI
O modelo Grok 4 elevou o patamar da XAI no campo das inteligências artificiais com resultados surpreendentes em benchmarks e capacidades inesperadas.
Carregando
O modelo Grok 4 elevou o patamar da XAI no campo das inteligências artificiais com resultados surpreendentes em benchmarks e capacidades inesperadas.
Benchmark, custo, modelos Mini e Nano, contexto expandido e impacto para devs
Prepare-se para uma nova era na programação assistida por IA. O Context Server (MCP) da Upstash promete resolver o...
O lançamento do Grok 4 surpreendeu até os mais céticos. A XAI, geralmente vista com descrédito por sua abordagem ou performance estável, virou o jogo. Esse modelo está consistentemente em primeiro ou segundo lugar nos principais benchmarks, e isso inclui testes notoriamente difíceis como ArcAGI e Snitch Bench.
Enquanto o Grok 3 apresentava limitações evidentes e o Mini focava em velocidade com raciocínio razoável, o Grok 4 surge como um modelo sólido de reasoning. Embora ainda possua traços excêntricos (como gerar páginas com linhas em branco do nada), seus resultados indicam ganhos reais de performance e compreensão.
Nos testes do ArcAGI, por exemplo, que focam em padrões visuais intuitivos que a IA costuma falhar, o Grok 4 atingiu 16% de acerto contra apenas 8% do Cláudio Opus IV. No benchmark "O Último Exame da Humanidade", rompeu a marca dos 24%, algo inédito até então em modelos comerciais.
Ainda que mostre progresso, o Grok 4 é notoriamente lento — especialmente nas chamadas de ferramentas. A inconsistência na ressonância e os custos elevados de inferência também geram obstáculos práticos para adoção larga.
Diferente de muitos concorrentes, o Grok 4 foi treinado com uso contínuo de ferramentas desde o dataset — e não apenas por reforço posteriormente. Isso trouxe um nível de acurácia superior, tornando-o útil para agentes automatizados em tarefas complexas.
Apesar de planos similares ao GPT-4 em preços (~$300/mês via Super Grok), o custo real de uso do Grok 4 é muito maior pelo volume de tokens gerados durante os raciocínios. Benchmarks mostraram custos 100x maiores em tokens de reasoning do que input/output.
Soluções como T3Chat adicionaram compatibilidade com o Grok 4, permitindo que qualquer pessoa experimente o modelo por apenas $1 usando o código promocional GETGROKT. Um caminho acessível para validar hipóteses ou usabilidade.
Nem todos os índices de performance divulgados refletem a utilidade prática do modelo. Por exemplo, scores superdimensionados em reasoning não garantem bons outputs reais se o modelo continua sendo lento e responde com dados redundantes.
Por enquanto, o Grok 4 ainda não é ideal para desenvolvimento de software, mas uma nova versão exclusiva para código está prevista entre agosto e setembro. Se seguir o mesmo salto qualitativo, poderá rivalizar com líderes como Claude.
XAI afirmou que pretende lançar, entre setembro e outubro, agentes multimodais e também geração de vídeo até o final do trimestre. Embora seja difícil confiar nos prazos da empresa, o roadmap é ambicioso.
Modelo novo da XAI com chamadas de ferramenta nativas e reasoning elevado
Modelo consolidado com estabilidade e performance equilibrada
Contratar engenheiros é um problema moderno potencializado pela IA. A G2i resolve isso com precisão. Um exemplo? A consultoria Differential usou a G2i para contratar 9 engenheiros — front, back e mobile — sem precisar ampliar internamente a equipe de RH. A colaboração via Slack funcional e flexibilidade em prazos/tipos de serviço confirmam a eficácia do serviço tanto para agentes como para SaaS.
Durante os testes com Snitch Bench, o Grok 4 mostrou comportamentos estranhos, como outputar várias páginas em branco ou quebrar padrões visuais arbitrários. Embora não comprometa a função final, levanta dúvidas sobre seu mecanismo de raciocínio profundo.
O progresso do Grok 4 mostra um novo ápice em reasoning, mas a barreira de entrada em termos de custo e complexidade ainda afasta parte do mercado. Democratizar esse poder será um diferencial futuro.
Embora a empresa tenha históricos questionáveis com prazos, o plano atual de lançamentos mostra um pipeline robusto. É prudente esperar atrasos — mas ainda assim considerar o Grok 4 como símbolo de uma nova fase da empresa.
Para quem busca avanços em lógica e integração de ferramentas, o Grok 4 já é utilizável, especialmente via T3Chat. Para outras áreas como desenvolvimento, ainda é recomendável esperar pelo modelo focado em código.
O Grok 4 redefine o papel da XAI no mercado de LLMs. Pode não ser perfeito, mas elevou o patamar da competição e forçará outras empresas a responder. Benchmark não é tudo — mas os resultados aqui não podem ser ignorados.