Custo real de modelos de IA além do gráfico de marketing
Preço de lista engana. Por que benchmarks custam caro e como escolher modelo sem se iludir com corrida ao fundo. na prática para builders
Resposta direta
Há um tempo atrás, eu publicei um vídeo chamado AI, um corrido para o fundo. Eu, pessoalmente, gastei muito dinheiro gerindo todas essas benchmarks para validar essa informação eu mesmo.
Por que este material importa
Este artigo reorganiza a transcrição de `custo-real-modelos-ia-benchmark` (tema: custo real modelos benchmark) em leitura operacional: o que muda no produto ou no processo nesta semana.
Há um tempo atrás, eu publicei um vídeo chamado AI, um corrido para o fundo. Eu, pessoalmente, gastei muito dinheiro gerindo todas essas benchmarks para validar essa informação eu mesmo.
O material não começa em teoria — começa assim: Há um tempo atrás, eu publicei um vídeo chamado AI, um corrido para o fundo. Eu, pessoalmente, gastei muito dinheiro gerindo todas essas benchmarks para validar essa informação eu mesmo. Eles têm uma galeria incrível onde você pode ver o de modelo que você esprocurando e eles apoiam muitas coisas diferentes de outras empresas também, como as modelos de vídeo da Clings, os modelos de contexto da FluxPro e até o V03 da Google.
O problema real atrás de custo real modelos benchmark
A cena inicial já define o jogo: Você pode mudar todos esses setores adicionais, mudar a resolução, estilos, cores, etc. Se eu pegar algum código random e eu o pastear no OpenAI Tokenizer, ele vai mostrar como ele quebra essa informação para tokens. 334 personagens, 83 tokens, é aproximadamente quatro personagens por token depende muito de coisas isso é também por que o formato de json para suas entradas não é ótimo porque é realmente pesado por conta do número de espaço adicional tomado por muitos dos personagens e o que não no formato comparado com algo como xml que tende a ser um pouco mais eficiente então é o que um token é, então quando estamos falando sobre o custo de milhões de tokens, isso seria 1 milhão de.
O que vale copiar é o processo, não a persona: Então, como um exemplo rápido para testar, eu dei o prompt do sistema do skatebench, que é um benchmark que eu fiz para medir o quão bem diferentes modelos podem nomear truques de skate. Eu digo que você é um assistente de nome de truques, dê o nome de um truque, dê a descrição, dê apenas o nome mais comum e eu vou perguntar o que é efetivamente um flip 360.
Se você não resume a restrição em uma frase, ainda extraiu só a vibe do vídeo — não o problema.
Âncora
Information gain = caso + mecanismo. Sem o caso, vira resumo vazio de blog.
Como as modelos de vídeo da Clings, os modelos de co
Desdobrando a decisão prática: A mesa suspira 360° para trás e vira na direção do kip-flip, o skater não vai virar, este é um 360° vira Eu estou dando isso para KimiK2, que é um modelo sem razoabilidade. Grok4 nem mesmo te dá a capacidade de escolher um budget para a razão. Na verdade, se você adicionar qualquer outro modelo que eu já usei Skatebench em, ainda é menos dinheiro do que dirigir em Grokfor um vez, porque não pode ajudar, mas pense, E quando você mostra isso em um gráfico de performance versus custo, parece até mais engraçado, porque o 03 custou literalmente 5 centavos para fazer o teste e ganhou melhor do que o Grock 4, que custou 5 dólares para fazer o mesmo teste.
O trecho operacional que importa: Vamos dizer que fizemos isso 1000 vezes. Apesar do fato de que estes são os mesmos inputos e os inputos custam a mesma quantidade, o preço final acabou sendo literalmente 30 vezes mais alto por causa, novamente, dessa diferença de custo de saída.
Checklist curto: 1) Dono da decisão. 2) Métrica de 7 dias. 3) Rollback se piorar. 4) Doc de uma página no repo.
Checklist
Copie o mecanismo, não a persona do criador. Seu ICP e stack ditam o experimento.
Como ele quebra essa informação para tokens
Leitura de risco a partir da evidência falada: Vou mostrar para vocês num lugar muito estranho. Este gráfico não importa mais por causa das coisas que estamos falando agora.
Falsas vitórias comuns: demo bonita sem dados, integração 'pronta' sem observabilidade, e automação que esconde erro em vez de expor.
Para `custo-real-modelos-ia-benchmark`, a pergunta de corte é: o usuário completa a tarefa sem você na call? Se não, ainda é protótipo.
O aviso embutido na narrativa: Este é o preço por token de cada um dos modelos mais demandados. Isso é algo que nós vimos com o T3Chat.
Atenção
Não marque como shipped o que só funciona com o founder logado e o .env da demo.
Como validar custo real modelos benchmark em 7 dias
Antes de escalar, revise com estes recortes: Eu, pessoalmente, gastei muito dinheiro gerindo todas essas benchmarks para validar essa informação eu mesmo. Eles têm uma galeria incrível onde você pode ver o de modelo que você esprocurando e eles apoiam muitas coisas diferentes de outras empresas também, como as modelos de vídeo da Clings, os modelos de contexto da FluxPro e até o V03 da Google.
Internalize com links vivos do ecossistema CrazyStack: /blog, /curso-cursor-avancado-configuracoes-pro, /curso-claude-code-9-dicas-profissionais, /programa-crazystack e /checklist-independencia-cursor.
Detalhes do material de origem
Leve para o board só o que for observável: Eles têm uma galeria incrível onde você pode ver o de modelo que você esprocurando e eles apoiam muitas coisas diferentes de outras empresas também, como as modelos de vídeo da Clings, os modelos de contexto da FluxPro e até o V03 da Google. Você pode mudar todos esses setores adicionais, mudar a resolução, estilos, cores, etc. Se eu pegar algum código random e eu o pastear no OpenAI Tokenizer, ele vai mostrar como ele quebra essa informação para tokens.
Implicações para produto e engenharia: 334 personagens, 83 tokens, é aproximadamente quatro personagens por token depende muito de coisas isso é também por que o formato de json para suas entradas não é ótimo porque é realmente pesado por conta do número de espaço adicional tomado por muitos dos personagens e o que não no formato comparado com algo como xml que tende a ser um pouco mais eficiente então é o que um token é, então quando estamos falando sobre o custo de milhões de tokens, isso seria 1 milhão de. Então, como um exemplo rápido para testar, eu dei o prompt do sistema do skatebench, que é um benchmark que eu fiz para medir o quão bem diferentes modelos podem nomear truques de skate. Eu digo que você é um assistente de nome de truques, dê o nome de um truque, dê a descrição, dê apenas o nome mais comum e eu vou perguntar o que é efetivamente um flip 360.
O que levar para a próxima sprint: Grok4 nem mesmo te dá a capacidade de escolher um budget para a razão. Na verdade, se você adicionar qualquer outro modelo que eu já usei Skatebench em, ainda é menos dinheiro do que dirigir em Grokfor um vez, porque não pode ajudar, mas pense, E quando você mostra isso em um gráfico de performance versus custo, parece até mais engraçado, porque o 03 custou literalmente 5 centavos para fazer o teste e ganhou melhor do que o Grock 4, que custou 5 dólares para fazer o mesmo teste. Vamos dizer que fizemos isso 1000 vezes.
Mais evidência do áudio original, sem inventar cena: Este é o preço por token de cada um dos modelos mais demandados. Isso é algo que nós vimos com o T3Chat. Eu deixo isso em médio, eu até vou desligar para baixo, mas a maioria das pessoas vai e clica em alto em cada vez e isso é um botão caro para clicar, mesmo que não ofereça você nada, porque a mente humana esatraída pela melhor opção possível, eles querem o mais, o melhor, o mais inteligente e essa é uma grande parte do porquê eles vêm para o chat t3 também, porque no chat t3 você tem acesso a tudo, você esvindo para o melhor, você quer o melhor para estar em em seu melhor.
Feche a semana com estes critérios do material: Agora, Deep Research vai passar 3 minutos planejando e 20 minutos lendo, e mais 5 minutos reescrevendo um relatório para você, enquanto o 03 vai só correr por 20 minutos para responder, Olá, lá. A explosão de aprendizagem de reforço e computação de tempo de teste resultou em algo que ninguém viu vindo. Uma vez que podemos deployar agentes para correr workloads por 24 horas de forma assíncrona, não vamos lhes dar uma instrução e esperar para feedback.
Quando a transcrição é curta, o ganho editorial está em transformar a restrição em checklist e critério de corte — sem inventar fatos ausentes do áudio.
Perguntas frequentes
No material de Custo real de modelos de IA além do gráfico de marketing, o que «O problema real atrás de custo real modelos benchmark» resolve de verdade?
Operação curta: A cena inicial já define o jogo: Você pode mudar todos esses setores adicionais, mudar a resolução, estilos, cores, etc. Se eu pegar algum código random e eu o pastear no OpenAI Tokenizer, ele vai mostrar como ele quebra essa informação para tokens. 334. Revise com evidência, não com feeling.
Como transformar «Como as modelos de vídeo da Clings, os modelos de co» em critério de done?
Do texto: Desdobrando a decisão prática: A mesa suspira 360° para trás e vira na direção do kip-flip, o skater não vai virar, este é um 360° vira Eu estou dando isso para KimiK2, que é um modelo sem razoabilidade. Grok4 nem mesmo te dá a capacidade de escolher um budget.
Qual evidência mínima confirma «Como ele quebra essa informação para tokens»?
Leitura de risco a partir da evidência falada: Vou mostrar para vocês num lugar muito estranho. Este gráfico não importa mais por causa das coisas que estamos falando agora. Em «Como ele quebra essa informação para tokens», trate como experimento com dono e prazo — não como lista de intenções.
O que o texto alerta sobre timing de «Como validar custo real modelos benchmark em 7 dias»?
Comece pelo mecanismo: Antes de escalar, revise com estes recortes: Eu, pessoalmente, gastei muito dinheiro gerindo todas essas benchmarks para validar essa informação eu mesmo. Eles têm uma galeria incrível onde você pode ver o de modelo que você esprocurando e eles apoiam muitas.