GPT-5: expectativa versus realidade
O lançamento do GPT-5 gerou decepção em parte da audiência: o playbook certo é avaliar por tarefas suas, não por hype de comentários.
O que o hype prometeu
Nesta parte do material sobre gpt-5 lancamento expectativa, o foco é «O que o hype prometeu». Em vez de teoria genérica, o raciocínio parte do que acontece quando você executa de verdade.
Quero dar o tempo de passar por todos os detalhes com vocês, do que minha experiência foi trabalhando com OpenAI, para como fui compensado, para como as coisas mudaram desde o lançamento, para como minhas próprias expectativas não foram cumpridas, Tchau. É um tempo que eu estou indo para cá e eu estou suposto estar, tipo, voltando de minha vacação agora, mas eu queria dar o tempo de explicar isso porque eu vejo muita confusão, frustração e desinformação sendo espalhada e eu não quero ser parte disso ao melhor de minha capacidade. Provavelmente estão tendo com o chat gpt e gpt5 agora não é a experiência que eu tive quando eu estava testando primeiro, vamos entrar nos detalhes de tudo isso em um pouco, mas há um par de outras coisas que eu quero pular primeiro, eu vejo muitas pessoas me acusando de ser um shill pagado de open ai e isso é tão hilariosamente não verdadeiro que eu estou quase frustrado que isso está acontecendo, mas eu entendo por que estou recebendo esse tipo de empurramento, eu disse que a coisa estava muito boa foi para mim, me levou a cabeça e eu tentei gravar minha reação real, para ver o quão poderosa era, porque eu queria que vocês vissem isso, não alguma de marketing.
Eu não fui pagado um cento pela OpenAI, de fato, estou atualmente a cerca de 25 mil dólares de imprensa com eles, com o T3chat, nos últimos dois a três semanas, então não, eles não me pagaram, eu estou na verdade perdendo muito dinheiro. Eles me ofereceram uma fia de aparecimento de mil dólares para o vídeo que eu estava fazendo, mas eu acho que precisamos entender melhor vídeo que eu estava no Para ser o mais transparente possível, vou dar a vocês a ordem dos eventos sobre como eu me envolvi com esse lançamento. Então eu acabei de acessar alguns dos meus contatos na OpenAI e, desde que eu não os acessei como uma empresa, eu os acessei como um indivíduo, eles não conseguiam me dar acesso no início de empresa que outros estavam conseguindo.
O que usuários sentiram
Nesta parte do material sobre gpt-5 lancamento expectativa, o foco é «O que usuários sentiram». Em vez de teoria genérica, o raciocínio parte do que acontece quando você executa de verdade.
Eu acho que o mesmo modelo está disponível através de atingir os 5 endpoints de API de razão alta do GPT-5. Então quando eu fui ainda mais longe e fiz o que agora é obviamente um tweet um pouco irresponsável dizendo que todas essas outras ferramentas não eram mais relevantes, se sua experiência não se alinhava com o que eu tinha dito lá, parece que estou apenas sendo pagado e eu posso ver como as pessoas pensam isso. Claramente essas pessoas não sabem muito da minha história e o quão difícil eu trabalho para ser transparente sobre cada pessoa que me pagou um dólar, mas se você Tive a experiência ruim que tantos tinham no chatgbt.com e depois fui para o Twitter para complicar sobre isso e vi o meu post, posso ver por que você seria hesitante em me confiar.
Do pequeno pouco que eu estava jogando com ele nos dias a dia, que era admitidamente, em uma base de código pequeno, que eu estava usando para resolver puzzles random na DefCon, parecia um pouco pior, mas não muito pior, e eu realmente não me importava com pensar mais sobre isso naquela época. A experiência que eu estava tendo usando GPT-5, até mesmo a versão alta, rápida, no cursor, não é tão boa quanto a build do Nectarine 725 que eu estava usando quando eu estava jogando com ele antes. E como eu mencionei antes, desde sexta-feira da semana passada, o dia antes que o GPT-5 lançasse, até agora, sexta-feira da semana que vem, eu não estou fazendo muito código.
Na prática
Lançamento GPT-5: expectativa, comentários e o que muda na prática.
Como avaliar modelo novo
Nesta parte do material sobre gpt-5 lancamento expectativa, o foco é «Como avaliar modelo novo». Em vez de teoria genérica, o raciocínio parte do que acontece quando você executa de verdade.
Eu estou surpreso com o quanto as pessoas estão dizendo que eles têm a mesma experiência de qualidade que eu estava falando quando eles estavam usando GPT-5 no primeiro dia ou dois e têm visto que o degradou desde então. Isso não é nem tão próximo da mesma qualidade e novamente o mesmo exato prompt estou muito tímido em abrir todas as diferentes builds que eu fiz, então vou mostrar aqui uma aqui é uma que também foi feita usando copilot e você pode ver que não até mesmo colocou o gradiente corretamente nesta caixa, ela se quebra na esquerda aqui, é só ruim, parece quebrado e foi gerado incorretamente aqui é outra que foi gerada no cursor e não é tão ruim, mas ainda não é tão bom quanto antes, eu até vi durante o passo de razão dizer que que deveria usar um gradiente, e não conseguiu. Isso em vez disso tudo começou com isso, por exemplo, este era o original que eu tinha enviado aos diferentes modelos em diferentes versões do modelo e disse, ei, faça isso parecer melhor, basicamente, sobrecarregue, crie e edite fluxos e faça uma melhor olhada melhor experiência de usuário para isso e por qualquer razão, só ficou pior quando eu estava testando primeiro, até pior do que como o horizonte, vocês viram as gerações que eu fiz então eles eram incríveis, então eu não tenho ideia do que está acontecendo aqui, especialmente quando consideramos o fato de que os modelos do horizonte tinham razões fora Mano, algumas dessas gerações eram ruins.
Desde que eu não tinha contado ao meu time sobre o lançamento do GPT-5, não estava planejado de qualquer forma específica, apenas se o vídeo era suposto estar disponível naquele momento. Até tentando que seus limites de preço se esvaiçam é como tirar as costas, não é uma empresa agradável para trabalhar, pelo menos na minha experiência, especialmente em comparação com as outras empresas que estamos falando sobre isso, eu estou longe da única pessoa que tem tido um retorno como esse e também está mudando sua tonalidade agora que eles estão tendo mais experiência, eu disse no meu vídeo original que gpt5 não era uma boa modela para falar e eu ainda meio que fico atrás disso o chat do gpt5 modelo, não é realmente um modelo, é um diferente set de parâmetros que você pode acessar sobre a API, é melhor do que a versão que eu estava usando, mas ainda não era ótimo para falar, pros e só ser divertido de interagir com. É um modelo realmente robótico que faz o que você diz, é a magia que nós experimentamos, mas não foi tão bom de falar, então quando ela acabou de colocar o seu produto, ela estava desimpressionada.
Playbook de upgrade
Nesta parte do material sobre gpt-5 lancamento expectativa, o foco é «Playbook de upgrade». Em vez de teoria genérica, o raciocínio parte do que acontece quando você executa de verdade.
Então eles acabaram se voltando para o GPT 4.1 para o produto deles, porque o produto deles é muito mais sobre copiar apresentações e ter um output conversacional. Eu, honestamente, não acredito que alguém tenha assistido meus vídeos anteriores e pensado uau, a OpenAI pagou por isso porque há tantas coisas que eu disse neles que são obviamente coisas que a OpenAI não teria querido que eu dissesse. Mesmo agora, quando eu postei, reclamando do fato de que essas modelos não estão funcionando como fizeram quando eu as testei, como, de forma exata, apenas dizendo que a modelos não é tão boa quanto era antes.
Eu não sabia quanto custava, eu não sabia se os mini modelos estavam acontecendo, eu não sabia como funcionavam os parâmetros de pensamento e razão, e eu certamente não sabia que a versão no chat gpt.com iria assustar tanto que era fácil recomendar o T3Chat em vez de que você pudesse experimentar o modelo. Eu teria ganho muito mais do que ganhei por as coisas que eu disse, mas o que eu disse é o que eu acreditava e eu ainda acho que o bom modelo está lá, como eu realmente acredito que eu acabei de acertar o api o suficiente vezes eu usei o t3 chat o suficiente vezes eu vi que funcionava incrivelmente bem no cursor eu sei que pode ser incrível Eu não sei o que está errado e por que esse rolê tem sido tão aborrecido quanto tem sido. E eu sabia que algo estava em alta quando eu recebi mais e mais feedback dos nossos usuários que o chatgpt.com era uma experiência muito melhor com os novos modelos do que o site do chatgpt.com.
Sinais de que está funcionando
Nesta parte do material sobre gpt-5 lancamento expectativa, o foco é «Sinais de que está funcionando». Em vez de teoria genérica, o raciocínio parte do que acontece quando você executa de verdade.
Estou certo que há muitos casos em que isso não é verdade, mas pela minha experiência viva usando todas essas coisas, eu ainda não encontrei um tempo em que GPT-5 não conseguia responder a uma coisa e Opus conseguia, mas eu encontrei muitos do oposto. O Sonnet é ainda um ótimo modelo, é apenas caro por como está agora, mas eu estou fazendo testes hoje em Gpt5 High vs Sonnet vs Opus, eu não estou feliz com a qualidade das ferramentas em geral, parece que elas estão meio que doendo no momento, eu não sei se isso é o cursor empurrando algum mau update no canal do Insider que está quebrando coisas Eu não sei se tem alguma outra coisa louca escondida que eu não estou pensando aqui. Se você não está familiarizado, eu falei disso no meu segundo vídeo quando Eu estava usando o modelo, eu tinha acesso a GPD5 reasoning sob vários nomes diferentes, um deles sendo Nectarine, que era o modelo que eu estava usando a maior parte do tempo.
Para mim, eu não usei o site do chat GPT, então eu nunca realmente teria atingido, mas a coisa que o autorouter faz é que ele toma a solicitação, olha para ela e determina onde enviar-a baseado no conteúdo da solicitação. E como o usuário average de ChatGPT tem usado 4.0 quase exclusivamente, eu acho que 30% de usuários já usaram um dos modelos de pensamento para os usuários pagos em serviços de OpenAI. Menos de 30% de usuários que pagam 20 dólares por mês para chat gpt usam qualquer um dos modelos mais inteligentes eles só continuam usando 4.0 por isso eles estão acostumados a receber uma resposta imediatamente então 4.0 é replicado com um modelo de razão eles não conseguem mais isso então eles fizeram duas coisas a primeira é que eles fizeram o modelo razão ou não razão baseado no imprimido e na complexidade do que você pergunta a outra coisa que eles fizeram é o novo botão de resposta rápida onde você clica e ele simplesmente expõe uma resposta imediatamente por desligar a razão esses são hack e esses hack parecem ser não é bem recebido no momento e as pessoas não estão vendo o que estamos vendo com o modelo e também o mais grande problema, escondendo todos os outros modelos.
O que evitar na primeira semana
Nesta parte do material sobre gpt-5 lancamento expectativa, o foco é «O que evitar na primeira semana». Em vez de teoria genérica, o raciocínio parte do que acontece quando você executa de verdade.
Eles não deveriam ter tirado todos os outros modelos, eu acho que eles foram para trás desde que Sam está postando muito sobre seus desgraças e os erros aqui e o autorouter é apenas um desastre em geral. Outra coisa que eles derrubaram com certeza é a claridade das diferentes versões do GPT-5, não são nem mesmo diferentes versões, são diferentes parâmetros quando você está queryando o modelo, há vários níveis de suco que você pode dar ao modelo, que é a quantidade de pensamento que é permitido fazer que o causa a agir e de forma totalmente diferente. Tudo que eu sei é que o ponto de um lado que eu tinha acesso quando eu estava jogando com ele antes era realmente, realmente bom e as versões que estou usando agora não se sentem tão bem, pelo menos não se sentem tão bem em Cursor.
Se um novo modelo de cláudio vier e por algum motivo o Cursor não o apoia, eu ainda posso testar o quão bom esse modelo é com o código usando o código de cláudio. Os dois que importam são o competidor de agente de fundo para o Devin, onde você o coloca no Slack e ele vai e espalha um VM e escreve o código para você. Eu não posso te dizer quantas histórias eu ouvi de várias empresas que estão construindo coisas como apps de código de vibe ou ferramentas de CLI e os hacks que eles tiveram que colocar para manter modelos antropóficos de fazer coisas estranhas.
Como explicar isso para o time
Nesta parte do material sobre gpt-5 lancamento expectativa, o foco é «Como explicar isso para o time». Em vez de teoria genérica, o raciocínio parte do que acontece quando você executa de verdade.
Eles deixaram o modelo escrever para o arquivo e então imediatamente revertiam os direitos que ele fazia, porque não faria um bom trabalho e iria insistir em tocar coisas que não deveria, mesmo se você colocasse no imprimidor do sistema que ele não deveria tocar. A maneira como o cursor se comporta com modelos de sonata, em vez da maneira como ele se comporta com o GPT-5, é totalmente diferente. Eles estão nela e eu literalmente vejo meu telefone se acender agora com um empregador do cursor que está trabalhando em resolver esse problema, eu acho que é tudo que eu tinha na minha lista, eu só queria dar a vocês minha opinião honesta sobre o que foi errado aqui, eu acho que a OpenAI botou o lançamento, eu acho que as coisas que eles fizeram no site do chat gpt são deploráveis e têm pessoas muito, muito preocupados por razões que fazem total sentido, eu acho que a experiência que estamos tendo no cursor agora é quase nada como a que eu estava tendo antes, é possível que de como terça a domingo, foi perto do que eu Eu tive.
Eu tenho falado com o suficiente pessoas para dizer com certeza que há confusão de todos os lados sobre o que está acontecendo, que o router automático em particular era uma ideia terrível e não está em um estado que é bom o suficiente para ser como um caminho recomendado, que a maioria das pessoas com quem eu estava falando usava o API, eu também, e todas as nossas experiências eram muito boas, e muitas dessas experiências ainda podem ser vistas se você usar o API em outras ferramentas. Tente aceitar o fato de que um vídeo que eu filmei semanas antes de tudo isso e planejado meses antes de tudo isso não é sobre GPT-5, certamente não é sobre a OpenAI me pagando qualquer coisa. Você vai me empurrar para fazer isso porque estou tentando meu mais difícil aqui eu realmente estou eu fui um pouco biasado porque a openai me tratava melhor do que os outros laboratórios sim talvez os outros laboratórios me tratassem melhor como sério, mas sim sim, estou biasado porque gosto da empresa porque me trataram bem transparente comigo e fiz coisas que eu acho que são boas o que O que você espera que eu faça?
Na prática
Próximo passo: escolha uma métrica (taxa de sucesso, tempo, retries ou conversão) e rode um experimento de 7 dias antes de escalar o padrão.