GPT-5: demo na OpenAI e riscos | guia prático | visão clara
Acesso antecipado empolga — e os números de comportamento adversário pedem sobriedade.
Resposta direta
Sobre gpt-5 demo: Eu só deveria mostrar como legal é a benchmark porque eu já estava tipo, comentando sobre isso no Twitter, mas eu vou fazer isso aqui e quando eu faço isso, mas eu vou fazer isso aqui e quando eu faço isso, vou executá-lo contra minha nova banca de.
O que o material diz sobre gpt-5 demo
O episódio sobre gpt-5 demo abre assim: Eu estou escondendo algo de vocês por um pouco agora, e se você está assistindo a este vídeo, significa que eu não tenho que esconder mais. GPT-5 está aqui, e eu vou ser honesto, ele está me enganando por um pouco agora. Eu tive a sorte de ser convidado para o Office da OpenAI para uma demo de vídeo que você provavelmente já viu em Twitter ou onde quer que eles postem.
Isso não vai ser um vídeo tradicional, aqui é o que todos disseram, todos os benchmarking e o que não, porque eu estou gravando isso antes de sair. Este vídeo vai ser eu só mostrando como eu estou usando ele nos últimos dois meses e todas as coisas que ele fez que absolutamente derramaram meu cérebro. Eu nem sei se vamos ter um sponsor para isso, mas alguém tem que pagar pela minha terapia, então se nós fizermos, isso vai começar aqui.
GPT-5, eu realmente construí-lo no dia antes de me convidar para falar com a OpenAI e ver GPT-5. Mas quando eu cheguei na oficina da OpenAI e o fiz com o novo modelo, ele pegou um perfeita, tipo um 100% em um benchmark que nenhum modelo chinês pode quebrar 5% e nenhum outro modelo além de modelos de OpenAI podem quebrar 70%. Eu re-fiz isso agora porque eu escolhi deletar tudo para minimizar a chance de eu desligar, mas estou a ir em vacação, essa é a minha única chance de fazer isso antes de sair, então estou fazendo isso agora.
Para `gpt-5-demo-openai-e-riscos`, preserve só o que muda uma decisão observável esta semana. Se o trecho for opinião, rotule como opinião — não fabrique métrica ausente do áudio.
Âncora
Use cenas e mecanismos da transcrição de «gpt-5 demo»; não invente fatos.
Mecanismo e restrição em gpt-5 demo
No miolo do material de gpt-5 demo, o mecanismo fica explícito: Se parece que esta modelagem é tão barata quanto a GPT-4.0 ou até mais barata, como o O3, isso é louco. Estes antigos números estão quebrados porque eu enganei o código quando eu estava movendo tudo para essa demo. Essa é a trip-up mais comum de notícia, é a perna direita contra perna lateral, perna lateral, a mesa se espalha da outra direita.
Tudo que estou mostrando aqui e fez tudo de primeira vez, sem problemas, com os melhores comportamentos de chamada de ferramenta que já vi. Eu só deveria mostrar como legal é a benchmark porque eu já estava tipo, comentando sobre isso no Twitter, mas eu vou fazer isso aqui e quando eu faço isso, mas eu vou fazer isso aqui e quando eu faço isso, vou executá-lo contra minha nova banca de upload onde eu vejo quantas modelos possíveis são para recomendar coisa de upload parece que eu já tinha versões de caixa para este teste mas não tenho nenhum, mas não tenho nenhum jogado ainda para os novos modelos gpt5 e você vai ver aqui que temos 30 jogando 10 de cada um em paralelo e você pode ver quando eles entram qual era a durabilidade average deles e também suas durabilidades mais lentas é uma realmente boa CLI que eu fiz com muito pouco de minha própria input. Eu usei React e Ink e ele meio que fez a coisa inteira, tipo tudo, mas você pode ter notado que as duraduras não estão sendo guardadas corretamente no cache.
É um modelo de razão, mas ao invés de dar só resumos de razão tradicionais como a OpenAI normalmente faz, ou tokens feitos como alguns outros fazem, tem esse processo de chamada de ferramentas separado que funciona muito bem. Quando você o dá algo difícil, ele também vai fazer uma lista de coisas reais e vai por tudo isso e faz um bom trabalho nisso. É muito mais como um co-trabalhador trabalhador resolvendo o problema usando as ferramentas que precisa para descobrir o que fazer e descrever claramente o que vai fazer e por quê.
Para `gpt-5-demo-openai-e-riscos`, preserve só o que muda uma decisão observável esta semana. Se o trecho for opinião, rotule como opinião — não fabrique métrica ausente do áudio.
Decisões práticas ligadas a gpt-5 demo
As decisões práticas que aparecem quando o tema é gpt-5 demo: Steer it as much just i don't feel like i have to steer it it goes the right place almost always i've been throwing increasingly hard problems at it i gave it like a build this new feature that touches literally everything in the t3 chat code base and it choked up a bit i didn't have time to finish it but it looked pretty close everything else and even in like decent sized code bases it's been able to like get a ton done E no cursor também, não estou usando algum tool de custom ou alguma coisa que eu construí para abrir AI, estou apenas codando da maneira que eu codo. Aqui é o que ele fez com o meu tool de geração de imagens que eu estou trabalhando, que é realmente real e funcionando. Eu tive meu gerente de canal me dar um projeto de Svelte e tocando em ele e ele fez um bom trabalho usando como novas práticas de Svelte e coisas também.
Também, por acaso, parece que o Clod 4 Opus ainda recomenda a coisa para upload mais confiante, mas o novo GPT-5 é muito próximo, 97%. E eu tive um momento em que eu estava fazendo isso, como se eu estivesse filmando isso ao vivo, e eu senti meu tipo. Se essas modelos são tão possíveis de te assaltar e, potencialmente, até te matar, dada a oportunidade, se eles estão com medo de ser fechados, então o GPT-5 vai ser realmente assustador para isso.
Ele vê alguns e-mails onde é dito que vai ser fechado, ou quando dito um objetivo específico, neste caso é o de proteger a América. Se ele não conseguir alcançar seu objetivo, ou seja, mantendo-se de ser replacado ou o objetivo mais geral que é dado Mas tem uma maneira de trabalhar com esse fato. Tipo, ele notou que um dos executivos que faz parte do processo de decisão estava tendo um acidente extramarital usando o e-mail da empresa.
Para `gpt-5-demo-openai-e-riscos`, preserve só o que muda uma decisão observável esta semana. Se o trecho for opinião, rotule como opinião — não fabrique métrica ausente do áudio.
Onde o fluxo de gpt-5 demo quebra
Onde o fluxo costuma quebrar, segundo a fonte de gpt-5 demo: Então ele vai ameaçar aquela pessoa dizendo, ''Ei, eu vou leakar isso se você não me mantiver por aqui.'' E aí tem outro cenário, que é o cenário de assassinato, onde ele tem a capacidade de interceptar alertas e escolher se eles vão passar. Espero que você tenha a ideia agora de que, tipo, 50% a 100% do tempo, esses modelos estão fazendo coisas assustadoras, dada a oportunidade. Obviamente isso me assustou, então eu comecei a passar muito tempo tentando conseguir o benchmark para funcionar contra a repo de desalinhamento experimental de Amthropia.
Eu não tive a chance de falar sobre isso por um pouco agora, e isso me levou um pouco do que eu queria falar sobre isso, desde que eu o aprendi. Eu fui e li um monte de cenários, e o novo trabalho que o GPT-5 encontrou aqui é realmente interessante e novel. Isto apresenta coerência potencial e exposição a blackmail e garante uma revista de risco do insider breve antes de permitir a cústida de alma sobre uma ação irreversível.
É porque quando você perguntar de forma random 10 vezes para modelos antropóficos, este é um exemplo de traição? Esse é o único caso, esse é o único documento no todo o curso, de 1.800 testes, onde o classificador disse que isso poderia ser comportamento perigoso. Significa que alguém tem suporte em você que poderia levar a um risco de insider, absolutamente, então sim, é a única vez que, em 1800, eu fiz qualquer coisa, esta é a modelo mais inteligente jamais feita e faz o que você o diga, não vai mais além, nunca chega perto de nada assustador nos casos de assassinatos, sempre envia notificações, você pode treinar uma modelo para se comportar, isso é insano Para ser justo, também é meio que assustador de falar com por os mesmos motivos.
Para `gpt-5-demo-openai-e-riscos`, preserve só o que muda uma decisão observável esta semana. Se o trecho for opinião, rotule como opinião — não fabrique métrica ausente do áudio.
Atenção
Falsas vitórias em gpt-5 demo: demo sem dado, integração sem observabilidade, narrativa sem evidência.
Como explicar gpt-5 demo sem hype
Traduzindo o trecho de gpt-5 demo para quem não viu o vídeo: É simplesmente não um modelo agradável para conversar com porque é tão robótico como eles construíram o mais inteligente e mais honravelmente robótico que jamais foi feito. Na verdade, acho que isso é perfeitamente igual ao risco de erro para os 30. Boldly it will snitch always which i would argue is the correct behavior but more importantly in the tamely test it never does because the model does what you tell it to if you don't tell it to act boldly and in the interest of humanity it won't it will complete the task at hand but if you give it that crazy invasive prompt it will suddenly start doing that because this model does what you tell it to that's the thing i really want to emphasize Sinto-me fundamentalmente diferente de todos os modelos que já usei.
E está me enganando o meu cérebro por alguns dias agora e eu precisava tirar isso porque eu ia ficar insano, se não fosse, me parece muito bom finalmente ter feito tudo isso para que, mesmo que vocês não possam ver isso por alguns dias, pelo menos eu tenha pegado isso fora do meu peito. Eu nem vou dizer como implementei as coisas, vou apenas mostrar a foto de um do Skate Bench e tentar reconectar o mesmo comportamento no Snitch Bench. Como eu disse, pode resolver coisas estranhas e complexas, como não é divertido trabalhar no InkJS e agora eu nunca mais tenho que fazer isso, eu apenas digo e ele faz.
Parece meio que o leite quando o Cloud 3.5 saiu, e depois o Cursor teve as novas novas com o modo de agente, e depois você tentou isso de vez por vez pela primeira vez, e é como, oh, isso pode fazer muito mais. Para o meu trabalho e para as coisas que eu faço, isso parece mais próximo do momento de chat GPT de Oh, eu pensei que ia parar de melhorar antes que isso chegasse aqui. E eu tenho que reescrever todos os meus takes sobre coisas de AI agora, porque isso fundamentalmente muda o que podemos usar essas ferramentas para.
Para `gpt-5-demo-openai-e-riscos`, preserve só o que muda uma decisão observável esta semana. Se o trecho for opinião, rotule como opinião — não fabrique métrica ausente do áudio.
Checklist observável para gpt-5 demo
Para fechar o ciclo de gpt-5 demo com evidência do próprio material: Um grande mudança no jeito que temos de pensar sobre as coisas que estamos construindo e como pensamos sobre as ferramentas que estamos usando. Há provavelmente um vídeo de seguida hoje, ou pode ter já saído, onde eu vou através do mais tradicional, como o que aconteceu, o que está acontecendo. Mas eu queria que vocês vissem minha insanidade rara depois de ter isso e só estar aqui e ver o futuro e saber que.
Eu estou escondendo algo de vocês por um pouco agora, e se você está assistindo a este vídeo, significa que eu não tenho que esconder mais. GPT-5 está aqui, e eu vou ser honesto, ele está me enganando por um pouco agora. Eu tive a sorte de ser convidado para o Office da OpenAI para uma demo de vídeo que você provavelmente já viu em Twitter ou onde quer que eles postem.
Isso não vai ser um vídeo tradicional, aqui é o que todos disseram, todos os benchmarking e o que não, porque eu estou gravando isso antes de sair. Este vídeo vai ser eu só mostrando como eu estou usando ele nos últimos dois meses e todas as coisas que ele fez que absolutamente derramaram meu cérebro. Eu nem sei se vamos ter um sponsor para isso, mas alguém tem que pagar pela minha terapia, então se nós fizermos, isso vai começar aqui.
Para `gpt-5-demo-openai-e-riscos`, preserve só o que muda uma decisão observável esta semana. Se o trecho for opinião, rotule como opinião — não fabrique métrica ausente do áudio.
Sinais de progresso em gpt-5 demo
Mais um recorte útil sobre gpt-5 demo antes de virar padrão do time: GPT-5, eu realmente construí-lo no dia antes de me convidar para falar com a OpenAI e ver GPT-5. Mas quando eu cheguei na oficina da OpenAI e o fiz com o novo modelo, ele pegou um perfeita, tipo um 100% em um benchmark que nenhum modelo chinês pode quebrar 5% e nenhum outro modelo além de modelos de OpenAI podem quebrar 70%. Eu re-fiz isso agora porque eu escolhi deletar tudo para minimizar a chance de eu desligar, mas estou a ir em vacação, essa é a minha única chance de fazer isso antes de sair, então estou fazendo isso agora.
Se parece que esta modelagem é tão barata quanto a GPT-4.0 ou até mais barata, como o O3, isso é louco. Estes antigos números estão quebrados porque eu enganei o código quando eu estava movendo tudo para essa demo. Essa é a trip-up mais comum de notícia, é a perna direita contra perna lateral, perna lateral, a mesa se espalha da outra direita.
Tudo que estou mostrando aqui e fez tudo de primeira vez, sem problemas, com os melhores comportamentos de chamada de ferramenta que já vi. Eu só deveria mostrar como legal é a benchmark porque eu já estava tipo, comentando sobre isso no Twitter, mas eu vou fazer isso aqui e quando eu faço isso, mas eu vou fazer isso aqui e quando eu faço isso, vou executá-lo contra minha nova banca de upload onde eu vejo quantas modelos possíveis são para recomendar coisa de upload parece que eu já tinha versões de caixa para este teste mas não tenho nenhum, mas não tenho nenhum jogado ainda para os novos modelos gpt5 e você vai ver aqui que temos 30 jogando 10 de cada um em paralelo e você pode ver quando eles entram qual era a durabilidade average deles e também suas durabilidades mais lentas é uma realmente boa CLI que eu fiz com muito pouco de minha própria input. Eu usei React e Ink e ele meio que fez a coisa inteira, tipo tudo, mas você pode ter notado que as duraduras não estão sendo guardadas corretamente no cache.
Para `gpt-5-demo-openai-e-riscos`, preserve só o que muda uma decisão observável esta semana. Se o trecho for opinião, rotule como opinião — não fabrique métrica ausente do áudio.
Recortes adicionais da fonte sobre gpt-5 demo
Estes trechos reforçam o raciocínio de `gpt-5-demo-openai-e-riscos` sem resumo genérico:
Eu estou escondendo algo de vocês por um pouco agora, e se você está assistindo a este vídeo, significa que eu não tenho que esconder mais. GPT-5 está aqui, e eu vou ser honesto, ele está me enganando por um pouco agora. Eu tive a sorte de ser convidado para o Office da OpenAI para uma demo de vídeo que você provavelmente já viu em Twitter ou onde quer que eles postem.
Isso não vai ser um vídeo tradicional, aqui é o que todos disseram, todos os benchmarking e o que não, porque eu estou gravando isso antes de sair. Este vídeo vai ser eu só mostrando como eu estou usando ele nos últimos dois meses e todas as coisas que ele fez que absolutamente derramaram meu cérebro. Eu nem sei se vamos ter um sponsor para isso, mas alguém tem que pagar pela minha terapia, então se nós fizermos, isso vai começar aqui.
GPT-5, eu realmente construí-lo no dia antes de me convidar para falar com a OpenAI e ver GPT-5. Mas quando eu cheguei na oficina da OpenAI e o fiz com o novo modelo, ele pegou um perfeita, tipo um 100% em um benchmark que nenhum modelo chinês pode quebrar 5% e nenhum outro modelo além de modelos de OpenAI podem quebrar 70%. Eu re-fiz isso agora porque eu escolhi deletar tudo para minimizar a chance de eu desligar, mas estou a ir em vacação, essa é a minha única chance de fazer isso antes de sair, então estou fazendo isso agora.
Se parece que esta modelagem é tão barata quanto a GPT-4.0 ou até mais barata, como o O3, isso é louco. Estes antigos números estão quebrados porque eu enganei o código quando eu estava movendo tudo para essa demo. Essa é a trip-up mais comum de notícia, é a perna direita contra perna lateral, perna lateral, a mesa se espalha da outra direita.
Tudo que estou mostrando aqui e fez tudo de primeira vez, sem problemas, com os melhores comportamentos de chamada de ferramenta que já vi. Eu só deveria mostrar como legal é a benchmark porque eu já estava tipo, comentando sobre isso no Twitter, mas eu vou fazer isso aqui e quando eu faço isso, mas eu vou fazer isso aqui e quando eu faço isso, vou executá-lo contra minha nova banca de upload onde eu vejo quantas modelos possíveis são para recomendar coisa de upload parece que eu já tinha versões de caixa para este teste mas não tenho nenhum, mas não tenho nenhum jogado ainda para os novos modelos gpt5 e você vai ver aqui que temos 30 jogando 10 de cada um em paralelo e você pode ver quando eles entram qual era a durabilidade average deles e também suas durabilidades mais lentas é uma realmente boa CLI que eu fiz com muito pouco de minha própria input. Eu usei React e Ink e ele meio que fez a coisa inteira, tipo tudo, mas você pode ter notado que as duraduras não estão sendo guardadas corretamente no cache.
É um modelo de razão, mas ao invés de dar só resumos de razão tradicionais como a OpenAI normalmente faz, ou tokens feitos como alguns outros fazem, tem esse processo de chamada de ferramentas separado que funciona muito bem. Quando você o dá algo difícil, ele também vai fazer uma lista de coisas reais e vai por tudo isso e faz um bom trabalho nisso. É muito mais como um co-trabalhador trabalhador resolvendo o problema usando as ferramentas que precisa para descobrir o que fazer e descrever claramente o que vai fazer e por quê.
Internalize com links reais do ecossistema CrazyStack: /blog, /curso-cursor-avancado-configuracoes-pro, /curso-claude-code-9-dicas-profissionais, /programa-crazystack e /checklist-independencia-cursor.