Google Genie 3: fronteira nova ou hype de AGI?....
Google lançou o Genie 3 como nova fronteira. Influencers falam em AGI — e o vídeo lembra que hype de tech influencer pode ser mau exemplo.
Resposta direta
Trate Genie 3 como avanço de modelo de mundo/simulação a investigar, não como atalho retórico para AGI por causa de thread viral. Se tu nem precisa ter isso, se tu pode criar bilhões de mundos simulados e tu conseguir confiar na física daquele mundo, porque tu usou, sei lá, uma engine de jogo, alguma coisa, não sei o que o Google está usando por.
O que o anúncio do Genie 3 reivindica
Ontem, o Google lançou o Genie 3, e segundo eles, isso aqui é uma nova fronteira no mundo dos modelos. Mas é bom, como o FFmpeg falou, é bom a gente lembrar que influenciadores de tecnologia podem sim ser maus exemplos. Porém, isso aqui parece estar sendo um grande pulo aí no avanço desse tipo de modelo, tá?
Então é aqui que vem o G do AGI, propósito geral, que pode gerar uma diversidade sem precedentes de ambientes interativos. Então, dado um prompt de texto, o GENIE 3 pode gerar mundos dinâmicos, que você pode navegar em tempo real a 24 quadros por segundo. Na verdade, muita coisa mais cinematográfica, ela roda num FPS mais baixo, não vai ter em 60 FPS, que 60 FPS não te dá emoção.
Por que AGI aparece no discurso
Mas uma das coisas mais importantes aqui é o seguinte, cara, ele mantém a consistência por alguns minutos em uma resolução de 720p. Então, o mais importante é que esse modelo não gera o vídeo inteiro, ele vai gerando o vídeo em tempo real e, basicamente, reagindo às tuas interações. Eu acho que tudo isso aqui é uma questão de o quanto eles conseguem fazer o pipeline de criação ser eficiente e rápido.
O Interaction Horizon é o mais importante aqui, porque isso aqui é a duração ou a extensão de tempo no qual a IA vai conseguir manter a consistência. Tu vai interagir com o mundo, tu vai, sei lá, pintar uma parede, fazer alguma coisa, e isso vai refletir nos próximos frames. Então, se tu for ver, o Interaction Horizon do Vue, que a gente reagiu aqui no canal, era de 8 segundos apenas.
Na prática
Trate Genie 3 como avanço de modelo de mundo/simulação a investigar, não como atalho retórico para AGI por causa de thread viral.
Influencer de tech como mau exemplo
E o mais impressionante é que eles conseguiram manter algo que no Vue a gente não tem, que é latência tempo real. Ou seja, Ele tá gerando um vídeo em tempo real e tudo que tu modifica nesse vídeo, porque tu tá interagindo com ele em tempo real, persiste na memória ou na compreensão daquele mundo pela IA por minutos. Então isso traz consistência ao longo do tempo, que é o que quebra aqueles sentimentos do tipo assim, cara, esse vídeo aqui foi feito por IA.
Agora, o mais importante, na minha opinião, e é o que todo mundo tá falando, é como que esse tipo de modelo pode nos levar. A melhores treinamentos para robôs e tudo mais, para ele ter uma compreensão do mundo, tá? Desde o treinamento de agentes para dominar jogos de estratégia em tempo real, até o desenvolvimento de ambientes simulados para aprendizado aberto e robótica.
Como avaliar sem FOMO
Então, a gente sabe que a potência, ou quão bom o modelo vai ser, vai depender do treinamento. Imagina se tu conseguir criar milhões de mundos em tempo real, em paralelo, pro teu robô interagir e aprender. Então, se tu dirige um Tesla, sim, os vídeos que o teu carro está gravando, eles podem sofrer ali uma revisão humana para fazer o reinforcement learning by human feedback.
Só que imagina, a Tesla depende de milhares de carros, milhões de carros no mundo, rodando o dia todo, gravando essas imagens para o modelo ficar cada vez melhor. Se tu nem precisa ter isso, se tu pode criar bilhões de mundos simulados e tu conseguir confiar na física daquele mundo, porque tu usou, sei lá, uma engine de jogo, alguma coisa, não sei o que o Google está usando por trás aqui, mas que consiga, de fato, na construção desse mundo, ter uma accuracy melhor, uma precisão melhor, tu consegue treinar esses modelos por um custo muito inferior. Eu fico me questionando, assim, tu deve se perguntar também como é que ele consegue modelar essas propriedades, né?
Perguntas práticas antes de pivotar carreira
Tem um erro grotesco aqui, que é, por exemplo, aqui tá aberto, né? Ele faz isso Bom, a porta abriu sozinho, mas enfim Tu conseguiria interagir com o mundo, cara Ele abriu e fechou a porta As pernas caminhando Ok, agora eu tô começando a ficar impressionado Vou te falar o seguinte Agora eu tô começando a ficar impressionado Tá ficando bom isso aqui Chega perto das folhagens Ah, o sombreamento Cara, a perna dele Tu viu a perna dele batendo na Na folhagem. Para que você seja capaz de interagir com o vídeo dessa forma, o vídeo está sendo gerado em tempo real mesmo, tá ligado?
Deve ter, não sei ali se é milissegundos, alguns segundos, não sei se eles vão falar aqui nesse artigo quanto tempo eles levam para reagir. Durante a geração autoregressiva de cada quadro, o modelo tem que levar em conta a trajetória gerada anteriormente que cresce com o tempo. Para alcançar a interatividade em tempo real, esse cálculo deve acontecer várias vezes por segundo, em resposta às novas entradas do usuário à medida que elas chegam.
Sinais de que está funcionando
No entanto, gerar um ambiente de forma autoregressiva é geralmente um problema técnico mais difícil do que gerar um vídeo inteiro, pois aí as impressões tendem a se acumular ao longo do tempo, pois as imprecisões, no caso aqui, tendem a se acumular ao longo do tempo. Apesar do desafio, os ambientes do GN3 permanecem em grande parte consistentes por vários minutos, com memória visual. Cara, isso aqui que é impressionante mesmo, essa complexidade, tá ligado, de gerenciar essas dependências aqui de longo prazo que vai acumulando e acumulando, e a gente já viu lá no artigo sobre o ContextRot, de como que os modelos, cara, eles acabam tendo o seu contexto corruído, quanto mais o contexto aumenta, né, então quanto mais informações tu dá para o modelo, mais ele é capaz de alucinar, digamos assim.
Então, imagina na geração do vídeo aqui, manter esses elementos, de fato, deve ter sido uma técnica diferente que eles estão utilizando. Além de entrada de navegação, o GN3 também permite uma forma mais expressiva de interação baseada em texto, que nos referirmos como eventos no mundo adicionáveis pro prompt. Banana Sky Driver Tá, o cara tá de ski E aí uma banana Sky Driver entra ali Agora eu vou botar um Deer Herd Ah, mas eu pensei que ele ia Manter a A banana ali, lá o Deer Herd Agora, ah, mas ele tá recarregando Cara, é como se tu Isso aqui não é interessante, eu tô inserindo prompt Pá, do nada ali Eu tô inserindo prompt Ou tu tá refazendo prompt Não entendi muito bem, cara.
O que evitar na primeira semana
Mas qual que é a diferença disso do que se eu colocasse isso no prompt original? Como o DINI 3 tem a capacidade de manter a consistência, isso agora possibilita executar sequência de ações mais prolongadas, atingindo complexidade de objetivos maiores. Se eu acredito que isso aqui vai nos levar ao AGI, eu acredito que o GPT-5 é o AGI, não é?
O GPT-5 é o grande AGI, e se não for, a bolha vai estourar. Eu acho que antes do GENI-3 conseguir produzir o AGI, ou a gente vai ter o AGI, ou a bolha vai estourar. Pra quem não sabe, eu comprei esse PC aqui com Windows pra corrigir uns bugs do Persua no Windows, tá?
Na prática
Próximo passo para «google-genie-3-agi-hype-cautela»: rode um experimento de 7 dias com uma métrica ligada a google genie 3 agi hype antes de escalar o padrão.