OpenAI Voice Mode avançado: build real de produto falado
Voice Mode em tempo real com interrupção natural: um ano de contexto, o que construir em cima e por que voz muda o produto que você vende.
Resposta direta
Voice Mode avançado da OpenAI: comunicação em tempo real com interrupção natural. Um ano depois do lançamento, o que construir em cima e por que voz muda o produto. Há um ano atrás, a OpenAI lançou uma nova ferramenta chamada Voicemode Avancado. O Voicemode Avancado, basicamente, te permite se comunicar em tempo real com um dos LLMs de OpenAI e, enquanto você fala, ele se responde de forma natural. Você pode interromper essa cadeira de pensamento, adicionar mais contexto e ele vai lidar com essa interrupção naturalmente.
O que mudou com voz realtime
No material original, o ponto de partida não é teoria abstrata: é uma sequência concreta ligada a «OpenAI Voice Mode avançado: build real de produto falado». Essa é, na minha opinião, uma das maiores aumentadas de funções de passo em termos de comunicação realista com LLMs e AI que tivemos há muito tempo. E eu sempre estava curioso para saber como eles lidam com esse de interação real-time, interrupção real-time tão suavemente.
Então é por isso que eu passei o último mês implementando esse de modo de voz na aplicação que estou construindo. Basicamente, quando eu preciso comunicar com um LLM, seja chat GPT ou Gemini, o que quer que seja, eu quase sempre defalo usando essa função de voz real-time, porque eu acho que isso aumenta imensamente a interação entre mim, o humano e o modelo LLM.
Ideia de produto do material
O contexto importa porque a mesma ideia muda de preço conforme visto, renda, ferramenta ou fase do produto. Então, neste vídeo, eu vou mostrar exatamente como eu construí tudo isso. E você pode estar surpreso, porque é muito mais fácil do que você pensa.
Eu quero primeiro dar um pouco de contexto sobre o tool que eu estou construindo, para que você tenha uma melhor ideia de como exatamente essa funcionalidade de modo voz realista se integra na tool. Então, a tool que meu co-fundador e eu estamos construindo atualmente é chamada Yorbi AI e nós estamos essencialmente criando o Recruiter de AI. Nós estamos construindo um Recruiter de AI que entrevista e escreve seus aplicantes 24 horas por dia.
Arquitetura mínima
Em vez de colecionar slogans, trate o conteúdo como checklist operacional: o que fazer nesta semana, o que medir, o que descartar. Eu não vou fazer você me ouvir passar por uma entrevista inteira, mas você consegue entender o gênero. Eu não tenho que pressionar nenhum botão para começar a gravar, parar de gravar, ele simplesmente vai imediatamente assim. E é um fluxo natural de conversa e no final você pode ver que automaticamente registra a interação inteira entre mim e o modelo de A.I., tem um todo o transcrítico blá blá blá blá blá, então essa é uma pequena overview da ferramenta que estamos construindo, tanto a versão B2B como a versão B2C, estou apenas mostrando a versão B2C porque isso é algo que qualquer um pode testar agora a versão de software B2B ainda está muito em desenvolvimento, então essa é uma pequena demonstração de como exatamente essa função de voz do OpenAI é integrada para as ferramentas que estou construindo, então exatamente como eu construí isso, tudo feito através do LiveKit.
Agora, em termos de como exatamente eu construí esta ferramenta, a maior parte do livro técnico é feito através deste tool chamado LiveKit. E, na verdade, se você descrever, você pode ver que o LiveKit é, de fato, a mesma tecnologia que a OpenAI construiu seu modo de voz avançado. Então, usando o LiveKit e integrando-o na minha app, ou se você quiser usar e integrar na sua app, será a mesma tecnologia, a mesma infraestrutura.
Information gain
Ganho específico deste material (não genérico): Que a openai está usando em seu modo de voz avançado, então apenas uma breve overview de nível alto sobre o que exatamente é o live kit é apenas como esta plataforma de fim a fim que ajuda você a adicionar como humano a lm interações de voz humana para ai e é realmente muito simples de como é feito então há essencialmente duas formas de que você pode implementar o live kit para sua aplicação, a primeira vai ser com um Speech-to-Text LLM, Text-to-Speech Pipeline. Ou a outra maneira é usando um modelo real-time como um dos modelos real-time da OpenAI ou modelos real-time do Gemini que é uma aplicação multimodal real-time que pode responder a coisas na tela, visão, sons também.
Erros comuns e trade-offs
Os erros mais caros aparecem quando você copia a estética do caso e ignora as restrições que tornaram o caso possível. Você vai ter esse server de kids que vai ajudar... Host this live kit what they call a room this room is where the user is going to be having their speech inputted this room is also where you're going to have this live kit agent basically a separate server that you have to spin up that will host all the llm logic and the llm that agent is going to be living in this room as well and within this room is where the user and the agent is going to be living and interacting with one another so those are the three distinct portions you're você vai ter que construir.
O lado do cliente onde você gestiona a input do sotaque de um usuário, você vai ter que espalhar um servidor de kit livre separado para que ele possa hostar quartos de kit livre com usuários e agentes dentro dele e, finalmente, você vai ter que criar um servidor separado para hostar esse agente de ação real, esse trabalhador de ação Então para mim o cliente site vai ser implementado em react e next.js e afinal como ele tem documentação bem boa e muitos componentes pré-estabelecidos e paquagens de mpm que você pode instalar para adicionar o cliente site de implementação para sua aplicação novamente para o server de live kit e serviço de hostagem de tudo isso eu pessoalmente não tenho hostado isso sozinho eu apenas pago pelo hosting e é aqui que eu vou aqui e você apenas cria um pequeno projeto aqui você pode ver que eu tenho um perfeito interview production and this is where it just todos existem aqui é onde o meu server de kit de vida existe onde os usuários podem entrar em sala e meus agentes de ai também podem entrar em sala agora a parte 1 se você é um grande desenvolvedor de next.js como eu sou um grande desenvolvedor de lista de server, mas criando um agente de ai você não pode fazer essa lista de server você precisa criar seu próprio server espalhar seu próprio server para host esse agente de agent live kit agente trabalhador dentro disso e honestamente é bem simples de como tudo está instalado, é realmente apenas um para mim, eu apenas uso um server python apenas porque como no momento de gravar este vídeo, sua versão mais nova de sua sdk é versão 1.0 e só está disponível para python, não está disponível para TypeScript ainda, eu provavelmente teria escolhido a versão de TypeScript primeiro se eu pudesse, mas eu também quero usar a o mais recente sdk possível, por isso estou usando python, mas a forma como tudo foi criado é É bem simples, você basicamente cria essas assistências, esses agentes realmente, você cria vários tipos de agentes diferentes Neste caso, este é um assistente de entrevista, um assistente que faz a verdadeira entrevista com o usuário E você pode basicamente definir um monte de funções diferentes, como você sabe, para mim, eu fiz entrevista completa Save Transcript, coisas como Process Interview RPC, você pode fazer chamadas de RPC também Para que você possa executar funções do site client-side do seu server também, muito, muito conveniente E porque este é um ativo de AI, de forma geral, ele automaticamente tem suporte para chamadas de ferramentas também então, por exemplo, eu tenho este ferramenta chamada e entrevista, como quando o agente de a.i. Assistente de entrevista detecta que a entrevista está feita, ela pode automaticamente acabar com a entrevista e fazer algum de processamento no fundo e basicamente tudo que você tem que fazer é criar seu assistente de entrevista e então você tem uma função sua função de entrada, basicamente onde você declara todos os seus assistentes seus agentes que vão estar nesta sala e como vai interagir e sim, é bem honestamente bem simples, é apenas um no meu caso, um arquivo python de 500 linhas e você apenas cria este pequeno pequeno servidor python e então em qualquer sessão de agentes você também pode escolher quais modelos você quer usar, então você pode escolher vários textos de texto lm oferências de texto para a fala, no meu caso, estou apenas usando openai para todos eles, mas você pode escolher talvez você queira usar 11 labs ou cartesia ou você queira usar clod ou gemini em vez do lm a experiência do desenvolvedor é realmente suave realmente ótimo e você pode customizá-lo como quer que você queira e então, uma vez que eu criei este arquivo main.python que vai hostar meu agente de a.i.
Próximo passo acionável
Feche com uma ação única nas próximas 48 horas — pequena o bastante para executar, grande o bastante para gerar sinal. Isso fez o processo de comunicação muito mais realista. 365 e estamos fazendo isso para minimizar o tempo que você tem que gastar entrevistando candidatos que são extremamente desqualificados, então estamos usando a ai para não apenas fazer coisas como escrituras de telefone pedindo expectativas de emprego, rango de salário, mas também estamos fazendo com que nossos entrevistadores de ai possam realizar assuntos técnicos também, então este é um produto para o que meu cofundador e eu estamos trabalhando e se você está interessado em usar este produto e trabalhar conosco, então vá para o yourbi.ai e coloque seu e-mail aqui, então este é o software para o que estou construindo mas há também um tool B2C que é essencialmente algo que eu estou trabalhando nos últimos seis meses se você é um espectador comum neste canal você vai se familiarizar com isso e é chamado de interview.ai perfeito e isso é basicamente usando a mesma tecnologia que este produto B2B está usando, mas apenas aplicando-o no sentido B2C e a forma como isso funciona é que dentro do interview perfeito, os usuários podem entrar e adicionar qualquer descrição de trabalho que eles querem para qualquer trabalho que eles estão aplicando e, fazendo isso, nós automaticamente criamos um monte de perguntas de entrevista de interview questions for the users to practice against.
Uma entrevista de mock para essas perguntas também e nesta entrevista de mock é onde adicionamos suporte para esta função deste modo voz de openai, então deixe-me te mostrar o que exatamente isso vai parecer, eu tenho este engenheiro de clientes para infraestrutura de infraestrutura de ai, blá blá blá, então vamos passar por esta entrevista de mock para que você possa ver exatamente como a experiência parece , chat, pausa rápida, mas eu só quero dizer que estou tão cansado de todas essas ferramentas de código de ai que são basicamente apenas ferramentas de autocomplicação para aplicativos para construir apps e demos de aplicativos de calculador E você sabe do que estou falando veja eu construir um Twitter em 10 minutos de nonsense de código de vibe que não tem nada a ver com engenharia de software real, sim, é meio engraçado, mas é aí que uma solução como o sponsor de vídeo de hoje, o Código de Aumentação, finalmente entra e eles finalmente construíram um ferramenta de tecnologia de inteligência para engenheiros reais trabalhando em código de produção real, então aqui está a coisa, como uma vez que você passa por sua MVP e comece a escalar, você não está começando com filas novas mais, você está você está entrando em 100 mil bases de código com...
Perguntas frequentes
Em OpenAI Voice Mode avançado: build real de produto falado, o que «Ideia de produto do material» pede para fazer esta semana?
O artigo aponta: O contexto importa porque a mesma ideia muda de preço conforme visto, renda, ferramenta ou fase do produto. Então, neste vídeo, eu vou mostrar exatamente como eu construí tudo isso. E você pode estar surpreso, porque é muito mais fácil do que você pensa. Ajuste ao contexto de `openai-voice-mode-avancado` antes de escalar.
Como provar «Arquitetura mínima» com um experimento mínimo?
Resposta direta do corpo: Em vez de colecionar slogans, trate o conteúdo como checklist operacional: o que fazer nesta semana, o que medir, o que descartar. Eu não vou fazer você me ouvir passar por uma entrevista inteira, mas você consegue entender o gênero. Eu não tenho que.
Quando «Erros comuns e trade-offs» deve esperar atrás de oferta/canal — recorte `openai-voice-mode-avancado`?
Extraia só o mecanismo de «Erros comuns e trade-offs»: Os erros mais caros aparecem quando você copia a estética do caso e ignora as restrições que tornaram o caso possível. Você vai ter esse server de kids que vai ajudar... Host this live kit what they call a room this room is where the user is going to be having.
Qual sinal mostra que «Próximo passo acionável» saiu do papel — recorte `openai-voice-mode-avancado`?
Operação curta: Feche com uma ação única nas próximas 48 horas — pequena o bastante para executar, grande o bastante para gerar sinal. Isso fez o processo de comunicação muito mais realista. 365 e estamos fazendo isso para minimizar o tempo que você tem que gastar. Revise com evidência, não com feeling.