n8n: transcrever áudio e imagem do WhatsApp
Automatize a transcrição de áudios e análise de imagens do WhatsApp integrando Evolution, N8n e OpenAI – descubra na prática como transformar mídias em texto e informação pronta
Por que isso é importante
Para transcrever áudio e analisar imagem do WhatsApp com n8n e OpenAI: receba a mídia no webhook (Evolution ou Cloud API), converta base64 → arquivo (Convert to File), envie áudio ao Whisper/transcribe e imagem ao GPT-4o vision, e unifique a saída em uma propriedade content. Separe ramos com Switch; sem binário válido a transcrição falha. Custo escala por minuto de áudio — revalide a tabela OpenAI no dia.
Por que isso é importante
Para transcrever áudio e analisar imagem do WhatsApp com n8n e OpenAI: receba a mídia no webhook (Evolution ou Cloud API), converta base64 → arquivo (Convert to File), envie áudio ao Whisper/transcribe e imagem ao GPT-4o vision, e unifique a saída em uma propriedade content. Separe ramos com Switch; sem binário válido a transcrição falha. Custo escala por minuto de áudio — revalide a tabela OpenAI no dia.
Webhook Evolution: áudio chega no n8n sem copiar link
Kilobytes falam mais alto que palavras. A integração começa quando o Evolution armazena e disponibiliza o áudio recebido pelo WhatsApp. Para n8n transcrever áudio WhatsApp, você captura esse áudio já em base64 – um formato ideal para transportar o áudio sem perder nenhuma informação de mídia no caminho.
Base64 e binary: linha de montagem da mídia
Toda a manipulação do áudio e da imagem dentro do workflow gira em torno do base64. Em vez de trabalhar apenas com links, transportar a mídia convertida em base64 evita erros de permissionamento, problemas de acesso externo e garante integridade do dado. O Evolution pode até fornecer já em base64, mas manualmente trazer esse dado te dá total controle do fluxo – e menos dor de cabeça quando surge bug de fluxo.
JSON do WhatsApp: payload, identifiers e mídia
Toda mensagem do WhatsApp chega ao workflow do N8n como um JSON estruturado: ele carrega identifiers, payload com a mídia em base64, url original, instance do servidor e a vitrine de metadados. É essencial saber editar e manipular JSON no N8n, adaptando o template para que o caminho dos dados nunca quebre – principalmente IDs de mensagem, chaves da API e endpoints dinâmicos.
Atenção
Cuidado: se o workflow do N8n tentar processar uma mídia inexistente ou mal referenciada, o processo falha silenciosamente. Sempre garanta o envio concreto do áudio/imagem no teste e não confie só no payload de testes automáticos.
Convert to File: do base64 ao Whisper
Após capturar o áudio em base64, converta o dado para um arquivo real (.ogg para áudio e .jpg para imagem). A OpenAI só processa arquivos – nunca base64 puro! O N8n permite a conversão com nó de manipulação de arquivo, basta apontar para o payload base64 e o destino final do arquivo, já definindo nome (audio.ogg, image.jpg) e o tipo correto (mimetype) da mídia.
Atenção
Erros de nome e mimetype são comuns e, quando acontecem, travam tudo sem máximo feedback: sempre valide o nome final do arquivo no output do node, principalmente porque a OpenAI só aceita padrões rígidos.
Views e execuções: debug do fluxo de mídia
Pinar execuções, copiar para editor e atualizar manualmente o fluxo são práticas obrigatórias para evitar retrabalho e testar todas as ramificações do seu automation. O N8n mostra na hora a conversão base64, o arquivo criado e permite visualizar o resultado dos dados enviados à OpenAI antes da próxima etapa.
Transcrição com Whisper: áudio vira texto
Basta passar o arquivo .ogg para o nó de Transcription da OpenAI no N8n: a IA automaticamente traduz áudio em texto, mantendo contexto e sem comandos extras. O segredo é ter o nó já preparado pra receber sempre o content na saída, padronizando o output até para diferentes caminhos do workflow.
Atenção
Ao automatizar o recebimento e transcrição, toda mensagem de áudio do WhatsApp será convertida em texto sem perda de contexto. Otimize para nunca depender de ouvinte humano.
Visão com GPT-4o: imagem vira insight
Da mesma forma que o áudio, envie a imagem em formato de arquivo do N8n direto para o endpoint de análise de imagens da OpenAI. Usando o modelo GPT-4o, extraia descrições detalhadas da foto, pronto para alimentar assistentes, triagens ou scripts de automação. A saída chega formatada como texto descritivo, também dentro da struct "content" – pronta para uso em integração e resposta automática.
Atenção
Erros de conversão imagem-base64 para arquivo são frequentes se a extensão ou mimetype estiverem incorretos; revise antes de enviar (image.jpg ou image/jpeg).
Um pipeline para áudio e imagem (mesmo Switch)
Concentre todo o output do processo em uma única propriedade: "content". Assim, qualquer mídia recebida – áudio, imagem ou texto puro – terminará o fluxo pronta para utilização, sem precisar reescrever lógica para cada tipo de input.
Custo em R$: ordem de grandeza por 100 áudios
Use a tabela oficial da OpenAI (Transcription) e multiplique pela duração média do seu nicho. Em ago/2026, a faixa pública para transcrição em arquivo fica perto de US$0,003–0,006 por minuto (ex.: gpt-4o-mini-transcribe ~US$0,003/min; whisper-1 / gpt-4o-transcribe ~US$0,006/min). Confirme sempre em openai.com/api/pricing — o preço muda.
Exemplo didático (não cotação de contrato): 100 áudios × 1 minuto médio × US$0,006 = US$0,60. Com câmbio ilustrativo ~R$5,50/USD, isso é ~R$3,30 só de STT. Se a média for 2 minutos, dobre. Some GPT-4o (visão ou resumo) só nos casos com imagem/texto longo — é outra linha da fatura.
Hospedagem: n8n self-host/VPS + Evolution amortizados no mês (ex.: R$40–120/mês de VPS, conforme provedor) divididos pelo volume. Em lote baixo, o fixo domina; em lote alto, a API domina. Não invente free-tier Groq eterno — só compare se você já tiver conta e cotas reais.
API oficial Meta vs Evolution: risco e quando usar
Cloud API (oficial Meta) e Evolution (não-oficial / WhatsApp Web-style) não são intercambiáveis em compliance. Para receita e conta que não pode cair, prefira a API oficial com Business Manager, templates e janela de 24h. Evolution acelera protótipo e laboratório — com risco maior de ban e mudança de protocolo.
No n8n, o payload muda: oficial traz wamid e estrutura Cloud; Evolution costuma entregar base64/URL de mídia via webhook próprio. Documente no README do workflow qual caminho está ativo e o que falta para migrar.
Cloud API (oficial Meta)
Caminho de compliance para receita e conta que não pode cair.
Prós
- Templates aprovados, BM e opt-in
- Janela 24h e políticas claras
- Melhor para cliente pagante sério
Contras
- Setup mais lento (BM + templates)
- Payload Cloud (wamid) diferente do Evolution
Evolution (não-oficial)
QR/setup rápido para MVP e laboratório — com risco maior de ban.
Prós
- Protótipo rápido via QR/webhook
- Ótimo para validar fluxo de mídia
Contras
- ToS e estabilidade piores
- Planeje migração para Cloud API se houver receita
Regra prática: protótipo ok em Evolution; cliente pagante sério → planeje Cloud API.
Fallback: mensagem sem mídia ou tipo inesperado
Implemente ramificações para lidar com mensagens que não sejam áudio, imagem ou texto, prevendo o fallback para tratar erros e caminhos vazios. Ter um padrão de fallback evita que a automação pare silenciosamente ou perca informações críticas.
Testar com áudio e imagem reais (Evolution)
Copiar, adaptar e clonar etapas do workflow (CTRL+C, CTRL+V com pequenas modificações de tipo ou nome) é a estratégia mais eficiente para acelerar a prototipagem e criar novas rotas de automação. Melhore continuamente cada nó, e mantenha o controle do output para garantir que nenhuma informação saia do padrão.
Atenção
Faça simulações reais enviando áudios e imagens novas do WhatsApp no Evolution; só assim você detecta gargalos, conflitos e bugs antes de ir para produção automatizada.
Próximos passos: do workflow ao atendimento
Automatizar a transcrição e análise de mídia no WhatsApp não é dom de programador sênior: é método, repetição e paciência. Implemente seu fluxo, ajuste nos detalhes, repita testes reais. Cada erro poupa horas de debug no futuro.
Atenção
Assista o passo a passo prático e todos os segredos em vídeo no canal Dev Doido – se inscreva para não cometer os mesmos erros e subir seu workflow para outro nível: youtube.com/@DevDoido
Fontes
Revisão em agosto de 2026. Nomes de modelo (ex.: GPT-4o) e preços de áudio/visão mudam — confira a documentação oficial antes de orçar produção. Tutorial de integração, não garantia de custo por minuto.
<a href="https://docs.n8n.io/">Documentação n8n</a>. <a href="https://platform.openai.com/docs/guides/speech-to-text">OpenAI Speech to text</a>. <a href="https://platform.openai.com/docs/guides/images-vision">OpenAI Vision</a>.
Perguntas frequentes
Como transcrever áudio do WhatsApp com n8n e OpenAI?
Receba o áudio via webhook (Evolution ou Cloud API), converta para binário e envie ao speech-to-text (Whisper/OpenAI). Depois devolva o texto na conversa ou grave no CRM.
Dá para analisar imagem no mesmo fluxo n8n?
Sim: separe o ramo de imagem (MIME/tamanho) e use um modelo vision como GPT-4o. Não misture áudio e imagem no mesmo nó sem Switch.
Preciso da Evolution API ou da API oficial do WhatsApp?
Os dois funcionam no padrão webhook → n8n. Para produção e compliance, prefira a Cloud API oficial; Evolution é comum em labs e self-host.
O áudio precisa vir em base64 no n8n?
Em vários setups Evolution o payload vem em base64: use Convert to File antes do Whisper. Sem binário válido, a transcrição falha.