# Como sistemas multiagentes detectam vídeo não original?

> Published 2026-10-03T00:07:03.223Z on https://www.crazystack.com.br/pt/p/como-sistemas-multiagentes-detectam-video-nao-original/
> Source video: https://www.youtube.com/watch?v=jNE8No-wvok

Sistemas multiagentes detectam vídeo não original combinando três papéis: um agente revisor orquestrador, um perceptor com VLM especializado e um recuperador que compara o conteúdo com repositórios indexados. É a abordagem que a Meta usa para identificar desalinhamento de modalidade em vídeos curtos, na escala de centenas de milhões de peças. Em 2024, Aditya Gautam apresentou esse pipeline em uma palestra no AI Engineer, e em 2025 ele segue em produção. Este artigo reconstrói a arquitetura e as otimizações que a tornam viável nessa escala.

## Quais problemas os sistemas multiagentes resolvem em vídeo curto?

Sistemas multiagentes resolvem dois problemas que um modelo único não dá conta em plataformas de vídeo curto: o desalinhamento de modalidade e a detecção de conteúdo não original. Foi assim que Aditya Gautam, do Meta, estruturou a palestra no [AI Engineer](https://ai.engineer), descrevendo uma operação interna que processa mais de 100 milhões de vídeos com conteúdo viral, adversário e multilíngue.

O primeiro problema é intramodal em aparência, mas exige granularidade. Um vídeo pode começar com esportes e, entre 6 e 6,5 segundos, migrar para conteúdo político ou publicidade sem aviso. Detectar essa anomalia pede análise em nível de clipe e de quadro, não do vídeo inteiro.

O segundo problema é a economia da duplicação. Com ferramentas de IA generativa, copiar e transformar um vídeo ficou trivial. O resultado é um desequilíbrio de atribuição: o criador original perde crédito, o ecossistema se enche de repetição e o usuário consome o mesmo conteúdo várias vezes.

## Por que usar multiagente em vez de um único LLM?

O multiagente se justifica quando o problema exige especialização em cada etapa: percepção de vídeo, recuperação de candidatos e raciocínio final. Se um único LLM resolve o problema, Gautam foi direto: não há motivo para multiagente. A complexidade do domínio, com dados confusos gerados por usuários e sem ground truth claro, é o que obriga a decomposição.

O orquestrador é o agente revisor, que funciona como um gateway de API. Ele recebe o ID do vídeo, faz a decomposição de sinais e coordena os outros dois agentes. A escolha reflete uma lição prática: decompor o problema é essencial, mas só quando a complexidade real pedir.

## Como funciona o pipeline de três agentes?

O pipeline funciona em três papéis coordenados pelo agente revisor, cada um com ferramentas próprias. A tabela abaixo resume os papéis descritos na palestra.

| Agente | Papel | Ferramentas principais |
| --- | --- | --- |
| Revisor | Orquestra e decide a anomalia | Análise temporal de JSON, sinais em tempo real |
| Perceptor | Decompõe o vídeo e descreve clipes | VLM especializado, OCR, embeddings, cortes por mudança temporal |
| Recuperador | Busca clipes e autores semelhantes | Índice invertido de tópicos, banco vetorial, grafo de entidades |

### O que o agente perceptor entrega

O perceptor busca o vídeo no banco de dados e o decompõe em clipes. Em vez de amostrar em taxa de quadros fixa, ele detecta onde a mudança temporal acontece e comprime quadros semelhantes em um ou dois representantes. Para cada clipe, ele emite embeddings, tags, OCR, descrição em linguagem natural e carimbos de tempo.

### O papel do recuperador

No processamento offline, o recuperador indexa os metadados de forma adaptativa: tópicos em índice invertido, embeddings em bancos vetoriais e entidades em banco de grafo. Online, ele busca clipes semelhantes, reclassifica candidatos com um classificador de spam e devolve o conjunto final ao revisor.

### O fechamento do ciclo

O revisor combina os sinais temporais do clipe com os candidatos recuperados e com dados de interação em tempo real: relatórios, deslikes, comentários e o sentimento deles. Esses sinais capturam o que os modelos offline perdem e sustentam a decisão final de desalinhamento ou duplicação. O ambiente usa orquestração em larga escala do tipo [Ray](https://ray.io) e ferramentas no padrão do [Model Context Protocol](https://modelcontextprotocol.io).

## Como treinar VLMs especializados para cada agente?

Cada agente roda sobre um VLM de pequena escala, treinado sob medida. A justificativa é econômica e técnica: os modelos de fronteira aprendem com dados da web limpos, enquanto os dados internos são confusos e específicos do fluxo de trabalho. Servir um modelo de fronteira em bilhões de quadros não é viável.

O primeiro passo é o pré-treinamento, que ajusta os tokens de imagem e linguagem e o vision transformer do zero. É caro, mas, quando o delta de desempenho aparece, compensa. Depois vem o fine-tuning por instrução: um conjunto interno de alta qualidade ensina o modelo a emitir um esquema JSON com rótulos de modalidade, pontuações de duplicação e cadeia de raciocínio, passando por um projetor entre o codificador de visão e o modelo de linguagem.

A terceira fase usa DPO (Direct Preference Optimization), técnica de pós-treinamento publicada em 2023 por Rafailov e colegas no artigo [Direct Preference Optimization](https://arxiv.org/abs/2305.18290). Em produção, uma subamostra das inferências passa por um LLM juiz treinado com rótulos humanos; o que falha vai para uma fila de revisão humana, gera pares positivo e negativo e realimenta o treino. Esse humano no circuito roda diariamente para capturar desvio de dados.

Por fim, a destilação de conhecimento e a quantização reduzem o custo de servir. A equipe testa experimentalmente se quantização de 4 bits ou bfloat16 atende ao limiar de qualidade e monta uma tabela de trade-offs entre tamanho destilado, precisão e economia de inferência.

## Como avaliar o sistema além de precisão e recall?

A avaliação é holística, em 360 graus, e começa pelo sucesso da tarefa: precisão, recall e F1 em um rótulo binário de alinhamento ou desalinhamento. Mas a palestra insiste que o objetivo final não conta a história toda.

A avaliação olha cada nó do pipeline. Na recuperação, mede latência e qualidade dos candidatos. No raciocínio, examina a cadeia de pensamento do revisor e ajusta um orçamento de raciocínio adaptativo: reduzir quando o modelo pensa demais, aumentar quando o problema é complexo.

A robustez rastreia taxas de erro por nó e por gancho, separando falha de chamada de ferramenta, falha de recuperação e falha do modelo. A eficiência soma custo de token e latência por agente e do sistema inteiro. E o LLM juiz é monitorado contra a fila humana, porque o desvio de dados em conteúdo gerado por usuários exige retreino periódico.

## Quais otimizações tornam o sistema viável em escala?

Três otimizações reduzem o volume que entra no pipeline. A primeira é a compressão espaço-temporal: quadros semelhantes viram um ou dois representantes, o que corta boa parte do processamento total.

A segunda é o cache de conteúdo viral. Quando um novo vídeo tem alta similaridade com um conteúdo já processado, o sistema pula o pipeline multiagente inteiro e decide direto pela pontuação de similaridade.

A terceira é a poda de metadados. Criadores com histórico de autenticidade alta, boa qualidade de vídeo e bom engajamento entram em um conjunto pequeno de candidatos; o resto é filtrado antes de consumir inferência. A conclusão da palestra resume: decomposição é essencial, otimização adaptativa garante o ROI, e uma boa avaliação é a base de todo o sistema.

## Perguntas frequentes

- **O que é desalinhamento de modalidade em vídeo?** É quando um segmento do vídeo introduz conteúdo de outra natureza ou intenção, como um anúncio ou tema político inserido no meio de um clipe de esportes. A detecção exige análise em nível de quadro e clipe, com metadados temporais por segmento.

- **Por que não usar um único LLM de fronteira?** Porque o custo de servir bilhões de quadros inviabiliza a operação e o domínio é muito específico. VLMs pequenos, pré-treinados em dados internos, destilados e quantizados, entregam o desempenho necessário por uma fração do custo.

- **Como o sistema detecta conteúdo não original?** O recuperador indexa embeddings, tópicos e entidades em bancos adaptativos e busca clipes e autores semelhantes. O revisor combina esses candidatos com sinais em tempo real de interação para atribuir origem e pontuar duplicação.

- **Qual o papel do humano no circuito?** Uma amostra diária da produção passa por um LLM juiz e por revisores humanos. As amostras mal classificadas geram pares de preferência que realimentam o treino, controlando o desvio de dados ao longo do tempo.

## Transforme palestras como esta em artigo

A palestra de Aditya Gautam mostra que a chave de sistemas multiagentes bem-sucedidos é a decomposição certa do problema. Se você tem conhecimento valioso gravado em vídeos, entrevistas ou aulas no YouTube, essa mesma lógica se aplica ao seu conteúdo: ele já existe, só precisa de estrutura escrita para alcançar quem pesquisa.

Com o [Skala Blog](https://skalablog.com), você cola a URL de um vídeo, gera a transcrição e recebe um artigo estruturado pronto para revisar. O fluxo é simples: vídeo do YouTube, transcrição, artigo. Vale testar com uma palestra técnica que você já deu, como as trilhas de conteúdo do [Crazystack Typescript](https://crazystack.com.br) ou as aulas do Bootcamp do Dev Doido do Gustavo Dev Doido. O Skala Blog cuida da transformação; você cuida do julgamento editorial.

[Source video](https://www.youtube.com/watch?v=jNE8No-wvok)
