Pular para o conteúdo
← Voltar para o Skalablog

Artigo publicado

Agent Waves realmente reduz o custo de API de LLM?

Engenharia de SoftwareClaude

A diferença foi de US$ 0,42 em uma única tarefa simples: o agente único custou cerca de US$ 25 e a orquestração com Agent Waves, cerca de US$ 24,50. O ganho parece pequeno, mas a lógica é o que importa. Agent Waves corta custo de API de LLM quando o modelo caro só planeja e o barato executa.

Agent Waves: o que é essa orquestração multiagente

Agent Waves é uma técnica de orquestração multiagente em que um modelo forte planeja e modelos baratos executam as subtarefas em paralelo. O coordenador principal quebra a tarefa complexa em partes independentes, e cada parte vira um worker com contexto próprio. Essa divisão é o mecanismo central da economia.

O nome é novo, a prática não. A comunidade já orquestrava subtarefas em paralelo com múltiplos agentes antes de alguém batizar o padrão de Agent Waves. A parte inédita é a combinação com a divisão entre modelo forte e modelo barato para cortar custo.

Como a técnica economiza: o custo real de uma tarefa de LLM

O custo de uma tarefa de LLM é a soma do preço dos tokens de entrada com o preço dos tokens de saída. Não adianta olhar só o volume de tokens; o que importa é quanto cada token custou. Um modelo barato consumindo mais tokens pode sair mais em conta do que um modelo caro consumindo menos.

A conta detalhada é esta: tokens de entrada (incluindo todo o contexto reinjetado) × preço de entrada por milhão, mais tokens de saída × preço de saída por milhão. As políticas do projeto, como Claude.md, AGENTS.md e arquivos de regras, entram na conta como contexto extra que você paga sem ter digitado.

Em Agent Waves você paga mais tokens de entrada, não menos. Cada subagente recebe um contexto inicial e parte do contexto do projeto é reinjetado a cada chamada. O ganho aparece quando esse volume extra roda em um modelo cujo preço por token é uma fração do modelo que ficou no planejamento.

Modelo forte no plano, modelo barato na execução

No vídeo, o modelo forte escolhido para o planejamento foi o Kimi K3, da Moonshot AI. A implementação ficou com o Kimi K2.7 Code, versão voltada a código, bem mais barata que o K3.

O coordenador recebe o pedido completo e devolve subtarefas detalhadas o suficiente para que um worker não precise raciocinar sobre o problema inteiro. Quanto mais preciso o plano, menos o modelo barato precisa adivinhar. A qualidade do plano define o resultado final tanto quanto o preço dos tokens.

O seu papel nessa etapa não é pequeno. O modelo forte pesquisa o que precisa ser feito e ajuda na tomada de decisão, mas você entra com o olhar técnico e valida o plano antes de paralelizar a execução. Só depois que o plano está fechado as subtarefas vão para o modelo barato.

Os preços que sustentam a conta

Segundo a tabela de preços da Moonshot AI consultada em setembro de 2026, o Kimi K3 custa US$ 0,30 por milhão de tokens de entrada com acerto de cache, US$ 3 por milhão de entrada com erro de cache e US$ 15 por milhão de saída. O Kimi K2.7 Code custa US$ 0,19 por milhão de entrada com acerto, US$ 0,95 com erro e US$ 4 por milhão de saída.

A diferença entre os dois modelos fica perto de três vezes no preço de saída. Se você quer refazer a conta com seus próprios números, use a tabela de preços da Moonshot AI e a documentação do Kimi K2.7 Code.

A simulação: 6 subtarefas por mês em uma planilha

Na simulação, uma tarefa grande foi quebrada em seis subtarefas, executadas seis vezes por mês. O cenário envolvia cerca de 700 tokens de entrada e cerca de 2.500 tokens de contexto por subagente. São números de uma tarefa pequena, o que explica o custo mensal baixo.

O resultado em moeda foi influenciado por volatilidade cambial e spread, mas a proporção é o dado relevante. Um único agente com o modelo forte saiu por volta de R$ 110 de custo estimado. A orquestração com o modelo forte no plano e um modelo barato na execução caiu para perto de R$ 73.

O motivo é simples: você aumenta o volume total de tokens, mas troca a maior parte deles por tokens muito mais baratos. A economia não vem de gerar menos; vem de gerar no modelo mais barato.

Teste real: o mesmo prompt em um agente único e em Agent Waves

O teste rodou no OpenCode, um harness de código aberto executado no terminal. O prompt pedia um preview de e-mails antes do envio no painel de administração de uma newsletter. A mesma tarefa foi executada duas vezes, primeiro por um único agente com o modelo caro e depois por um coordenador que delegou a implementação.

A execução com o modelo único mexeu em seis arquivos, com 298 linhas adicionadas e 25 removidas. O agente criou testes unitários, alterou o template de e-mail, a action de preview, o formulário de edição e a documentação. Esse é o tipo de tarefa que preenche o contexto e faz o preço subir.

No painel da API, o saldo disponível caiu de US$ 26,95316 para US$ 25,4984 na primeira execução, cerca de US$ 1,45 de gasto. Na execução com Agent Waves, o saldo caiu de US$ 25,4984 para US$ 24,4893, uma diferença de aproximadamente US$ 1,01. A redução ficou em torno de US$ 0,42, ou 29% em relação ao custo da primeira execução.

A segunda execução também exigiu trocas extras de mensagem, porque o agente pediu uma worktree nova e teve que lidar com alterações existentes. Esse custo adicional não apareceu na execução única. Mesmo assim, o total ficou abaixo do modelo caro fazendo tudo.

Como pedir Agent Waves no OpenCode

O teste foi simplificado de propósito. Em vez de montar um pipeline automatizado de orquestração, a autora abriu um chat novo no OpenCode e pediu ao próprio agente que fizesse o trabalho de coordenação. O fluxo foi este:

  1. Abra um chat novo no OpenCode e mantenha o Kimi K3 selecionado como modelo do coordenador.
  2. Peça explicitamente que o agente planeje a tarefa e quebre o trabalho em subtarefas de implementação.
  3. Determine que a implementação de cada subtarefa seja delegada ao Kimi K2.7 Code, o modelo mais barato.
  4. Cole a descrição completa da tarefa que você quer executar.
  5. Peça uma worktree nova se não quiser que o agente reaproveite alterações de execuções anteriores.
  6. Acompanhe o painel da API antes e depois para medir o gasto real.

Esse formato é o mais simples possível e serve para comparar custo, não para servir de referência de qualidade. Um fluxo de orquestração de verdade chama os agentes de forma automática, encaixa o planejamento numa pipeline e trabalha as specs com mais cuidado.

Onde a economia aparece de verdade

A economia é proporcional ao volume de contexto e de código gerado. Nove arquivos com specs detalhadas, regras do projeto e histórico de decisões inflam o custo de entrada. Repetir isso em seis tarefas por mês, ou em um time inteiro usando a API, multiplica a diferença até ela deixar de ser decimal.

Quanto mais contexto-heavy for a tarefa, maior a fatia do custo que pode migrar para o modelo barato. O planejamento exige raciocínio sobre o problema inteiro e justifica o modelo caro. A implementação segue instruções já decididas e não precisa do mesmo nível de raciocínio.

Uma única tarefa de editar preview de e-mail, gerar testes e ajustar documentação rendeu menos de um dólar de diferença. Uma reestruturação grande, ou um produto inteiro com API em uso, muda a ordem de grandeza. É por isso que a comparação precisa ser lida como proporção, não como valor absoluto.

Quanto custa cada modelo por milhão de tokens

Os preços abaixo vêm da tabela de preços da Moonshot AI consultada em setembro de 2026.

ModeloEntrada com acerto de cacheEntrada com erro de cacheSaída
Kimi K3US$ 0,30US$ 3US$ 15
Kimi K2.7 CodeUS$ 0,19US$ 0,95US$ 4

Os números são por milhão de tokens. O modelo barato é o que roda a maior parte da execução; o modelo caro fica restrito ao planejamento.

Quando Agent Waves aumenta seu custo

Se o modelo caro for usado em todos os subagentes, a orquestração vai apenas adicionar tokens. Cada worker recebe um contexto inicial que o agente único não precisaria duplicar. Sem delegar a execução para um modelo mais barato, não existe economia para compensar o volume extra.

Orquestrar tarefas pequenas também não compensa. Em uma tarefa que um agente único resolve com pouco contexto, o ganho fica abaixo de um dólar e não paga a complexidade operacional. A técnica faz sentido quando o contexto é grande e repetido.

Perguntas frequentes sobre Agent Waves

Agent Waves é uma tecnologia nova ou só um nome para multiagentes?

É um nome recente para uma prática que a comunidade já usava: orquestrar subtarefas em paralelo com múltiplos agentes. A novidade está na combinação com a divisão entre modelo forte e barato para cortar custo.

Agent Waves sempre reduz o custo de uma API de LLM?

Não. Se você usar o mesmo modelo caro em todos os subagentes, o custo sobe, porque cada worker reinjeta contexto. A redução depende de delegar a execução a um modelo significativamente mais barato.

Preciso de um framework de orquestração para começar?

Você pode testar apenas pedindo ao agente coordenador que quebre a tarefa e delegue a implementação a um modelo mais barato. Um fluxo automatizado com pipeline é mais robusto e reduz intervenção manual.

Por que o consumo de tokens de entrada aumenta com Agent Waves?

Cada subagente recebe um contexto inicial mais parte do contexto do projeto. Um agente único lê esse contexto uma vez e segue trabalhando. Em Agent Waves, cada worker paga essa leitura de novo.

Qual a economia esperada em uma tarefa pequena?

Em uma tarefa de baixo contexto, a diferença ficou em torno de US$ 0,42, perto de 29%. O ganho cresce com o volume de contexto e com a repetição mensal.

O que mais pesa no custo além do preço por token?

Trocas extras de mensagem pesam. No teste, o agente de Agent Waves precisou negociar uma worktree nova e lidar com alterações já existentes, o que gerou duas ou três interações adicionais que o agente único não teve. O valor foi pequeno, mas entra na conta.

Dá para usar essa estratégia fora de agentes de código?

Sim, desde que a tarefa separe planejamento de execução em volume. Se o seu time usa a API para atender clientes ou rodar rotinas internas, o mesmo raciocínio se aplica: o modelo forte decide o caminho, o barato executa em escala.

Quanto de contexto o plano precisa carregar?

O suficiente para que o worker não tenha que raciocinar sobre o problema inteiro. Specs, regras do projeto e histórico de decisões entram como contexto de entrada e são cobrados a cada chamada. Contexto detalhado encarece a entrada, mas reduz retrabalho na execução.

Vale a pena medir antes de adotar?

Sim. O painel da API mostra o gasto por execução e permite comparar o mesmo prompt nas duas abordagens. No teste, o saldo saiu de US$ 26,95316 para US$ 25,4984 no agente único e de US$ 25,4984 para US$ 24,4893 com Agent Waves, deixando a diferença de US$ 0,42 visível.

Como transformar seus vídeos técnicos em artigo

A ideia central deste artigo é dividir o trabalho: deixar o planejamento com quem pensa melhor e a execução com quem custa menos. Você pode aplicar o mesmo princípio ao conteúdo que já gravou. Se existe um vídeo no seu canal com uma explicação técnica, uma entrevista ou uma decisão de arquitetura, esse material já está pronto para virar texto.

No Skala Blog, você cola a URL do vídeo, o sistema transcreve e gera um artigo estruturado. É uma forma de reaproveitar o que você já produziu em vídeo sem começar a escrever do zero. Quem acompanha o Dev Doido do canal do youtube reconhece bem esse problema: horas de conteúdo técnico gravado que nunca viram texto pesquisável.

Se você também grava conteúdo técnico e quer ver esse material em outro formato, confira outros projetos em crazystack.com.br.

Source video

Skala Blog