# Como usar modelos chineses de IA na sua stack

> Published 2026-09-14T19:42:33.180Z on https://www.crazystack.com.br/pt/p/como-usar-modelos-chineses-de-ia-na-sua-stack/
> Source video: https://www.youtube.com/watch?v=Qd8nnzAv8gQ

Modelos chineses de IA não venceram por serem melhores em tudo. Eles venceram porque ficaram baratos o suficiente para virar padrão de consumo em poucos meses, com 61% dos tokens do OpenRouter em fevereiro de 2026. A parte incômoda é o que vem depois dessa conquista de terreno.

## O que os modelos chineses de IA mudaram no OpenRouter

Os modelos chineses de IA saltaram de 1,2% dos tokens consumidos no [OpenRouter](https://openrouter.ai/) em dezembro de 2024 para 61% em fevereiro de 2026, segundo os números apresentados no vídeo do canal mano deyvin. O OpenRouter é um roteador que dá acesso a centenas de modelos por token, sem contrato com cada fornecedor.

A trajetória descrita tem três marcos: 1,2% em dezembro de 2024, cerca de 30% um ano depois e 61% em fevereiro de 2026. São 18 meses entre o primeiro e o último número. Trate-os como dados de uma plataforma específica de roteamento, não como participação de mercado global de IA.

Essa distinção importa porque o OpenRouter concentra um perfil de usuário: desenvolvedores que comparam preço por token com frequência e trocam de modelo sem cerimônia contratual. O crescimento nessa base mede sensibilidade a preço, não adoção corporativa consolidada.

O vídeo não apresenta a metodologia por trás dos 61%. Sem o relatório original, o número serve como sinal direcional forte e nada além disso. 2026 ainda é o ano em que essa curva precisa ser confirmada por fonte independente.

## DeepSeek, Qwen e outros modelos abertos citados

Os modelos citados no vídeo incluem o [DeepSeek](https://www.deepseek.com/), o Qwen da Alibaba, o MiniMax e o Kimi, todos com variantes de pesos abertos que podem ser baixadas e executadas localmente. Pesos abertos significam que você baixa o arquivo do modelo e roda na sua própria máquina ou servidor.

Esse é o ponto que separa essa onda da anterior. Um modelo fechado só é acessível por API, com preço definido pelo fornecedor. Um modelo de pesos abertos pode ser servido por qualquer provedor, inclusive por você mesmo, o que pressiona o preço para baixo de forma estrutural.

O detalhe que o vídeo trata como economia de 70% no custo de inferência merece cautela antes de virar número de apresentação. O vídeo não informa qual modelo, qual hardware, qual tamanho de contexto ou qual baseline foi usado nessa medição. Custo de inferência depende de todos esses fatores ao mesmo tempo.

Empresas como Baidu, ByteDance, Alibaba e Tencent aparecem no relato cortando preços de API na casa de 80% a 90%, com alguns casos chegando a zero. Repetições desse tipo são movimentos comerciais observáveis, não prova de que o custo real de servir o modelo seja zero.

## Por que a estratégia chinesa lembra o carro elétrico no Brasil

A analogia central do vídeo compara IA a carros elétricos chineses, que ganharam participação no Brasil em poucos anos com preço agressivo e financiamento estatal, e a placas solares, setor em que a China domina a produção global. A lógica é a mesma: subsidiar a entrada, conquistar volume e só então discutir margem.

No caso dos carros, o argumento é que ninguém vende abaixo do custo por bondade. Se o preço é baixo demais, alguém está pagando a diferença. O vídeo aponta injeção de capital estatal nas montadoras como a explicação, e o mesmo raciocínio é aplicado a data centers e energia na China.

O vídeo menciona um fundo estatal com meta anual próxima de 2 trilhões de dólares, com cerca de um quarto destinado à IA. Esse número aparece sem fonte citada no vídeo e sem data de referência clara. Use-o como ordem de grandeza, não como dado auditado.

A parte relevante para quem programa não é a geopolítica em si, é o efeito de preço. Enquanto o subsídio durar, o custo de rodar inferência cai. Quando ele parar, quem construiu produto em cima do preço mais baixo sente a diferença primeiro.

## O que é mérito técnico e o que é subsídio

O vídeo faz uma concessão importante: o avanço chinês não é só preço. O DeepSeek treinou um modelo por cerca de 5,5 milhões de dólares, segundo o relato, contra algo próximo de 100 milhões de dólares atribuído ao treinamento de modelos do topo do Vale do Silício.

Essa comparação de custo de treinamento circulou amplamente em 2025 e virou uma das discussões técnicas mais citadas do período. O ponto que costuma ser omitido em resumos é que custo de treinamento não é custo total de operação. Servir o modelo para milhões de usuários é uma conta separada.

Ainda assim, a diferença de ordem de grandeza sugere ganhos reais de arquitetura e engenharia, não apenas desconto. O vídeo cita redução de custo de inferência por decisões de arquitetura, sem especificar o método. Sem o detalhamento, o número fica no campo da afirmação.

Para quem decide stack, a conclusão prática é simples: parte da vantagem é engenharia replicável, parte é subsídio não replicável. Você não consegue copiar a segunda, mas pode aprender com a primeira.

## As três fases da estratégia descritas no vídeo

O vídeo propõe uma leitura em três fases: primeiro baratear a IA para capturar o ecossistema de desenvolvedores, depois deixar que produtos sejam construídos em cima desses modelos, e por fim monetizar ou usar essa dependência como alavanca. É uma tese do autor, apresentada como teoria, não como documento oficial.

A fase um estaria quase concluída, na avaliação do vídeo, com 61% dos tokens no OpenRouter e a alegação de que grande parte das stacks de código aberto já roda modelo chinês. Esse segundo número não vem com fonte e deve ser tratado como estimativa do autor.

A fase dois descreve o efeito de lock-in. O argumento é que trocar a base de um produto depois que ele cresceu dói: o vídeo compara com empresas presas à infraestrutura do GitHub ou da Amazon. Migrar de provedor de modelo é mais fácil que migrar de nuvem, mas não é gratuito.

Em 14 de setembro de 2026, a fase três continua sendo projeção. Nenhuma das empresas citadas anunciou aumento generalizado de preço como parte de um plano declarado. Tratar a fase três como fato seria confundir hipótese com evidência.

## Privacidade, dados e a acusação da Anthropic

A [Anthropic](https://www.anthropic.com/), empresa por trás do Claude, acusou DeepSeek, MiniMax e Moonshot de usar contas falsas para extrair capacidade do seu modelo em escala industrial, segundo o relato do vídeo. A Anthropic uma empresa de pesquisa em IA com sede nos Estados Unidos.

O vídeo cita a alegação de que houve cerca de 16 milhões de interações vindas de contas falsas, com 13 milhões atribuídas só ao MiniMax, e liga essas extrações às restrições de uso que usuários pagantes enfrentam. São alegações de uma parte contra outra, não um fato estabelecido por decisão judicial.

Há também a menção a um achado de código atribuído à ABC News, segundo o qual haveria envio de dados para uma operadora estatal de telecomunicações chinesa. O vídeo cita a existência de uma lei chinesa que obriga empresas a cooperar com serviços de inteligência do estado.

Para quem programa, a conclusão não depende de resolver quem está certo. Rodar o modelo localmente com pesos abertos mantém os dados na sua máquina; usar API hospedada na China significa que o tráfego passa por lá. São arquiteturas diferentes com implicações diferentes, e só uma delas é local.

## Como decidir entre modelo local, API na China e API americana

A escolha prática tem três caminhos: executar pesos abertos na sua própria infraestrutura, consumir API de provedor chinês, ou continuar com provedores americanos. Cada um troca custo, privacidade e trabalho de manutenção de forma diferente, e nenhum é gratuito em todas as dimensões.

Rodar local exige hardware. O vídeo comenta que montar uma máquina capaz de servir modelos maiores é caro, e isso é verdadeiro: memória de GPU é o gargalo, não a capacidade de processamento bruta. Modelos menores e quantizados cabem em hardware modesto, com perda de qualidade que varia por tarefa.

Consumir API chinesa é o caminho mais barato e o mais rápido de implementar. O preço é o que o provedor definir, e ele pode mudar sem aviso. O tráfego e o conteúdo enviado passam pela infraestrutura do fornecedor, o que é uma decisão de arquitetura antes de ser uma decisão de preço.

Manter provedor americano reduz a exposição a mudanças regulatórias chinesas, mas mantém o custo mais alto e a dependência de um fornecedor único. A escolha defensável é por carga de trabalho: código proprietário sensível de um lado, tarefas de baixo risco do outro.

## O que fazer na prática com a sua stack

Se o objetivo é reduzir custo sem reescrever o produto, a abordagem mais segura é tornar o provedor de modelo substituível antes de trocar de fornecedor. Isso significa isolar a chamada de inferência atrás de uma camada própria, sem espalhar SDK de fornecedor pelo código.

O roteador de modelos cumpre parte desse papel, mas cria sua própria dependência. A camada de abstração que você controla é a única que sobrevive a uma mudança de preço, de política ou de disponibilidade. Vale o esforço mesmo que você não pretenda trocar agora.

Meça o custo por tarefa concluída, não o preço por milhão de tokens. Um modelo três vezes mais barato que erra com mais frequência pode sair mais caro no fim do mês. Preço por token é a métrica mais fácil de comparar e a menos informativa sobre custo real.

Ferramentas como o [Crazystack Typescript](https://crazystack.com.br) existem justamente para padronizar essa camada de integração em projetos TypeScript. Cursos como o Bootcamp do Dev Doido e conteúdos de nomes como Gustavo Dev Doido cobrem esse tipo de decisão de arquitetura com exemplos concretos.

## Perguntas frequentes sobre modelos chineses de IA

- **Os modelos chineses de IA são realmente mais baratos que os americanos?**

Sim, o preço por token de APIs chinesas costuma ser menor, e parte dessa diferença vem de subsídio estatal segundo o relato do vídeo. O OpenRouter registrou 61% dos tokens vindos da China em fevereiro de 2026. Preço mais baixo não garante custo menor por tarefa concluída.

- **O que significa 61% dos tokens no OpenRouter?**

Significa que, entre os tokens processados por essa plataforma de roteamento específica, 61% foram servidos por modelos chineses em fevereiro de 2026. Não é participação de mercado global de IA nem medição de qualidade. É um recorte de uma base de usuários sensível a preço.

- **Rodar um modelo aberto localmente protege meus dados?**

Rodar localmente mantém o conteúdo na sua máquina, o que é uma diferença real em relação a enviar o texto para uma API hospedada fora do país. Isso não equivale a conformidade regulatória automática. Controles de acesso, criptografia e governança continuam sendo responsabilidade sua.

- **O treinamento do DeepSeek custou mesmo 5,5 milhões de dólares?**

Esse valor foi amplamente citado no início de 2025 e se refere ao custo de treinamento do modelo, não ao custo total de operação. Servir o modelo para muitos usuários tem uma conta separada, que depende de hardware, contexto e volume.

- **A China vai aumentar os preços depois de dominar o mercado?**

Essa é a terceira fase da tese apresentada no vídeo, não um fato confirmado em setembro de 2026. Nenhuma das empresas citadas anunciou esse movimento. A lógica do argumento é o lock-in, não um anúncio de reajuste.

- **Um modelo aberto pode substituir uma API fechada sem mudanças no código?**

Não como substituto direto. As APIs diferem em formato de requisição, parâmetros, tokenização e comportamento. A migração é viável com uma camada de abstração própria, mas exige testes de qualidade e de custo antes de ir para produção.

- **O que é a lei chinesa de cooperação com inteligência estatal citada no vídeo?**

O vídeo menciona a existência de uma lei que obriga empresas chinesas a cooperar com serviços de inteligência do estado, tratando isso como explicação para envio de dados. A reportagem é citada de forma indireta, sem link ou número de lei. Verifique o texto legal antes de repetir a afirmação.

- **Vale a pena trocar de provedor só por causa do preço?**

Só depois de medir custo por tarefa concluída e de isolar a chamada de inferência atrás de uma camada própria. Trocar de fornecedor com SDK espalhado pelo código é caro, independentemente do desconto. Preço baixo não compensa uma migração traumática.

- **Como acompanhar se esse cenário ainda vale em 2026?**

Acompanhe os números divulgados pela própria plataforma de roteamento e os preços praticados nas páginas oficiais dos provedores. Os dados de fevereiro de 2026 são um retrato de um momento. A curva pode mudar quando o subsídio mudar.

- **Isso afeta quem trabalha com TypeScript e desenvolvimento web?**

Afeta o custo de qualquer produto que chame inferência, o que inclui a maior parte das aplicações web modernas. A decisão técnica relevante é onde colocar a camada de abstração do provedor. Frameworks como o [Crazystack Typescript](https://crazystack.com.br) tratam esse ponto na estrutura do projeto.

## Do vídeo ao artigo: transforme conteúdo em texto com o Skala Blog

A tese central deste texto é simples: quando um insumo fica barato demais, alguém está pagando a diferença, e a conta chega depois. Se você já explicou esse tipo de raciocínio em um vídeo, esse conhecimento fica preso no formato de vídeo, difícil de citar, indexar e revisar.

O [Skala Blog](https://skalablog.com) resolve exatamente essa etapa: você cola a URL do vídeo do YouTube, o sistema transcreve o conteúdo e gera um artigo estruturado pronto para revisão. O resultado mantém o argumento original e ganha a forma que buscadores e assistentes conseguem ler.

Se você tem análises, aulas ou opiniões gravadas que merecem circular além do YouTube, o caminho é esse: vídeo, transcrição, artigo. Vale testar com um episódio que você já publicou e comparar com o que você escreveria à mão.

[Source video](https://www.youtube.com/watch?v=Qd8nnzAv8gQ)
