Pular para o conteúdo
← Voltar para o Skalablog

Artigo publicado

Como rodar IA local mac mini 16 gb com LM Studio

Engenharia de SoftwareOpenAI

Você compra um Mac mini de 16 GB esperando rodar IA local sem depender da nuvem. O teste do canal de Bart Slodyczka, em 2026, mostra que a maioria das tarefas simples funciona; o gargalo aparece quando resultados de busca enchem a janela de contexto.

## A configuração: LM Studio, Gemma 4 12B e o chip M6

O teste completo usou LM Studio, aplicativo gratuito para baixar e executar modelos de IA local, com o modelo Gemma 4 12B do Google na versão MLX quantizada a 4 bits. Segundo o vídeo, publicado em 30 de setembro de 2026, os pesos ocupam 6,77 GB de memória, sobrando pouco espaço para a janela de conversa de 19,5 mil tokens. O Gemma é a família de modelos abertos do Google, documentada em ai.google.dev.

Comparando com o Mac mini M4 de 16 GB que ele usou por seis meses, o autor relata que o M6 fez o pré-preenchimento cerca de 4,5 vezes mais rápido e a decodificação 30% a 40% mais veloz. São números medidos por ele, não um benchmark independente, então trate como experiência própria do criador. A conversa também ativou ferramentas via MCP: acesso ao sistema de arquivos e à Busca Brave, com o modelo com visão para ler imagens.

## Extração de faturas em imagens passou com uma ressalva

A extração de faturas em PNG foi a tarefa mais sólida. O modelo leu três faturas com 2, 5 e 10 itens de linha e acertou emitente, datas, itens, totais e imposto GST em todas, como nos valores 147,95 e 696,30 verificados contra as imagens originais.

Fora da câmera, porém, a primeira tentativa devolveu o número NL2605 no lugar de NL2609, o mesmo erro que reapareceu depois no aplicativo. A conclusão do vídeo é honesta: a precisão é alta, mas não é 100% do tempo, e vale conferir os campos críticos antes de confiar.

## Criar um miniaplicativo levou 5 minutos e quase funcionou

No segundo teste, o modelo criou uma página HTML única com back-end que envia a imagem da fatura ao endpoint local do LM Studio e devolve os dados no front-end. Tudo levou cerca de 5 minutos, incluindo a gravação do arquivo na pasta correta via MCP, e o app ainda gerou prévia da imagem sem ter sido pedido.

O resultado repetiu o padrão: funcionalidade completa, com um erro no número da fatura de 10 itens. Para quem quer um processador de recibos caseiro, o fluxo demonstrado funciona; só não dispensa revisão humana nos campos-chave.

## Conversar com um PDF funcionou em menos de 40 segundos

Com um PDF de quatro páginas gerado por um chatbot, o modelo resumiu o documento em cinco tópicos em menos de 40 segundos e respondeu perguntas de acompanhamento: orçamento total de US$ 12.000, equipe de 12 pessoas com apenas 4 citadas nominalmente. O recurso de chat com arquivos é integrado ao LM Studio e dispensa ferramentas externas.

Esse foi o teste mais equilibrado entre velocidade e qualidade dentro do vídeo, e o autor diz ter ficado satisfeito com o raciocínio contra o documento.

## Busca na web revelou o limite real de 19,5 mil tokens

Aqui a IA local no Mac mini de 16 GB encontrou seu teto. A busca pelas notícias da semana, via API gratuita da Busca Brave, até encontrou o lançamento do DevDay da OpenAI, mas os resultados em JSON lotaram a janela de contexto. O contador saltou para 73.000 tokens em uma janela de 19.500, ou 375% do limite, e o modelo entrou em chamadas de ferramenta repetidas.

Ao reabrir a conversa, duas de quatro buscas falharam com erro de muitas requisições, limitação do nível gratuito da API. A lição do vídeo: tarefas com respostas volumosas de ferramentas não cabem bem em uma janela pequena, independentemente da velocidade do chip.

## Organizar uma pasta de PDFs foi o único fracasso

O teste final pedia separar seis PDFs entre pagos e não pagos. Usando apenas o MCP de arquivos, o modelo listou os arquivos, mas não conseguiu decodificar o conteúdo binário dos PDFs e ficou presa pedindo critérios.

O autor então abriu o VS Code e iniciou uma sessão no agente Pi, ferramenta leve para modelos locais que oferece ferramentas extras a partir de pi.dev. Mesmo com o segundo ambiente, o modelo entrou no loop clássico de modelos pequenos quantizados a 4 bits: repetir a mesma chamada de ferramenta ou raciocinar infinitamente. O veredito dele foi direto: o teste falhou.

## FAQ

  • Um Mac mini de 16 GB roda IA local no dia a dia? Sim, para tarefas curtas e bem definidas. No vídeo de 2026, extração de faturas, geração de um app simples e resumo de PDF funcionaram; buscas web longas e automação de arquivos PDF falharam por contexto e por ferramentas.
  • Qual modelo foi usado e quanto pesa? O Gemma 4 12B do Google, na versão MLX de 4 bits, com 6,77 GB de pesos em memória. A quantização reduz o consumo de RAM, mas também reduz a precisão em números e códigos.
  • O chip M6 é realmente mais rápido que o M4 para modelos locais? O autor do vídeo relata pré-preenchimento cerca de 4,5 vezes mais rápido e decodificação 30% a 40% mais veloz no M6. São medições próprias dele, não um benchmark independente publicado.
  • Preciso pagar pela busca na web? O teste usou o nível gratuito da API da Busca Brave, que retornou erro de muitas requisições em parte das consultas. Níveis pagos podem reduzir esse limite.
  • O que fazer quando o modelo entra em loop chamando ferramentas? O vídeo sugere simplificar a tarefa, fornecer arquivos em texto simples quando possível e testar um agente mais leve, como o Pi. Modelos pequenos quantizados tendem a repetir chamadas quando a tarefa excede o contexto.

## Transforme seus vídeos em artigos que ficam no ar

O vídeo de Bart mostra que testes práticos viram conteúdo útil quando alguém documenta o que funcionou e o que falhou. Se você tem esse tipo de conhecimento gravado em vídeos do YouTube — tutoriais, comparativos, aulas do Bootcamp do Dev Doido ou lives da comunidade Crazystack Typescript, liderada por Gustavo Dev Doido —, vale transformar essas gravações em artigos que os buscadores conseguem encontrar.

O Skala Blog faz exatamente esse caminho: você cola a URL do vídeo, a ferramenta transcreve o áudio e gera um artigo estruturado, pronto para revisão. O material que hoje vive só dentro do player passa a ser encontrado por quem pesquisa o assunto. Conheça em https://crazystack.com.br o ecossistema e o Skala Blog para começar.

Source video