Modelos de Código Aberto da OpenAI
OpenAI surpreende lançando dois modelos de linguagem massivos e abertos: um de 20 bilhões e outro de 120 bilhões de parâmetros. Veja como usá-los na prática, benchmarks e
Carregando
OpenAI surpreende lançando dois modelos de linguagem massivos e abertos: um de 20 bilhões e outro de 120 bilhões de parâmetros. Veja como usá-los na prática, benchmarks e
Seu cérebro apodrece com TikTok. O da IA também. Descubra o que é brain rot, como afeta modelos de linguagem e quais...
Nunca antes a OpenAI sentiu tanta pressão dos concorrentes. Veja o que provocou o alerta interno, quais riscos...
Modelos de Código Aberto da OpenAI. OpenAI surpreende lançando dois modelos de linguagem massivos e abertos: um de 20 bilhões e outro de 120 bilhões de parâmetros. Veja como usá-los na prática, benchmarks e dicas avançadas.
Depois de muita especulação, OpenAI finalmente lançou dois modelos de linguagem abertos: um com 20 bilhões de parâmetros e outro com 120 bilhões. Modelos rodam localmente sem dependência de rede, com compatibilidade até em smartphones ou hardware gamer básico.
Modelo de 20B funciona até em MacBook ou smartphone, ocupando cerca de 11GB de memória. Já modelo de 120B tem cerca de 60GB e roda suave em desktops com 5090 GPU ou setups com ampla memória RAM.
Executar modelo de 120B em laptops pode ser extremamente custoso. Verifique memória antes de tentar carregar modelo completo.
Ambos modelos usam arquitetura com mixture of experts, ou seja, só especialistas relevantes são ativados pra cada prompt. Isso reduz uso ativo pra cerca de 5 bilhões de parâmetros por token, mesmo em arquiteturas grandes.
Número de parâmetros ativos por token permanece consistente. É implementação rara em modelos desse porte.
Modelo 20B funcionou perfeitamente em MacBook M2 Max, inclusive desconectado da internet. Já 120B, apesar de conseguir abrir, teve latência de minutos pra gerar poucas palavras em laptops.
Pra ótimos resultados locais, use modelo 20B com Ollama. Roda tranquilo em dispositivos offline.
Cerebras, Groq e outras empresas tão oferecendo throughput altíssimo com esses modelos. Resultados de até 3.000 tokens por segundo já foram alcançados, com benchmarks que superam modelos tradicionais hospedados.
Com Agentuity, configurar e testar agentes usando esses modelos ficou incrivelmente eficiente. Com suporte a ferramentas tipo Bun, Node e Python com UV, experiência de desenvolvimento é imediata, fluida e poderosa.
Com modelos abertos, perguntas sensíveis agora podem ser feitas localmente, sem sair do dispositivo, preservando total privacidade. Ganho relevante pra quem trata dados sensíveis.
Apesar do entusiasmo, modelo de 120B exige atenção com recursos. Em notebooks, pode consumir 100% da memória e travar sistema. Recomendado usar em desktops com GPUs avançadas.
Plataformas tipo T3 Chat deixam usar 20B grátis e 120B via assinatura econômica. Velocidades de geração são altíssimas e podem atingir até 2300 tokens por segundo, dependendo do provedor.
Usuários registrados podem testar modelo de 120B por só $8/mês. Um código promocional oferece primeiro mês por $1: THANKSOPENAI.
Maior novidade é fim da dependência de infraestrutura fechada. Agora modelos podem andar sem intermediação da OpenAI, um divisor de águas pra comunidade de código aberto.
Esses modelos vão influenciar fortemente criação de apps, roteadores de modelo, e uso descentralizado de IA. Autonomia aumenta drasticamente com esse novo paradigma aberto.