GPT-OSS: open source e benchmarks | guia prático na prática
A empresa que competia com open source agora lança o seu — com números de Codeforces no relato.
Resposta direta
Sobre gpt-oss: Para os desenvolvedores, estes modelos são compatíveis com a API de respostas, o que significa que vocês podem usá-los como qualquer outro modelo em seus workflows agentes, independente de qual plataforma você está usando. Ambos os modelos oferecem uma janela de contexto de 128K, que é standardizado para.
O que o material diz sobre gpt-oss
O episódio sobre gpt-oss abre assim: A empresa que estava completamente contra a open source e considerava-se o maior competidor de modelos de open source como DeepSeq e KimiK2, acabou de lançar um modelo de open source. Isso é certo, Sam Altman anunciou que eles estão lançando GPT-OSS. Especialmente, esses modelos de open source oferecem performance similar a um dos seus modelos de flagship, o 4 Mini.
Há duas versões, que eu vou mostrar para vocês mais tarde no vídeo. Segundo as especificações, o modelo maior pode ser usado em máquinas de alta renda com o equivalente a um GPU de 80 GB. Enquanto a versão menor pode realmente funcionar em telefones, de acordo com este post.
Este é o primeiro modelo de open source que eles lançaram em mais de 5 anos, com o último sendo o GPT-2, em 2019. Agora, os dois modelos que foram lançados são chamados GPT-OSS120B e OSS20B. Apesar de ser o modelo menor, quando você vê as marcas de GPT-OSS20B, você vai se surpreender com o quão eficiente é.
Para `gpt-oss-open-source-benchmarks`, preserve só o que muda uma decisão observável esta semana. Se o trecho for opinião, rotule como opinião — não fabrique métrica ausente do áudio.
Âncora
Use cenas e mecanismos da transcrição de «gpt-oss»; não invente fatos.
Mecanismo e restrição em gpt-oss
No miolo do material de gpt-oss, o mecanismo fica explícito: Eles estão disponíveis sob a licença Apache 2.0. E ambos são treinados usando as técnicas internas mais avançadas da OpenAI, um mix de aprendizagem de reenforçamento e os mesmos métodos usados em modelos de top-tier da OpenAI. O modelo maior, o OSS120B, como mencionado anteriormente, alcança performance perto de paridade com o 04 Mini e pode funcionar no equivalente de um GPU de 80 GB.
Enquanto isso, o modelo menor, o OSS20B, entrega resultados similares ao 03 Mini e pode realmente funcionar em dispositivos com apenas 16 GB de memória, o que é realmente remarcável. Ambos modelos excelem no uso de ferramentas, chamada de função de few-shot e a razão de pensamento de linha de pensamento. A melhor notícia é que os preços para estes modelos também estão disponíveis, o que significa que qualquer um pode os finetunar para seus casos de uso específicos.
Para os desenvolvedores, estes modelos são compatíveis com a API de respostas, o que significa que vocês podem usá-los como qualquer outro modelo em seus workflows agentes, independente de qual plataforma você está usando. Enquanto que ele apoie a API, você está bem para ir. Aqui na comunidade do Discord da AI Labs, nós estamos hosteando o nosso primeiro hackathon.
Para `gpt-oss-open-source-benchmarks`, preserve só o que muda uma decisão observável esta semana. Se o trecho for opinião, rotule como opinião — não fabrique métrica ausente do áudio.
Decisões práticas ligadas a gpt-oss
As decisões práticas que aparecem quando o tema é gpt-oss: Nós ouvimos seu feedback e queríamos dar mais tempo para construir algo incrível. Nós também estamos adicionando um prêmio de 500 dólares para a melhor submissão overall, além dos 5 projetos que serão apresentados em um vídeo no YouTube. Agora aqui você pode ver ambos os modelos, o número de colheres que eles têm e seus parâmetros total.
O OSS120B tem 117 bilhões de parâmetros, enquanto o modelo 20B tem 21 bilhões de parâmetros, junto com outras especificações. Como essas são uma mistura de modelos de expertos, o número total de expertos também está listado. Ambos os modelos oferecem uma janela de contexto de 128K, que é standardizado para modelos hoje em dia, embora não muito no ponto de corte, como modelos de flagship.
Que agora oferecem cerca de 200 mil janelas de contexto. Estes modelos, junto com todos os modelos chineses de open source que vimos este ano, serão mudadores de jogo para organizações de empresas que querem mais controle e privacidade ao executar modelos em seus próprios sistemas. Agora vamos olhar os benchmark que eles executaram, e eu vou mostrar para vocês porque o modelo OSS20B é um modelo tão eficiente.
Para `gpt-oss-open-source-benchmarks`, preserve só o que muda uma decisão observável esta semana. Se o trecho for opinião, rotule como opinião — não fabrique métrica ausente do áudio.
Onde o fluxo de gpt-oss quebra
Onde o fluxo costuma quebrar, segundo a fonte de gpt-oss: O primeiro benchmark é um benchmark de código, Codeforces. Eles testaram os modelos com e sem ferramentas, comparando-os contra o 03, 04 Mini, e o 3 mini o que é remarcável aqui é que tanto oss 20b e oss 120b com ferramentas mostram apenas uma pequena diferença de performance o nível de performance que alcança é impressionante, se mover para a última benchmark de exame da humanidade, que contém alguns dos maiores problemas de todos os tempos, incluindo matemática profissional, razoabilidade e perguntas de razoabilidade multistep, os modelos performance exceptionally well. OSS 20B with tools comes very close to 04 mini with tools.
Next, we have the HealthBench benchmarks, which focus on health-related questions. The open-source models performed well on realistic health conversations, though on more challenging scenarios, OSS 20B did drop off somewhat. Finally, in benchmarks for mathematics and PhD-level science questions, these models continue to demonstrate strong performance across the board.
Agora, esses dois modelos são modelos de pensamento e sua linha de pensamento, o processo de razoabilidade que eles passam para dar melhores respostas é uma parte importante da sua arquitetura. Desde o lançamento do modelo de previsão 01, eles não aplicaram nenhuma supervisão direta à linha de pensamento e a mesma abordagem se aplica aos modelos de OSS. Essa escolha deliberada os ajuda a analisar o comportamento de mal-estar do modelo crítico, decepção e potencial de mal-uso.
Para `gpt-oss-open-source-benchmarks`, preserve só o que muda uma decisão observável esta semana. Se o trecho for opinião, rotule como opinião — não fabrique métrica ausente do áudio.
Atenção
Falsas vitórias em gpt-oss: demo sem dado, integração sem observabilidade, narrativa sem evidência.
Como explicar gpt-oss sem hype
Traduzindo o trecho de gpt-oss para quem não viu o vídeo: Ao lançar esses modelos sem uma cadeia de pensamento supervisiva, Eles estão permitindo a outros a construir e implementar seus próprios sistemas de monitoramento da linha de pensamento. Eles também clarificaram que essa linha de pensamento rá-reta não deveria ser exposta ao público através de aplicações construídas nesses modelos, como pode ter conteúdo ou respostas perigosas que o modelo foi treinado para evitar. Você pode realmente ajustar a quantidade de razão que eles performam durante o processo de linha de pensamento.
E então aumentá-lo para matemática complexa, ciência, código e problemas de razão. Agora, falando sobre a disponibilidade destes modelos, eles são disponíveis para download gratuitamente no Hugging Face, e como já sabemos, os preços são open source também. OpenAI também se apresenta com plataformas de deploymento em frente ao lançamento, incluindo Azure, Ollama, LM Studio, Together AI e OpenRouter.
Então todas essas plataformas terão esses modelos disponíveis para download ou uso através de API. Então, como você pode ver, os modelos OSS OSS 120B e OSS 20B já estão disponíveis no Open Router e podemos testá-los sozinhos. Dê-nos um comentário se você quiser ver um vídeo completo de testes de ambos os modelos.
Para `gpt-oss-open-source-benchmarks`, preserve só o que muda uma decisão observável esta semana. Se o trecho for opinião, rotule como opinião — não fabrique métrica ausente do áudio.
Checklist observável para gpt-oss
Para fechar o ciclo de gpt-oss com evidência do próprio material: Enquanto as benchmarking oferecidas pela empresa são ajudantes, elas não sempre refletem performance real do mundo. Isso pode ser revelado somente através de testes de prática. Se você quiser apoiar o canal e nos ajudar a continuar fazendo vídeos como este, você pode fazer isso usando o botão de super obrigado abaixo.
A empresa que estava completamente contra a open source e considerava-se o maior competidor de modelos de open source como DeepSeq e KimiK2, acabou de lançar um modelo de open source. Isso é certo, Sam Altman anunciou que eles estão lançando GPT-OSS. Especialmente, esses modelos de open source oferecem performance similar a um dos seus modelos de flagship, o 4 Mini.
Há duas versões, que eu vou mostrar para vocês mais tarde no vídeo. Segundo as especificações, o modelo maior pode ser usado em máquinas de alta renda com o equivalente a um GPU de 80 GB. Enquanto a versão menor pode realmente funcionar em telefones, de acordo com este post.
Para `gpt-oss-open-source-benchmarks`, preserve só o que muda uma decisão observável esta semana. Se o trecho for opinião, rotule como opinião — não fabrique métrica ausente do áudio.
Sinais de progresso em gpt-oss
Mais um recorte útil sobre gpt-oss antes de virar padrão do time: Este é o primeiro modelo de open source que eles lançaram em mais de 5 anos, com o último sendo o GPT-2, em 2019. Agora, os dois modelos que foram lançados são chamados GPT-OSS120B e OSS20B. Apesar de ser o modelo menor, quando você vê as marcas de GPT-OSS20B, você vai se surpreender com o quão eficiente é.
Eles estão disponíveis sob a licença Apache 2.0. E ambos são treinados usando as técnicas internas mais avançadas da OpenAI, um mix de aprendizagem de reenforçamento e os mesmos métodos usados em modelos de top-tier da OpenAI. O modelo maior, o OSS120B, como mencionado anteriormente, alcança performance perto de paridade com o 04 Mini e pode funcionar no equivalente de um GPU de 80 GB.
Enquanto isso, o modelo menor, o OSS20B, entrega resultados similares ao 03 Mini e pode realmente funcionar em dispositivos com apenas 16 GB de memória, o que é realmente remarcável. Ambos modelos excelem no uso de ferramentas, chamada de função de few-shot e a razão de pensamento de linha de pensamento. A melhor notícia é que os preços para estes modelos também estão disponíveis, o que significa que qualquer um pode os finetunar para seus casos de uso específicos.
Para `gpt-oss-open-source-benchmarks`, preserve só o que muda uma decisão observável esta semana. Se o trecho for opinião, rotule como opinião — não fabrique métrica ausente do áudio.
Recortes adicionais da fonte sobre gpt-oss
Estes trechos reforçam o raciocínio de `gpt-oss-open-source-benchmarks` sem resumo genérico:
A empresa que estava completamente contra a open source e considerava-se o maior competidor de modelos de open source como DeepSeq e KimiK2, acabou de lançar um modelo de open source. Isso é certo, Sam Altman anunciou que eles estão lançando GPT-OSS. Especialmente, esses modelos de open source oferecem performance similar a um dos seus modelos de flagship, o 4 Mini.
Há duas versões, que eu vou mostrar para vocês mais tarde no vídeo. Segundo as especificações, o modelo maior pode ser usado em máquinas de alta renda com o equivalente a um GPU de 80 GB. Enquanto a versão menor pode realmente funcionar em telefones, de acordo com este post.
Este é o primeiro modelo de open source que eles lançaram em mais de 5 anos, com o último sendo o GPT-2, em 2019. Agora, os dois modelos que foram lançados são chamados GPT-OSS120B e OSS20B. Apesar de ser o modelo menor, quando você vê as marcas de GPT-OSS20B, você vai se surpreender com o quão eficiente é.
Eles estão disponíveis sob a licença Apache 2.0. E ambos são treinados usando as técnicas internas mais avançadas da OpenAI, um mix de aprendizagem de reenforçamento e os mesmos métodos usados em modelos de top-tier da OpenAI. O modelo maior, o OSS120B, como mencionado anteriormente, alcança performance perto de paridade com o 04 Mini e pode funcionar no equivalente de um GPU de 80 GB.
Enquanto isso, o modelo menor, o OSS20B, entrega resultados similares ao 03 Mini e pode realmente funcionar em dispositivos com apenas 16 GB de memória, o que é realmente remarcável. Ambos modelos excelem no uso de ferramentas, chamada de função de few-shot e a razão de pensamento de linha de pensamento. A melhor notícia é que os preços para estes modelos também estão disponíveis, o que significa que qualquer um pode os finetunar para seus casos de uso específicos.
Para os desenvolvedores, estes modelos são compatíveis com a API de respostas, o que significa que vocês podem usá-los como qualquer outro modelo em seus workflows agentes, independente de qual plataforma você está usando. Enquanto que ele apoie a API, você está bem para ir. Aqui na comunidade do Discord da AI Labs, nós estamos hosteando o nosso primeiro hackathon.
Internalize com links reais do ecossistema CrazyStack: /blog, /curso-cursor-avancado-configuracoes-pro, /curso-claude-code-9-dicas-profissionais, /programa-crazystack e /checklist-independencia-cursor.