Qwen 4: o que a preview da Alibaba já revela sobre a nova IA em 2026
O Qwen 4 ainda não foi lançado oficialmente, mas a Alibaba já entregou uma preview da sua arquitetura no modelo aberto Qwen3.8-Flash-Next (26/08/2026), enquanto o Qwen3.8-Max-0902 assumiu o 1º lugar geral em geração de código (Code Arena: WebDev). Na prática: dá pra testar a base do Qwen 4 hoje — e o momento Qwen já superou Claude e Kimi em coding.
Nos últimos meses, os modelos da família Qwen, desenvolvidos pela Alibaba, passaram de coadjuvantes a protagonistas no debate de inteligência artificial open-source. Com o lançamento do Qwen3.8-Flash-Next em agosto de 2026, a empresa foi além: não apenas lançou um modelo novo, mas declarou abertamente que aquela arquitetura é a prévia do que virá no Qwen 4. É raro um laboratório revelar sua mão com tanta antecedência — e vale entender o que isso significa para quem desenvolve, pesquisa ou simplesmente usa IA no dia a dia.
O que é o Qwen 4 e ele já foi lançado?
O Qwen 4 é a próxima geração da família de modelos de linguagem da Alibaba, ainda sem lançamento oficial — mas sua arquitetura base já está disponível para testes via o Qwen3.8-Flash-Next, lançado em 26 de agosto de 2026.
A série Qwen é o braço de IA generativa da Alibaba Cloud, desenvolvida pelo Qwen Team. Desde o Qwen 2.5, os modelos da família passaram a competir diretamente com GPT e Claude em benchmarks internacionais. O Qwen 3 consolidou a aposta em arquitetura MoE (Mixture of Experts) e multimodalidade.
O Qwen 4 ainda não tem data de lançamento oficial confirmada. O que a Alibaba fez foi estrategicamente diferente: lançou o Qwen3.8-Flash-Next com posicionamento explícito de “preview da arquitetura do Qwen 4”, permitindo que desenvolvedores e pesquisadores testem as inovações centrais antes do modelo completo chegar. É uma estratégia de comunidade e de sinalização competitiva ao mesmo tempo.
Se você já acompanha a IA da Alibaba, o Qwen 4 representa a evolução direta do que você já conhece — com mudanças significativas em eficiência de custo, contexto máximo e capacidade multimodal.
O que o Qwen3.8-Flash-Next revela da arquitetura do Qwen 4?
O Qwen3.8-Flash-Next é um MoE multimodal com 125B parâmetros totais e apenas ~6B ativos por token — e introduz quatro mudanças arquiteturais que devem definir o Qwen 4 completo.
Lançado em 26 de agosto de 2026 às 23h no horário de Pequim, o modelo é open-weight com checkpoint FP8 aberto. Conforme documentado pelo TechNode e pelo MarkTechPost, os números principais são:
- Arquitetura: MoE multimodal
- Parâmetros totais: 125B (backbone) + 51B (N-gram embedding) + 4B (multi-token prediction)
- Parâmetros ativos por token: ~6B
- Contexto nativo: 262.144 tokens, extensível a 1 milhão
As quatro inovações arquiteturais destacadas pelo Qwen Team para o Qwen 4:
- Gated DeltaNet + Qwen Sparse Attention: mecanismo híbrido que combina atenção densa seletiva com state-space models, reduzindo custo quadrático em contextos longos. Especialmente relevante para tarefas com documentos extensos, bases de código grandes ou histórico de conversa longo.
- Gated Residual: controle mais fino do fluxo de gradiente entre camadas, melhorando estabilidade de treinamento e capacidade de recuperação de informação em contextos extensos. Na prática, o modelo “esquece menos” à medida que o contexto cresce.
- N-gram Embedding (51B params adicionais): embeddings de n-gramas pré-computados que permitem ao modelo capturar padrões de subpalavras e tokens compostos com mais precisão. Particularmente útil para código — onde sequências de tokens formam padrões sintáticos reconhecíveis — e para idiomas com morfologia rica como o português.
- Otimizador Muon: substituto ao AdamW para pré-treinamento, com convergência mais rápida e menor custo computacional. O Muon tem ganhado atenção na comunidade de pesquisa por apresentar melhores propriedades de generalização em alguns regimes de treinamento.
O foco declarado pela Alibaba é “ultimate cost efficiency”: rodar um modelo de fronteira com custo por token próximo de modelos menores. Com 6B ativos por token sobre um backbone de 125B, o Flash-Next entrega capacidade de modelo grande a custo de modelo médio — o que tem implicações diretas para quem roda pipelines em produção.
Como analisa The Decoder, o Flash-Next representa uma aposta na eficiência como vantagem competitiva sustentável, não apenas no raw performance. Para contexto: o GPT-6/Astra da OpenAI também aposta em arquiteturas esparsas — mas mantém seus checkpoints fechados. A Alibaba está jogando diferente.
O que é o Qwen3.8-Max-0902 e por que virou notícia?
O Qwen3.8-Max-0902 é uma atualização de pós-treinamento do Qwen3.8-Max, lançada em 2 de setembro de 2026, que alcançou o 1º lugar geral no Code Arena: WebDev com 1.691 pontos — superando Claude Opus 5, Kimi K3 e o próprio Qwen3.8-Max anterior.
O sufixo “-0902” indica a data do snapshot: 2 de setembro de 2026. Diferente do Flash-Next, que é uma mudança arquitetural profunda, o Max-0902 manteve a mesma base:
- Mesma arquitetura do Qwen3.8-Max
- Mesmos 2,4 trilhões de parâmetros totais
- Mesmo contexto de 1 milhão de tokens
O que mudou foi o pós-treinamento: ajuste fino de RLHF, novos dados de preferência e realinhamento específico para tarefas de código. O resultado foi consistente: todos os 8 benchmarks de coding avaliados pelo Code Arena melhoraram na mesma atualização — não foi melhora pontual em uma categoria isolada.
O timing da atualização é significativo. O Kimi K3 havia assumido a liderança no Code Arena: WebDev pouco antes. A resposta da Alibaba foi rápida e cirúrgica — sem nova arquitetura, apenas refinamento de alinhamento, o suficiente para retomar o primeiro lugar. Isso demonstra tanto a maturidade do processo de pós-treinamento quanto a capacidade de iteração rápida do Qwen Team.
Conforme reportado pelo TechNode, o Qwen3.8-Max-0902 liderou nas categorias Data & Analytics e Consumer Product, ficando em 2º ou 3º em cinco outras subcategorias do ranking.
Qwen3.8-Max-0902 é melhor que Claude e Kimi em código?
No Code Arena: WebDev, sim — o Qwen3.8-Max-0902 lidera com 1.691 pontos, contra 1.687 do Claude Opus 5 e 1.674 do Kimi K3. Mas essa liderança é específica para geração de código web e agentic coding, não um título de “melhor modelo do mundo em tudo”.
O Code Arena: WebDev é um benchmark crowdsourced que avalia geração de aplicações web completas, código funcional e tarefas de coding agêntico em condições de uso real. É considerado uma das métricas mais relevantes para capacidade de codificação prática porque reflete preferências de usuários reais, não apenas respostas de múltipla escolha ou benchmarks estáticos.
| Posição | Modelo | Pontuação | Diferença vs. Qwen3.8-Max-0902 |
|---|---|---|---|
| 🥇 1º | Qwen3.8-Max-0902 | 1.691 | — |
| 🥈 2º | Claude Opus 5 | 1.687 | -4 pts |
| 🥉 3º | Kimi K3 | 1.674 | -17 pts |
| 4º | Qwen3.8-Max (anterior) | 1.669 | -22 pts |
A margem sobre o Claude Opus 5 é pequena — apenas 4 pontos — mas no contexto competitivo do Code Arena, qualquer liderança sustentada é significativa. Segundo o anúncio oficial do @Alibaba_Qwen, o modelo também obteve o melhor ponto Pareto geral considerando desempenho versus custo, com aproximadamente US$5/M tokens blended.
Ressalva de honestidade: o Code Arena: WebDev avalia especificamente tarefas de geração de código web e agentic coding. Em raciocínio científico, matemática pura, escrita criativa ou outros domínios, o panorama competitivo pode ser diferente. O Qwen3.8-Max-0902 é, com evidências verificáveis, o melhor em coding web — não necessariamente em toda e qualquer tarefa.
Quanto custa usar os modelos Qwen hoje?
O Qwen3.8-Max-0902 custa aproximadamente US$2/milhão de tokens de entrada e US$6/milhão de tokens de saída — posicionando-o como o melhor ponto Pareto (desempenho/custo) entre os modelos de fronteira para coding, conforme análise do DataCamp.
| Modelo | Input (por 1M tokens) | Output (por 1M tokens) | Contexto máximo | Destaque |
|---|---|---|---|---|
| Qwen3.8-Max-0902 | ~US$2,00 | ~US$6,00 | 1M tokens | #1 Code Arena WebDev |
| Qwen3.8-Max (anterior) | ~US$2,00 | ~US$6,00 | 1M tokens | Substituído pelo 0902 |
| Qwen3.8-Flash-Next | Open-weight | Open-weight | 262K–1M tokens | Self-host gratuito (FP8) |
Atenção: preços de API podem variar por provedor (Alibaba Cloud Model Studio, Together AI, Fireworks AI, OpenRouter). Confirme os valores atuais antes de contratar qualquer plano.
Para times que rodam pipelines de coding em escala, a equação é favorável: o Qwen3.8-Max-0902 oferece desempenho ligeiramente superior ao Claude Opus 5 em WebDev a um custo por token significativamente menor. Isso se traduz em economia real em produção.
Já o Flash-Next muda a conversa completamente: como modelo open-weight com checkpoint FP8 aberto, quem tem infraestrutura pode rodar localmente sem qualquer custo de API. Isso é especialmente relevante para empresas que trabalham com código proprietário e não podem enviá-lo para APIs de terceiros — o modelo roda dentro da própria infraestrutura, sem dados saindo da empresa.
Como testar a preview do Qwen 4 agora mesmo?
Você pode testar a arquitetura que vai definir o Qwen 4 hoje: via Qwen3.8-Flash-Next (open-weight, self-host) ou pelo Qwen3.8-Max-0902 via API da Alibaba Cloud ou provedores como Together AI e Fireworks AI.
Opções práticas, do mais simples ao mais técnico:
- Qwen Chat (sem instalação): acesse chat.qwen.ai para testar os modelos mais recentes da família Qwen diretamente no navegador, sem criar conta de desenvolvedor. Ideal para avaliação inicial antes de decidir pela integração via API.
- Qwen3.8-Max-0902 via API: acesse o Alibaba Cloud Model Studio, Together AI ou Fireworks AI. Crie uma conta, gere uma API key e use o endpoint padrão compatível com o formato OpenAI. Custo: ~US$2/M tokens de entrada, ~US$6/M de saída. Integração direta com frameworks como LangChain, LlamaIndex e CrewAI.
- Qwen3.8-Flash-Next self-hosted: faça download do checkpoint FP8 no Hugging Face (busque por
Qwen/Qwen3.8-Flash-Next). Requer GPU com 24GB+ VRAM para INT4 quantizado, ou cluster para FP8 nativo. Frameworks compatíveis: vLLM, llama.cpp, SGLang. Ideal para quem precisa de privacidade de dados ou quer estudar a arquitetura base do Qwen 4 diretamente.
Para desenvolvedores que já usam modelos em automação agêntica e computer use, o Qwen3.8-Max-0902 merece atenção especial: o benchmark Code Arena: WebDev avalia exatamente o tipo de tarefa de coding agêntico que esses pipelines executam. Testar com casos reais de produção é o caminho mais rápido para validar se a troca faz sentido.
Por que isso importa para a corrida EUA x China no open-source?
O preview do Qwen 4 marca um ponto de inflexão: a China não apenas acompanha, mas lidera em pelo menos uma dimensão crítica — coding open-source a custo acessível. Isso tem implicações diretas para quem define os padrões de IA generativa global.
O contexto é mais amplo do que um benchmark. A movimentação de grandes players no ecossistema open-source reflete uma disputa de influência tecnológica: quem controla os modelos de referência define os padrões de fine-tuning, tooling e infraestrutura que toda a indústria vai usar nos próximos anos.
A estratégia da Alibaba com o Flash-Next opera em múltiplas frentes simultaneamente:
- Comunidade antes do lançamento: ao abrir o checkpoint FP8 do Flash-Next, a Alibaba está construindo um ecossistema ao redor do Qwen 4 antes mesmo do modelo completo chegar. Quando o Qwen 4 for lançado oficialmente, haverá uma comunidade ativa de fine-tuners, pesquisadores e empresas já familiarizados com a arquitetura — reduzindo drasticamente o tempo de adoção.
- Custo-eficiência como argumento de mercado: 6B parâmetros ativos por token sobre 125B totais é uma proposta que laboratórios ocidentais precisarão responder. Se o Qwen 4 completo entregar desempenho comparável ao GPT-6 ou Claude Opus 5 a custo de modelos médios, o mercado vai reposicionar suas escolhas de infraestrutura.
- Velocidade de iteração: o Qwen3.8-Max-0902 assumiu #1 em WebDev logo após o Kimi K3 ter chegado lá — sinaliza capacidade de resposta competitiva rápida. Não é só sobre ter o modelo mais potente; é sobre manter-se na fronteira continuamente.
Para quem acompanha a corrida global por AGI, o que está em jogo vai além do ranking de benchmarks. É sobre qual infraestrutura, qual stack e qual ecossistema de ferramentas vai treinar os modelos que treinarão os próximos modelos. Essa é a aposta de longo prazo que a Alibaba está fazendo com o Qwen 4.
Conforme analisa o Decrypt, o movimento de preview antecipado é também uma sinalização para a comunidade global de que os modelos chineses não são mais apenas “alternativas”: são referências que moldam a direção da pesquisa.
Vale esperar o Qwen 4 ou usar os modelos atuais?
Para a maioria dos casos de uso práticos em coding e desenvolvimento, não faz sentido esperar: o Qwen3.8-Max-0902 já oferece o melhor desempenho disponível em coding web, e o Flash-Next permite experimentar a arquitetura do Qwen 4 hoje mesmo, gratuitamente.
A resposta depende do seu caso específico:
- Você precisa de coding agêntico em produção agora? Use o Qwen3.8-Max-0902 via API. Melhor relação desempenho/custo disponível, liderança comprovada em WebDev com base em avaliação crowdsourced de usuários reais.
- Você quer estudar ou experimentar a nova arquitetura? Baixe o Qwen3.8-Flash-Next. É open-weight, o checkpoint FP8 está disponível no Hugging Face, e você estará rodando a base arquitetural do Qwen 4 antes do lançamento oficial — vantagem real para quem planeja fine-tuning futuro.
- Você precisa de multimodalidade avançada? Aguardar o Qwen 4 pode valer. O Flash-Next já é MoE multimodal, mas o modelo completo deve ampliar substancialmente as capacidades de compreensão visual e de dados estruturados.
- Você tem restrições de privacidade ou soberania de dados? O Flash-Next open-weight para self-host já resolve: o modelo roda na sua infraestrutura, sem dados saindo para APIs de terceiros. Não é necessário esperar o Qwen 4 para ter essa segurança.
O risco de aguardar o Qwen 4 completo é o de sempre com modelos de fronteira: sem data oficial confirmada, pode ser meses. E o que está disponível hoje — tanto em termos de desempenho (Max-0902) quanto de arquitetura (Flash-Next) — já é competitivo de forma concreta e mensurável.
Uma consideração adicional: o ritmo de lançamentos da Alibaba nos últimos meses sugere que o gap entre “preview” e “modelo completo” pode ser menor do que em ciclos anteriores. A Alibaba está claramente em modo de execução acelerada.
Perguntas frequentes sobre o Qwen 4
O Qwen 4 já foi lançado?
Não. O Qwen 4 ainda não tem lançamento oficial confirmado. O Qwen3.8-Flash-Next (26/08/2026) é uma preview da arquitetura do Qwen 4, não o modelo final. É possível testá-lo hoje via download do checkpoint FP8 no Hugging Face.
Qual é o preço do Qwen 4?
O Qwen 4 ainda não foi lançado. Os modelos atuais da família (Qwen3.8-Max-0902) custam aproximadamente US$2/1M tokens de entrada e US$6/1M de saída. O Qwen3.8-Flash-Next é open-weight e pode ser rodado localmente sem custo de API.
O Qwen 4 é melhor que o Claude ou o ChatGPT?
A família Qwen atual (Qwen3.8-Max-0902) lidera o Code Arena: WebDev com 1.691 pontos, superando Claude Opus 5 (1.687) e Kimi K3 (1.674) em coding web e agentic coding. Em outros domínios como raciocínio científico ou escrita criativa, o panorama pode ser diferente. O Qwen 4 completo ainda não foi lançado para avaliação abrangente.
O Qwen 4 será open-source?
Com base no histórico da Alibaba e no posicionamento do Flash-Next, é provável que versões open-weight do Qwen 4 sejam lançadas. O Qwen3.8-Flash-Next já é open-weight com checkpoint FP8 aberto. A Alibaba mantém estratégia dual: modelos fechados via API e versões abertas para a comunidade.
Como o Qwen 4 se diferencia do Qwen 3?
O Qwen 4 trará quatro mudanças arquiteturais confirmadas: Gated DeltaNet + Qwen Sparse Attention, Gated Residual, N-gram Embedding (51B parâmetros adicionais) e otimizador Muon. O foco declarado é eficiência de custo extrema com contexto de até 1 milhão de tokens.
Onde posso testar o Qwen 4 antes do lançamento oficial?
Via Qwen3.8-Flash-Next: download no Hugging Face (open-weight FP8) para self-host, ou via chat.qwen.ai. O Qwen3.8-Max-0902 está disponível via Alibaba Cloud Model Studio, Together AI e Fireworks AI com API compatível com o formato OpenAI.
O Qwen 4 tem suporte a português?
A família Qwen historicamente apresenta bom desempenho em português, especialmente em tarefas de texto. O N-gram Embedding introduzido no Flash-Next (base do Qwen 4) deve melhorar o tratamento de morfologia rica, o que beneficia diretamente línguas como o português.
