Alibaba lança Qwen 3.8 Max e versão local de 27B

Alibaba lança Qwen 3.8 Max e versão local de 27B

Este artigo também está disponível em: English Español

O novo modelo de fronteira da empresa aposta em agentes capazes de trabalhar por dias, inteligência visual e tarefas extensas. Uma versão aberta de 27 bilhões de parâmetros leva parte dessas capacidades para computadores domésticos.

Max: modelo de fronteira da Alibaba

O Qwen 3.8 Max é o modelo mais avançado da família Qwen. Ele utiliza uma arquitetura Mixture of Experts com 2,4 trilhões de parâmetros no total — cerca de 95 bilhões são ativados a cada inferência — e oferece uma janela de contexto de até 1 milhão de tokens.

O destaque do lançamento está na autonomia. Em um dos testes apresentados pela Alibaba, o modelo trabalhou por mais de dez dias desenvolvendo e aprimorando um projeto de software sem intervenção humana. Em outro, participou de uma competição contra 526 equipes e, segundo a empresa, superou 458 delas, o equivalente a 87% dos times humanos.

Evolução da pontuação média do Qwen 3.8 Max em mais de 10 benchmarks conforme o treinamento por reforço escala

Segundo a Alibaba, os ganhos em benchmarks internos e públicos se mantêm consistentes conforme o treinamento por aprendizado por reforço continua a escalar.

Foco em tarefas não apenas complexas, mas extensas

O material de lançamento dedica mais espaço a casos de uso prolongados do que a demonstrações isoladas. A proposta é mostrar um modelo capaz de manter objetivos, interpretar resultados e corrigir sua estratégia ao longo de centenas ou milhares de interações.

Os exemplos passam por programação, pesquisa, trabalho profissional, projeto de chips e simulações empresariais. Em comum, todos envolvem ciclos de execução, avaliação e correção, com pouca ou nenhuma participação humana. A Alibaba posiciona o Qwen 3.8 Max como um agente para projetos completos, e não apenas como um chatbot que responde a tarefas pontuais.

Inteligência visual

A visão também deixa de ser apenas uma forma de entrada. O Qwen 3.8 Max consegue analisar PDFs com mais de 200 páginas, interpretando texto, gráficos e a organização visual do documento. A empresa também promete processamento de vídeos com mais de 100 horas.

Durante a execução de uma tarefa, o modelo pode observar os próprios resultados, identificar interfaces desalinhadas, objetos em posições incorretas ou diferenças em relação ao projeto solicitado. Essa informação visual passa a fazer parte do ciclo de planejamento, execução, verificação e correção.

Benchmarks

Os benchmarks foram divididos entre programação, agentes gerais, capacidades tradicionais de raciocínio e diferentes formas de inteligência multimodal. Os testes visuais cobrem desde documentos e percepção espacial até controle de interfaces, criação de aplicações e compreensão de vídeos longos.

Em programação e agentes, o Qwen 3.8 Max fica próximo dos principais modelos fechados, mas apresenta um salto expressivo sobre a geração anterior. As maiores vantagens aparecem nas categorias visuais, de documentos e de raciocínio multimodal.

Benchmarks oficiais do Qwen 3.8 Max em comparação com Opus 4.8, Fable 5, Gemini 3.1 Pro e GPT-5.6 Sol

Resultados oficiais publicados pela Alibaba em benchmarks de programação, agentes, visão e compreensão de vídeo.

Categoriavs. Opus 4.8vs. Fable 5vs. GPT-5.6 Solvs. Qwen anterior
Agente de programação-0,3%-8,1%-0,1%+42,3%
Agente geral+4,4%-4,5%-0,8%+46,1%
Capacidades gerais+10,4%+2,1%+1,5%+11,5%
Raciocínio multimodal+36,3%+14,5%+7,3%+30,0%
Agente visual e programação+4,0%-4,9%+0,2%+80,0%
Documentos e produtividade+18,8%+13,9%+13,6%+9,2%
Compreensão espacial e do mundo real+22,7%+5,3%+14,1%+3,8%
Percepção e localização visual+82,1%+34,2%+20,7%+30,5%
Vídeo e agentes multimodais+22,6%+7,0%+2,7%+15,5%

Valores positivos indicam vantagem do Qwen 3.8 Max; negativos indicam desvantagem. Os resultados representam a média das variações relativas dos testes comparáveis em cada categoria. A geração anterior corresponde ao Qwen 3.7 Max nas avaliações de texto e ao Qwen 3.7 Plus nas multimodais. Os números foram publicados pela própria Alibaba e ainda precisam de validação independente.

Disponibilidade

O Qwen 3.8 Max está disponível pela API do QwenCloud, com interfaces compatíveis com os padrões da OpenAI e da Anthropic. O modelo pode ser integrado a ferramentas como Claude Code, Codex, Qoder CLI, Qwen Code e OpenClaw.

Desempenho do Qwen 3.8 Max em diferentes harnesses, como QwenWork, Claude Code, Codex, OpenClaw e Hermes

Nos testes da Alibaba, o modelo mantém desempenho equivalente independentemente da ferramenta utilizada para conduzir as tarefas.

São oferecidos três níveis de raciocínio: xhigh, utilizado por padrão em tarefas complexas; medium, que equilibra precisão e velocidade; e low, voltado à redução de custo e latência. A preservação do raciocínio entre mensagens também vem ativada por padrão.

Qwen 3.8 27B

A versão aberta Qwen 3.8 27B foi disponibilizada nesta semana no Hugging Face sob licença Apache 2.0. Trata-se de um modelo denso de 27 bilhões de parâmetros, com visão nativa, contexto de 262 mil tokens — extensível até 1 milhão — e controle dos níveis de raciocínio.

Com quantização, ele pode rodar em computadores domésticos mais potentes. Configurações agressivas já funcionam em placas com 16 GB de VRAM, enquanto GPUs com 24 ou 32 GB e Macs com pelo menos 32 GB de memória unificada oferecem mais espaço para contexto. Isso coloca o modelo no mesmo território dos Gemma 4 de 26B e 31B, fazendo boa frente principalmente para uso geral.

A recepção inicial também trouxe uma crítica recorrente: o modelo “pensa demais”. Usuários relatam cadeias de raciocínio desnecessariamente longas até para solicitações simples. Parte do comportamento parece estar relacionada ao nível xhigh adotado como padrão; trocar para medium ou low, ou desligar o modo de raciocínio, pode tornar as respostas mais rápidas. Ainda assim, há quem considere essa insistência uma vantagem em projetos difíceis, nos quais o modelo tende a revisar o próprio trabalho antes de entregar o resultado.

Fontes