El nuevo modelo de frontera de la empresa apuesta por agentes capaces de trabajar durante días, inteligencia visual y tareas extensas. Una versión abierta de 27 mil millones de parámetros lleva parte de esas capacidades a computadoras domésticas.
Max: el modelo de frontera de Alibaba
Qwen 3.8 Max es el modelo más avanzado de la familia Qwen. Utiliza una arquitectura Mixture of Experts con 2,4 billones de parámetros en total —cerca de 95 mil millones se activan en cada inferencia— y ofrece una ventana de contexto de hasta 1 millón de tokens.
Lo más destacado del lanzamiento es la autonomía. En una de las pruebas presentadas por Alibaba, el modelo trabajó durante más de diez días desarrollando y mejorando un proyecto de software sin intervención humana. En otra, participó en una competencia contra 526 equipos y, según la empresa, superó a 458 de ellos, el equivalente al 87% de los equipos humanos.

Según Alibaba, las ganancias en benchmarks internos y públicos se mantienen consistentes a medida que el entrenamiento por aprendizaje por refuerzo continúa escalando.
Enfoque en tareas no solo complejas, sino extensas
El material de lanzamiento dedica más espacio a casos de uso prolongados que a demostraciones aisladas. La propuesta es mostrar un modelo capaz de mantener objetivos, interpretar resultados y corregir su estrategia a lo largo de cientos o miles de interacciones.
Los ejemplos abarcan programación, investigación, trabajo profesional, diseño de chips y simulaciones empresariales. En común, todos implican ciclos de ejecución, evaluación y corrección, con poca o ninguna participación humana. Alibaba posiciona a Qwen 3.8 Max como un agente para proyectos completos, y no solo como un chatbot que responde a tareas puntuales.
Inteligencia visual
La visión también deja de ser solo una forma de entrada. Qwen 3.8 Max puede analizar PDFs de más de 200 páginas, interpretando texto, gráficos y la organización visual del documento. La empresa también promete procesamiento de videos de más de 100 horas.
Durante la ejecución de una tarea, el modelo puede observar sus propios resultados, identificando interfaces desalineadas, objetos en posiciones incorrectas o diferencias con respecto al proyecto solicitado. Esa información visual pasa a formar parte del ciclo de planificación, ejecución, verificación y corrección.
Benchmarks
Los benchmarks se dividieron entre programación, agentes generales, capacidades tradicionales de razonamiento y diferentes formas de inteligencia multimodal. Las pruebas visuales cubren desde documentos y percepción espacial hasta control de interfaces, creación de aplicaciones y comprensión de videos largos.
En programación y agentes, Qwen 3.8 Max se acerca a los principales modelos cerrados, pero presenta un salto expresivo sobre la generación anterior. Las mayores ventajas aparecen en las categorías visuales, de documentos y de razonamiento multimodal.

Resultados oficiales publicados por Alibaba en benchmarks de programación, agentes, visión y comprensión de video.
| Categoría | vs. Opus 4.8 | vs. Fable 5 | vs. GPT-5.6 Sol | vs. Qwen anterior |
|---|---|---|---|---|
| Agente de programación | -0,3% | -8,1% | -0,1% | +42,3% |
| Agente general | +4,4% | -4,5% | -0,8% | +46,1% |
| Capacidades generales | +10,4% | +2,1% | +1,5% | +11,5% |
| Razonamiento multimodal | +36,3% | +14,5% | +7,3% | +30,0% |
| Agente visual y programación | +4,0% | -4,9% | +0,2% | +80,0% |
| Documentos y productividad | +18,8% | +13,9% | +13,6% | +9,2% |
| Comprensión espacial y del mundo real | +22,7% | +5,3% | +14,1% | +3,8% |
| Percepción y localización visual | +82,1% | +34,2% | +20,7% | +30,5% |
| Video y agentes multimodales | +22,6% | +7,0% | +2,7% | +15,5% |
Los valores positivos indican ventaja de Qwen 3.8 Max; los negativos indican desventaja. Los resultados representan el promedio de las variaciones relativas de las pruebas comparables en cada categoría. La generación anterior corresponde a Qwen 3.7 Max en las evaluaciones de texto y a Qwen 3.7 Plus en las multimodales. Los números fueron publicados por la propia Alibaba y aún necesitan validación independiente.
Disponibilidad
Qwen 3.8 Max está disponible a través de la API de QwenCloud, con interfaces compatibles con los estándares de OpenAI y Anthropic. El modelo puede integrarse en herramientas como Claude Code, Codex, Qoder CLI, Qwen Code y OpenClaw.

En las pruebas de Alibaba, el modelo mantiene un desempeño equivalente independientemente de la herramienta utilizada para conducir las tareas.
Se ofrecen tres niveles de razonamiento: xhigh, utilizado por defecto en tareas complejas; medium, que equilibra precisión y velocidad; y low, orientado a la reducción de costo y latencia. La preservación del razonamiento entre mensajes también viene activada por defecto.
Qwen 3.8 27B
La versión abierta Qwen 3.8 27B fue puesta a disposición esta semana en Hugging Face bajo la licencia Apache 2.0. Se trata de un modelo denso de 27 mil millones de parámetros, con visión nativa, contexto de 262 mil tokens —extensible hasta 1 millón— y control de los niveles de razonamiento.
Con cuantización, puede ejecutarse en computadoras domésticas más potentes. Configuraciones agresivas ya funcionan en tarjetas con 16 GB de VRAM, mientras que GPUs con 24 o 32 GB y Macs con al menos 32 GB de memoria unificada ofrecen más espacio para el contexto. Esto coloca al modelo en el mismo territorio de los Gemma 4 de 26B y 31B, compitiendo bien principalmente para uso general.
La recepción inicial también trajo una crítica recurrente: el modelo “piensa demasiado”. Los usuarios reportan cadenas de razonamiento innecesariamente largas incluso para solicitudes simples. Parte del comportamiento parece estar relacionada con el nivel xhigh adoptado por defecto; cambiar a medium o low, o desactivar el modo de razonamiento, puede hacer que las respuestas sean más rápidas. Aun así, hay quienes consideran esta insistencia una ventaja en proyectos difíciles, en los que el modelo tiende a revisar su propio trabajo antes de entregar el resultado.
