Alibaba lanza Qwen 3.8 Max y una versión local de 27B

Alibaba lanza Qwen 3.8 Max y una versión local de 27B

Este artículo también está disponible en: Português English

El nuevo modelo de frontera de la empresa apuesta por agentes capaces de trabajar durante días, inteligencia visual y tareas extensas. Una versión abierta de 27 mil millones de parámetros lleva parte de esas capacidades a computadoras domésticas.

Max: el modelo de frontera de Alibaba

Qwen 3.8 Max es el modelo más avanzado de la familia Qwen. Utiliza una arquitectura Mixture of Experts con 2,4 billones de parámetros en total —cerca de 95 mil millones se activan en cada inferencia— y ofrece una ventana de contexto de hasta 1 millón de tokens.

Lo más destacado del lanzamiento es la autonomía. En una de las pruebas presentadas por Alibaba, el modelo trabajó durante más de diez días desarrollando y mejorando un proyecto de software sin intervención humana. En otra, participó en una competencia contra 526 equipos y, según la empresa, superó a 458 de ellos, el equivalente al 87% de los equipos humanos.

Evolución de la puntuación media de Qwen 3.8 Max en más de 10 benchmarks conforme escala el entrenamiento por refuerzo

Según Alibaba, las ganancias en benchmarks internos y públicos se mantienen consistentes a medida que el entrenamiento por aprendizaje por refuerzo continúa escalando.

Enfoque en tareas no solo complejas, sino extensas

El material de lanzamiento dedica más espacio a casos de uso prolongados que a demostraciones aisladas. La propuesta es mostrar un modelo capaz de mantener objetivos, interpretar resultados y corregir su estrategia a lo largo de cientos o miles de interacciones.

Los ejemplos abarcan programación, investigación, trabajo profesional, diseño de chips y simulaciones empresariales. En común, todos implican ciclos de ejecución, evaluación y corrección, con poca o ninguna participación humana. Alibaba posiciona a Qwen 3.8 Max como un agente para proyectos completos, y no solo como un chatbot que responde a tareas puntuales.

Inteligencia visual

La visión también deja de ser solo una forma de entrada. Qwen 3.8 Max puede analizar PDFs de más de 200 páginas, interpretando texto, gráficos y la organización visual del documento. La empresa también promete procesamiento de videos de más de 100 horas.

Durante la ejecución de una tarea, el modelo puede observar sus propios resultados, identificando interfaces desalineadas, objetos en posiciones incorrectas o diferencias con respecto al proyecto solicitado. Esa información visual pasa a formar parte del ciclo de planificación, ejecución, verificación y corrección.

Benchmarks

Los benchmarks se dividieron entre programación, agentes generales, capacidades tradicionales de razonamiento y diferentes formas de inteligencia multimodal. Las pruebas visuales cubren desde documentos y percepción espacial hasta control de interfaces, creación de aplicaciones y comprensión de videos largos.

En programación y agentes, Qwen 3.8 Max se acerca a los principales modelos cerrados, pero presenta un salto expresivo sobre la generación anterior. Las mayores ventajas aparecen en las categorías visuales, de documentos y de razonamiento multimodal.

Benchmarks oficiales de Qwen 3.8 Max en comparación con Opus 4.8, Fable 5, Gemini 3.1 Pro y GPT-5.6 Sol

Resultados oficiales publicados por Alibaba en benchmarks de programación, agentes, visión y comprensión de video.

Categoríavs. Opus 4.8vs. Fable 5vs. GPT-5.6 Solvs. Qwen anterior
Agente de programación-0,3%-8,1%-0,1%+42,3%
Agente general+4,4%-4,5%-0,8%+46,1%
Capacidades generales+10,4%+2,1%+1,5%+11,5%
Razonamiento multimodal+36,3%+14,5%+7,3%+30,0%
Agente visual y programación+4,0%-4,9%+0,2%+80,0%
Documentos y productividad+18,8%+13,9%+13,6%+9,2%
Comprensión espacial y del mundo real+22,7%+5,3%+14,1%+3,8%
Percepción y localización visual+82,1%+34,2%+20,7%+30,5%
Video y agentes multimodales+22,6%+7,0%+2,7%+15,5%

Los valores positivos indican ventaja de Qwen 3.8 Max; los negativos indican desventaja. Los resultados representan el promedio de las variaciones relativas de las pruebas comparables en cada categoría. La generación anterior corresponde a Qwen 3.7 Max en las evaluaciones de texto y a Qwen 3.7 Plus en las multimodales. Los números fueron publicados por la propia Alibaba y aún necesitan validación independiente.

Disponibilidad

Qwen 3.8 Max está disponible a través de la API de QwenCloud, con interfaces compatibles con los estándares de OpenAI y Anthropic. El modelo puede integrarse en herramientas como Claude Code, Codex, Qoder CLI, Qwen Code y OpenClaw.

Desempeño de Qwen 3.8 Max en diferentes harnesses, como QwenWork, Claude Code, Codex, OpenClaw y Hermes

En las pruebas de Alibaba, el modelo mantiene un desempeño equivalente independientemente de la herramienta utilizada para conducir las tareas.

Se ofrecen tres niveles de razonamiento: xhigh, utilizado por defecto en tareas complejas; medium, que equilibra precisión y velocidad; y low, orientado a la reducción de costo y latencia. La preservación del razonamiento entre mensajes también viene activada por defecto.

Qwen 3.8 27B

La versión abierta Qwen 3.8 27B fue puesta a disposición esta semana en Hugging Face bajo la licencia Apache 2.0. Se trata de un modelo denso de 27 mil millones de parámetros, con visión nativa, contexto de 262 mil tokens —extensible hasta 1 millón— y control de los niveles de razonamiento.

Con cuantización, puede ejecutarse en computadoras domésticas más potentes. Configuraciones agresivas ya funcionan en tarjetas con 16 GB de VRAM, mientras que GPUs con 24 o 32 GB y Macs con al menos 32 GB de memoria unificada ofrecen más espacio para el contexto. Esto coloca al modelo en el mismo territorio de los Gemma 4 de 26B y 31B, compitiendo bien principalmente para uso general.

La recepción inicial también trajo una crítica recurrente: el modelo “piensa demasiado”. Los usuarios reportan cadenas de razonamiento innecesariamente largas incluso para solicitudes simples. Parte del comportamiento parece estar relacionada con el nivel xhigh adoptado por defecto; cambiar a medium o low, o desactivar el modo de razonamiento, puede hacer que las respuestas sean más rápidas. Aun así, hay quienes consideran esta insistencia una ventaja en proyectos difíciles, en los que el modelo tiende a revisar su propio trabajo antes de entregar el resultado.

Fuentes