Ollama ha anunciado la disponibilidad de Qwen 3.8 27B, el modelo de lenguaje más potente de su clase, que ya puede ejecutarse en todas las plataformas compatibles con la herramienta. El lanzamiento incluye mejoras sustanciales en tareas de programación, trabajo profesional, investigación y tareas agénticas de largo alcance, según informó la compañía en un comunicado.
El nuevo modelo está diseñado específicamente para agentes de inteligencia artificial, con control flexible de pensamiento y capacidad para llevar a cabo tareas complejas de múltiples pasos con mayor fiabilidad. Además, Qwen 3.8 27B es un modelo denso multimodal nativo que incluye soporte para entrada de imágenes, y ofrece un contexto nativo de 262K, ideal para sesiones de programación de larga duración.
Una de las ventajas más destacadas es su amplia accesibilidad: el modelo está disponible bajo la licencia Apache 2.0 en todas las plataformas compatibles con Ollama. Los usuarios pueden comenzar a utilizarlo de inmediato con el comando ollama run qwen3.8, o bien integrarlo con agentes de codificación como Pi mediante ollama launch pi --model qwen3.8.
La documentación oficial de Ollama detalla el uso de Qwen 3.8 27B con diversos agentes de programación y asistentes personales, incluyendo Claude Code, Codex, Hermes, OpenClaw y otros. Esta versatilidad posiciona al modelo como una opción atractiva tanto para desarrolladores individuales como para equipos que buscan integrar IA en sus flujos de trabajo.
Rendimiento optimizado en hardware NVIDIA y Apple Silicon
Ollama colaboró con NVIDIA y con el proyecto de código abierto MLX de Apple para optimizar el rendimiento de Qwen 3.8 27B en hardware específico. En dispositivos Apple Silicon con chip M3 o más recientes, la integración con el framework MLX permite alcanzar más de 70 tokens por segundo al ejecutar el modelo en una MacBook con chip M5 Max, utilizando el comando ollama run qwen3.8:27b-mlx.
La compatibilidad con MLX también habilita el soporte de entrada de imágenes, lo que permite consultas como ollama run qwen3.8:27b-mlx "What's in this image? ./image.png". Por el lado de NVIDIA, la colaboración se centró en maximizar el rendimiento en la arquitectura Blackwell a través de llama.cpp, logrando más de 131 tokens por segundo con optimización de predicción multi-token (MTP).
La compañía invitó a los usuarios a compartir sus comentarios respondiendo directamente al correo de anuncio o uniéndose al servidor de Discord de Ollama. Con este lanzamiento, Ollama refuerza su posición como plataforma de referencia para la ejecución local de modelos de lenguaje de última generación.

