Ollama publicó la versión 0.33.1 el 26 de agosto de 2026. El cambio más visible es el soporte de Qwen 3.8 27B, pensado por Alibaba para tareas de código, investigación y uso agéntico más exigentes que las de modelos más pequeños de la misma familia. Junto a eso llegan varios ajustes que afectan al uso diario aunque no salgan en el titular: transcodificación WebP para los renderizadores de llama-server, mejor manejo de mensajes de sistema que no van en primera posición del historial, y un cambio de comportamiento que conviene tener en cuenta si mantienes Modelfiles propios — los modelos que no fijan explícitamente repeat_penalty pasan ahora a un valor por defecto de 1.0 (desactivado) en vez de 1.1, alineándose con el comportamiento de otros motores de inferencia y acelerando la decodificación especulativa. En hardware Apple Silicon con modelos NVFP4 vía MLX, esta versión trae mejoras de velocidad de prefill de entre un 7% y un 8% en Qwen3.6 y Muse Glimmer gracias a una escala global nueva. Se corrigen además fallos de verificación de blobs y se amplía la compatibilidad general, junto a ajustes de interfaz menores (texto de bienvenida más claro, alineación de la cabecera en macOS con los controles semáforo de la ventana).
Cómo actualizar a Ollama 0.33.1 y aprovechar el soporte de Qwen 3.8 27B
Comprueba tu versión actual
Ejecuta
ollama --version
en terminal para confirmar qué versión tienes instalada ahora mismo. Si administras Ollama como contenedor, comprueba la etiqueta de imagen actual con
docker inspect <contenedor> --format='{{.Config.Image}}'Cualquier versión anterior a la 0.33.1 se beneficia de las mejoras de esta guía, aunque el salto es más notable si vienes de una serie 0.32.x o anterior.
Actualiza según tu forma de instalación
En Linux con el script de instalación oficial, vuelve a ejecutar
curl -fsSL https://ollama.com/install.sh | sh
detecta la instalación existente y actualiza en el sitio. En macOS y Windows, la app de escritorio se actualiza sola por defecto; si prefieres forzar la comprobación, ábrela desde el menú y busca la opción de buscar actualizaciones. Con Docker, el proceso habitual es
docker pull ollama/ollama:latest
seguido de recrear el contenedor manteniendo el volumen de datos (
-v ollama:/root/.ollama) para no perder los modelos ya descargados.Descarga Qwen 3.8 27B si tu hardware lo soporta
Con la 0.33.1 instalada, descarga el modelo con
ollama pull qwen3.8:27b
(ajusta la etiqueta exacta a la variante de cuantización que prefieras según la documentación del modelo en la librería de Ollama). Es un modelo de 27.000 millones de parámetros pensado para tareas de código, investigación y uso agéntico más exigente — ten en cuenta que necesitarás VRAM/RAM proporcional al tamaño real del modelo cuantizado que elijas; si tu equipo ya sufría con modelos de la generación anterior de tamaño similar, este no va a ser la excepción.
Revisa tus Modelfiles si dependes de repeat_penalty
Si mantienes Modelfiles propios que no fijan explícitamente el parámetro
repeat_penalty
ese modelo pasa ahora a comportarse con el valor por defecto 1.0 (desactivado) en vez del 1.1 anterior — un cambio deliberado para alinear a Ollama con el comportamiento de otros motores de inferencia y acelerar la decodificación especulativa. Si notas que un modelo que llevabas usando con normalidad empieza a repetir frases o estructuras con más frecuencia que antes, este cambio de valor por defecto es la primera sospecha a descartar: añade
PARAMETER repeat_penalty 1.1
explícitamente en tu Modelfile si prefieres conservar el comportamiento anterior.
Si usas Apple Silicon con modelos NVFP4/MLX, valora el salto de velocidad
En equipos con chips Apple Silicon ejecutando modelos NVFP4 vía MLX, esta versión trae una escala global nueva que mejora la velocidad de prefill entre un 7% y un 8% en modelos como Qwen3.6 y Muse Glimmer. No hace falta ninguna acción adicional para beneficiarte de esto más allá de haber actualizado — pero si llevas benchmarks propios de latencia en tu homelab (algo recomendable si dependes de Ollama para una integración con tiempos de respuesta ajustados), es buen momento para repetir la medición y confirmar la mejora en tu caso concreto.
Confirma que las integraciones existentes siguen funcionando
Si tienes Ollama integrado con Open WebUI, n8n o cualquier otra herramienta que consuma su API, haz una prueba rápida de extremo a extremo tras la actualización — el manejo mejorado de mensajes de sistema que no van en primera posición del historial es justo el tipo de cambio que puede alterar sutilmente el comportamiento de integraciones que ya funcionaban con la versión anterior, aunque no rompan nada de forma evidente. Una conversación de prueba simple es suficiente para confirmar que el flujo completo sigue respondiendo como esperas.
Conclusión
Ninguno de los cambios de la 0.33.1 obliga a actualizar con urgencia de seguridad, pero el soporte de Qwen 3.8 27B y las mejoras de velocidad en Apple Silicon sí son motivo suficiente para no dejarla acumulando polvo en la cola de actualizaciones pendientes del homelab. Presta atención especial al cambio de repeat_penalty si tienes Modelfiles con configuración heredada de versiones anteriores — es el tipo de cambio silencioso que puede alterar el tono de las respuestas de un modelo que llevas meses usando sin tocar.



