Guía para ejecutar Qwen3.6 35B en Windows con IA Colibrì

Ejecutar un modelo de 35 mil millones de parámetros en un portátil habría parecido absurdo hace poco. Sin embargo, para ejecutar Qwen3.6 35B en Windows, los modelos Mixture of Experts (MoE) y motores especializados como Colibrì permiten hacerlo sin depender de una API externa ni enviar nuestros datos a la nube.

En esta nueva prueba instalé Colibrì 1.10.1, descargué el modelo cuantizado a int4-gs64, comprobé sus 41 fragmentos y lo dejé listo para utilizarse como chat interactivo en PowerShell y mediante una interfaz web local. También encontré un detalle en el diagnóstico de GPU y enviamos una corrección como pull request #1322.

Qué necesitas para ejecutar Qwen3.6 35B en Windows

La configuración utilizada en esta guía es la siguiente:

Componente Configuración
SistemaWindows 10 u 11 de 64 bits
MotorColibrì 1.10.1 para Windows x86-64
ModeloQwen3.6-35B-A3B, int4-gs64
TamañoAproximadamente 20–23 GB
Memoria24 GB mínimo; 32 GB o más recomendados
AlmacenamientoSSD o, preferiblemente, NVMe
Python3.10 o superior
GPUOpcional; el paquete ejecuta Qwen3.6 por CPU

Este modelo tiene 35 mil millones de parámetros totales, pero activa aproximadamente 3 mil millones para cada token. Aunque la arquitectura de Colibrì puede repartir modelos entre RAM, VRAM y disco, este motor necesita que el conjunto completo de expertos resida en RAM. No conviene prometer que funcionará con muy poca memoria.

1. Preparar las carpetas

Abrimos PowerShell y creamos una carpeta para el programa y otra para los modelos:

>_ PowerShell
New-Item -ItemType Directory -Force C:\proyectos\nia\colibri
New-Item -ItemType Directory -Force C:\proyectos\nia\modelos

2. Descargar Colibrì para Windows

Para reproducir esta instalación y lograr ejecutar Qwen3.6 35B en Windows sin errores, usamos la versión 1.10.1 que corrige dependencias de Python:

>_ PowerShell
Invoke-WebRequest `
  -Uri "https://github.com/JustVugg/colibri/releases/download/v1.10.1/colibri-v1.10.1-windows-x86_64.zip" `
  -OutFile "C:\proyectos\nia\colibri-v1.10.1-windows-x86_64.zip"

Expand-Archive `
  -Path "C:\proyectos\nia\colibri-v1.10.1-windows-x86_64.zip" `
  -DestinationPath "C:\proyectos\nia\colibri" `
  -Force

3. Instalar la herramienta de Hugging Face

Instalamos el cliente oficial para descargar el modelo a nuestro equipo:

>_ PowerShell
py -m pip install -U "huggingface_hub[cli]"
hf auth login

4. Descargar el modelo local

Descargamos el contenedor int4-gs64 (aprox. 23 GB divididos en 41 fragmentos):

>_ PowerShell
hf download Kreuzzelg/qwen36-35b-a3b-colibri-i4-gs64 `
  --local-dir C:\proyectos\nia\modelos\qwen36

5. Verificar la instalación

Colibrì incluye doctor, un diagnóstico que revisa el equipo. Para una revisión estricta:

>_ PowerShell
cd C:\proyectos\nia
.\colibri\coli.cmd doctor --deep --model .\modelos\qwen36

6. Iniciar como chat local interactivo

Este es el comando correcto para iniciar una conversación desde la consola:

>_ PowerShell
.\colibri\coli.cmd chat --model .\modelos\qwen36

7. Ejecutar la interfaz web local

La versión visual se inicia cambiando el parámetro chat por web:

>_ PowerShell
.\colibri\coli.cmd web --model .\modelos\qwen36
🚀
Tutorial Recomendado Cómo instalar OpenWA en Windows, corregir errores y desplegar en VPS

8. El detalle de la GPU y nuestro Pull Request

El equipo de prueba tiene una NVIDIA RTX A2000. Colibrì la detectó, pero el archivo ejecutable era CPU-only. El diagnóstico advertía correctamente esto, pero luego sugería ajustes exclusivos de CUDA que confundían al usuario.

Decidimos contribuir al proyecto de código abierto: localizamos el problema, ajustamos el código para que el plan omita la GPU si el binario es solo CPU, añadimos tests y enviamos el PR #1322: fix(doctor): omit GPU plan for CPU-only engine.

💡 Diagnóstico coherente temporal: Mientras se integra nuestro PR, puedes pedir un diagnóstico sin sugerencias de GPU usando: .\colibri\coli.cmd doctor --gpu none --model .\modelos\qwen36
💻
Para ir más allá con la IA Local Guía paso a paso: Instalar OmniRoute, OpenCode y Cline en VSCode

Conclusión

Sí es posible ejecutar Qwen3.6 35B en Windows de forma totalmente local, siempre que tengamos RAM y almacenamiento suficientes. En nuestra instalación, el modelo ocupó unos 23 GB y el chat interactivo funcionó a la perfección. Además, logramos aprender cómo funciona el motor desde dentro y contribuir al ecosistema Open Source mejorando sus diagnósticos.

🤖 Asistente Virtual
¡Hola! 👋

¿En qué te puedo ayudar hoy?