En las últimas semanas, Reddit se ha convertido, sin hacer mucho ruido, en el mejor indicador temprano de cómo Qwen 3.6 cómo funciona en la vida real —no en pruebas de rendimiento ni en blogs de lanzamiento, sino en situaciones reales, con limitaciones de hardware y dependientes de la cadena de herramientas—.
En los subreddits r/LocalLLaMA, r/LocalLLM y r/Qwen_AI destaca una tendencia:
La gente ya no se pregunta: “¿Es inteligente?”.
Preguntan: “¿De verdad puedo usar esto para trabajar de verdad sin perder el tiempo?”
Este artículo resume esos debates en conclusiones concretas y respaldadas por la experiencia, con configuraciones reales, cifras reales y compensaciones reales.

El avance no radica en la inteligencia, sino en Menor fricción
Durante años, las modelos locales han tenido que soportar un impuesto oculto:
- Ellos puede generar código
- Pero dedicas más tiempo a corrección, maquetación, depuración y orientación
- Resultado final: más lento que hacerlo uno mismo
Un usuario de Reddit resumió el cambio introducido con Qwen 3.6:
“Es la primera vez que el beneficio compensa el esfuerzo”.”
Caso práctico real: “Es que no me apetece escribir este código”
- Usuario: Desarrollador independiente / estudiante
- Tareas: XML de la interfaz de usuario de Avalonia, C++ integrado
- Modelo: Qwen3.6-35B-A3B
- Antes de:
- Modelos locales = fijación constante
- El resultado requirió una laboriosa limpieza manual
- En:
- Resultados aceptables con una corrección mínima
- Se utiliza específicamente para código “aburrido pero necesario”, lo que supone un cambio de paradigma De la programación basada en la vibración a la programación basada en los deseos.
Conclusión clave:
Los usuarios no necesitan la perfección, sino que necesitan menos trabajo de corrección.
Es la primera vez que un modelo local supera ese umbral de forma constante.
Rendimiento real: no son pruebas de rendimiento, sino resultados reales del hardware
Los hilos de Reddit están llenos de algo mucho más valioso que las puntuaciones de las clasificaciones: telemetría real del hardware.
Configuración de gama alta (RTX 5090)
- Modelo: Qwen3.6-35B-A3B (GPTQ Int4 / NVFP4)
- Velocidad: ~205 tokens/seg.
- Contexto: ~125 000
- Caso de uso: Programación + flujos de trabajo de los agentes
“Increíblemente rápido para programar”.”
¿Qué ha cambiado?
Antes:
- Has elegido entre:
- Rápido (modelos pequeños)
- Smart (modelos grandes)
Después:
- Qwen 3.6 logra un equilibrio aceptable
Equipos antiguos o de gama media (ordenadores de más de 8 años)
- VRAM: 11 GB
- RAM: 64 GB
- Velocidad: ~29 tokens/seg.
- Contexto: Completo
Esto es fundamental.
Perspicacia:
Qwen 3.6 no solo está creciendo, sino que es reducir la usabilidad.
Rendimiento del flujo de trabajo de los agentes
- Medio ambiente: Hermes-Agent
- Velocidad observada: Más de 100 tokens por segundo
“Verlo funcionar a más de 100 tok/s es una locura”.”
Esto es importante porque:
👉 En los flujos de trabajo de los agentes, rendimiento > inteligencia bruta
27B frente a 35B-A3B: más grande no siempre es mejor
Una de las comparativas más detalladas que se han analizado en Reddit:
- Qwen3.6-27B
- Qwen3.6-35B-A3B
- Qwen3.5-27B
- Gemma 4
Tarea real: Elaboración de un plan director de arquitectura
Resultados (valoraciones de los usuarios):
- Qwen3.6-27B → 9.3 (Mejor valor por defecto)
- Qwen3.6-35B-A3B → 9,2 (Más amplio)
- Gemma 4 → 8,9
- Qwen3.5-27B → 8,8
La diferencia clave
| Modelo | Función |
|---|---|
| 27B | Un “coche para el día a día” fiable” |
| 35B-A3B | Generador de ideas / generador de estructuras |
“El 35B es como una mina de recursos. El 27B es el que realmente usaría a diario”.”
Perspectiva
Los usuarios ya no eligen los modelos en función de la talla.
Están seleccionando por funciones del puesto:
- Editor
- Generador
- Planificador
- Expansor
Se trata de un cambio importante en la forma en que se utiliza la IA local.
La compatibilidad con los agentes es donde Qwen 3.6 realmente destaca
En una de las pruebas más avanzadas realizadas en Reddit, se ejecutó Qwen 3.6 en 5 marcos de trabajo de agentes:
- Agente de Hermes
- PydanticAI
- LangChain
- smolagents
- OpenClaude / Antrópico SDK
Resultados clave (Qwen 3.6 35B, 4 bits)
- Éxito en la ejecución de la herramienta: 100%
- Velocidad: ~100 tok/s
- Contexto: 262 000
- Consumo de memoria: ~20 GB
Qué significa
La mayoría de los modelos fracasan no porque sean tontos, sino porque:
- Interrupción de llamadas de la herramienta
- Incompatibilidad de formatos
- Los agentes se quedan atascados en mitad de una tarea
Qwen 3.6 muestra gran fiabilidad entre distintos marcos.
Pero hay una trampa
Incluso aquí, los usuarios tenían que:
- Añadir controles de tiempo de ejecución
- Instrucciones de uso de la herramienta «Inject» (80-150 tokens)
- Crear capas de análisis personalizadas
Perspicacia:
El modelo está bien, pero… el sistema que lo rodea sigue siendo igual de importante.
El cuello de botella oculto: no es el modelo, sino el arnés
Una de las ideas más importantes (y subestimadas) de Reddit:
La gente está obteniendo mejores resultados no cambiando de modelo, sino cambiando el andamios de agente.
Ajustes de ingeniería reales
Los desarrolladores indicaron que habían añadido:
- Protecciones en tiempo de ejecución
- Reflexionar sobre los presupuestos
- Inyección de uso de herramientas
- Capas de análisis sintáctico estructuradas
Resultado:
👉 Qwen 3.6 pasa a ser competitivo frente a los agentes de programación en la nube, entrando en el ámbito de ChatGPT Codex frente a Claude Code.
Ejemplo: Inyección de herramientas
- Añade Entre 80 y 150 fichas por paso
- Mejora:
- Fiabilidad de las herramientas
- Coherencia en la ejecución
Perspectiva
Estamos entrando en una nueva fase:
El cuello de botella ya no es solo el modelo —
es el diseño del sistema de ejecución.
Dónde sigue fallando (y por qué es importante)
A pesar del entusiasmo, los usuarios de Reddit dejaron muy claras las limitaciones.
1. La llamada a la herramienta aún puede bloquearse
- A veces, modelo se detiene a mitad del proceso
- Es necesario pulsar manualmente “Continuar”
👉 Interrumpe los bucles de automatización completos
2. Compensaciones entre memoria y contexto (especialmente en Mac)
Ejemplo:
- Dispositivo: MacBook Pro M2 (32 GB)
- Era necesario reducir el contexto a 32K para evitar un error de memoria insuficiente (OOM)
- Recomendado: 128 K para tareas complejas
👉 “Funciona” ≠ “funciona bien”
3. Compromisos en la cuantificación
- Las versiones de 4 bits muestran:
- Puntuaciones de referencia más bajas
- Inestabilidad en algunas tareas
4. Sensibilidad del marco
El rendimiento varía en función de:
- Formato de la herramienta (XML frente a JSON)
- Comportamiento del marco
- Diseño del analizador sintáctico
Perspectiva
Qwen 3.6 no es «plug-and-play».
Es «enchufar y diseñar».
Percepción de los precios: ¿competir con modelos cerrados?
Las reacciones en Reddit ante los precios de la API de Qwen 3.6 fueron dispares:
- Algunos se preguntan: “¿Por qué es esto...?» con un precio similar al de Anthropic?”
- Otros: “Sigue siendo más barato que Opus”.”
Lo que esto revela
Los usuarios ya no comparan Qwen con:
- Modelos abiertos
Lo están comparando con:
- Claude (que a menudo se compara con Claude Opus 4.7)
- Grok
- Sistemas cerrados de primera categoría
Perspectiva
Qwen 3.6 está superando una barrera psicológica:
👉 De “alternativa de código abierto”
👉 A “competidor serio”
El gran cambio: la IA local se está adaptando a los flujos de trabajo
En todos los hilos se aprecia claramente una tendencia:
Los usuarios ya no están experimentando.
Son los siguientes:
- Realización de tareas prácticas de programación
- Creación de flujos de trabajo de agentes inmobiliarios
- Redacción de documentos de arquitectura
- Pruebas de los flujos de trabajo de producción
La antigua realidad
- IA local = afición
- Demasiada fricción
- No merece la pena
La nueva realidad (Era Qwen 3.6)
- Apto para:
- Programación
- Planificación
- Flujos de trabajo de los agentes
- Aún hay que configurarlo
- Pero, por fin, merece la pena el esfuerzo
Preguntas frecuentes sobre Qwen 3.6: respuestas a preguntas reales
¿Es capaz Qwen 3.6 de realizar tareas reales de programación?
Sí, sobre todo para la programación estructurada y repetitiva. Los flujos de trabajo complejos requieren una configuración adecuada.
¿Por qué a veces se detiene la ejecución de la herramienta?
Normalmente se debe a problemas de ejecución o de análisis sintáctico. Añadir medidas de seguridad mejora la estabilidad.
¿Son suficientes 32 GB de RAM?
Sí, pero puede que sea necesario reducir el tamaño del contexto, lo que afecta al rendimiento.
¿Qué modelo debería elegir: el 27B o el 35B?
- 27B para el trabajo diario
- 35B para planificación y expansión
¿Afecta la cuantificación al rendimiento?
Sí. Los modelos con menos bits son más rápidos, pero menos estables.
¿Qué marcos de trabajo funcionan mejor?
Los marcos estructurados, como PydanticAI, ofrecen un rendimiento fiable; los marcos más sencillos son más tolerantes.
¿Puede sustituir a los modelos en la nube?
En algunos flujos de trabajo, sí. Para el razonamiento avanzado, los modelos en la nube siguen siendo los líderes.
¿Es adecuado para los flujos de trabajo de investigación?
En parte. Los modelos más grandes ofrecen mejores resultados, pero estos pueden variar.
¿Debería actualizar el hardware u optimizar la configuración?
Optimizar la configuración de tus agentes suele reportar mayores beneficios.
¿En qué se diferencia de Qwen 3.5?
Qwen 3.6 mejora la facilidad de uso, especialmente en los flujos de trabajo de los agentes.
Conclusión final
Qwen 3.6 no gana por ser el modelo más inteligente.
Gana porque:
Por primera vez, un modelo local genera menos empleo del que crea.
Ese es el umbral que importa.
Y según las primeras indicaciones de Reddit:
👉 Acabamos de cruzarlo.


