Commander Flow: un año de evolución de la entrada de voz

En junio de 2025 me dieron una build que se caía cada 40 minutos y reconocía mi «hola» como «o-la-a». Y yo, encantado. Sabía que estaba palpando el prototipo de algo que en Windows no existía: un voice-input completamente offline con un pulido humano. Hoy es abril de 2026 y ese mismo portátil aguanta Commander Flow en segundo plano días enteros.
Esta no es la historia del producto. Es la historia de cómo cambiaron mis hábitos a medida que el producto cambiaba.
Verano de 2025: aprendí a aguantar Whisper-tiny
La primera build usaba ggml-tiny (75 MB). El reconocimiento era pasable en inglés limpio, mediocre en español y catastrófico en mezcla. Dictaba «despliegue en staging» y obtenía «despliegue en estainin». De pulido, ni hablamos: ASR en crudo.
¿Qué hice? Reorganicé mi flujo de trabajo en torno a las debilidades de la herramienta. Hablaba con frases cortas. Evitaba la jerga. Era incómodo, pero seguía siendo más rápido que teclear, y ya estaba enganchado.
«Cuando construyes tu propia herramienta, te enamoras de la idea antes de que el código la refleje con honestidad.»
Otoño de 2025: llegó el pulido y dejé de avergonzarme de las muletillas
Añadí un LLM local. Fue el punto de inflexión. Podía decir «pues mira, eh, yo creo que tendríamos que rehacer este módulo» y en el campo de texto aparecía «Creo que deberíamos rehacer este módulo».
Justo en ese momento dejé de preparar el discurso. Antes formateaba la frase mentalmente antes de pulsar el atajo. Ahora la idea sale como idea y la herramienta separa la paja por sí sola.
Invierno 2025/2026: Parakeet y entendí lo que es «rápido»
En enero el ASR por defecto pasó a ser Parakeet-TDT-0.6B-v3 a través de sherpa-onnx. En mi CPU sin GPU, va 5–10 veces más rápido que Whisper-large. La latencia entre soltar el atajo y ver el texto cayó de ~900 ms a ~140 ms.
140 milisegundos es menos de lo que tardo en notar la pausa. La frontera entre «pulsas el atajo» y «aparece el texto» se diluye en la percepción. A partir de ese momento, dictar dejó de sentirse como «darle una orden a una herramienta»: es solo la continuación de la idea.
Primavera de 2026: la última IA de Google y los modos de pulido
Hoy el estándar es la última IA local de Google. Y lo más importante: los modos de pulido. Elijo el estilo desde la bandeja o con un atajo: business / friendly / minimal-edit / accountant / academic / code-comments.
Mi lunes típico:
- Por la mañana, correos a clientes:
business - En el Slack del equipo:
friendly - Comentarios en el código:
code-comments(mantiene los términos en su escritura original y no «se mete» con los nombres de las variables) - Por la tarde, respuesta al chat de la familia:
minimal-edit(solo limpia las muletillas y no «peina» la entonación)
Retrospectiva: lo que cambió en mí
Si lo enumero, queda aburrido. Lo cuento así. Tras un año con Commander Flow han cambiado tres cosas en mi relación con el texto, y ninguna la planeé.
La primera: las ideas en mis correos son más largas. Teclear corta la frase a lo que físicamente te da tiempo a escribir. La voz no te mete prisa. Los testers notaron que mis informes eran más estructurados antes de que lo notara yo mismo.
La segunda: los correos en inglés dejaron de ponerme nervioso. Dicto en español, pido reescribir en business English y obtengo un texto indistinguible del de un nativo. Ya no es una tensión aparte: es solo el siguiente paso del mismo dictado.
Y la tercera, la más rara: las manos me cansan menos al final del día. Nunca consideré que teclear fuera trabajo físico hasta que dejé de hacerlo.
Las asperezas que pillo
Lista honesta de lo que me roza con regularidad:
El pulido a veces «mejora» términos que no había que mejorar. Digo «kubectl apply» y obtengo «Kubernetes apply». Resuelto con el diccionario en los ajustes (PolishOptions.Dictionary): añades tus términos y el LLM ya no los toca. Pero las primeras semanas no lo sabía y me sorprendía.
Calentamiento del modelo en arranque en frío. El primer dictado tras encender Windows es notablemente más lento que los siguientes. Añadí AudioDeviceWarmup (ahorra 40–80 ms), pero la KV-cache del LLM aún hay que calentarla. Lo arreglo diciendo cualquier frase al micrófono justo después de arrancar el sistema: como un calentamiento.
A veces quiero hot-swap de modos dentro de la misma frase. Por ejemplo: «inicio formal y luego una P.D. con humor». Eso aún no está, pero la dirección me gusta y la tengo presente.
Lo que le diría a mi yo de hace un año
«Aguanta. Lo que ahora parece un juguete, en 10 meses será tu aplicación más usada después del navegador. Lleva un diario. Va a ser la historia de cómo el AI privado en un dispositivo concreto se convierte en la nueva norma.»
La alfa terminó. La beta casi termina. Ya no entrego un prototipo — soy responsable de un producto que se usa a diario.
Y estoy muy orgulloso de ello.
Pruébalo tú mismo
Descarga Commander Flow y mantén pulsado Caps Lock en cualquier aplicación. El reconocimiento se ejecuta localmente, sin nube — el dictado es gratis para siempre.


