Commander Flow : un an d'évolution de la saisie vocale

En juin 2025, on m'a confié une build qui plantait toutes les 40 minutes et qui transcrivait mon « bonjour » en « bon — eu — uh ». J'étais ravi. Je comprenais que je tenais entre les mains le prototype de quelque chose qui n'existait pas sous Windows : un voice-input entièrement hors ligne avec une mise au propre humaine. Aujourd'hui, en avril 2026, le même ordinateur portable fait tourner Commander Flow en arrière-plan des journées entières.
Ce n'est pas l'histoire d'un produit. C'est l'histoire de la façon dont mes habitudes ont changé à mesure que le produit changeait.
Été 2025 : j'apprenais à supporter Whisper-tiny
La première build utilisait ggml-tiny (75 Mo). La reconnaissance était correcte en anglais propre, médiocre en français, catastrophique en mode mixte. Je dictais « déploie sur staging » et j'obtenais « déploie sur stâgeing ». À l'époque, il n'y avait aucune mise au propre — juste de l'ASR brut.
Comment je m'en sortais ? J'ai reconfiguré ma façon de travailler autour des faiblesses de l'outil. Je parlais par phrases courtes. J'évitais l'argot. C'était inconfortable, mais quand même plus rapide que la frappe — et j'étais déjà accro.
« Quand tu construis ton propre outil, tu tombes amoureux de l'idée avant que le code ne la reflète honnêtement. »
Automne 2025 : la mise au propre arrive et j'arrête de me censurer
J'ai ajouté un LLM local. Ça a été la rupture. Je pouvais dire « bon en fait je pense qu'il faut euh refaire ce module-là », et le champ texte affichait « Je pense qu'il faut refaire ce module ».
C'est précisément à ce moment-là que j'ai cessé de préparer ma diction. Auparavant, je formatais mentalement la phrase avant d'appuyer sur le raccourci. Maintenant, la pensée sort comme une pensée et l'outil sépare lui-même le bon grain de l'ivraie.
Hiver 2025/2026 : Parakeet, et j'ai compris ce que veut dire « rapide »
En janvier, l'ASR par défaut est devenu Parakeet-TDT-0.6B-v3 via sherpa-onnx. Sur mon CPU sans carte graphique, il est 5 à 10 fois plus rapide que Whisper-large. La latence entre le relâchement du raccourci et l'apparition du texte est passée de ~900 ms à ~140 ms.
140 millisecondes, c'est moins que le temps qu'il me faut pour percevoir la pause. La frontière entre « j'appuie » et « le texte apparaît » s'efface dans la perception. À partir de là, la dictée a cessé d'être ressentie comme « une commande à un outil » ; c'est simplement le prolongement de la pensée.
Printemps 2026 : la dernière IA de Google et les modes de mise au propre
Aujourd'hui, le standard est la dernière IA de Google. Et surtout, les modes de mise au propre. Je choisis le style depuis la barre des tâches ou avec un raccourci : business / friendly / minimal-edit / accountant / academic / code-comments.
Mon lundi typique :
- Le matin, e-mails clients :
business - Sur Slack avec l'équipe :
friendly - Commentaires de code :
code-comments(préserve les termes en latin, ne touche pas aux noms de variables) - Le soir, réponse au groupe des parents d'élèves :
minimal-edit(nettoie les tics, ne « lisse » pas le ton)
Rétrospective : ce qui a changé en moi
Si je liste en bullet points, ce sera ennuyeux. Alors je le dirai autrement. En un an d'usage de Commander Flow, trois choses ont changé dans mon rapport au texte, et aucune n'était prévue.
D'abord, les pensées dans mes e-mails sont plus longues. La frappe coupe la phrase à ce qu'on a physiquement le temps de taper. La voix ne presse pas. Les testeurs ont remarqué que mes rapports étaient plus structurés avant que je ne le remarque moi-même.
Ensuite, les e-mails en anglais ont cessé de m'angoisser. Je dicte en français, je demande à reformuler en business English, j'obtiens un texte qu'on ne distingue pas de celui d'un natif. Ce n'est plus une tension à part, juste l'étape suivante de la même dictée.
Et la troisième, la plus étrange : mes mains sont moins fatiguées en fin de journée. Je n'avais jamais considéré la frappe comme un travail physique, jusqu'à ce que j'arrête.
Les aspérités que je rencontre
Liste honnête de ce qui m'accroche régulièrement :
La mise au propre « améliore » parfois des termes qu'il ne fallait pas améliorer. Je dis « kubectl apply », j'obtiens « Kubernetes apply ». Réglé via le dictionnaire dans les paramètres (PolishOptions.Dictionary) : on ajoute ses termes et le LLM ne les touche plus. Mais les premières semaines, je l'ignorais et ça me surprenait.
Préchauffage du modèle au démarrage à froid. La première dictée après le démarrage de Windows est nettement plus lente que les suivantes. J'ai ajouté AudioDeviceWarmup (économise 40 à 80 ms), mais le KV-cache du LLM doit malgré tout chauffer. Je règle ça en disant n'importe quelle phrase au micro juste après le démarrage — comme un échauffement.
Parfois, je voudrais un hot-swap des modes au sein d'une même phrase. Par exemple : « début professionnel, puis P.S. amusant ». Pas encore disponible — mais la direction me plaît, et je la garde en tête.
Ce que je dirais à moi-même il y a un an
« Tiens bon. Ce qui ressemble aujourd'hui à un jouet sera dans 10 mois ton application la plus utilisée après le navigateur. Tiens un journal. Ce sera l'histoire de comment l'IA privée sur un appareil concret devient la nouvelle norme. »
L'alpha est terminée. La bêta est presque terminée. Je ne livre plus un prototype — je suis responsable d'un produit utilisé chaque jour.
Et j'en suis très fier.
Essayez vous-même
Téléchargez Commander Flow et maintenez Caps Lock dans n'importe quelle application. La reconnaissance s'exécute localement, sans cloud — la dictée est gratuite pour toujours.


