Je reviens sur le sujet après mes précédents articles de 2024 (ca passe vite)
Android
Je recommandais Futo pour Android à l’époque. J’ai trouvé une autre alternative intéressante à vous partager
Le lien https://github.com/notune/android_transcribe_app (apparait comme « Offline Voice Input » sur votre smartphone)
L’installeur APK est disponible sur GitHub et donc vous évite de devoir passer par le PlayStore de Google pour ceux comme moi qui n’ont pas de compte Google.
L’application ne requiert pas la permission d’accéder à Internet. Donc à priori pas d’exfiltration de données et tout le traitement audio fonctionne localement sur votre téléphone.
Par rapport à Futo, la différence se trouve dans le choix des modèles d’ASR (Automatic Speech Recognition). Là où Futo utilise le modèle Whisper (construit par OpenAI), cette appli donne accès à des modèles plus récents que Parakeet (construit par Nvidia)

L’application utilise le moteur de Handy pour effectuer la reconnaissance vocale. le développeur a surtout fait un travail d’intégration par dessus pour nous rendre cela utilisable.
Concrètement, une fois activé le « clavier vocal », vous cliquez sur l’icône du petit micro sur votre clavier Android standard depuis n’importe quelle application et vous avez accès à la reconnaissance vocale.


GNU/Linux et + si affinité
J’ai Murmure et Handy qui me viennent à l’esprit. Ils ont des paquets Debian installables. Mais sont aussi installables sur Mac & Windows.
- Handy permet de changer de modèle très facilement. On peut par exemple utiliser le modèle Cohere Transcribe (4% d’erreur contre 5% pour Parakeet selon ce test)
Les modèles sont stockés dans le dossier ~/.cache/huggingface et sont pas supprimés avec la désinstallation du paquet « handy »

- Murmure a un seul modèle (Parakeet) mais plus d’options utilisateurs comme s’assurer de la conversion des nombres en notation numérique, ou un mode d’écoute continue avec déclenchement de la transcription sur un son clé (« ok alix »). Il me semble consommer 1.3GB de RAM alors que je ne vois rien que 100MB pris par Handy.

Tous les deux permettent l’ajout de mots spécifiques. Je pense que si la prononciation ressemble au mot, alors il utilisera celui ci.
Pour les deux, j’ai du configurer des raccourcis dans Gnome pour déclencher l’enregistrement ("handy --toggle-transcription" & "murmure --transcription") que j’ai configuré sur Ctrl-1 et Ctrl-2 ce qui m’a permis de comparer les deux à l’usage.

Dans les deux, la copie du texte automatiquement à la fin de la transcription ne fonctionne pas. Je pense que c’est un bug no attendu. Je suis obligé de faire un CTRL-V une fois la transcription terminée. (J’utilise Gnome & Wayland si jamais quelqu’un a une solution à me donner). Gênant mais pas rédhibitoire.
Hand