Skip to content

Mode vocal : énoncer vos prompts plutôt que de les saisir

📚 Navigation de la série : L'article précédent 46 Configuration de développement a détaillé la configuration de l'environnement de travail de Claude Code. Cette étape revient à un geste quotidien — comment énoncer vos prompts pour les transcrire en texte en temps réel. Une fois la commande /voice activée, maintenez la barre d'espace enfoncée pour parler et insérer le texte dans le champ de saisie, avec la possibilité de combiner saisie vocale et manuelle. Bien que simple en apparence, l'activation requiert de respecter des prérequis stricts sous peine de bloquer dès la première étape.

⚠️ Fonctionnalité expérimentale, sujette à modifications. Les commandes, paramètres et numéros de version présentés s'appuient sur la documentation officielle. Le service étant en cours de développement, les comportements observés sur votre machine peuvent différer de cette présentation, la commande /voice faisant foi.

L'idée de « parler plutôt que d'écrire » est souvent présentée comme un gain de temps. Cependant, pour les développeurs, la saisie vocale s'avère souvent peu adaptée au quotidien — nous saisissons le texte rapidement, et énoncer des noms de variables, de fonctions ou du code écrit en snake_case conduit généralement à des erreurs de transcription fastidieuses à corriger manuellement. L'usage d'outils de reconnaissance vocale grand public pour rédiger des notes techniques montre que des termes comme useEffect sont souvent retranscrits de manière erronée, ce qui conduit à abandonner leur utilisation.

L'implémentation de la reconnaissance vocale dans Claude Code se distingue sur deux aspects : premièrement, elle est configurée pour reconnaître le vocabulaire technique et de programmation (regex, OAuth, JSON, localhost, etc.) ; deuxièmement, elle utilise le nom de votre projet et de la branche git active comme contexte de reconnaissance, ce qui améliore la détection des termes spécifiques à votre codebase par rapport à un outil généraliste.

C'est là que réside sa valeur. Le but n'est pas d'écrire du code à la voix, mais de formuler vos descriptions de tâches — énoncer « refactorise le middleware d'authentification pour utiliser le nouveau helper de validation de jeton » est plus rapide que de saisir chaque mot au clavier. Cet article détaille l'activation, l'utilisation et la résolution des problèmes courants.

Après avoir lu cet article, vous obtiendrez :

  • Une description du fonctionnement de la saisie vocale et du lieu de traitement de la transcription (en ligne)
  • Le prérequis d'authentification indispensable — utilisation exclusive d'un compte Claude.ai, les clés d'API n'étant pas prises en charge
  • Un tableau de compatibilité par plateforme (Mac, Windows, Linux, WSL, sessions distantes, VS Code)
  • Les deux modes d'enregistrement (maintien de touche vs activation par clic) et leurs cas d'usage respectifs
  • Comment activer la saisie par défaut, modifier la langue de transcription et changer le raccourci d'activation
  • Une mise en pratique pas à pas : de l'activation à la première transcription vocale

01 Fonctionnement de la saisie vocale et lieu de traitement

Pour faire simple : la saisie vocale transcrit vos paroles en texte directement dans le champ de saisie — il ne s'agit pas d'une conversation audio avec Claude, mais d'une alternative à la saisie au clavier.

Analogie : le sous-titrage en temps réel d'une réunion. Lors d'une visioconférence, l'activation des sous-titres transcrit vos paroles en texte à l'écran en temps réel — vous ne parlez pas aux sous-titres, l'outil se contente de transcrire votre flux audio. C'est le rôle du mode vocal de Claude Code : maintenir la touche enfoncée insère le texte transcrit dans le champ de saisie, ce texte pouvant ensuite être manipulé de la même manière qu'un texte saisi manuellement — vous pouvez le compléter au clavier avant d'appuyer sur Entrée pour l'envoyer à Claude.

La documentation officielle le décrit ainsi :

Énoncez vos prompts dans le CLI Claude Code au lieu de les saisir. Votre voix est transcrite en temps réel dans le champ de saisie, ce qui vous permet de combiner voix et saisie manuelle dans un même message.

La possibilité de « combiner voix et saisie manuelle » est particulièrement utile. Le texte transcrit est inséré à la position du curseur, ce dernier se plaçant à la fin du bloc inséré, ce qui permet de détailler une tâche à la voix puis de saisir manuellement un nom de fichier ou de fonction précis. C'est un avantage important par rapport à un outil de dictée classique.

Le point suivant détermine l'ensemble des prérequis détaillés ci-après : le flux audio n'est pas traité localement sur votre machine. La documentation officielle le précise :

Le mode vocal transmet votre flux audio enregistré aux serveurs d'Anthropic pour traitement. L'audio n'est pas traité localement.

L'envoi du flux audio aux serveurs d'Anthropic implique trois conséquences : premièrement, une connexion internet active est requise ; deuxièmement, l'authentification par compte Claude.ai est obligatoire pour identifier l'utilisateur ; troisièmement, les environnements distants sans accès au microphone local ne sont pas pris en charge.

Notez également que la transcription vocale est gratuite et ne consomme pas de crédits. La documentation officielle l'indique :

La transcription ne consomme pas de messages ou de jetons Claude, et n'est pas comptabilisée dans les limites affichées par la commande /usage.

L'utilisation de la saisie vocale n'altère pas votre quota d'abonnement (voir article 06 pour le détail de la tarification). Vous pouvez le vérifier à l'aide de la commande /usage — la consommation reste inchangée après plusieurs transcriptions. Vous pouvez donc utiliser cette fonctionnalité sans contrainte de coût.

💡 Résumé en une phrase : Le mode vocal remplace la saisie clavier par la parole ; le texte transcrit s'utilise comme un texte saisi manuellement et peut être complété au clavier ; le traitement est effectué sur les serveurs d'Anthropic sans affecter votre quota d'utilisation /usage.


02 Authentification : compte Claude.ai requis, clés d'API non supportées

Il s'agit du principal point de blocage lors de la première utilisation.

Le traitement audio s'effectuant sur les serveurs d'Anthropic, ces derniers doivent identifier votre session. Le mode vocal requiert donc une authentification par compte Claude.ai. Les cas suivants ne sont pas pris en charge :

Le service de transcription vocale est uniquement disponible lors de l'authentification avec un compte Claude.ai. Il n'est pas disponible lorsque Claude Code est configuré avec une clé d'API Anthropic directe, Amazon Bedrock, Google Vertex AI ou Microsoft Foundry. Le mode vocal est également indisponible si votre organisation a activé la conformité HIPAA.

Pour faire le lien avec les articles 04 et 05 :

  • Authentification par compte Claude.ai (abonnements Pro / Max) : ✅ Mode vocal disponible.
  • Configuration par clé d'API Anthropic ou accès via Bedrock / Vertex / Foundry : ❌ Mode vocal indisponible.
  • Compte avec conformité HIPAA active : ❌ Mode vocal indisponible.

Cette restriction technique s'explique par l'intégration du service de transcription au sein de l'infrastructure des comptes Claude.ai.

Pour identifier votre mode de connexion, tentez d'activer la commande /voice. Si vous utilisez une clé d'API, le message d'erreur suivant s'affichera :

text
Voice mode requires a Claude.ai account

Si ce message apparaît, l'accès au microphone n'est pas en cause ; l'erreur provient du mode d'authentification. Utilisez la commande /login pour vous connecter avec un compte Claude.ai compatible. Ce message d'erreur est fréquent lors des tests sur des machines configurées with des clés d'API d'entreprise.

Mode de connexionCompatibilité mode vocal
Compte Claude.ai (abonnements Pro / Max)✅ Supporté
Clé d'API Anthropic❌ Non supporté (erreur requires a Claude.ai account)
Amazon Bedrock / Google Vertex / Microsoft Foundry❌ Non supporté
Conformité HIPAA active❌ Non supporté

💡 Résumé en une phrase : Le mode vocal requiert une authentification par compte Claude.ai ; les clés d'API, les accès Bedrock, Vertex, Foundry ou les profils HIPAA ne sont pas compatibles. Utilisez /login pour basculer de mode de connexion en cas d'erreur.


03 Accès matériel : microphone local requis et compatibilité des plateformes

Outre l'authentification, le système requiert un accès matériel au microphone pour enregistrer le flux audio avant son envoi. Ce prérequis limite l'usage de la fonctionnalité dans certains environnements de travail.

Analogie : la présence physique d'un microphone. Même doté d'un moteur de transcription performant, le système doit pouvoir capter le son. Parler devant une machine ne disposant pas de microphone connecté ne permet pas la transcription. Le mode vocal requiert l'accès au microphone de la machine hôte, ce qui exclut les cas où l'utilisateur est distant de la machine exécutant le processus.

La documentation officielle le précise :

Le mode vocal requiert un accès au microphone local, il ne fonctionne donc pas dans les environnements distants tels que Claude Code sur le web ou au sein d'une session SSH.

Voici la compatibilité selon les environnements :

Plateforme / EnvironnementCompatibilitéRemarques
macOS✅ SupportéDemande d'autorisation système d'accès au microphone lors du premier appel à /voice
Windows✅ SupportéActiver l'accès au microphone pour l'application de terminal dans les paramètres système
Linux✅ SupportéModule natif avec repli sur arecord ou rec en cas de besoin
WSL⚠️ PartielRequiert WSLg (inclus par défaut dans WSL2 sur Windows 10/11) ; non supporté sous WSL1 (exécuter Claude Code sur Windows directement)
Session SSH❌ Non supportéLe microphone est sur la machine locale tandis que le processus s'exécute sur le serveur distant
Claude Code sur le web❌ Non supportéEnvironnement hébergé sans accès au microphone local (voir article 11)
Extension VS Code✅ SupportéRequiert un compte Claude.ai ; non supporté en mode VS Code Remote (SSH / Dev Containers / Codespaces)

Détails concernant les environnements spécifiques :

Les sessions distantes ne sont pas compatibles (SSH, version web dans le navigateur ou extension VS Code en mode Remote). Le processus s'exécutant sur le serveur distant ne peut pas accéder physiquement au microphone de votre machine locale. La documentation de l'extension VS Code le précise :

Non disponible dans les sessions VS Code Remote (SSH, Dev Containers et Codespaces), le microphone étant sur la machine locale tandis que l'extension s'exécute sur l'hôte distant.

L'environnement WSL requiert le support de WSLg. WSLg gère l'affichage graphique et les flux audio sous WSL2. Si vous utilisez WSL1 ou une configuration WSL2 sans support audio, la saisie vocale ne fonctionnera pas. Il est alors conseillé d'exécuter Claude Code directement sous Windows.

Sous Linux, l'outil signale les dépendances manquantes. Le système tente d'utiliser le module natif, et se replie sur les outils système arecord (ALSA) ou rec (SoX). Si ces paquets sont absents, la commande /voice affiche la commande d'installation appropriée (par exemple sudo apt-get install sox) pour configurer le système.

💡 Résumé en une phrase : La capture audio s'effectue sur le microphone local ; le mode vocal est compatible en local sous macOS, Windows, Linux et WSL2 (avec WSLg), mais est incompatible avec les sessions SSH, la version web ou VS Code Remote.


04 Les deux modes d'enregistrement : maintien de touche ou activation par clic

Une fois les prérequis validés, deux modes de fonctionnement sont disponibles via la commande /voice pour contrôler l'enregistrement.

Analogie : l'usage d'un talkie-talkie vs un dictaphone. Le mode talkie-talkie requiert de maintenir le bouton enfoncé pendant que l'on parle (mode maintien de touche) ; le mode dictaphone démarre et s'arrête par un clic successif sans maintien continu (mode clic). Choisissez le mode adapté à vos habitudes.

Comparatif des deux modes de fonctionnement :

ModeDéclenchementFin d'enregistrementEnvoi du messageUsage recommandé
Maintien (hold) (par défaut)Maintenir SpaceRelâcher SpaceSaisie manuelle complémentaire puis Entrée (envoi automatique paramétrable)Insertion précise de phrases au sein d'une saisie mixte
Clic (tap)Appuyer brièvement sur SpaceAppuyer de nouveau sur SpaceEnvoi automatique si la saisie comporte au moins 3 motsFormulation de prompts complets d'une seule traite

Mode Maintien (par défaut) : maintien de touche pour enregistrer

Le mode maintien fonctionne sur le principe du Push-to-Talk : maintenez la barre d'espace Space enfoncée pour enregistrer, et relâchez-la pour terminer. C'est le mode actif par défaut lors de l'appel à /voice.

Notez un point de fonctionnement lors de la première utilisation : le mode maintien présente un léger délai d'activation. Claude Code s'appuie sur la répétition de l'événement d'appui sur la touche dans le terminal pour détecter le maintien. Le message keep holding... s'affiche brièvement avant l'activation de la capture audio et l'affichage de l'indicateur graphique. La documentation officielle précise :

Les premiers caractères générés par la répétition de la touche pendant la phase d'activation sont insérés puis supprimés automatiquement dès que l'enregistrement débute. Un appui bref sur Space insère un simple espace, la détection du maintien ne se déclenchant que lors d'un appui prolongé.

En clair : les caractères parasites saisis pendant le délai d'activation sont nettoyés automatiquement par l'outil, et un appui court sur la barre d'espace conserve son comportement habituel d'insertion d'espace sans déclencher l'enregistrement.

Le texte transcrit s'affiche en temps réel dans le champ de saisie (dans un ton grisé avant validation). Relâcher la touche fige le texte à la position du curseur. Vous pouvez répéter l'opération pour ajouter du texte. Exemple d'utilisation mixte :

text
> refactor the auth middleware to ▮
  # Maintenir la barre d'espace Space enfoncée et dire : "use the new token validation helper"
> refactor the auth middleware to use the new token validation helper▮

Par défaut, le message n'est pas envoyé automatiquement après relâchement de la touche, vous permettant de le relire ou de le compléter au clavier. Pour envoyer le message dès relâchement de la touche, activez l'option autoSubmit (détaillée à la section suivante). Le message est alors envoyé automatiquement si la transcription comporte au moins trois mots.

Mode Clic : activation et arrêt par appuis successifs

Le mode clic fonctionne par bascule : appuyez brièvement sur la touche Space pour démarrer l'enregistrement, parlez, puis appuyez de nouveau sur Space pour arrêter l'enregistrement et envoyer le message. Ce mode ne présente pas de délai d'activation ni de contrainte de maintien.

Activez ce mode à l'aide de la commande /voice tap. Notez que ce mode requiert une version récente de Claude Code. La documentation officielle précise :

Le mode vocal requiert Claude Code v2.1.69 ou supérieur. Le mode clic (tap) requiert la version v2.1.116 ou supérieur.

Vérifiez votre version à l'aide de claude --version si la commande /voice tap n'est pas reconnue.

Le mode clic intègre deux sécurités pour éviter les erreurs de saisie :

  • L'enregistrement ne se déclenche que si le champ de saisie est vide lors du premier appui sur Space, ce qui permet d'insérer des espaces normalement lors de la saisie manuelle d'un message.
  • Si la transcription comporte moins de trois mots, le texte est inséré mais le message n'est pas envoyé automatiquement, évitant l'envoi accidentel d'un mot isolé suite à un double appui rapide.

L'enregistrement s'interrompt également de manière automatique après 15 secondes de silence ou après une durée maximale de 2 minutes.

À l'usage, le mode clic est souvent privilégié pour sa réactivité ; il évite le délai d'activation du mode maintien et l'envoi automatique facilite l'enchaînement des commandes. Le mode maintien reste adapté pour insérer ponctuellement des phrases au milieu d'une saisie de texte complexe.

💡 Résumé en une phrase : Deux modes de capture — maintien (hold) (maintenir Space pour enregistrer, relâcher pour insérer sans envoyer) et clic (tap) (appuyer sur Space pour démarrer/arrêter et envoyer automatiquement, requiert la version v2.1.116+).


05 Personnalisation : activation par défaut, langue et raccourci clavier

Ces trois réglages permettent d'adapter le mode vocal à vos préférences de travail.

Activation automatique au lancement

Pour activer le mode vocal automatiquement lors de l'ouverture de Claude Code sans avoir à saisir /voice à chaque session, ajoutez la configuration suivante dans votre fichier de paramètres utilisateur settings.json (voir article 31) :

json
{
  "voice": {
    "enabled": true,
    "mode": "tap"
  }
}

Renseignez la clé enabled sur true et définissez le mode par défaut (hold ou tap) à l'aide de la clé mode.

Pour activer l'envoi automatique dès la fin de l'enregistrement en mode maintien, ajoutez l'option autoSubmit dans le bloc voice :

json
{
  "voice": {
    "enabled": true,
    "mode": "hold",
    "autoSubmit": true
  }
}

Sélection de la langue de transcription

Ce point est important pour les utilisateurs non anglophones. Le système est configuré en anglais par défaut — parler dans une autre langue sans modifier ce paramètre entraînera des erreurs de transcription. La documentation officielle précise que la langue de dictée s'aligne sur le paramètre de langue générale de Claude :

Le service s'appuie sur la configuration générale de langue language. Si ce paramètre est vide, le système utilise l'anglais par défaut.

Les langues prises en charge pour la transcription vocale sont définies par une liste restreinte : allemand, anglais, danois, espagnol, finnois, français, grec, hindi, indonésien, italien, japonais, coréen, norvégien, néerlandais, polonais, portugais, russe, suédois, turc, ukrainien et tchèque. Configurez la langue de votre choix si elle figure dans cette liste.

Pour modifier la langue, utilisez la commande /config ou éditez directement votre fichier de paramètres en renseignant le nom de la langue ou son code BCP 47 :

json
{
  "language": "french"
}

Si la langue configurée ne figure pas dans la liste des langues prises en charge par le service de transcription, un avertissement s'affiche lors de l'activation du mode vocal et la reconnaissance se replie sur l'anglais (cela n'affecte pas la langue des réponses textuelles de Claude).

Personnalisation de la touche de déclenchement

La touche de déclenchement par défaut est la barre d'espace Space. Pour associer la fonction à une autre touche, éditez le fichier ~/.claude/keybindings.json (voir article 14 pour la gestion des raccourcis) en modifiant l'action voice:pushToTalk :

json
{
  "bindings": [
    {
      "context": "Chat",
      "bindings": {
        "meta+k": "voice:pushToTalk",
        "space": null
      }
    }
  ]
}

Respectez cette consigne de la documentation officielle pour le mode maintien :

En mode maintien (hold), évitez d'associer l'action à une simple touche alphabétique (comme v), la détection s'appuyant sur la répétition de la touche qui insérerait le caractère dans le champ de saisie pendant la phase d'activation.

Associez l'action à une combinaison de touches (comme meta+k) pour éviter ce comportement en mode maintien. La combinaison de touches déclenche l'enregistrement immédiatement sans délai d'activation. Cette contrainte ne s'applique pas au mode clic.

💡 Résumé en une phrase : Configurez le mode vocal avec l'option voice.enabled dans settings.json, définissez la langue avec le paramètre language (le français est pris en charge), et modifiez la touche de déclenchement via l'action voice:pushToTalk dans keybindings.json (privilégiez une combinaison de touches).


06 Mise en pratique : de l'activation à la première transcription vocale

Appliquons ces étapes dans un cas simple. Vérifiez au préalable que vous utilisez un compte Claude.ai compatible (voir section 02) et que vous exécutez l'outil en local sur une machine dotée d'un microphone.

Étape 0 : Vérifier la version de Claude Code (dans votre terminal)

bash
claude --version

Résultat attendu : Le numéro de version doit être supérieur ou égal à v2.1.69 (et v2.1.116 pour tester le mode clic). Mettez à jour l'outil si nécessaire.

Étape 1 : Activer le mode vocal dans une session

Saisissez dans votre session claude active :

text
/voice

Résultat attendu : Lors de la première activation, le système d'exploitation sollicite l'accès au microphone (sous macOS, acceptez l'invite système). Le terminal affiche ensuite la confirmation suivante :

text
Voice mode enabled (hold). Hold Space to record. Dictation language: fr (/config to change).

L'affichage de ce message confirme l'activation. Si un message d'erreur de type requires a Claude.ai account s'affiche, reportez-vous à la section 02 pour modifier votre mode de connexion à l'aide de la commande /login.

Étape 2 : Repérer l'indicateur graphique

Lorsque le champ de saisie est vide, la ligne d'état du terminal affiche la mention hold Space to speak indiquant que la fonction est prête.

Étape 3 : Effectuer un enregistrement en mode maintien

Maintenez la barre d'espace Space enfoncée et énoncez de manière claire une consigne simple (en français si configuré, ou en anglais) :

text
# Maintenir la barre d'espace Space enfoncée et dire : list all files in the current directory

Résultat attendu : L'indicateur graphique de capture s'affiche dans le terminal. Lorsque vous relâchez la touche Space, le texte transcrit est inséré dans le champ de saisie :

text
> list all files in the current directory▮

Le message reste en attente de validation sans envoi automatique.

Étape 4 : Compléter la saisie manuellement

Ajoutez du texte au clavier à la suite de la transcription pour tester le fonctionnement mixte :

text
> list all files in the current directory and show their sizes▮

Appuyez sur Entrée pour envoyer le message. Claude traite la demande normalement, confirmant que le texte transcrit est traité de la même manière qu'une saisie manuelle.

Étape 5 : Tester le mode clic (requiert la version v2.1.116+)

Activez le mode clic :

text
/voice tap

Videz le champ de saisie, puis appuyez brièvement sur Space (sans maintenir la touche enfoncée). Énoncez une phrase d'au moins trois mots, puis appuyez de nouveau sur Space.

Résultat attendu : L'enregistrement s'interrompt lors du second appui et le message contenant la transcription est envoyé automatiquement à Claude. Ce mode évite le délai d'activation du mode maintien.

Étape 6 : Désactiver le mode vocal

Saisissez :

text
/voice off

Résultat attendu : Le terminal confirme la désactivation du mode vocal, les indicateurs graphiques disparaissent et la touche Space retrouve son comportement habituel.

Ce test valide l'ensemble du flux de travail de la saisie vocale. Vous pouvez désormais configurer ces options de manière permanente dans votre fichier de paramètres si vous souhaitez utiliser cette fonctionnalité régulièrement.

💡 Résumé en une phrase : Testez le mode vocal en exécutant /voice, maintenez Space pour dicter un prompt de test, complétez-le manuellement pour valider l'usage mixte, puis essayez le mode clic avec /voice tap avant de désactiver avec /voice off.


07 Synthèse

Dans cet article, nous avons détaillé le fonctionnement et la configuration du mode vocal de Claude Code.

Récapitulatif des concepts clés :

SujetFonctionnement / RéglagePoint clé
DescriptionTranscription vocale en temps réelTraitement sur les serveurs d'Anthropic ; ne consomme pas de crédits /usage
AuthentificationCompte Claude.ai requisIncompatible avec les clés d'API, les connexions Bedrock/Vertex/Foundry et HIPAA
MatérielMicrophone local requisIncompatible avec SSH, la version web ou VS Code Remote
Modeshold (maintien) / tap (clic)Mode clic (v2.1.116+) recommandé pour la réactivité et l'envoi automatique
ConfigurationParamètres voice.enabled et languageLe français est supporté ; modifier la touche via voice:pushToTalk

Vous êtes désormais en mesure de : configurer le mode vocal dans Claude Code, valider les prérequis d'authentification et de matériel, choisir le mode d'enregistrement adapté (maintien ou clic), modifier la langue de dictée et changer la touche de déclenchement. Cette fonctionnalité est particulièrement utile pour formuler de longues descriptions de tâches sans avoir à les saisir entièrement au clavier.

Le mode vocal offre une alternative de saisie efficace pour les phases de description de tâches ou de conception, le clavier restant l'outil privilégié pour les modifications de code précises.


L'article suivant 48 « Projet pratique : mise en œuvre complète » propose un exercice de synthèse : réaliser un projet de bout en bout. Nous utiliserons l'ensemble des outils abordés dans cette série (installation de l'environnement, rédaction des consignes, serveurs MCP, sous-agents et gestion des versions avec git) pour concevoir et déployer une application à partir d'un dossier vide, illustrant l'articulation de ces composants dans un cas réel.


Lectures recommandées