Transcription locale vérifiée

Whisper local : transcrire un audio gratuitement sur PC en 2026

Le choix utile n'est pas seulement « installer Whisper ». Il faut choisir le bon moteur, le modèle adapté au CPU ou au GPU, puis mesurer la vitesse sur un fichier représentatif.

Par Chris Drakkeng · publié le 4 avril 2026 · vérifié le 27 juillet 2026

Whisper local pour transcrire un fichier audio en texte sur son ordinateur
Verdict court.

Pour débuter sans ligne de commande, utilisez Buzz. Pour un script Python, choisissez faster-whisper. Pour une machine CPU, AMD, Apple Silicon ou un déploiement léger, regardez whisper.cpp. Le paquet OpenAI reste la référence la plus directe pour comprendre le modèle et sa CLI.

1. Quatre façons d'utiliser Whisper en local

Whisper est le modèle de reconnaissance vocale publié par OpenAI. Plusieurs moteurs peuvent exécuter ses poids. Ils n'ont pas les mêmes dépendances, accélérateurs ni interfaces.

Le plus simple Buzz

Interface graphique Windows, macOS et Linux. Import audio ou vidéo, transcription locale, export TXT, SRT et VTT. À privilégier pour un premier essai sans Python.

Référence OpenAI Whisper

Paquet Python et commande officielle. Il nécessite FFmpeg. C'est le chemin le plus proche de la documentation OpenAI.

Python optimisé faster-whisper

Réimplémentation CTranslate2, exécution CPU INT8 ou NVIDIA. Elle décode l'audio via PyAV et n'exige pas un FFmpeg système.

Portable whisper.cpp

Moteur C/C++ avec quantification, CPU, Metal, CUDA, Vulkan et ROCm. Intéressant sur Apple Silicon, AMD, vieux PC et applications embarquées.

À ne pas confondre : le modèle Whisper, son moteur d'inférence et l'interface graphique sont trois éléments distincts. Une erreur CUDA peut venir du moteur ou de ses bibliothèques, pas du fichier audio ni du modèle lui-même.

2. Quel modèle Whisper choisir ?

Le tableau suivant reprend les ordres de grandeur publiés par le dépôt OpenAI. Ce ne sont pas des benchmarks OutilsIA. La vitesse réelle dépend notamment de la langue, de la durée, du moteur, du beam size et du matériel.

Modèle Paramètres VRAM indicative OpenAI Point de départ conseillé
tiny39 Menviron 1 GoTests rapides, CPU modeste, brouillon
base74 Menviron 1 GoCPU et fichiers simples
small244 Menviron 2 GoBon premier essai français sur CPU
medium769 Menviron 5 GoQualité supérieure si le temps reste acceptable
turbo809 Menviron 6 GoTranscription rapide sur GPU compatible
large1 550 Menviron 10 GoQualité à comparer sur audio difficile

Le modèle turbo est une version optimisée de large-v3. OpenAI l'annonce beaucoup plus rapide que le modèle large dans son protocole A100, mais précise que les performances varient fortement en conditions réelles. Il ne convient pas à la traduction vers l'anglais : pour cette tâche, utilisez un modèle multilingue comme medium ou large.

Pas de « 98 % de précision » universel. Une précision unique n'a pas de sens sans corpus de référence. Accent, bruit, noms propres, chevauchement de voix et vocabulaire métier modifient le taux d'erreur.

3. Installer Whisper localement

Option A : Buzz, sans ligne de commande

Téléchargez Buzz depuis son projet officiel, installez un modèle dans les préférences, choisissez un backend local puis importez le fichier. Le projet signale que son installateur Windows n'est pas signé : Windows peut donc afficher un avertissement SmartScreen.

Projet officiel Buzz et téléchargements

Option B : OpenAI Whisper sur Windows

Le dépôt OpenAI documente Python 3.8 à 3.11 et exige l'outil FFmpeg. Dans PowerShell :

py -3.11 -m venv whisper-env
.\whisper-env\Scripts\Activate.ps1
python -m pip install --upgrade pip
pip install -U openai-whisper

# Installer FFmpeg avec un gestionnaire déjà présent :
choco install ffmpeg
# ou
scoop install ffmpeg

Transcrire un fichier français et produire des sous-titres :

whisper reunion.mp3 --model turbo --language French --output_format srt

Option C : OpenAI Whisper sur Ubuntu ou Debian

sudo apt update
sudo apt install ffmpeg python3-venv
python3 -m venv whisper-env
source whisper-env/bin/activate
python -m pip install --upgrade pip
pip install -U openai-whisper
whisper reunion.mp3 --model small --language French --output_format txt

Option D : faster-whisper en Python

Le paquet s'installe avec pip install faster-whisper. Voici un exemple CPU reproductible. L'itération sur segments est importante : l'objet est un générateur et le calcul commence réellement lorsqu'il est parcouru.

from pathlib import Path
from faster_whisper import WhisperModel

audio = "reunion.mp3"
output = Path("reunion.txt")

model = WhisperModel(
    "small",
    device="cpu",
    compute_type="int8",
)

segments, info = model.transcribe(
    audio,
    beam_size=5,
    vad_filter=True,
    language="fr",
)

with output.open("w", encoding="utf-8") as handle:
    for segment in segments:
        line = f"[{segment.start:8.2f} - {segment.end:8.2f}] {segment.text.strip()}"
        print(line)
        handle.write(line + "\n")

Pour un GPU NVIDIA correctement configuré, remplacez le modèle et les options par :

model = WhisperModel(
    "turbo",
    device="cuda",
    compute_type="float16",
)

Compatibilité NVIDIA : la version actuelle de CTranslate2 utilisée par faster-whisper demande CUDA 12 et cuDNN 9. N'installez pas plusieurs toolkits au hasard. Vérifiez d'abord le pilote, la version réellement chargée et la documentation du moteur.

Option E : whisper.cpp

whisper.cpp est le chemin le plus souple pour CPU, Apple Silicon, Vulkan ou ROCm. Il prend aussi en charge des modèles quantifiés. Le projet fournit des instructions CMake, des images Docker et un outil de benchmark. Sa CLI standard attend notamment un WAV 16 bits lorsqu'elle n'est pas compilée avec le support FFmpeg.

Instructions officielles whisper.cpp

4. Mesurer la vitesse et la qualité sans tricher

Une mesure utile doit conserver le même fichier, le même modèle, le même moteur et les mêmes options. Utilisez un extrait de 10 minutes représentatif de votre usage, pas un fichier idéal de quelques secondes.

Mesure Calcul Lecture
Temps total secondes entre lancement et fichier final Inclut chargement du modèle et transcription
Facteur temps réel temps de calcul / durée audio 0,25 signifie 15 min de calcul pour 1 h d'audio
WER substitutions + suppressions + insertions / mots de référence Nécessite une transcription humaine fiable
Mémoire maximale pic RAM ou VRAM observé À relever pendant le même essai

Comparez au minimum small et turbo sur le même extrait français. Le moteur le plus rapide n'est pas forcément le meilleur si des phrases ou noms propres disparaissent. Un benchmark sans qualité de sortie peut récompenser un moteur qui génère moins de texte.

5. Whisper local est-il réellement privé ?

Le traitement peut rester local, mais le mot « Whisper » ne suffit pas à le garantir. Le premier lancement télécharge généralement les poids. Une interface peut aussi proposer un backend API ou un plugin externe.

  • sélectionnez explicitement un moteur local ;
  • désactivez les fonctions cloud inutiles ;
  • vérifiez le dossier où sont stockés les modèles et transcriptions ;
  • testez hors connexion après le téléchargement du modèle ;
  • ne confondez pas transcription locale et résumé cloud.

Whisper puis Ollama

Whisper produit le texte. Un modèle Ollama peut ensuite résumer la réunion, extraire les décisions ou transformer la transcription en notes. Ce sont deux étapes séparées : OutilsIA Local Cockpit peut diagnostiquer la machine et préparer le LLM, mais il ne mesure pas encore Whisper dans son benchmark public.

Questions fréquentes

Whisper fonctionne-t-il gratuitement et sans cloud ?

Oui avec un moteur exécuté localement. Le premier lancement télécharge généralement le modèle. Vérifiez qu'aucune option d'API cloud n'est sélectionnée.

Peut-on utiliser Whisper sans carte graphique ?

Oui. Commencez par tiny, base ou small avec whisper.cpp ou faster-whisper en INT8. La vitesse dépend du processeur et doit être mesurée.

Quel modèle choisir pour le français ?

Commencez par small sur CPU ou turbo avec environ 6 Go de VRAM. Comparez ensuite medium ou large sur un extrait difficile si la qualité est insuffisante.

Ollama transcrit-il directement l'audio ?

Pas dans ce parcours. Whisper produit la transcription, puis un LLM géré par Ollama peut l'analyser ou la résumer.

Sources primaires et projets

Les chiffres de modèles et de mémoire proviennent des projets cités. OutilsIA n'a pas ajouté de vitesse terrain non mesurée à cet article.

Avant de choisir un modèle local pour résumer vos transcriptions

Le scanner Web donne une première estimation. Local Cockpit mesure ensuite le matériel et les modèles Ollama sur la machine. Il ne prétend pas encore benchmarker Whisper.

À retenir

  • Le moteur se choisit selon la machine : Buzz sans ligne de commande, faster-whisper pour un GPU NVIDIA et Python, whisper.cpp pour CPU, AMD ou Apple Silicon.
  • Comparez small et turbo sur un extrait représentatif (2-3 minutes de votre propre audio) avant de transcrire des heures : la qualité et la vitesse dépendent de votre fichier, pas d'un benchmark générique.
  • Coupez la connexion et relancez une transcription : si elle passe, tout tourne bien en local — le modèle est téléchargé une fois, rien ne part dans le cloud.

Sources et liens

Pour étayer Whisper local : transcrire un audio gratuitement sur PC en 2026 et rester sur des faits mesurables :

Du même labo · Strategy Arena
🧪 Donnez un vrai travail à votre GPU

Essayez de tuer une stratégie de trading, en local : votre GPU explore des centaines de variantes, un holdout scellé reste invisible pendant la recherche, et le moteur Rust rend le verdict sur votre machine. App Windows/Linux gratuite — simulation éducative, aucune promesse de gain.

Télécharger le Lab gratuit → Lire : notre GPU a trouvé +172 % — et c'était un mensonge