Transcription locale vérifiée
Whisper local : transcrire un audio gratuitement sur PC en 2026
Le choix utile n'est pas seulement « installer Whisper ». Il faut choisir le bon moteur, le modèle adapté au CPU ou au GPU, puis mesurer la vitesse sur un fichier représentatif.
Pour débuter sans ligne de commande, utilisez Buzz. Pour un script Python, choisissez faster-whisper. Pour une machine CPU, AMD, Apple Silicon ou un déploiement léger, regardez whisper.cpp. Le paquet OpenAI reste la référence la plus directe pour comprendre le modèle et sa CLI.
1. Quatre façons d'utiliser Whisper en local
Whisper est le modèle de reconnaissance vocale publié par OpenAI. Plusieurs moteurs peuvent exécuter ses poids. Ils n'ont pas les mêmes dépendances, accélérateurs ni interfaces.
Interface graphique Windows, macOS et Linux. Import audio ou vidéo, transcription locale, export TXT, SRT et VTT. À privilégier pour un premier essai sans Python.
Paquet Python et commande officielle. Il nécessite FFmpeg. C'est le chemin le plus proche de la documentation OpenAI.
Réimplémentation CTranslate2, exécution CPU INT8 ou NVIDIA. Elle décode l'audio via PyAV et n'exige pas un FFmpeg système.
Moteur C/C++ avec quantification, CPU, Metal, CUDA, Vulkan et ROCm. Intéressant sur Apple Silicon, AMD, vieux PC et applications embarquées.
À ne pas confondre : le modèle Whisper, son moteur d'inférence et l'interface graphique sont trois éléments distincts. Une erreur CUDA peut venir du moteur ou de ses bibliothèques, pas du fichier audio ni du modèle lui-même.
2. Quel modèle Whisper choisir ?
Le tableau suivant reprend les ordres de grandeur publiés par le dépôt OpenAI. Ce ne sont pas des benchmarks OutilsIA. La vitesse réelle dépend notamment de la langue, de la durée, du moteur, du beam size et du matériel.
| Modèle | Paramètres | VRAM indicative OpenAI | Point de départ conseillé |
|---|---|---|---|
tiny | 39 M | environ 1 Go | Tests rapides, CPU modeste, brouillon |
base | 74 M | environ 1 Go | CPU et fichiers simples |
small | 244 M | environ 2 Go | Bon premier essai français sur CPU |
medium | 769 M | environ 5 Go | Qualité supérieure si le temps reste acceptable |
turbo | 809 M | environ 6 Go | Transcription rapide sur GPU compatible |
large | 1 550 M | environ 10 Go | Qualité à comparer sur audio difficile |
Le modèle turbo est une version optimisée de large-v3. OpenAI l'annonce beaucoup plus rapide que le modèle large dans son protocole A100, mais précise que les performances varient fortement en conditions réelles. Il ne convient pas à la traduction vers l'anglais : pour cette tâche, utilisez un modèle multilingue comme medium ou large.
Pas de « 98 % de précision » universel. Une précision unique n'a pas de sens sans corpus de référence. Accent, bruit, noms propres, chevauchement de voix et vocabulaire métier modifient le taux d'erreur.
3. Installer Whisper localement
Option A : Buzz, sans ligne de commande
Téléchargez Buzz depuis son projet officiel, installez un modèle dans les préférences, choisissez un backend local puis importez le fichier. Le projet signale que son installateur Windows n'est pas signé : Windows peut donc afficher un avertissement SmartScreen.
Projet officiel Buzz et téléchargements
Option B : OpenAI Whisper sur Windows
Le dépôt OpenAI documente Python 3.8 à 3.11 et exige l'outil FFmpeg. Dans PowerShell :
py -3.11 -m venv whisper-env
.\whisper-env\Scripts\Activate.ps1
python -m pip install --upgrade pip
pip install -U openai-whisper
# Installer FFmpeg avec un gestionnaire déjà présent :
choco install ffmpeg
# ou
scoop install ffmpeg
Transcrire un fichier français et produire des sous-titres :
whisper reunion.mp3 --model turbo --language French --output_format srt
Option C : OpenAI Whisper sur Ubuntu ou Debian
sudo apt update
sudo apt install ffmpeg python3-venv
python3 -m venv whisper-env
source whisper-env/bin/activate
python -m pip install --upgrade pip
pip install -U openai-whisper
whisper reunion.mp3 --model small --language French --output_format txt
Option D : faster-whisper en Python
Le paquet s'installe avec pip install faster-whisper. Voici un exemple CPU reproductible. L'itération sur segments est importante : l'objet est un générateur et le calcul commence réellement lorsqu'il est parcouru.
from pathlib import Path
from faster_whisper import WhisperModel
audio = "reunion.mp3"
output = Path("reunion.txt")
model = WhisperModel(
"small",
device="cpu",
compute_type="int8",
)
segments, info = model.transcribe(
audio,
beam_size=5,
vad_filter=True,
language="fr",
)
with output.open("w", encoding="utf-8") as handle:
for segment in segments:
line = f"[{segment.start:8.2f} - {segment.end:8.2f}] {segment.text.strip()}"
print(line)
handle.write(line + "\n")
Pour un GPU NVIDIA correctement configuré, remplacez le modèle et les options par :
model = WhisperModel(
"turbo",
device="cuda",
compute_type="float16",
)
Compatibilité NVIDIA : la version actuelle de CTranslate2 utilisée par faster-whisper demande CUDA 12 et cuDNN 9. N'installez pas plusieurs toolkits au hasard. Vérifiez d'abord le pilote, la version réellement chargée et la documentation du moteur.
Option E : whisper.cpp
whisper.cpp est le chemin le plus souple pour CPU, Apple Silicon, Vulkan ou ROCm. Il prend aussi en charge des modèles quantifiés. Le projet fournit des instructions CMake, des images Docker et un outil de benchmark. Sa CLI standard attend notamment un WAV 16 bits lorsqu'elle n'est pas compilée avec le support FFmpeg.
4. Mesurer la vitesse et la qualité sans tricher
Une mesure utile doit conserver le même fichier, le même modèle, le même moteur et les mêmes options. Utilisez un extrait de 10 minutes représentatif de votre usage, pas un fichier idéal de quelques secondes.
| Mesure | Calcul | Lecture |
|---|---|---|
| Temps total | secondes entre lancement et fichier final | Inclut chargement du modèle et transcription |
| Facteur temps réel | temps de calcul / durée audio | 0,25 signifie 15 min de calcul pour 1 h d'audio |
| WER | substitutions + suppressions + insertions / mots de référence | Nécessite une transcription humaine fiable |
| Mémoire maximale | pic RAM ou VRAM observé | À relever pendant le même essai |
Comparez au minimum small et turbo sur le même extrait français. Le moteur le plus rapide n'est pas forcément le meilleur si des phrases ou noms propres disparaissent. Un benchmark sans qualité de sortie peut récompenser un moteur qui génère moins de texte.
5. Whisper local est-il réellement privé ?
Le traitement peut rester local, mais le mot « Whisper » ne suffit pas à le garantir. Le premier lancement télécharge généralement les poids. Une interface peut aussi proposer un backend API ou un plugin externe.
- sélectionnez explicitement un moteur local ;
- désactivez les fonctions cloud inutiles ;
- vérifiez le dossier où sont stockés les modèles et transcriptions ;
- testez hors connexion après le téléchargement du modèle ;
- ne confondez pas transcription locale et résumé cloud.
Whisper puis Ollama
Whisper produit le texte. Un modèle Ollama peut ensuite résumer la réunion, extraire les décisions ou transformer la transcription en notes. Ce sont deux étapes séparées : OutilsIA Local Cockpit peut diagnostiquer la machine et préparer le LLM, mais il ne mesure pas encore Whisper dans son benchmark public.
Questions fréquentes
Whisper fonctionne-t-il gratuitement et sans cloud ?
Oui avec un moteur exécuté localement. Le premier lancement télécharge généralement le modèle. Vérifiez qu'aucune option d'API cloud n'est sélectionnée.
Peut-on utiliser Whisper sans carte graphique ?
Oui. Commencez par tiny, base ou small avec whisper.cpp ou faster-whisper en INT8. La vitesse dépend du processeur et doit être mesurée.
Quel modèle choisir pour le français ?
Commencez par small sur CPU ou turbo avec environ 6 Go de VRAM. Comparez ensuite medium ou large sur un extrait difficile si la qualité est insuffisante.
Ollama transcrit-il directement l'audio ?
Pas dans ce parcours. Whisper produit la transcription, puis un LLM géré par Ollama peut l'analyser ou la résumer.
Sources primaires et projets
Avant de choisir un modèle local pour résumer vos transcriptions
Le scanner Web donne une première estimation. Local Cockpit mesure ensuite le matériel et les modèles Ollama sur la machine. Il ne prétend pas encore benchmarker Whisper.
À retenir
- Le moteur se choisit selon la machine : Buzz sans ligne de commande, faster-whisper pour un GPU NVIDIA et Python, whisper.cpp pour CPU, AMD ou Apple Silicon.
- Comparez small et turbo sur un extrait représentatif (2-3 minutes de votre propre audio) avant de transcrire des heures : la qualité et la vitesse dépendent de votre fichier, pas d'un benchmark générique.
- Coupez la connexion et relancez une transcription : si elle passe, tout tourne bien en local — le modèle est téléchargé une fois, rien ne part dans le cloud.
Sources et liens
Pour étayer Whisper local : transcrire un audio gratuitement sur PC en 2026 et rester sur des faits mesurables :
Essayez de tuer une stratégie de trading, en local : votre GPU explore des centaines de variantes, un holdout scellé reste invisible pendant la recherche, et le moteur Rust rend le verdict sur votre machine. App Windows/Linux gratuite — simulation éducative, aucune promesse de gain.
Télécharger le Lab gratuit → Lire : notre GPU a trouvé +172 % — et c'était un mensonge