CT
← Tout le Lab
LabIA·2026

Whisper small vs medium sur du français

Comparaison mesurée des modèles Whisper small et medium sur du français, exécutés en local via whisper.cpp. Protocole reproductible, taux d'erreur par condition acoustique, et arbitrage entre précision et temps de calcul.

whisper.cppPythonjiwerFFmpegHuggingFace Datasets
Type
Lab d'expérimentation
Domaine
IA
Techs
5
Année
2026

Contexte

Whisper transcrit la parole en texte et fonctionne entièrement hors ligne, sur sa propre machine sans abonnement ni envoi de données. Il est distribué en cinq tailles qui partagent la même architecture : seul change le nombre de paramètres internes. Il faut donc en choisir une, et ce choix engage à la fois la qualité du résultat, le temps de calcul et l'espace disque.

La documentation officielle classe ces modèles entre eux, mais sans mesure spécifique au français, ni sur du matériel ordinaire sans carte graphique. Le choix se fait donc le plus souvent à l'intuition.

Objectifs

  • Mesurer l'écart réel de précision entre small et medium sur du français.
  • Mesurer l'écart de temps de calcul, sur une machine sans GPU.
  • Identifier sur quel type d'audio l'écart est le plus marqué.
  • Établir un protocole reproductible sur d'autres enregistrements.
  • Vérifier les choix de modèle déjà faits dans WhisperLocal.
De l'onde sonore au texte : le modèle convertit le son en image, puis lit cette image
De l'onde sonore au texte : le modèle convertit le son en image, puis lit cette image
Les cinq tailles de Whisper — small et medium sont les deux modèles testés
Les cinq tailles de Whisper — small et medium sont les deux modèles testés
MachineIntel Core i5-1335U · 16 Go · sans GPU
Moteurwhisper.cpp v1.9.2
Modèlessmall 0,49 Go et medium 1,53 Go, tous deux en F16
Jeu de test8 extraits · 97 s d'audio · 6 conditions
MétriqueWER : taux d'erreur sur les mots, normalisé