Whisper small vs medium sur du français
Comparaison mesurée des modèles Whisper small et medium sur du français, exécutés en local via whisper.cpp. Protocole reproductible, taux d'erreur par condition acoustique, et arbitrage entre précision et temps de calcul.
Contexte
Whisper transcrit la parole en texte et fonctionne entièrement hors ligne, sur sa propre machine sans abonnement ni envoi de données. Il est distribué en cinq tailles qui partagent la même architecture : seul change le nombre de paramètres internes. Il faut donc en choisir une, et ce choix engage à la fois la qualité du résultat, le temps de calcul et l'espace disque.
La documentation officielle classe ces modèles entre eux, mais sans mesure spécifique au français, ni sur du matériel ordinaire sans carte graphique. Le choix se fait donc le plus souvent à l'intuition.
Objectifs
- —Mesurer l'écart réel de précision entre small et medium sur du français.
- —Mesurer l'écart de temps de calcul, sur une machine sans GPU.
- —Identifier sur quel type d'audio l'écart est le plus marqué.
- —Établir un protocole reproductible sur d'autres enregistrements.
- —Vérifier les choix de modèle déjà faits dans WhisperLocal.