Blog

Auto-héberger Whisper : quelles sont les meilleures options ?

Chargement...

5 min de lecture

Auto-héberger Whisper : quelles sont les meilleures options ?

Serveurs, VM cloud ou PaaS : comparez les options pour auto-héberger Whisper et découvrez comment le déployer simplement sur Scalingo.

""

Whisper d’OpenAI est un modèle de reconnaissance vocale qui transforme l’audio en texte. Il se prête à de nombreux cas d’usage : transcrire des réunions ou des entretiens, générer des sous-titres, traiter des appels clients ou encore retranscrire des consultations et des notes médicales.

Si vous envisagez d’intégrer Whisper à votre application, la question de son hébergement se pose rapidement. Vous pouvez soit utiliser l’API d’OpenAI soit choisir d’auto-héberger Whisper sur l'infrastructure de votre choix.

Pour l’auto-hébergement, plusieurs options sont possibles : utiliser vos propres serveurs, déployer Whisper sur une machine virtuelle dans le cloud ou encore passer par une plateforme managée de type PaaS. Dans cet article, nous verrons ce que chacune de ces solutions implique concrètement.

Et comme nous recevons régulièrement des questions sur l’hébergement de Whisper sur Scalingo, nous vous montrerons aussi comment notre équipe DevRel l’a testé sur la plateforme.

Qu’est-ce que Whisper par OpenAI ?

Whisper est un modèle open source de reconnaissance automatique de la parole (ASR, pour Automatic Speech Recognition) développé par OpenAI. Il transforme la parole en texte et peut reconnaître et transcrire de nombreuses langues.

Il est également capable d'identifier la langue parlée et de traduire vers l’anglais les contenus audio dans les langues prises en charge.

Utiliser Whisper via l’API d’OpenAI

La façon la plus simple d’utiliser Whisper est de passer directement par l’API d’OpenAI. Votre application envoie alors simplement le fichier audio à OpenAI et récupère sa transcription, tandis qu’OpenAI se charge des modèles et de l’infrastructure nécessaires à leur exécution.

Le principal avantage est la simplicité : vous n’avez pas à déployer Whisper vous-même, ce qui permet d’intégrer assez rapidement la transcription à une application. L’API permet également de bénéficier des nouvelles générations de modèles de transcription proposées par OpenAI, sans avoir à gérer leur déploiement ou leurs mises à jour.

En contrepartie, vos fichiers audio sont traités sur l’infrastructure d’OpenAI. Selon votre application, vous pouvez avoir besoin de davantage de contrôle sur l’endroit où ces données sont traitées, l’infrastructure utilisée, ou encore le modèle et l’implémentation de Whisper que vous souhaitez faire tourner. C’est là que l’auto-hébergement entre en jeu.

🩺 Vous traitez des données de santé ?

En France, l’hébergement de données de santé est soumis à des exigences spécifiques. Si votre application utilise Whisper pour traiter des données de santé, la certification HDS (Hébergeur de Données de Santé) peut donc également faire partie des critères à prendre en compte au moment de choisir votre infrastructure.

Quelles solutions pour auto-héberger Whisper ?

Pour héberger Whisper vous-même, trois grandes options s’offrent à vous : utiliser vos propres serveurs, déployer Whisper sur une machine virtuelle (VM) dans le cloud, ou passer par une plateforme managée comme un PaaS.

Le bon choix dépend notamment du volume d’audio à traiter, des performances dont vous avez besoin et, surtout, du niveau de gestion de l’infrastructure que vous souhaitez garder à votre charge.

Voici un aperçu des trois approches avant de les regarder plus en détail :

Option

Idéal pour

À prendre en compte

Votre propre infrastructure

Les entreprises qui disposent déjà de leur propre infrastructure ou qui ont des besoins très spécifiques

Vous gérez tout : serveurs, sécurité, maintenance et contraintes réglementaires

VM dans le cloud

Les équipes qui veulent garder la main sur leur environnement et les ressources allouées

La configuration, la sécurité et la maintenance de la VM restent à votre charge

PaaS

Les équipes qui veulent auto-héberger Whisper sans avoir à administrer de serveurs

Vous avez moins de contrôle sur l’infrastructure

Auto-héberger Whisper sur votre propre infrastructure

L’option qui vous donne donc le plus de contrôle consiste à faire tourner Whisper sur vos propres serveurs, dans vos locaux ou dans un datacenter privé. Vous maîtrisez ainsi l’environnement dans lequel Whisper est déployé, les accès, la localisation des données et les ressources utilisées, qu’il s’agisse de CPU ou de GPU.

Pour les organisations qui disposent déjà de leur propre infrastructure, ou qui ont des contraintes très précises en matière d’hébergement et de localisation des données, cette approche peut avoir du sens.

En revanche, si vous ne gérez pas déjà vos propres serveurs, la marche est nettement plus haute. Il ne suffit pas d’installer Whisper : il faut aussi acheter ou louer les machines, les configurer, les sécuriser, appliquer les mises à jour, mettre en place le monitoring, gérer les pannes, les sauvegardes et la redondance, puis faire évoluer l’infrastructure à mesure que les besoins augmentent.

Il faut également prévoir les pics de charge. Si le volume de transcriptions augmente fortement, ajouter de la capacité peut nécessiter de provisionner de nouvelles machines plutôt que de simplement ajuster les ressources disponibles.

En résumé, cette approche offre un maximum de contrôle, mais demande aussi le plus d’investissement côté infrastructure. Si votre équipe n’a pas déjà l’habitude d’administrer ses propres serveurs, passer par une infrastructure cloud sera infiniment plus simple.

Auto-héberger Whisper sur une VM dans le cloud

Si vous souhaitez héberger Whisper vous-même sans avoir à posséder et maintenir vos propres serveurs physiques, vous pouvez opter pour une machine virtuelle (VM) chez un fournisseur cloud. AWS, Google Cloud, Azure, OVHcloud ou Scaleway, par exemple, permettent de choisir les ressources adaptées à vos besoins : CPU, mémoire et, si nécessaire, GPU.

Contrairement à un hébergement sur vos propres serveurs, vous n’avez pas à vous occuper des machines physiques. Vous pouvez ajuster les ressources allouées à votre VM ou en ajouter à mesure que vos besoins évoluent.

En revanche, la VM reste à votre charge. C’est à votre équipe de configurer le système et l’environnement nécessaire à Whisper, d’installer et de mettre à jour les dépendances, de sécuriser la VM, de la monitorer et de gérer la montée en charge de l’application.

Cette approche offre donc beaucoup de souplesse aux équipes qui ont déjà les compétences nécessaires pour administrer une infrastructure cloud. Mais si vous souhaitez auto-héberger Whisper sans avoir à administrer les serveurs sur lesquels il tourne, il existe une autre possibilité : passer par un Platform as a Service (PaaS).

Auto-héberger Whisper sur un Platform as a Service (PaaS)

Troisième option, et sans doute la plus simple si vous souhaitez auto-héberger Whisper sans administrer de serveurs : passer par un Platform as a Service (PaaS).

Comme avec une VM dans le cloud, votre application tourne sur l’infrastructure d’un fournisseur. La différence, c’est que vous n’avez pas besoin de gérer les serveurs vous-même. Vous déployez votre application, choisissez les ressources dont elle a besoin, et la plateforme se charge de tout le reste.

Dans le cas de Whisper, vous gardez la main sur le modèle et l’implémentation que vous souhaitez utiliser, ainsi que sur les ressources à leur allouer, CPU, mémoire, etc. Vous pouvez ensuite faire évoluer ces ressources en fonction de vos besoins, sans avoir à administrer les machines derrière votre application.

Un PaaS offre en revanche moins de liberté qu’une VM sur l’infrastructure disponible. Les types de ressources et les configurations possibles dépendent de la plateforme choisie. Si votre usage nécessite par exemple un GPU particulier ou une infrastructure très spécifique, une VM ou une infrastructure dédiée pourra être plus adaptée.

Le PaaS constitue donc un bon compromis pour les équipes qui souhaitent auto-héberger Whisper et garder la maîtrise de leur application, sans avoir à gérer les serveurs qui la font tourner.

Faut-il un GPU pour faire tourner Whisper ?

Non. Whisper peut fonctionner aussi bien sur CPU que sur GPU.

Un CPU, le processeur généraliste que l’on trouve dans pratiquement tous les ordinateurs et serveurs, suffit pour de nombreux usages de Whisper et constitue souvent l’option la plus économique.

Un GPU est conçu pour effectuer de nombreux calculs en parallèle et peut accélérer considérablement la transcription. Il devient particulièrement intéressant avec les modèles les plus volumineux, pour traiter de grandes quantités de données audio ou lorsque la vitesse de transcription est un critère important.

En bref : un GPU permet de faire tourner Whisper plus rapidement, mais il n’est pas indispensable.

Pourquoi déployer Whisper sur le PaaS Scalingo ?

Au-delà de la simplicité du PaaS, le choix de la plateforme peut aussi répondre à des enjeux de localisation des données, de sécurité ou de conformité. Scalingo est un PaaS européen dont l’infrastructure est hébergée en France, un point particulièrement important lorsque les fichiers audio traités par Whisper contiennent des données sensibles.

Prenons l’exemple de la santé. L’enregistrement d’une consultation médicale peut contenir des données de santé avant même d’être transcrit par Whisper. L’endroit où cet audio est traité et hébergé compte donc dès le départ. Scalingo est certifié HDS (Hébergeur de Données de Santé) et permet d’héberger des applications qui traitent ce type de données.

Les contraintes de sécurité ou de souveraineté ne concernent évidemment pas que la santé. Pour les projets qui ont des exigences plus poussées dans ces domaines, Scalingo propose également une région reposant sur l’infrastructure qualifiée SecNumCloud d’OUTSCALE.

Toutes les applications utilisant Whisper n’ont bien sûr pas les mêmes contraintes. Mais lorsque la localisation des données ou les exigences réglementaires entrent en jeu, le choix de la plateforme sur laquelle Whisper est déployé devient un critère à part entière.

-> Découvrez les autres avantages du PaaS Scalingo

Démo : déployer Whisper sur Scalingo

Vous êtes de plus en plus nombreux à nous demander comment déployer Whisper sur Scalingo. Notre équipe DevRel a donc préparé un exemple concret pour vous montrer comment procéder.

Pour cette démo, nous avons développé une petite application de transcription audio basée sur faster-whisper, puis nous l’avons déployée sur Scalingo. L’application permet d’envoyer un fichier audio et d’en récupérer la transcription, avec la possibilité de choisir la taille du modèle Whisper en fonction de vos besoins.

Qu'est-ce-que faster-whisper ?

En cherchant comment auto-héberger Whisper, vous tomberez probablement sur faster-whisper. Cette implémentation de Whisper s’appuie sur CTranslate2, un moteur optimisé pour l’exécution de modèles Transformer.

L’intérêt ? Faire tourner les mêmes modèles Whisper plus rapidement et avec moins de mémoire dans de nombreuses configurations, aussi bien sur CPU que sur GPU. Un choix particulièrement intéressant lorsqu’on cherche à optimiser les ressources nécessaires pour faire tourner Whisper.

Le déploiement suit le même principe que pour une application Python classique sur Scalingo : une fois l’application poussée, Scalingo détecte l’environnement Python, installe les dépendances et lance l’application.

Si vous souhaitez tester un déploiement de Whisper sur Scalingo, notre équipe DevRel a documenté toutes les étapes, du choix et du dimensionnement du modèle Whisper au déploiement de l’application et au test de l’endpoint de transcription.

→ Suivre le tutoriel pour déployer Whisper sur Scalingo

FAQ

Vaut-il mieux auto-héberger Whisper ou utiliser l’API d’OpenAI ?

Tout dépend de vos besoins. Avec l’API d’OpenAI, vous n’avez pas à déployer ni à gérer Whisper vous-même. En choisissant l’auto-hébergement, vous décidez où et sur quelle infrastructure Whisper fonctionne, et gardez ainsi davantage de contrôle sur le traitement de vos fichiers audio.

Il n’y a pas de solution idéale dans l’absolu : le choix dépend surtout des besoins et des contraintes de votre application.

Quelle est la différence entre Whisper et faster-whisper ?

Whisper est le modèle de reconnaissance vocale développé par OpenAI. faster-whisper est une implémentation optimisée des modèles Whisper, conçue pour les exécuter plus efficacement.

La principale différence tient donc à leur exécution : faster-whisper utilise CTranslate2 comme moteur d’inférence, ce qui permet notamment d’améliorer les performances et de réduire la consommation de mémoire.

Peut-on auto-héberger Whisper sans administrer ses propres serveurs ?

Oui. En passant par un PaaS, vous pouvez déployer et faire tourner Whisper sans avoir à administrer vous-même les serveurs qui l’hébergent.

Vous restez responsable de votre application (choix et configuration de Whisper, ressources allouées, etc.) tandis que le PaaS se charge de l’infrastructure sous-jacente.

Peut-on utiliser Whisper pour une application de santé ?

Oui. Whisper peut servir de moteur de transcription pour des applications de santé, par exemple pour retranscrire des consultations médicales ou saisir des notes cliniques à la voix.

Ces enregistrements pouvant contenir des données de santé, il faut toutefois tenir compte de l’endroit où les fichiers audio sont traités et stockés, ainsi que des exigences réglementaires qui s’appliquent à l’infrastructure utilisée.

En France, lorsque la réglementation l’exige, l’hébergement de données de santé à caractère personnel doit être assuré par un hébergeur certifié HDS, comme Scalingo.

Peut-on déployer Whisper sur Scalingo ?

Oui. Whisper peut être déployé sur Scalingo comme n’importe quelle application conteneurisée. Vous gardez la maîtrise de votre application et de sa configuration, tandis que Scalingo prend en charge l’infrastructure sous-jacente, le déploiement et l’exploitation de la plateforme.

Cela permet d’auto-héberger Whisper sans avoir à administrer vos propres serveurs, tout en bénéficiant des fonctionnalités d’un PaaS pour déployer, superviser et faire évoluer votre application.

Jennifer Taylor, Scalingo

Jennifer Taylor

Chez Scalingo, Jennifer pilote les initiatives de croissance et de marketing, et contribue à façonner la voix de l’entreprise dans l’écosystème en pleine évolution du PaaS et du cloud. Elle aime particulièrement transformer des concepts cloud complexes en idées simples et accessibles.

Restez informé

Recevez des articles et des mises à jour de la plateforme dans votre boîte de réception.

Prêt à déployer en toute confiance ?

Découvrez des déploiements sans temps d'arrêt, une mise à l'échelle automatique intelligente et une infrastructure entièrement gérée. Commencez à déployer vos applications sur Scalingo dès aujourd'hui.

Aucune carte de crédit requise • Déployez en quelques minutes • Annulez à tout moment

Dégradé arrière-plan section

Déployez une application ou base de données

Commencez à déployer

Rejoignez les équipes qui misent sur une plateforme conçue pour livrer rapidement, opérer sereinement, avec des valeurs européennes et un support humain.

Dégradé arrière-plan section

Déployez une application ou base de données

Commencez à déployer

Rejoignez les équipes qui misent sur une plateforme conçue pour livrer rapidement, opérer sereinement, avec des valeurs européennes et un support humain.

Dégradé arrière-plan section

Déployez une application ou base de données

Commencez à déployer

Rejoignez les équipes qui misent sur une plateforme conçue pour livrer rapidement, opérer sereinement, avec des valeurs européennes et un support humain.