Text-to-speech français souverain avec Gradium et Micdrop
Intégrez Gradium, le TTS français issu de Kyutai, dans une application web avec Micdrop. Vos données passent par des serveurs européens, avec un fallback.
March 3, 2026
Godefroy de CompreignacDe toutes les briques d’une IA vocale, la synthèse vocale est celle qui envoie le plus de contenu chez un tiers, phrase après phrase, pendant toute la conversation. Quand ce contenu transite par des serveurs américains soumis au Cloud Act, la souveraineté devient un sujet concret. Gradium, startup française issue du laboratoire Kyutai, propose un TTS avec des serveurs européens.
Le package @micdrop/gradium fait la connexion, la région européenne est le réglage par défaut, et un fournisseur de secours prend le relais en cas de panne.
Qu’est-ce que Gradium ?
Gradium est une startup parisienne fondée par d’anciens chercheurs de Meta, Google DeepMind, Google Brain et Jane Street. Elle a levé 70 millions de dollars en seed fin 2025 auprès de FirstMark Capital, Eurazeo et d’investisseurs comme Eric Schmidt et Yann LeCun.
Gradium développe des modèles de langage audio-natifs pour le text-to-speech et le speech-to-text en temps réel.
Les caractéristiques de Gradium
| Caractéristique | Détail |
|---|---|
| Voix disponibles | 150+ voix dans 5 langues (FR, EN, DE, ES, PT) |
| Clonage vocal | À partir de 10 secondes d’audio |
| Streaming | WebSocket temps réel avec timestamps mot par mot |
| Régions | Serveurs EU et US au choix |
| Formats audio | PCM (8/16/24/48 kHz), WAV, Opus, µ-law, A-law |
| Latence | < 300 ms (time-to-first-byte) |
| Code-switching | Changement de langue en milieu de phrase |
Gradium et la souveraineté des données
Le siège de Gradium est à Paris, celui d’ElevenLabs à New York et celui de Cartesia à San Francisco. La différence se joue sur quatre points :
- l’hébergement est européen par défaut, les données restent dans l’Union
- les plans Enterprise fonctionnent sans conservation des données
- un déploiement en cloud privé ou sur site reste possible
- Gradium relève du droit européen plutôt que du Cloud Act
Pour une administration, un établissement de santé ou une école, l’hébergement européen décide souvent du fournisseur retenu.
Intégration avec Micdrop
Micdrop est un framework TypeScript open source pour ajouter des conversations vocales IA dans les applications web. Vous branchez Gradium en quelques lignes avec le package @micdrop/gradium.
Installation
npm install @micdrop/server @micdrop/gradiumConfiguration de base
import { MicdropServer } from '@micdrop/server'import { GradiumTTS } from '@micdrop/gradium'
const tts = new GradiumTTS({ apiKey: process.env.GRADIUM_API_KEY || '', voiceId: 'YOUR_VOICE_ID', region: 'eu', // Serveurs européens outputFormat: 'pcm_16000',})
new MicdropServer(socket, { tts, agent, // Votre agent LLM stt, // Votre fournisseur STT})La région eu est la valeur par défaut, et le trafic Gradium reste dans l’Union jusqu’à ce que vous choisissiez la région US.
Configuration avancée de la voix
Trois réglages contrôlent le rendu de la voix :
const tts = new GradiumTTS({ apiKey: process.env.GRADIUM_API_KEY || '', voiceId: 'YOUR_VOICE_ID', region: 'eu', outputFormat: 'pcm_16000', jsonConfig: { temp: 0.7, // Expressivité (0 → monotone, 1.4 → très expressif) cfg_coef: 2.0, // Fidélité à la voix originale (1.0 → libre, 4.0 → fidèle) padding_bonus: 0, // Vitesse (-4.0 → rapide, 4.0 → lent) },})La stack souveraine complète
Gradium couvre la sortie audio. Avec deux autres fournisseurs européens, il forme une stack vocale qui reste en Europe :
| Composant | Fournisseur | Rôle |
|---|---|---|
| Agent (LLM) | Mistral | Modèle de langage français, entraîné et hébergé en Europe |
| Speech-to-Text | Gladia | Transcription temps réel, 90+ langues |
| Text-to-Speech | Gradium | Synthèse vocale, serveurs EU |
Exemple complet
import { MicdropServer } from '@micdrop/server'import { MistralAgent } from '@micdrop/mistral'import { GladiaSTT } from '@micdrop/gladia'import { GradiumTTS } from '@micdrop/gradium'
const agent = new MistralAgent({ apiKey: process.env.MISTRAL_API_KEY || '', model: 'mistral-large-latest', systemPrompt: 'Tu es un assistant vocal en français. Réponds de manière concise et naturelle.',})
const stt = new GladiaSTT({ apiKey: process.env.GLADIA_API_KEY || '', settings: { language_config: { languages: ['fr'] }, },})
const tts = new GradiumTTS({ apiKey: process.env.GRADIUM_API_KEY || '', voiceId: 'YOUR_FRENCH_VOICE_ID', region: 'eu',})
new MicdropServer(socket, { agent, stt, tts })Avec cette configuration, l’audio et le texte de la conversation restent chez des fournisseurs européens, hors du champ du Cloud Act. La conformité RGPD de l’ensemble dépend encore de votre hébergement et de vos contrats, Micdrop rend l’architecture possible et s’arrête là.
Stratégie de fallback pour la résilience
Un fournisseur finit toujours par tomber. Micdrop embarque un fallback entre fournisseurs TTS. Si Gradium répond en erreur, le serveur bascule sur un fournisseur de secours et la conversation continue.
TTS avec fallback
import { FallbackTTS } from '@micdrop/server'import { GradiumTTS } from '@micdrop/gradium'import { ElevenLabsTTS } from '@micdrop/elevenlabs'
const tts = new FallbackTTS({ factories: [ // Fournisseur principal : Gradium (souverain) () => new GradiumTTS({ apiKey: process.env.GRADIUM_API_KEY || '', voiceId: process.env.GRADIUM_VOICE_ID || '', region: 'eu', maxRetry: 2, }), // Secours : ElevenLabs () => new ElevenLabsTTS({ apiKey: process.env.ELEVENLABS_API_KEY || '', voiceId: process.env.ELEVENLABS_VOICE_ID || '', maxRetry: 3, }), ],})Le FallbackTTS fonctionne ainsi :
- Il utilise le premier fournisseur (Gradium) par défaut
- Si Gradium échoue après ses retries, il bufferise le texte en cours
- Il bascule sur ElevenLabs
- Le texte bufferisé est rejoué sur le nouveau fournisseur
- L’utilisateur perçoit une micro-interruption, et rien de plus
Vous gardez donc Gradium au quotidien, et la conversation tient les jours de panne. Le secours choisi ici sort de l’Union pendant ce temps. Prendre un second fournisseur européen garde la chaîne entière en Europe, au prix d’un catalogue de voix plus court.
Comparaison avec les alternatives
| Critère | Gradium | ElevenLabs | Cartesia |
|---|---|---|---|
| Siège | Paris, France | New York, USA | San Francisco, USA |
| Serveurs EU | Natif | Non prioritaire | Non |
| Rétention données | Zéro (Enterprise) | Standard US | Standard US |
| Cloud Act | Non soumis | Soumis | Soumis |
| Langues | 5 | 70+ | 15 |
| Clonage vocal | 10s | 30s | 3s |
| Streaming WebSocket | Oui | Oui | Oui |
| Tarification | Par caractère | Par caractère | Par caractère |
ElevenLabs reste devant sur le nombre de langues et Cartesia clone une voix à partir d’un extrait plus court. Les deux traitent par défaut vos données aux États-Unis.
Cas d’usage
Service public et administration
L’ANSSI et la CNIL poussent les administrations vers des fournisseurs relevant du droit européen. Un assistant vocal ouvert aux citoyens se déploie alors avec des données qui restent en Europe.
Santé et HDS
Les données de santé exigent un hébergement HDS (Hébergeur de Données de Santé). Gradium en région EU se combine avec un hébergeur certifié sans rompre la chaîne, là où un TTS américain oblige à documenter un transfert hors Union.
Entreprise et confidentialité
Les conversations internes et les échanges commerciaux touchent au secret des affaires. Les garder chez un fournisseur européen simplifie la cartographie des traitements que réclament les grands comptes.
Éducation
Un établissement scolaire traite les données d’élèves souvent mineurs, ce qui durcit ses obligations. Un TTS européen épargne au dossier un transfert extra-européen de plus.
Pour aller plus loin
- Documentation Gradium dans Micdrop
- Guide IA Vocale Souveraine
- Stratégies de fallback TTS
- Site officiel Gradium
Gradium et Micdrop suffisent à garder la synthèse vocale chez un fournisseur européen, avec le code sur votre infrastructure et vos propres clés API. Installez @micdrop/gradium, choisissez une voix dans le catalogue Gradium, et le premier appel tourne dans la foulée.