Traduit de l’anglais. Voir l’original
Kokoro TTS en ligne, gratuit et privé dans votre navigateur
Kokoro TTS en ligne gratuit : tapez un texte, choisissez l’une des 41 voix Kokoro en six langues et générez la voix ici même, dans votre navigateur, sans rien envoyer.
En bref
Peut-on utiliser Kokoro TTS en ligne gratuitement ?
Oui. Cette page fait tourner Kokoro-82M, le modèle de synthèse vocale à poids ouverts, dans l’onglet de votre navigateur, gratuitement et sans compte. Elle propose les 41 voix que Sandbook intègre, en anglais, espagnol, français, italien, portugais du Brésil et hindi, jusqu’à 1 500 caractères à la fois, avec un téléchargement en WAV. Votre texte n’est jamais envoyé, car la voix est générée sur votre propre appareil.
Dernière vérification : 2 octobre 2026
Comment ça marche
Le modèle tourne sur votre propre ordinateur, lit la première phrase pendant que la suite se calcule et vous donne un WAV à télécharger. Quand vous appuyez sur Démarrer, votre navigateur télécharge une fois le modèle Kokoro-82M et le garde en cache. Ensuite, tout se passe dans cet onglet. Votre texte est découpé en phrases, chaque phrase est convertie en phonèmes, et le modèle transforme ces phonèmes en audio 24 kHz avec la voix choisie. La première phrase se fait entendre dès qu’elle est prête, pendant que les suivantes se calculent derrière.
Le texte anglais passe par le phonétiseur anglais de Kokoro, qui énonce aussi les nombres, les prix et les heures. L’espagnol, le français, l’italien, le portugais et le hindi passent par eSpeak NG, le phonétiseur que Kokoro utilise pour ces langues, chargé seulement quand vous choisissez l’une de ces voix. L’inférence tourne dans un worker en arrière-plan, si bien que la page reste réactive.
À quoi s’attendre : WebGPU ou CPU
L’outil choisit le moteur à votre place. Il n’y a aucun réglage de qualité à mal choisir, car les modèles quantifiés plus petits produisent une voix brouillée sur WebGPU.
- WebGPU (carte graphique) : le modèle en pleine précision, un téléchargement unique de 326 Mo. Sur un portable récent, un paragraphe de 40 mots prend environ 3 secondes et la première phrase se fait entendre au bout d’environ 1 seconde. Chrome et Edge récents sur ordinateur ont WebGPU ; Safari 26 sur Mac aussi.
- CPU (WebAssembly) : le modèle 8 bits, un téléchargement unique de 92 Mo, utilisé quand WebGPU n’est pas disponible. Il est plus lent que le temps réel : comptez 10 à 15 secondes avant la première phrase et 20 à 40 secondes pour le même paragraphe, selon votre processeur.
Dans les deux cas, la deuxième visite évite le téléchargement : le modèle se charge depuis le cache du navigateur en quelques secondes. Prévoyez 1 à 1,5 Go de mémoire dans l’onglet pendant qu’il tourne.
Six langues, 41 voix
C’est la voix qui décide de la langue. L’outil propose les mêmes 41 voix que l’app Sandbook, avec les noms et les descriptions de l’app :
- Anglais : 28 voix, 20 américaines et 8 britanniques, dont Heart, Bella, Michael, Emma et George.
- Espagnol : 3 voix (Dora, Alex, Santa).
- Français : 1 voix (Siwis).
- Italien : 2 voix (Sara, Nicola).
- Portugais du Brésil : 3 voix (Dora, Alex, Santa).
- Hindi : 4 voix (Alpha, Beta, Omega, Psi).
Pour écouter une voix sans rien charger, appuyez sur le bouton de lecture à côté du choix de la voix, ou écoutez tous les extraits des voix Kokoro. La vitesse va de 0,5× à 2,0×, appliquée dans le modèle lui-même : une voix rapide sonne toujours comme une personne qui parle vite.
Téléchargement, droits d’usage et limites
Téléchargement. Chaque génération peut être enregistrée en fichier WAV mono 24 kHz. L’export en MP3 et en M4A n’est pas encore disponible.
Droits d’usage. Kokoro-82M est publié sous licence Apache-2.0, qui autorise l’usage commercial. L’audio que vous générez vous appartient ; Sandbook ne revendique rien dessus.
Limites. Jusqu’à 1 500 caractères par génération, soit environ une minute et demie de parole. Le modèle demande autant de mémoire qu’un ordinateur de bureau en offre : l’outil est donc pensé pour les ordinateurs. Un téléphone n’a pas toujours assez de mémoire pour la version web, et sur un téléphone la page propose des extraits de voix avant de charger quoi que ce soit. Fermer l’onglet juste après le premier téléchargement peut parfois empêcher le navigateur de finir d’écrire son cache ; la visite suivante télécharge alors le modèle à nouveau.
Confidentialité. Tout reste dans votre navigateur. Votre texte et l’audio ne quittent jamais cet onglet ; les seuls fichiers que l’outil récupère sont le modèle, la voix choisie et, pour les voix autres qu’anglaises, le phonétiseur. La page compte combien de fois l’outil sert, jamais ce que vous tapez.
Envie de l’avoir hors ligne sur iPhone ?
Cette page est une démo du modèle. Sandbook, c’est l’app : elle fait tourner le même modèle Kokoro-82M sur iPhone et iPad grâce à Apple MLX, entièrement hors ligne, avec les 41 voix et sans limite de longueur. Elle lit à voix haute les livres EPUB et les PDF, les pages web et les pages numérisées, surligne chaque mot au moment où il est prononcé et retient où vous vous êtes arrêté. Gratuite, sans compte et sans rien à acheter. Elle demande un iPhone 12 ou plus récent sous iOS 18.2.
La façon dont le modèle tourne sur un téléphone est expliquée sur la page app Kokoro TTS pour iPhone. Si vous voulez seulement qu’un téléphone lise l’écran à voix haute, iOS le fait déjà : la synthèse vocale sur iPhone avec les réglages intégrés. Et pour voir comment Sandbook se situe face à Speechify, NaturalReader et les autres lecteurs, consultez les alternatives de lecteurs pour iPhone.
iPhone et iPad uniquement · Gratuit, sans achat intégré
Questions sur Kokoro TTS en ligne
Cet outil Kokoro TTS en ligne est-il vraiment gratuit ?
Oui. Pas de compte, pas d’inscription, aucun décompte des générations. Chaque génération accepte jusqu’à 1 500 caractères, et vous pouvez en lancer autant que vous voulez. Son fonctionnement ne coûte rien, car le modèle tourne sur votre propre ordinateur et non sur un serveur.
Puis-je utiliser commercialement l’audio que je génère ?
Kokoro-82M est publié sous licence Apache-2.0, qui autorise l’usage commercial. Sandbook ne revendique aucun droit sur l’audio que vous créez ici : téléchargez le WAV et utilisez-le dans une vidéo, un cours ou un produit. Les voix sont synthétiques ; aucune voix de personne réelle n’est en jeu.
Pourquoi est-ce lent sur mon ordinateur ?
Sans WebGPU, l’outil fait tourner un modèle de 92 Mo sur le processeur via WebAssembly, plus lentement que le temps réel : environ 20 à 40 secondes pour un paragraphe de 40 mots sur un portable rapide, et la première phrase se fait entendre au bout de 10 à 15 secondes. Un navigateur doté de WebGPU, comme un Chrome ou un Edge récent sur ordinateur, utilise le modèle complet sur la carte graphique et produit le même paragraphe en 3 secondes environ.
Est-ce que ça marche sur iPhone ou Android ?
Un téléphone n’a pas toujours assez de mémoire pour cela. Le modèle a besoin d’environ 1 Go dans un seul onglet du navigateur, et Safari sur iPhone ferme les onglets qui en utilisent trop. Sur un téléphone, la page propose d’abord des extraits de voix, puis un bouton bêta pour essayer quand même. Sur iPhone et iPad, l’app gratuite Sandbook fait tourner le même modèle en natif et hors ligne.
Est-ce que ça fonctionne hors ligne ?
En partie. Après le premier chargement, les fichiers du modèle restent en cache dans votre navigateur, et la voix est générée dans l’onglet sans aucun serveur. Ouvrir la page elle-même demande toutefois une connexion. Pour une synthèse Kokoro TTS entièrement hors ligne sur iPhone ou iPad, utilisez l’app Sandbook, qui embarque le modèle.