Tous les modèles
Inworld AI

Inworld Realtime TTS-2

Le tout nouveau modèle expressif de synthèse vocale en temps réel d'Inworld, conçu pour mémoriser les conversations et parler dans plus de 100 langues.

Présentation de l'anglais simple

Qu'est-ce que Inworld Realtime TTS-2 ?

Inworld Realtime TTS-2 transforme le texte en discours diffusé tout en utilisant des tours audio antérieurs pour maintenir la cohérence de la prestation d'un personnage. Les développeurs peuvent décrire l'ambiance ou la diffusion souhaitée en langage naturel, changer de langue et utiliser le clonage vocal lorsque leurs droits et la configuration de leur compte le permettent.

La tarification est basée sur les caractères plutôt que sur les jetons audio, ce qui facilite l'estimation des scripts. Inworld rapporte un temps médian inférieur à 200 ms pour le premier audio, mais la distance du réseau, le travail des applications et le modèle de langage en amont affectent toujours le temps de réponse complet.

Bon ajustement pour

  • Compagnons en temps réel et voix de soutien
  • Expériences multilingues avec une seule voix cohérente
  • Direction vocale créative et clonage autorisé

Comparaison des catégories

Les faits importants pour les modèles voix

Il s'agit de spécifications publiées par le fournisseur et non de scores de référence Cody. Suivez les sources liées pour connaître les limites actuelles et les exceptions spécifiques aux points de terminaison.

Base de prix
25 $/1 million de caractères sur demande ; remises sur volumePrix basé sur un jeton, un caractère ou une minute pour l'itinéraire d'accès répertorié.
Mode d'interaction
TTS en temps réel orientable avec contexte audio préalableComportement parole-parole, audio-audio ou synthèse vocale en streaming.
Latence publiée
Moins de 200 ms de TTFA médianMesure publiée par le fournisseur avec ses exclusions indiquées ; pas un test Cody.
Langues
100+ avec commutation à mi-prononcéCouverture linguistique documentée par le fournisseur ou marqueur clair non publié.
Outils et contrôle
Direction vocale, conception, clonage, non-verbalFonctionnalités natives d’appel de fonctions, de raisonnement ou de contrôle vocal.
Contexte ou limite d'entrée
Non publiéLimite de jetons ou de caractères documentée lorsque cela est significatif.

Accès API et fournisseur

Où obtenir Inworld Realtime TTS-2

Disponibilité

Régions et étape d'accès

Généralement disponible via l'API REST TTS d'Inworld et l'API en temps réel compatible OpenAI.

La couverture régionale standard n'est pas répertoriée sur la page du modèle ; les plans d'entreprise annoncent des options de résidence de données dans l'UE et en Inde.

Vérifier la disponibilité en direct

Données et formation

L'itinéraire compte.

Inworld annonce une rétention de données nulle en tant que module complémentaire d'entreprise, mais sa page de support ZDR actuellement publiée ne nomme que TTS-1.5 Mini et Max. Confirmez directement la couverture TTS-2 avant d'envoyer un texte réglementé ou confidentiel.

Il s'agit d'une lecture concise du matériel du fournisseur cité, et non d'un avis juridique. Une passerelle tierce peut avoir des conditions de stockage, de routage, de formation et de résidence différentes de celles de l'API directe du modéliste.

Lire la politique du fournisseur

Questions fréquemment posées

FAQ Inworld Realtime TTS-2

Qu'est-ce que Inworld Realtime TTS-2 ?

Le tout nouveau modèle expressif de synthèse vocale en temps réel d'Inworld, conçu pour mémoriser les conversations et parler dans plus de 100 langues. Inworld Realtime TTS-2 transforme le texte en discours diffusé tout en utilisant des tours audio antérieurs pour maintenir la cohérence de la prestation d'un personnage. Les développeurs peuvent décrire l'ambiance ou la diffusion souhaitée en langage naturel, changer de langue et utiliser le clonage vocal lorsque leurs droits et la configuration de leur compte le permettent.

Quand Inworld Realtime TTS-2 est-il sorti ?

Inworld Realtime TTS-2 a été publié sur 31 août 2026 selon les documents du fournisseur cités.

Où puis-je accéder à Inworld Realtime TTS-2 ?

Généralement disponible via l'API REST TTS d'Inworld et l'API en temps réel compatible OpenAI. Les voies d'accès répertoriées dans ce guide sont Inworld AI.

Combien coûte Inworld Realtime TTS-2 ?

25 $ / 1 million de caractères sur demande. Les tarifs d'abonnement publiés tombent à 20 $, 17,50 $, 15 $ et 12,50 $ par million de caractères par niveau, les tarifs d'entreprise étant annoncés à seulement 5 $.

Où le Inworld Realtime TTS-2 est-il disponible ?

Généralement disponible via l'API REST TTS d'Inworld et l'API en temps réel compatible OpenAI. La couverture régionale standard n'est pas répertoriée sur la page du modèle ; les plans d'entreprise annoncent des options de résidence de données dans l'UE et en Inde.

Mes données API Inworld Realtime TTS-2 sont-elles utilisées pour la formation ?

Inworld annonce une rétention de données nulle en tant que module complémentaire d'entreprise, mais sa page de support ZDR actuellement publiée ne nomme que TTS-1.5 Mini et Max. Confirmez directement la couverture TTS-2 avant d'envoyer un texte réglementé ou confidentiel. La politique appartient à l'itinéraire du fournisseur et aux conditions du compte, vérifiez-la donc à nouveau avant de l'utiliser en production.

Comparaisons associées

Comparaisons face à face

  1. Inworld Realtime TTS-2 vs Gemini 3.8 Flash TTS

    Le modèle vocal de Google pour la narration expressive, les voix de personnages et les dialogues dans 130 langues.

    Ouvrir la comparaison complète
  2. Inworld Realtime TTS-2 vs Gemini 3.8 Flash-Lite TTS

    Le modèle vocal moins coûteux de Google pour la lecture à voix haute et la production audio à grande échelle dans 101 langues.

    Ouvrir la comparaison complète
  3. Inworld Realtime TTS-2 vs GPT-Live 1

    Frontend vocal full duplex du OpenAI pour une conversation naturelle qui délègue un raisonnement et des actions plus approfondis à un agent backend distinct.

    Ouvrir la comparaison complète
  4. Inworld Realtime TTS-2 vs Gemini 3.8 Live

    Le modèle vocal en temps réel de Google pour des échanges réactifs avec audio, texte et contexte visuel.

    Ouvrir la comparaison complète
  5. Inworld Realtime TTS-2 vs Gemini 3.8 Live Extended Thinking

    Un modèle vocal Gemini distinct qui traite les demandes complexes en arrière-plan tout en poursuivant la conversation.

    Ouvrir la comparaison complète
  6. Inworld Realtime TTS-2 vs GPT-Realtime-2.1

    Modèle de raisonnement parole-parole en temps réel de OpenAI pour les agents vocaux utilisant des outils qui ont également besoin d'un contexte de texte et d'image.

    Ouvrir la comparaison complète
  7. Inworld Realtime TTS-2 vs Gemini 3.1 Flash Live Preview

    Modèle audio-audio en avant-première de Google pour un dialogue à faible latence avec une conscience multimodale, une réflexion, une mise à la terre de recherche et un appel de fonction.

    Ouvrir la comparaison complète
  8. Inworld Realtime TTS-2 vs Eleven v3 Conversational

    Modèle de synthèse vocale en temps réel expressif de ElevenLabs pour un dialogue naturel, une transmission émotionnelle, des balises audio et plus de 70 langues.

    Ouvrir la comparaison complète
  9. Inworld Realtime TTS-2 vs Grok Voice Think Fast 2.0

    Modèle de parole en temps réel actuel de SpaceXAI pour les agents conversationnels en moins d'une seconde avec accès aux outils.

    Ouvrir la comparaison complète