Todos os modelos
Voz e tempo realDisponível
Inworld AI

Inworld Realtime TTS-2

O mais novo modelo expressivo de conversão de texto em fala em tempo real da Inworld, projetado para lembrar a conversação e falar em mais de 100 idiomas.

Visão geral em inglês simples

O que Inworld Realtime TTS-2 realmente é

Inworld Realtime TTS-2 transforma texto em fala transmitida enquanto usa turnos de áudio anteriores para manter a entrega de um caractere consistente. Os desenvolvedores podem descrever o clima ou a entrega desejada em linguagem natural, alternar idiomas e usar a clonagem de voz onde seus direitos e configuração de conta permitirem.

O preço é baseado em caracteres e não em tokens de áudio, o que torna os scripts mais fáceis de estimar. O Inworld relata um tempo médio inferior a 200 ms para o primeiro áudio, mas a distância da rede, o trabalho do aplicativo e o modelo de linguagem upstream ainda afetam o tempo de resposta completo.

Bom ajuste para

  • Companheiros em tempo real e vozes de apoio
  • Experiências multilíngues com uma voz consistente
  • Direção criativa de voz e clonagem autorizada

Comparação de categorias

Os fatos que importam para os modelos voz

Estas são especificações publicadas pelo fornecedor, não pontuações de benchmark Cody. Siga as fontes vinculadas para limites atuais e exceções específicas de endpoint.

Base de preço
US$ 25/1 milhão de caracteres sob demanda; descontos por volumePreço baseado em token, caractere ou minuto para a rota de acesso listada.
Modo de interação
TTS orientável em tempo real com contexto de áudio anteriorComportamento de fala para fala, áudio para áudio ou transmissão de texto para fala.
Latência publicada
Mediana de TTFA inferior a 200 msMedição publicada pelo provedor com suas exclusões declaradas; não é um teste Cody.
Idiomas
Mais de 100 com comutação no meio da falaCobertura linguística documentada pelo fornecedor ou um marcador claro e não publicado.
Ferramentas e controle
Direção de voz, design, clonagem, não-verbaisRecursos nativos de chamada de função, raciocínio ou controle de fala.
Contexto ou limite de entrada
Não publicadoToken documentado ou limite de caracteres onde for significativo.

Acesso à API e ao provedor

Onde obter Inworld Realtime TTS-2

Disponibilidade

Regiões e estágio de acesso

Geralmente disponível por meio da API REST TTS da Inworld e da API Realtime compatível com OpenAI.

A cobertura da região padrão não está listada na página do modelo; os planos empresariais anunciam opções de residência de dados na UE e na Índia.

Verifique a disponibilidade ao vivo

Dados e treinamento

A rota é importante.

A Inworld anuncia retenção zero de dados como um complemento empresarial, mas sua página de suporte ZDR publicada atualmente nomeia apenas TTS-1.5 Mini e Max. Confirme a cobertura do TTS-2 diretamente antes de enviar texto regulamentado ou confidencial.

Esta é uma leitura concisa do material citado do fornecedor, e não um aconselhamento jurídico. Um gateway de terceiros pode ter diferentes termos de armazenamento, roteamento, treinamento e residência da API direta do criador do modelo.

Leia a política do provedor

Perguntas frequentes

Perguntas frequentes sobre Inworld Realtime TTS-2

O que é Inworld Realtime TTS-2?

O mais novo modelo expressivo de conversão de texto em fala em tempo real da Inworld, projetado para lembrar a conversação e falar em mais de 100 idiomas. Inworld Realtime TTS-2 transforma texto em fala transmitida enquanto usa turnos de áudio anteriores para manter a entrega de um caractere consistente. Os desenvolvedores podem descrever o clima ou a entrega desejada em linguagem natural, alternar idiomas e usar a clonagem de voz onde seus direitos e configuração de conta permitirem.

Quando o Inworld Realtime TTS-2 foi lançado?

Inworld Realtime TTS-2 foi lançado em 31 de agosto de 2026 de acordo com os materiais do fornecedor citado.

Onde posso acessar Inworld Realtime TTS-2?

Geralmente disponível por meio da API REST TTS da Inworld e da API Realtime compatível com OpenAI. As rotas de acesso listadas neste guia são Inworld AI.

Quanto custa Inworld Realtime TTS-2?

US$ 25/1 milhão de caracteres sob demanda. As taxas de assinatura publicada caem para US$ 20, US$ 17,50, US$ 15 e US$ 12,50 por milhão de caracteres por nível, com preços corporativos anunciados a partir de US$ 5.

Onde o Inworld Realtime TTS-2 está disponível?

Geralmente disponível por meio da API REST TTS da Inworld e da API Realtime compatível com OpenAI. A cobertura da região padrão não está listada na página do modelo; os planos empresariais anunciam opções de residência de dados na UE e na Índia.

Os dados da minha API Inworld Realtime TTS-2 são usados ​​para treinamento?

A Inworld anuncia retenção zero de dados como um complemento empresarial, mas sua página de suporte ZDR publicada atualmente nomeia apenas TTS-1.5 Mini e Max. Confirme a cobertura do TTS-2 diretamente antes de enviar texto regulamentado ou confidencial. A política pertence à rota do provedor e aos termos da conta, portanto, verifique-a novamente antes do uso em produção.

Comparações relacionadas

Comparações lado a lado

  1. Inworld Realtime TTS-2 vs Gemini 3.8 Flash TTS

    O modelo de voz do Google para narração expressiva, vozes de personagens e diálogos em 130 idiomas.

    Abrir comparação completa
  2. Inworld Realtime TTS-2 vs Gemini 3.8 Flash-Lite TTS

    O modelo de voz mais econômico do Google para leitura em voz alta e produção de áudio em escala em 101 idiomas.

    Abrir comparação completa
  3. Inworld Realtime TTS-2 vs GPT-Live 1

    Front-end de voz full-duplex do OpenAI para conversas naturais que delega raciocínios e ações mais profundos a um agente de back-end separado.

    Abrir comparação completa
  4. Inworld Realtime TTS-2 vs Gemini 3.8 Live

    O modelo de voz em tempo real do Google para conversas ágeis com áudio, texto e contexto visual.

    Abrir comparação completa
  5. Inworld Realtime TTS-2 vs Gemini 3.8 Live Extended Thinking

    Um modelo de voz Gemini separado que resolve solicitações complexas em segundo plano enquanto mantém a conversa.

    Abrir comparação completa
  6. Inworld Realtime TTS-2 vs GPT-Realtime-2.1

    Modelo de raciocínio de fala para fala em tempo real do OpenAI para agentes de voz que usam ferramentas e que também precisam de contexto de texto e imagem.

    Abrir comparação completa
  7. Inworld Realtime TTS-2 vs Gemini 3.1 Flash Live Preview

    Modelo de visualização de áudio para áudio do Google para diálogo de baixa latência com consciência multimodal, pensamento, base de pesquisa e chamada de função.

    Abrir comparação completa
  8. Inworld Realtime TTS-2 vs Eleven v3 Conversational

    Modelo expressivo de conversão de texto em fala em tempo real do ElevenLabs para diálogo natural, entrega emocional, tags de áudio e mais de 70 idiomas.

    Abrir comparação completa
  9. Inworld Realtime TTS-2 vs Grok Voice Think Fast 2.0

    Modelo atual de fala em fala em tempo real do SpaceXAI para agentes de conversação em menos de um segundo com acesso a ferramentas.

    Abrir comparação completa