Inworld Realtime TTS-2
O mais novo modelo expressivo de conversão de texto em fala em tempo real da Inworld, projetado para lembrar a conversação e falar em mais de 100 idiomas.
O mais novo modelo expressivo de conversão de texto em fala em tempo real da Inworld, projetado para lembrar a conversação e falar em mais de 100 idiomas.
Visão geral em inglês simples
Inworld Realtime TTS-2 transforma texto em fala transmitida enquanto usa turnos de áudio anteriores para manter a entrega de um caractere consistente. Os desenvolvedores podem descrever o clima ou a entrega desejada em linguagem natural, alternar idiomas e usar a clonagem de voz onde seus direitos e configuração de conta permitirem.
O preço é baseado em caracteres e não em tokens de áudio, o que torna os scripts mais fáceis de estimar. O Inworld relata um tempo médio inferior a 200 ms para o primeiro áudio, mas a distância da rede, o trabalho do aplicativo e o modelo de linguagem upstream ainda afetam o tempo de resposta completo.
Comparação de categorias
Estas são especificações publicadas pelo fornecedor, não pontuações de benchmark Cody. Siga as fontes vinculadas para limites atuais e exceções específicas de endpoint.
Acesso à API e ao provedor
Disponibilidade
Geralmente disponível por meio da API REST TTS da Inworld e da API Realtime compatível com OpenAI.
A cobertura da região padrão não está listada na página do modelo; os planos empresariais anunciam opções de residência de dados na UE e na Índia.
Verifique a disponibilidade ao vivoDados e treinamento
A Inworld anuncia retenção zero de dados como um complemento empresarial, mas sua página de suporte ZDR publicada atualmente nomeia apenas TTS-1.5 Mini e Max. Confirme a cobertura do TTS-2 diretamente antes de enviar texto regulamentado ou confidencial.
Esta é uma leitura concisa do material citado do fornecedor, e não um aconselhamento jurídico. Um gateway de terceiros pode ter diferentes termos de armazenamento, roteamento, treinamento e residência da API direta do criador do modelo.
Leia a política do provedorPerguntas frequentes
O mais novo modelo expressivo de conversão de texto em fala em tempo real da Inworld, projetado para lembrar a conversação e falar em mais de 100 idiomas. Inworld Realtime TTS-2 transforma texto em fala transmitida enquanto usa turnos de áudio anteriores para manter a entrega de um caractere consistente. Os desenvolvedores podem descrever o clima ou a entrega desejada em linguagem natural, alternar idiomas e usar a clonagem de voz onde seus direitos e configuração de conta permitirem.
Inworld Realtime TTS-2 foi lançado em 31 de agosto de 2026 de acordo com os materiais do fornecedor citado.
Geralmente disponível por meio da API REST TTS da Inworld e da API Realtime compatível com OpenAI. As rotas de acesso listadas neste guia são Inworld AI.
US$ 25/1 milhão de caracteres sob demanda. As taxas de assinatura publicada caem para US$ 20, US$ 17,50, US$ 15 e US$ 12,50 por milhão de caracteres por nível, com preços corporativos anunciados a partir de US$ 5.
Geralmente disponível por meio da API REST TTS da Inworld e da API Realtime compatível com OpenAI. A cobertura da região padrão não está listada na página do modelo; os planos empresariais anunciam opções de residência de dados na UE e na Índia.
A Inworld anuncia retenção zero de dados como um complemento empresarial, mas sua página de suporte ZDR publicada atualmente nomeia apenas TTS-1.5 Mini e Max. Confirme a cobertura do TTS-2 diretamente antes de enviar texto regulamentado ou confidencial. A política pertence à rota do provedor e aos termos da conta, portanto, verifique-a novamente antes do uso em produção.
Comparações relacionadas
Modelo de raciocínio de fala para fala em tempo real do OpenAI para agentes de voz que usam ferramentas e que também precisam de contexto de texto e imagem.
Abrir comparação completaModelo de visualização de áudio para áudio do Google para diálogo de baixa latência com consciência multimodal, pensamento, base de pesquisa e chamada de função.
Abrir comparação completaModelo expressivo de conversão de texto em fala em tempo real do ElevenLabs para diálogo natural, entrega emocional, tags de áudio e mais de 70 idiomas.
Abrir comparação completaModelo atual de fala em fala em tempo real do SpaceXAI para agentes de conversação em menos de um segundo com acesso a ferramentas.
Abrir comparação completa