Muse Voice Transcribe
Modelo de reconhecimento de fala de streaming do Meta para legendas ao vivo, áudio longo, muitos alto-falantes, troca de código e transcrição com reconhecimento de domínio.
Modelo de reconhecimento de fala de streaming do Meta para legendas ao vivo, áudio longo, muitos alto-falantes, troca de código e transcrição com reconhecimento de domínio.
Visão geral em inglês simples
O Muse Voice Transcribe foi projetado para fala que chega continuamente, e não apenas como um upload finalizado. Ele pode processar pequenos pedaços de áudio, decidir quando uma expressão termina, rotular muitos falantes e usar linguagem, palavras-chave e dicas de contexto para melhorar nomes ou vocabulário especializado.
Meta anuncia amplo treinamento multilíngue, ao mesmo tempo que identifica um conjunto menor de idiomas especificamente verificados. Essa distinção é útil para compras: teste os sotaques exatos, os padrões de troca de código, o ruído e a sobreposição de alto-falantes em suas próprias chamadas antes de tratar o conjunto mais amplo de treinamento como cobertura de produção.
Comparação de categorias
Estas são especificações publicadas pelo fornecedor, não pontuações de benchmark Cody. Siga as fontes vinculadas para limites atuais e exceções específicas de endpoint.
Preços e comparações
Defina seu uso. A estimativa é atualizada enquanto você digita.
Usa a duração em horas: 30 minutos = 0,5 hora. Recursos extras e cobranças mínimas podem alterar o total.
Muse Voice Transcribe
Meta
Total estimado (USD)
Para o uso indicado · USD · Preço de API, não de assinatura
Estimativas sem impostos, ferramentas, armazenamento/gravação de cache, franquias gratuitas e descontos personalizados. Imagens incluem apenas a saída, sem prompt ou referências. Os modos de qualidade variam. Configurações não listadas não são consideradas gratuitas.
Acesso à API e ao provedor
Disponibilidade
Disponível por meio de Meta Model API, Meta AI para Mac e Muse Code durante a visualização pública da Model API.
Meta não enumera uma lista de países ou regiões de processamento específicas do modelo na página de lançamento pública; use os termos atuais da conta do desenvolvedor.
Verifique a disponibilidade ao vivoDados e treinamento
A página de lançamento do Meta descreve a privacidade para sua demonstração pública, não uma retenção completa da API do modelo ou compromisso de uso de treinamento. Revise os termos atuais da Model API e os controles corporativos antes de enviar áudio confidencial.
Esta é uma leitura concisa do material citado do fornecedor, e não um aconselhamento jurídico. Um gateway de terceiros pode ter diferentes termos de armazenamento, roteamento, treinamento e residência da API direta do criador do modelo.
Leia a política do provedorPerguntas frequentes
Modelo de reconhecimento de fala de streaming do Meta para legendas ao vivo, áudio longo, muitos alto-falantes, troca de código e transcrição com reconhecimento de domínio. O Muse Voice Transcribe foi projetado para fala que chega continuamente, e não apenas como um upload finalizado. Ele pode processar pequenos pedaços de áudio, decidir quando uma expressão termina, rotular muitos falantes e usar linguagem, palavras-chave e dicas de contexto para melhorar nomes ou vocabulário especializado.
Muse Voice Transcribe foi lançado em 1 de setembro de 2026 de acordo com os materiais do fornecedor citado.
Disponível por meio de Meta Model API, Meta AI para Mac e Muse Code durante a visualização pública da Model API. As rotas de acesso listadas neste guia são Meta Model API e Meta.
US$ 0,18/hora de áudio. Meta lista esta taxa de API de modelo no catálogo revisado. As franquias de produtos no Meta AI para Mac ou no Muse Code podem ser diferentes.
Disponível por meio de Meta Model API, Meta AI para Mac e Muse Code durante a visualização pública da Model API. Meta não enumera uma lista de países ou regiões de processamento específicas do modelo na página de lançamento pública; use os termos atuais da conta do desenvolvedor.
A página de lançamento do Meta descreve a privacidade para sua demonstração pública, não uma retenção completa da API do modelo ou compromisso de uso de treinamento. Revise os termos atuais da Model API e os controles corporativos antes de enviar áudio confidencial. A política pertence à rota do provedor e aos termos da conta, portanto, verifique-a novamente antes do uso em produção.
Comparações relacionadas
Modelo de transcrição em lote rápido do Microsoft para gravações longas, rótulos de alto-falante, tempo de palavra, polarização de palavras-chave e transcrições limpas ou literais.
Abrir comparação completaModelo geral de fala para texto do Google Cloud para streaming, arquivo e transcrição de lote dinâmico de baixo custo em vários idiomas e regiões.
Abrir comparação completaModelo de transcrição focado na precisão do AssemblyAI para arquivos e áudio ao vivo, com troca de código, rótulos de alto-falante, carimbos de data e hora e prompts contextuais.
Abrir comparação completaModelo multilíngue de conversão de fala em texto do ElevenLabs para transcrições detalhadas com muitos alto-falantes, tempo de palavra, eventos de áudio e grandes listas de termos-chave personalizados.
Abrir comparação completa