Scribe v2
Modelo multilíngue de conversão de fala em texto do ElevenLabs para transcrições detalhadas com muitos alto-falantes, tempo de palavra, eventos de áudio e grandes listas de termos-chave personalizados.
Modelo multilíngue de conversão de fala em texto do ElevenLabs para transcrições detalhadas com muitos alto-falantes, tempo de palavra, eventos de áudio e grandes listas de termos-chave personalizados.
Visão geral em inglês simples
O Scribe v2 transforma áudio ou vídeo longos em transcrições estruturadas com detecção de idioma, carimbos de data e hora de palavras, diarização do locutor e tags de áudio para eventos além da fala. A solicitação de termos-chave ajuda as equipes a preservar nomes, produtos e vocabulário que os modelos de reconhecimento geral muitas vezes ignoram.
ElevenLabs oferece transcrição de arquivos e uma rota em tempo real com preço separado. A plataforma mais ampla também fornece produtos de voz e de agente, o que pode simplificar os pipelines de áudio de um único fornecedor, embora cada capacidade tenha seus próprios controles de faturamento e dados.
Comparação de categorias
Estas são especificações publicadas pelo fornecedor, não pontuações de benchmark Cody. Siga as fontes vinculadas para limites atuais e exceções específicas de endpoint.
Preços e comparações
Defina seu uso. A estimativa é atualizada enquanto você digita.
Usa a duração em horas: 30 minutos = 0,5 hora. Recursos extras e cobranças mínimas podem alterar o total.
Scribe v2
ElevenLabs
Total estimado (USD)
Para o uso indicado · USD · Preço de API, não de assinatura
Estimativas sem impostos, ferramentas, armazenamento/gravação de cache, franquias gratuitas e descontos personalizados. Imagens incluem apenas a saída, sem prompt ou referências. Os modos de qualidade variam. Configurações não listadas não são consideradas gratuitas.
Acesso à API e ao provedor
Disponibilidade
Disponível por meio da API de fala para texto ElevenLabs e interfaces de produto; o tempo real usa uma rota de modelo separada.
As opções globais e de residência de dados dependem do plano ElevenLabs, do endpoint e da configuração empresarial.
Verifique a disponibilidade ao vivoDados e treinamento
ElevenLabs permite que clientes de API qualificados gerenciem preferências de uso de dados. A retenção zero de dados por meio de enable_logging=false é limitada a configurações corporativas qualificadas e modelos suportados, incluindo Scribe v2; verifique o plano ativo e o endpoint regional.
Esta é uma leitura concisa do material citado do fornecedor, e não um aconselhamento jurídico. Um gateway de terceiros pode ter diferentes termos de armazenamento, roteamento, treinamento e residência da API direta do criador do modelo.
Leia a política do provedorPerguntas frequentes
Modelo multilíngue de conversão de fala em texto do ElevenLabs para transcrições detalhadas com muitos alto-falantes, tempo de palavra, eventos de áudio e grandes listas de termos-chave personalizados. O Scribe v2 transforma áudio ou vídeo longos em transcrições estruturadas com detecção de idioma, carimbos de data e hora de palavras, diarização do locutor e tags de áudio para eventos além da fala. A solicitação de termos-chave ajuda as equipes a preservar nomes, produtos e vocabulário que os modelos de reconhecimento geral muitas vezes ignoram.
Scribe v2 foi lançado em 9 de janeiro de 2026 de acordo com os materiais do fornecedor citado.
Disponível por meio da API de fala para texto ElevenLabs e interfaces de produto; o tempo real usa uma rota de modelo separada. As rotas de acesso listadas neste guia são ElevenLabs e ElevenLabs API.
US$ 0,22/hora de áudio para Scribe v2. ElevenLabs lista preços separados para lote Scribe v2 e Scribe v2 Realtime. A detecção e a redação de entidades podem ser cobradas separadamente.
Disponível por meio da API de fala para texto ElevenLabs e interfaces de produto; o tempo real usa uma rota de modelo separada. As opções globais e de residência de dados dependem do plano ElevenLabs, do endpoint e da configuração empresarial.
ElevenLabs permite que clientes de API qualificados gerenciem preferências de uso de dados. A retenção zero de dados por meio de enable_logging=false é limitada a configurações corporativas qualificadas e modelos suportados, incluindo Scribe v2; verifique o plano ativo e o endpoint regional. A política pertence à rota do provedor e aos termos da conta, portanto, verifique-a novamente antes do uso em produção.
Comparações relacionadas
Modelo de reconhecimento de fala de streaming do Meta para legendas ao vivo, áudio longo, muitos alto-falantes, troca de código e transcrição com reconhecimento de domínio.
Abrir comparação completaModelo de transcrição em lote rápido do Microsoft para gravações longas, rótulos de alto-falante, tempo de palavra, polarização de palavras-chave e transcrições limpas ou literais.
Abrir comparação completaModelo geral de fala para texto do Google Cloud para streaming, arquivo e transcrição de lote dinâmico de baixo custo em vários idiomas e regiões.
Abrir comparação completaModelo de transcrição focado na precisão do AssemblyAI para arquivos e áudio ao vivo, com troca de código, rótulos de alto-falante, carimbos de data e hora e prompts contextuais.
Abrir comparação completa