MAI-Transcribe-2
Modelo de transcrição em lote rápido do Microsoft para gravações longas, rótulos de alto-falante, tempo de palavra, polarização de palavras-chave e transcrições limpas ou literais.
Modelo de transcrição em lote rápido do Microsoft para gravações longas, rótulos de alto-falante, tempo de palavra, polarização de palavras-chave e transcrições limpas ou literais.
Visão geral em inglês simples
O MAI-Transcribe-2 tem como objetivo transformar rapidamente grandes arquivos de áudio em texto utilizável. Microsoft combina reconhecimento multilíngue com diarização, carimbos de data/hora em nível de palavra, detecção automática de idioma e controles para saber se a transcrição preserva palavras de preenchimento ou retorna uma prosa mais limpa.
O acesso é executado por meio de Microsoft Foundry, o que torna o modelo uma opção natural para organizações que já gerenciam identidades, regiões e controles de dados no Azure. O preço de lançamento é explicitamente limitado por tempo, portanto as projeções de custos devem reter uma margem para uma taxa padrão futura.
Comparação de categorias
Estas são especificações publicadas pelo fornecedor, não pontuações de benchmark Cody. Siga as fontes vinculadas para limites atuais e exceções específicas de endpoint.
Preços e comparações
Defina seu uso. A estimativa é atualizada enquanto você digita.
Usa a duração em horas: 30 minutos = 0,5 hora. Recursos extras e cobranças mínimas podem alterar o total.
MAI-Transcribe-2
Microsoft
Total estimado (USD)
Para o uso indicado · USD · Preço de API, não de assinatura
Estimativas sem impostos, ferramentas, armazenamento/gravação de cache, franquias gratuitas e descontos personalizados. Imagens incluem apenas a saída, sem prompt ou referências. Os modos de qualidade variam. Configurações não listadas não são consideradas gratuitas.
Acesso à API e ao provedor
Disponibilidade
Disponível através do Microsoft Foundry para reconhecimento de fala em lote e formato longo.
A disponibilidade de implantação segue o catálogo do modelo Microsoft Foundry em tempo real e a região do Azure escolhida pelo cliente.
Verifique a disponibilidade ao vivoDados e treinamento
Microsoft diz que prompts, saídas, incorporações e dados de treinamento enviados aos modelos Foundry não estão disponíveis para provedores de modelos e não são usados para treinar modelos básicos sem permissão. Os detalhes de retenção e monitoramento de abuso dependem do serviço implantado.
Esta é uma leitura concisa do material citado do fornecedor, e não um aconselhamento jurídico. Um gateway de terceiros pode ter diferentes termos de armazenamento, roteamento, treinamento e residência da API direta do criador do modelo.
Leia a política do provedorPerguntas frequentes
Modelo de transcrição em lote rápido do Microsoft para gravações longas, rótulos de alto-falante, tempo de palavra, polarização de palavras-chave e transcrições limpas ou literais. O MAI-Transcribe-2 tem como objetivo transformar rapidamente grandes arquivos de áudio em texto utilizável. Microsoft combina reconhecimento multilíngue com diarização, carimbos de data/hora em nível de palavra, detecção automática de idioma e controles para saber se a transcrição preserva palavras de preenchimento ou retorna uma prosa mais limpa.
MAI-Transcribe-2 foi lançado em 3 de setembro de 2026 de acordo com os materiais do fornecedor citado.
Disponível através do Microsoft Foundry para reconhecimento de fala em lote e formato longo. As rotas de acesso listadas neste guia são Microsoft AI e Microsoft Foundry.
US$ 0,10 / hora de áudio pela taxa de visualização por tempo limitado. Microsoft rotula isso como preço por tempo limitado. Confirme o catálogo da Foundry ao vivo antes de prever o custo de produção sustentado.
Disponível através do Microsoft Foundry para reconhecimento de fala em lote e formato longo. A disponibilidade de implantação segue o catálogo do modelo Microsoft Foundry em tempo real e a região do Azure escolhida pelo cliente.
Microsoft diz que prompts, saídas, incorporações e dados de treinamento enviados aos modelos Foundry não estão disponíveis para provedores de modelos e não são usados para treinar modelos básicos sem permissão. Os detalhes de retenção e monitoramento de abuso dependem do serviço implantado. A política pertence à rota do provedor e aos termos da conta, portanto, verifique-a novamente antes do uso em produção.
Comparações relacionadas
Modelo de reconhecimento de fala de streaming do Meta para legendas ao vivo, áudio longo, muitos alto-falantes, troca de código e transcrição com reconhecimento de domínio.
Abrir comparação completaModelo geral de fala para texto do Google Cloud para streaming, arquivo e transcrição de lote dinâmico de baixo custo em vários idiomas e regiões.
Abrir comparação completaModelo de transcrição focado na precisão do AssemblyAI para arquivos e áudio ao vivo, com troca de código, rótulos de alto-falante, carimbos de data e hora e prompts contextuais.
Abrir comparação completaModelo multilíngue de conversão de fala em texto do ElevenLabs para transcrições detalhadas com muitos alto-falantes, tempo de palavra, eventos de áudio e grandes listas de termos-chave personalizados.
Abrir comparação completa