Comparación de modelos
MAI-Transcribe-2 y Chirp 3
Compare MAI-Transcribe-2 y Chirp 3 utilizando la misma rúbrica reconocimiento y transcripción de voz del proveedor. Sin puntuación misteriosa ni clasificación de referencia inventada.
Comparación de modelos
Compare MAI-Transcribe-2 y Chirp 3 utilizando la misma rúbrica reconocimiento y transcripción de voz del proveedor. Sin puntuación misteriosa ni clasificación de referencia inventada.
Indica tu uso. La estimación se actualiza al escribir.
Usa la duración en horas: 30 minutos = 0,5 horas. Funciones extra y cargos mínimos pueden cambiar el total.
Las estimaciones excluyen impuestos, herramientas, almacenamiento/escritura de caché, cuotas gratuitas y descuentos personalizados. En imágenes solo incluyen la salida, no el prompt ni las referencias. Los modos de calidad varían. Los ajustes no listados no se consideran gratuitos.
| modelo | Acceso | Total estimado (USD) |
|---|---|---|
| Chirp 3Google Cloud | Google Cloud | Sin tarifa revisada |
| MAI-Transcribe-2Microsoft | Microsoft | Sin tarifa revisada |
Toma rápida
El rápido modelo de transcripción por lotes de Microsoft para grabaciones largas, etiquetas de oradores, sincronización de palabras, sesgo de palabras clave y transcripciones limpias o textuales.
La cifra de una hora en aproximadamente diez segundos de Microsoft es una afirmación del proveedor, no un SLA garantizado. Compare su propio audio y confirme el precio posterior a la vista previa, la región de implementación, las cuotas y la configuración de retención.
El modelo general de voz a texto de Google Cloud para transmisión, archivos y transcripción por lotes dinámicos de bajo costo en muchos idiomas y regiones.
Consulte la tabla Chirp 3 para conocer su idioma y región precisos. Las etiquetas de los hablantes, las marcas de tiempo, la adaptación y el comportamiento de los lotes tienen restricciones específicas de ruta que un único número de cobertura puede ocultar.
Compara los hechos publicados
Los valores utilizan las unidades y límites publicados de cada proveedor. Un espacio en blanco significa que el proveedor no publicó un valor directamente comparable en las fuentes revisadas.
| Reconocimiento y transcripción de voz | MAI-Transcribe-2 | Chirp 3 |
|---|---|---|
| Precio de transcripciónPrecio actual del proveedor por hora o minuto de audio para la ruta de procesamiento indicada. | $0.10 / hora de audio tarifa por tiempo limitado | $0,016/min estándar · $0,003/min lote dinámico |
| En vivo o por lotesSi el modelo maneja transmisiones en tiempo real, grabaciones cargadas o ambas. | Transcripción rápida por lotes y de formato largo | Streaming, sincrónico y por lotes |
| IdiomasCobertura de idiomas publicada por el proveedor, separando la cobertura capacitada o anunciada de los idiomas específicamente verificados cuando sea necesario. | 60 idiomas | Más de 85 idiomas y configuraciones regionales |
| Etiquetas de altavozSi el modelo identifica quién habló y el límite de oradores publicado. | si | Compatible con un subconjunto documentado de idiomas |
| Marcas de tiempoInformación de sincronización disponible a nivel de palabra, segmento o enunciado. | Marcas de tiempo a nivel de palabra | Marcas de tiempo a nivel de palabra con restricciones de ruta |
| control de vocabularioMejora de palabras clave, ortografía personalizada, contexto, indicaciones u otras formas de mejorar los términos del dominio. | Sesgo de palabras clave, salida limpia/textual, detección automática de idioma | Adaptación del habla, vocabulario personalizado, detección de idioma, eliminación de ruido. |
| donde usarloAPI directa, catálogo en la nube, aplicación o punto final regional documentado por el proveedor. | Microsoft Foundry / Azur | Google Cloud Voz a texto V2 |
como elegir
Comience con el trabajo que necesita completar y luego valide los detalles del costo, el acceso y la política en la ruta exacta de su proveedor.
Microsoft dice que las indicaciones, resultados, incrustaciones y datos de entrenamiento enviados a Foundry Models no están disponibles para los proveedores de modelos y no se utilizan para entrenar modelos básicos sin permiso. Los detalles de retención y monitoreo de abuso dependen del servicio implementado.
Enlaces de proveedores y API
Google dice que el contenido de voz a texto no se utiliza más allá de proporcionar el servicio a menos que el cliente opte por el registro de datos. El contenido en streaming y sincrónico se maneja en la memoria; Los resultados asincrónicos pueden conservarse temporalmente según lo documentado.
Enlaces de proveedores y API
Preguntas frecuentes
MAI-Transcribe-2: El rápido modelo de transcripción por lotes de Microsoft para grabaciones largas, etiquetas de oradores, sincronización de palabras, sesgo de palabras clave y transcripciones limpias o textuales. Chirp 3: El modelo general de voz a texto de Google Cloud para transmisión, archivos y transcripción por lotes dinámicos de bajo costo en muchos idiomas y regiones.
Considere MAI-Transcribe-2 cuando su prioridad sea Llamadas y reuniones grabadas de alto volumen. Considere Chirp 3 cuando su prioridad sea Transcripción en la nube multilingüe. Pruebe ambos con sus propios datos y la ruta del proveedor antes de comprometerse.
No. Esta comparación alinea los datos publicados por el proveedor para la categoría Reconocimiento y transcripción de voz. No reclama un ganador universal ni combina puntuaciones de referencia de terceros incompatibles.