Chirp 3
El modelo general de voz a texto de Google Cloud para transmisión, archivos y transcripción por lotes dinámicos de bajo costo en muchos idiomas y regiones.
El modelo general de voz a texto de Google Cloud para transmisión, archivos y transcripción por lotes dinámicos de bajo costo en muchos idiomas y regiones.
Descripción general en inglés sencillo
Chirp 3 se encuentra dentro de Google Cloud Speech-to-Text V2, por lo que admite varios patrones operativos en lugar de una aplicación fija. Los equipos pueden usarlo para transmisiones en vivo, solicitudes sincrónicas breves o lotes asincrónicos y pueden agregar detección de idioma, adaptación del habla y eliminación de ruido cuando la región y el idioma seleccionados los admitan.
Su matriz de características no es uniforme en todos los idiomas. La diarización y algunas opciones de adaptación se aplican a los subconjuntos documentados, y la ubicación del punto final afecta la disponibilidad. Por lo tanto, la comparación correcta es un idioma, una región y un modo de solicitud exactos, no solo el idioma del título.
Comparación de categorías
Estas son especificaciones publicadas por el proveedor, no puntuaciones de referencia Cody. Siga las fuentes vinculadas para conocer los límites actuales y las excepciones específicas de los terminales.
Precios y comparaciones
Indica tu uso. La estimación se actualiza al escribir.
Usa la duración en horas: 30 minutos = 0,5 horas. Funciones extra y cargos mínimos pueden cambiar el total.
Chirp 3
Google Cloud
Total estimado (USD)
Para el uso indicado · USD · Precio de API, no de suscripción
Las estimaciones excluyen impuestos, herramientas, almacenamiento/escritura de caché, cuotas gratuitas y descuentos personalizados. En imágenes solo incluyen la salida, no el prompt ni las referencias. Los modos de calidad varían. Los ajustes no listados no se consideran gratuitos.
Acceso a API y proveedores
Disponibilidad
Generalmente disponible en Google Cloud Speech-to-Text V2 con rutas de reconocimiento por streaming, sincrónicas y por lotes.
Las funciones y los idiomas admitidos varían según la región Google Cloud; elija un punto final regional de la documentación en vivo Chirp 3.
Consultar disponibilidad en vivoDatos y entrenamiento
Google dice que el contenido de voz a texto no se utiliza más allá de proporcionar el servicio a menos que el cliente opte por el registro de datos. El contenido en streaming y sincrónico se maneja en la memoria; Los resultados asincrónicos pueden conservarse temporalmente según lo documentado.
Esta es una lectura concisa del material del proveedor citado, no un asesoramiento legal. Una puerta de enlace de terceros puede tener términos de almacenamiento, enrutamiento, capacitación y residencia diferentes a los de la API directa del fabricante del modelo.
Lea la política del proveedor.Preguntas frecuentes
El modelo general de voz a texto de Google Cloud para transmisión, archivos y transcripción por lotes dinámicos de bajo costo en muchos idiomas y regiones. Chirp 3 se encuentra dentro de Google Cloud Speech-to-Text V2, por lo que admite varios patrones operativos en lugar de una aplicación fija. Los equipos pueden usarlo para transmisiones en vivo, solicitudes sincrónicas breves o lotes asincrónicos y pueden agregar detección de idioma, adaptación del habla y eliminación de ruido cuando la región y el idioma seleccionados los admitan.
Chirp 3 se lanzó en 13 de octubre de 2025 según los materiales del proveedor citados.
Generalmente disponible en Google Cloud Speech-to-Text V2 con rutas de reconocimiento por streaming, sincrónicas y por lotes. Las rutas de acceso enumeradas en esta guía son Google Cloud.
$0,016/min estándar · $0,003/min lote dinámico. Estas son las tasas actuales de voz a texto Google Cloud para las rutas de reconocimiento relevantes; los niveles de volumen elegibles y los contratos de nube pueden cambiar el costo efectivo.
Generalmente disponible en Google Cloud Speech-to-Text V2 con rutas de reconocimiento por streaming, sincrónicas y por lotes. Las funciones y los idiomas admitidos varían según la región Google Cloud; elija un punto final regional de la documentación en vivo Chirp 3.
Google dice que el contenido de voz a texto no se utiliza más allá de proporcionar el servicio a menos que el cliente opte por el registro de datos. El contenido en streaming y sincrónico se maneja en la memoria; Los resultados asincrónicos pueden conservarse temporalmente según lo documentado. La política pertenece a la ruta del proveedor y a los términos de la cuenta, así que verifíquela nuevamente antes de usarla en producción.
Comparaciones relacionadas
Modelo de reconocimiento de voz en streaming de Meta para subtítulos en vivo, audio largo, muchos parlantes, cambio de código y transcripción con reconocimiento de dominio.
Abrir comparación completaEl rápido modelo de transcripción por lotes de Microsoft para grabaciones largas, etiquetas de oradores, sincronización de palabras, sesgo de palabras clave y transcripciones limpias o textuales.
Abrir comparación completaEl modelo de transcripción centrado en la precisión de AssemblyAI para archivos y audio en vivo, con cambio de código, etiquetas de oradores, marcas de tiempo e indicaciones contextuales.
Abrir comparación completaModelo multilingüe de voz a texto ElevenLabs para transcripciones detalladas con muchos hablantes, sincronización de palabras, eventos de audio y grandes listas de términos clave personalizados.
Abrir comparación completa