Veo 3.1
Modelo de video de vista previa de Google para generación guiada de texto, imágenes y video con audio nativo y opciones de salida de hasta 4K.
Modelo de video de vista previa de Google para generación guiada de texto, imágenes y video con audio nativo y opciones de salida de hasta 4K.
Descripción general en inglés sencillo
Veo 3.1 maneja clips cortos con audio sincronizado y admite generación, extensión, interpolación y flujos de trabajo basados en referencias a través de puntos finales de variantes específicas. La resolución, la duración y el modo de entrada están vinculados; No todas las combinaciones están disponibles.
Google publica un rango de latencia de solicitud inusualmente útil de 11 segundos a seis minutos durante los períodos pico. Se trata de un rango operativo, no de un punto de referencia de calidad, y una resolución más alta puede aumentar la latencia y el precio.
Comparación de categorías
Estas son especificaciones publicadas por el proveedor, no puntuaciones de referencia Cody. Siga las fuentes vinculadas para conocer los límites actuales y las excepciones específicas de los terminales.
Precios y comparaciones
Indica tu uso. La estimación se actualiza al escribir.
Ejemplo: clips de 8 segundos a 720p con audio. Los modelos incompatibles con estos ajustes no tendrán estimación.
Veo 3.1
Total estimado (USD)
Para el uso indicado · USD · Precio de API, no de suscripción
Las estimaciones excluyen impuestos, herramientas, almacenamiento/escritura de caché, cuotas gratuitas y descuentos personalizados. En imágenes solo incluyen la salida, no el prompt ni las referencias. Los modos de calidad varían. Los ajustes no listados no se consideran gratuitos.
Acceso a API y proveedores
Disponibilidad
Acceso a vista previa a través de Gemini API; Las variantes también están disponibles a través de plataformas seleccionadas.
Google publica restricciones regionales de generación de personas para ubicaciones de la UE, el Reino Unido, Suiza y MENA.
Consultar disponibilidad en vivoDatos y entrenamiento
Google dice que el contenido pago Gemini API no se utiliza para mejorar sus productos. Los videos generados se conservan en el servidor durante dos días y deben descargarse durante ese período.
Esta es una lectura concisa del material del proveedor citado, no un asesoramiento legal. Una puerta de enlace de terceros puede tener términos de almacenamiento, enrutamiento, capacitación y residencia diferentes a los de la API directa del fabricante del modelo.
Lea la política del proveedor.Preguntas frecuentes
Modelo de video de vista previa de Google para generación guiada de texto, imágenes y video con audio nativo y opciones de salida de hasta 4K. Veo 3.1 maneja clips cortos con audio sincronizado y admite generación, extensión, interpolación y flujos de trabajo basados en referencias a través de puntos finales de variantes específicas. La resolución, la duración y el modo de entrada están vinculados; No todas las combinaciones están disponibles.
Veo 3.1 se lanzó en 1 de septiembre de 2025 según los materiales del proveedor citados.
Acceso a vista previa a través de Gemini API; Las variantes también están disponibles a través de plataformas seleccionadas. Las rutas de acceso enumeradas en esta guía son Google, fal y Runway.
$0,40/segundo a 720p o 1080p. La salida estándar con audio cuesta $0,40/s a 720p o 1080p y $0,60/s a 4K. Las variantes Fast y Lite tienen tarifas diferentes.
Acceso a vista previa a través de Gemini API; Las variantes también están disponibles a través de plataformas seleccionadas. Google publica restricciones regionales de generación de personas para ubicaciones de la UE, el Reino Unido, Suiza y MENA.
Google dice que el contenido pago Gemini API no se utiliza para mejorar sus productos. Los videos generados se conservan en el servidor durante dos días y deben descargarse durante ese período. La política pertenece a la ruta del proveedor y a los términos de la cuenta, así que verifíquela nuevamente antes de usarla en producción.
Comparaciones relacionadas
El modelo heredado de video y audio sincronizado de OpenAI para clips cortos guiados por texto o imágenes, aún documentado, pero acercándose a un cierre permanente de la API.
Abrir comparación completaLa variante Veo 3.1 de menor costo de Google para crear rápidamente clips de video cortos con audio nativo y opciones de salida de hasta 4K.
Abrir comparación completaEl modelo de video para desarrolladores insignia de Runway para clips guiados por texto e imágenes, con formatos profesionales y una tasa base de crédito por segundo predecible.
Abrir comparación completaEl modelo de video Pro de Kuaishou se entrega a través de fal para generación de texto/imagen de tomas múltiples, audio nativo opcional, referencias y clips de hasta 15 segundos.
Abrir comparación completaUn modelo Kling económico en fal para clips fluidos de cinco o diez segundos generados a partir de texto o una imagen inicial.
Abrir comparación completaEl modelo de vídeo actual de SpaceXAI para convertir texto, imágenes o referencias en clips cortos con voz y sonido generados opcionalmente.
Abrir comparación completaEl modelo audiovisual actual de ByteDance para clips coherentes de hasta 30 segundos, con sonido nativo, narración extensa, referencias ricas y edición específica.
Abrir comparación completaFamilia de videos unificada de Alibaba para crear clips cortos con sonido a partir de texto, una imagen inicial o un video de referencia.
Abrir comparación completaModelo de vídeo centrado en la calidad Lightricks para crear clips de 720p o 1080p a partir de texto, imágenes o audio con sonido nativo.
Abrir comparación completaModelo de video de velocidad optimizada de LTX para entrada de texto, imagen o audio, sonido nativo, duración automática y salida de hasta 4K.
Abrir comparación completaEl modelo maduro de video de flujo de trabajo completo de LTX para generación más retomar, extender, reencuadrar, audio nativo y control del primero al último fotograma.
Abrir comparación completa