Veo 3.1
Das Vorschauvideomodell von Google für die text-, bild- und videogeführte Generierung mit nativem Audio und Ausgabeoptionen bis zu 4K.
Das Vorschauvideomodell von Google für die text-, bild- und videogeführte Generierung mit nativem Audio und Ausgabeoptionen bis zu 4K.
Übersicht in einfacher englischer Sprache
Veo 3.1 verarbeitet kurze Clips mit synchronisiertem Audio und unterstützt Generierung, Erweiterung, Interpolation und referenzgesteuerte Workflows über variantenspezifische Endpunkte. Auflösung, Dauer und Eingabemodus sind miteinander verknüpft; nicht jede Kombination ist verfügbar.
Google veröffentlicht einen ungewöhnlich nützlichen Anforderungslatenzbereich von 11 Sekunden bis sechs Minuten in Spitzenzeiten. Dabei handelt es sich um einen Betriebsbereich, nicht um einen Qualitätsmaßstab, und eine höhere Auflösung kann die Latenz und den Preis erhöhen.
Kategorievergleich
Hierbei handelt es sich um vom Anbieter veröffentlichte Spezifikationen, nicht um Cody-Benchmark-Ergebnisse. Folgen Sie den verlinkten Quellen für aktuelle Grenzwerte und endpunktspezifische Ausnahmen.
Preise und Vergleiche
Geben Sie Ihre Nutzung ein. Die Schätzung wird sofort aktualisiert.
Beispiel: 8-Sekunden-Clips in 720p mit Audio. Modelle ohne Unterstützung dieser Einstellungen erhalten keine Schätzung.
Veo 3.1
Geschätzte Summe (USD)
Für die angegebene Nutzung · USD · API-Preis, kein Abonnement
Schätzungen ohne Steuern, Tools, Cache-Speicherung/-Schreiben, Freikontingente und individuelle Rabatte. Bei Bildern zählt nur die Ausgabe, nicht Prompt oder Referenzbilder. Qualitätsmodi unterscheiden sich. Nicht aufgeführte Einstellungen gelten nicht als kostenlos.
API- und Provider-Zugriff
Verfügbarkeit
Vorschauzugriff über Gemini API; Varianten sind auch über ausgewählte Plattformen verfügbar.
Google veröffentlicht regionale Personengenerierungsbeschränkungen für Standorte in der EU, im Vereinigten Königreich, in der Schweiz und in der MENA-Region.
Überprüfen Sie die Live-VerfügbarkeitDaten und Schulung
Laut Google werden kostenpflichtige Gemini API-Inhalte nicht zur Verbesserung seiner Produkte verwendet. Erstellte Videos werden zwei Tage lang auf dem Server gespeichert und sollten in diesem Zeitraum heruntergeladen werden.
Hierbei handelt es sich um eine prägnante Lektüre des zitierten Anbietermaterials und nicht um eine Rechtsberatung. Ein Drittanbieter-Gateway kann andere Speicher-, Routing-, Schulungs- und Residenzbedingungen haben als die direkte API des Modellherstellers.
Lesen Sie die Richtlinien des AnbietersHäufig gestellte Fragen
Das Vorschauvideomodell von Google für die text-, bild- und videogeführte Generierung mit nativem Audio und Ausgabeoptionen bis zu 4K. Veo 3.1 verarbeitet kurze Clips mit synchronisiertem Audio und unterstützt Generierung, Erweiterung, Interpolation und referenzgesteuerte Workflows über variantenspezifische Endpunkte. Auflösung, Dauer und Eingabemodus sind miteinander verknüpft; nicht jede Kombination ist verfügbar.
Veo 3.1 wurde gemäß den zitierten Anbietermaterialien auf 1. September 2025 veröffentlicht.
Vorschauzugriff über Gemini API; Varianten sind auch über ausgewählte Plattformen verfügbar. Die in diesem Handbuch aufgeführten Zugriffsrouten sind Google, fal und Runway.
0,40 $/Sekunde bei 720p oder 1080p. Die Standardausgabe mit Audio kostet 0,40 $/s bei 720p oder 1080p und 0,60 $/s bei 4K. Fast- und Lite-Varianten haben unterschiedliche Tarife.
Vorschauzugriff über Gemini API; Varianten sind auch über ausgewählte Plattformen verfügbar. Google veröffentlicht regionale Personengenerierungsbeschränkungen für Standorte in der EU, im Vereinigten Königreich, in der Schweiz und in der MENA-Region.
Laut Google werden kostenpflichtige Gemini API-Inhalte nicht zur Verbesserung seiner Produkte verwendet. Erstellte Videos werden zwei Tage lang auf dem Server gespeichert und sollten in diesem Zeitraum heruntergeladen werden. Die Richtlinie gehört zu den Routen- und Kontobedingungen des Anbieters. Überprüfen Sie sie daher vor der produktiven Nutzung erneut.
Verwandte Vergleiche
Das alte synchronisierte Audio-Video-Modell von OpenAI für kurze text- oder bildgesteuerte Clips – immer noch dokumentiert, aber kurz vor einer dauerhaften API-Abschaltung.
Vollständigen Vergleich öffnenDie kostengünstigere Veo 3.1-Variante von Google für die schnelle Erstellung kurzer Videoclips mit nativem Audio und Ausgabeoptionen bis zu 4K.
Vollständigen Vergleich öffnenRunways Flaggschiff-Entwickler-Videomodell für text- und bildgesteuerte Clips mit professionellen Formaten und einer vorhersehbaren Basisrate pro Sekunde.
Vollständigen Vergleich öffnenDas über fal bereitgestellte Pro-Videomodell von
Vollständigen Vergleich öffnenEin kostenbewusstes Kling-Modell auf fal für flüssige fünf- oder zehnsekündige Clips, die aus Text oder einem Startbild generiert werden.
Vollständigen Vergleich öffnenDas aktuelle Videomodell von SpaceXAI zum Umwandeln von Text, Bildern oder Referenzen in kurze Clips mit optional generierter Sprache und Ton.
Vollständigen Vergleich öffnenDas aktuelle audiovisuelle Modell von ByteDance für zusammenhängende Clips mit einer Länge von bis zu 30 Sekunden, mit nativem Ton, langem Storytelling, umfangreichen Referenzen und gezielter Bearbeitung.
Vollständigen Vergleich öffnenDie einheitliche Videofamilie von Alibaba zum Erstellen kurzer Clips mit Ton aus Text, einem Startbild oder einem Referenzvideo.
Vollständigen Vergleich öffnenDas qualitätsorientierte Videomodell Lightricks zum Erstellen von 720p- oder 1080p-Clips aus Text, Bildern oder Audio mit nativem Ton.
Vollständigen Vergleich öffnenDas geschwindigkeitsoptimierte Videomodell von LTX für Text-, Bild- oder Audioeingabe, nativer Ton, automatische Dauer und Ausgabe bis zu 4K.
Vollständigen Vergleich öffnenDas ausgereifte Full-Workflow-Videomodell von LTX für die Generierung plus Retake, Extend, Reframe, natives Audio und Steuerung vom ersten bis zum letzten Bild.
Vollständigen Vergleich öffnen