Model generowania mowy Google do ekspresyjnej narracji, głosów postaci i dialogów w 130 językach.
0,50 USD za wejście tekstowe · 9 USD za wyjście audio / 1 mln tokenów
Przeczytaj przewodnikFirma modelująca sztuczną inteligencję
Google rozwija rodzinę Gemini wraz ze specjalistycznymi modelami mediów, dokumentów, głosu i świata z Google DeepMind i Google Cloud. Dostęp różni się w zależności od produktów Gemini API, Vertex AI, Google Cloud i podglądów badań.
Informacje o Google
Model generowania mowy Google do ekspresyjnej narracji, głosów postaci i dialogów w 130 językach.
0,50 USD za wejście tekstowe · 9 USD za wyjście audio / 1 mln tokenów
Przeczytaj przewodnikTańszy model generowania mowy Google do odczytywania tekstu i masowej produkcji audio w 101 językach.
0,50 USD za wejście tekstowe · 6 USD za wyjście audio / 1 mln tokenów
Przeczytaj przewodnikStabilny, wysokowydajny model multimodalny Google do zastosowań agentów, pracy z oprogramowaniem i dużych danych wejściowych z różnych multimediów w początkowej cenie warstwy Flash.
Wejście 0,75 USD · Wyjście 3,75 USD / 1 milion tokenów
Przeczytaj przewodnikWszechstronny moduł obrazu Google do szybkiego generowania, edycji konwersacyjnej, wielu odniesień, ugruntowanych obrazów i wyników do 4K.
Obraz 0,067 USD / 1 tys
Przeczytaj przewodnikPodgląd modelu wideo Google do generowania tekstu, obrazu i wideo z natywnym dźwiękiem i opcjami wyjściowymi do 4K.
0,40 USD / sekundę w rozdzielczości 720p lub 1080p
Przeczytaj przewodnikTańszy wariant Veo 3.1 Google do szybkiego tworzenia krótkich klipów wideo z natywnym dźwiękiem i opcjami wyjściowymi do 4K.
0,10–0,30 USD / wygenerowana sekunda
Przeczytaj przewodnikFlagowy model muzyczny Google zapewniający kompletne utwory o wysokiej jakości z bogatszymi aranżacjami, wyrazistym wokalem, uporządkowanymi tekstami i szczegółową kontrolą kreatywną.
0,08 USD / cały utwór
Przeczytaj przewodnikModel głosowy Google do płynnych rozmów w czasie rzeczywistym z dźwiękiem, tekstem i kontekstem wizualnym.
Wejście audio 0,005 USD/min · Wyjście audio 0,018 USD/min
Przeczytaj przewodnikOsobny model głosowy Gemini, który przetwarza złożone prośby w tle, podtrzymując rozmowę.
Wejście audio 0,005 USD/min · Wyjście audio 0,018 USD/min
Przeczytaj przewodnikModel Google typu audio-to-audio umożliwiający dialog o niskim opóźnieniu ze świadomością multimodalną, myśleniem, uziemieniem wyszukiwania i wywoływaniem funkcji.
Wejście audio 0,005 USD/min · Wyjście audio 0,018 USD/min
Przeczytaj przewodnikModel świata badawczego Google DeepMind do generowania fotorealistycznych, kontrolowanych środowisk, które można badać w czasie rzeczywistym na podstawie opisu tekstowego.
Nieopublikowane
Przeczytaj przewodnikAnalizator składni Google Cloud wspomagany przez Gemini do zachowywania hierarchii dokumentów i tworzenia fragmentów bogatych w kontekst na potrzeby wyszukiwania korporacyjnego i RAG.
10 dolarów za 1000 stron
Przeczytaj przewodnikProcesor AI oparty na technologii Gemini firmy Google Cloud do wyodrębniania dokładnych pól i wartości pochodnych zdefiniowanych w schemacie biznesowym.
30 USD / 1000 stron za pierwszy milion stron
Przeczytaj przewodnikMultimodalny model osadzania Google do umieszczania tekstu, obrazów, wideo, audio i plików PDF w jednej przeszukiwalnej przestrzeni wektorowej.
Wyślij SMS o wartości 0,20 $ / 1 milion
Przeczytaj przewodnikOgólny model zamiany mowy na tekst Google Cloud do przesyłania strumieniowego, plików i taniej dynamicznej transkrypcji wsadowej w wielu językach i regionach.
Standard 0,016 USD/min · Partia dynamiczna 0,003 USD/min
Przeczytaj przewodnik