MAI-Transcribe-2
Model szybkiej transkrypcji wsadowej Microsoft do długich nagrań, etykiet głośników, synchronizacji słów, stronniczości słów kluczowych i czystych lub dosłownych transkrypcji.
Model szybkiej transkrypcji wsadowej Microsoft do długich nagrań, etykiet głośników, synchronizacji słów, stronniczości słów kluczowych i czystych lub dosłownych transkrypcji.
Przegląd w prostym języku angielskim
MAI-Transcribe-2 ma na celu szybkie przekształcenie dużych plików audio w użyteczny tekst. Microsoft łączy rozpoznawanie wielojęzyczne z diaaryzacją, znacznikami czasu na poziomie słów, automatycznym wykrywaniem języka i kontrolą tego, czy transkrypcja zachowuje słowa wypełniające, czy zwraca czystszą prozę.
Dostęp przebiega poprzez Microsoft Foundry, co sprawia, że model jest naturalnym rozwiązaniem dla organizacji, które już zarządzają tożsamościami, regionami i kontrolą danych na platformie Azure. Cena wprowadzenia na rynek jest wyraźnie ograniczona czasowo, dlatego w prognozach kosztów należy zachować marżę dla przyszłej stawki standardowej.
Porównanie kategorii
Są to specyfikacje opublikowane przez dostawcę, a nie wyniki testów porównawczych Cody. Skorzystaj z połączonych źródeł, aby poznać aktualne limity i wyjątki specyficzne dla punktu końcowego.
Ceny i porównania
Podaj zużycie. Szacunek aktualizuje się podczas wpisywania.
Używa czasu nagrania w godzinach: 30 minut = 0,5 godziny. Dodatkowe funkcje i opłaty minimalne mogą zmienić rachunek.
MAI-Transcribe-2
Microsoft
Szacowany koszt (USD)
Dla podanego użycia · USD · Cena API, nie abonamentu
Szacunki nie obejmują podatków, narzędzi, zapisu i przechowywania pamięci podręcznej, darmowych limitów ani rabatów. Dla obrazów obejmują tylko wynik, bez promptu i obrazów referencyjnych. Tryby jakości różnią się. Brak stawki nie oznacza bezpłatności.
Dostęp do API i dostawcy
Dostępność
Dostępne za pośrednictwem Microsoft Foundry do rozpoznawania mowy wsadowej i długiej.
Dostępność wdrożenia jest zgodna z aktualnym katalogiem modeli Microsoft Foundry i regionem platformy Azure wybranym przez klienta.
Sprawdź dostępność na żywoDane i szkolenia
Microsoft mówi, że podpowiedzi, dane wyjściowe, osadzania i dane szkoleniowe przesłane do Foundry Models nie są dostępne dla dostawców modeli i nie są wykorzystywane do uczenia modeli podstawowych bez pozwolenia. Szczegóły przechowywania i monitorowania nadużyć zależą od wdrożonej usługi.
Jest to zwięzła lektura cytowanych materiałów dostawcy, a nie porada prawna. Brama innej firmy może mieć inne warunki przechowywania, routingu, szkolenia i miejsca zamieszkania niż bezpośrednie API twórcy modelu.
Przeczytaj politykę dostawcyCzęsto zadawane pytania
Model szybkiej transkrypcji wsadowej Microsoft do długich nagrań, etykiet głośników, synchronizacji słów, stronniczości słów kluczowych i czystych lub dosłownych transkrypcji. MAI-Transcribe-2 ma na celu szybkie przekształcenie dużych plików audio w użyteczny tekst. Microsoft łączy rozpoznawanie wielojęzyczne z diaaryzacją, znacznikami czasu na poziomie słów, automatycznym wykrywaniem języka i kontrolą tego, czy transkrypcja zachowuje słowa wypełniające, czy zwraca czystszą prozę.
Według materiałów cytowanego dostawcy MAI-Transcribe-2 został wydany na 3 września 2026.
Dostępne za pośrednictwem Microsoft Foundry do rozpoznawania mowy wsadowej i długiej. Drogi dostępu wymienione w tym przewodniku to Microsoft AI i Microsoft Foundry.
0,10 USD za godzinę audio w przypadku ograniczonej czasowo stawki podglądu. Microsoft określa to jako cenę ograniczoną czasowo. Przed prognozowaniem stałych kosztów produkcji potwierdź aktualny katalog Foundry.
Dostępne za pośrednictwem Microsoft Foundry do rozpoznawania mowy wsadowej i długiej. Dostępność wdrożenia jest zgodna z aktualnym katalogiem modeli Microsoft Foundry i regionem platformy Azure wybranym przez klienta.
Microsoft mówi, że podpowiedzi, dane wyjściowe, osadzania i dane szkoleniowe przesłane do Foundry Models nie są dostępne dla dostawców modeli i nie są wykorzystywane do uczenia modeli podstawowych bez pozwolenia. Szczegóły przechowywania i monitorowania nadużyć zależą od wdrożonej usługi. Polityka należy do warunków trasy dostawcy i konta, dlatego sprawdź ją ponownie przed użyciem w środowisku produkcyjnym.
Powiązane porównania
Model Meta do strumieniowego rozpoznawania mowy dla napisów na żywo, długiego dźwięku, wielu głośników, przełączania kodów i transkrypcji uwzględniającej domeny.
Otwórz pełne porównanieOgólny model zamiany mowy na tekst Google Cloud do przesyłania strumieniowego, plików i taniej dynamicznej transkrypcji wsadowej w wielu językach i regionach.
Otwórz pełne porównanieModel AssemblyAI zorientowany na dokładność transkrypcji plików i dźwięku na żywo, z przełączaniem kodów, etykietami głośników, znacznikami czasu i podpowiedziami kontekstowymi.
Otwórz pełne porównanieWielojęzyczny model zamiany mowy na tekst ElevenLabs umożliwiający szczegółowe transkrypcje z wieloma mówcami, synchronizacją słów, zdarzeniami audio i dużymi niestandardowymi listami kluczowych terminów.
Otwórz pełne porównanie