Scribe v2
Modèle de synthèse vocale multilingue de ElevenLabs pour des transcriptions détaillées avec de nombreux locuteurs, une synchronisation des mots, des événements audio et de grandes listes de mots clés personnalisées.
Modèle de synthèse vocale multilingue de ElevenLabs pour des transcriptions détaillées avec de nombreux locuteurs, une synchronisation des mots, des événements audio et de grandes listes de mots clés personnalisées.
Présentation de l'anglais simple
Scribe v2 transforme les longs fichiers audio ou vidéo en transcriptions structurées avec détection de la langue, horodatage des mots, diarisation du locuteur et balises audio pour les événements au-delà de la parole. Les invites de termes clés aident les équipes à préserver les noms, les produits et le vocabulaire qui manquent souvent aux modèles de reconnaissance générale.
ElevenLabs propose une transcription de fichiers et un itinéraire en temps réel facturé séparément. La plate-forme plus large fournit également des produits vocaux et d'agent, qui peuvent simplifier les pipelines audio d'un seul fournisseur, bien que chaque fonctionnalité ait ses propres contrôles de facturation et de données.
Comparaison des catégories
Il s'agit de spécifications publiées par le fournisseur et non de scores de référence Cody. Suivez les sources liées pour connaître les limites actuelles et les exceptions spécifiques aux points de terminaison.
Tarifs et comparaisons
Indiquez votre utilisation. L’estimation se met à jour à chaque modification.
Utilise la durée en heures : 30 minutes = 0,5 heure. Options et frais minimums peuvent modifier la facture.
Scribe v2
ElevenLabs
Total estimé (USD)
Pour l’utilisation indiquée · USD · Tarif API, hors abonnement
Les estimations excluent taxes, outils, stockage/écriture du cache, quotas gratuits et remises personnalisées. Pour les images, seule la sortie est incluse, pas le prompt ni les références. Les modes de qualité varient. Un paramètre non répertorié n’est pas gratuit.
Accès API et fournisseur
Disponibilité
Disponible via l'API de synthèse vocale et les interfaces produit ElevenLabs ; le temps réel utilise un itinéraire de modèle distinct.
Les options globales et de résidence des données dépendent du plan ElevenLabs, du point de terminaison et de la configuration de l'entreprise.
Vérifier la disponibilité en directDonnées et formation
ElevenLabs permet aux clients API éligibles de gérer leurs préférences d'utilisation des données. La conservation zéro des données via activate_logging=false est limitée aux configurations d'entreprise éligibles et aux modèles pris en charge, notamment Scribe v2 ; vérifiez le plan en direct et le point de terminaison régional.
Il s'agit d'une lecture concise du matériel du fournisseur cité, et non d'un avis juridique. Une passerelle tierce peut avoir des conditions de stockage, de routage, de formation et de résidence différentes de celles de l'API directe du modéliste.
Lire la politique du fournisseurQuestions fréquemment posées
Modèle de synthèse vocale multilingue de ElevenLabs pour des transcriptions détaillées avec de nombreux locuteurs, une synchronisation des mots, des événements audio et de grandes listes de mots clés personnalisées. Scribe v2 transforme les longs fichiers audio ou vidéo en transcriptions structurées avec détection de la langue, horodatage des mots, diarisation du locuteur et balises audio pour les événements au-delà de la parole. Les invites de termes clés aident les équipes à préserver les noms, les produits et le vocabulaire qui manquent souvent aux modèles de reconnaissance générale.
Scribe v2 a été publié sur 9 janvier 2026 selon les documents du fournisseur cités.
Disponible via l'API de synthèse vocale et les interfaces produit ElevenLabs ; le temps réel utilise un itinéraire de modèle distinct. Les voies d'accès répertoriées dans ce guide sont ElevenLabs et ElevenLabs API.
0,22 $/heure audio pour Scribe v2. ElevenLabs répertorie des tarifs distincts pour les lots Scribe v2 et Scribe v2 Realtime. La détection et la rédaction d'entités peuvent être facturées séparément.
Disponible via l'API de synthèse vocale et les interfaces produit ElevenLabs ; le temps réel utilise un itinéraire de modèle distinct. Les options globales et de résidence des données dépendent du plan ElevenLabs, du point de terminaison et de la configuration de l'entreprise.
ElevenLabs permet aux clients API éligibles de gérer leurs préférences d'utilisation des données. La conservation zéro des données via activate_logging=false est limitée aux configurations d'entreprise éligibles et aux modèles pris en charge, notamment Scribe v2 ; vérifiez le plan en direct et le point de terminaison régional. La politique appartient à l'itinéraire du fournisseur et aux conditions du compte, vérifiez-la donc à nouveau avant de l'utiliser en production.
Comparaisons associées
Modèle de reconnaissance vocale en streaming de Meta pour les sous-titres en direct, l'audio long, de nombreux haut-parleurs, la commutation de code et la transcription sensible au domaine.
Ouvrir la comparaison complèteModèle de transcription par lots rapide de Microsoft pour les enregistrements longs, les étiquettes des locuteurs, la synchronisation des mots, la polarisation des mots clés et les transcriptions claires ou textuelles.
Ouvrir la comparaison complèteModèle général de synthèse vocale de Google Cloud pour le streaming, les fichiers et la transcription par lots dynamiques à faible coût dans de nombreuses langues et régions.
Ouvrir la comparaison complèteModèle de transcription axé sur la précision du AssemblyAI pour les fichiers et l'audio en direct, avec commutation de code, étiquettes de locuteur, horodatages et invites contextuelles.
Ouvrir la comparaison complète