Qu’est-ce que l’avatar de synthèse vocale ?

L’avatar de synthèse vocale convertit le texte en une vidéo numérique d’un humain photoréaliste (soit un avatar standard, soit un avatar de synthèse vocale personnalisé) s'exprimant avec une voix naturelle. Vous pouvez synthétiser la vidéo d’un avatar vocal de manière asynchrone ou en temps réel. Les développeurs peuvent créer des applications intégrées à l’avatar de synthèse vocale via une API ou utiliser l’avatar de synthèse vocale dans Foundry pour créer du contenu vidéo sans coder.

En utilisant les modèles avancés d’avatars de synthèse vocale, vous pouvez créer des vidéos d’avatars parlants synthétiques réalistes et de haute qualité pour diverses applications, tout en respectant les pratiques d’IA responsable.

Conseil

Pour convertir text to speech avec une approche sans code, essayez l’avatar Microsoft Foundry Synthèse vocale.

Fonctionnalités d’avatar

Les fonctionnalités d’avatar de synthèse vocale sont les suivantes :

  • Convertit le texte en une vidéo numérique d'un humain photoréaliste parlant avec des voix naturelles grâce à la technologie de synthèse vocale d'Azure AI.
  • Fournit une collection d’avatars standard. Consultez les avatars Standard pour obtenir la liste complète des avatars standard pris en charge.
  • Azure IA pour la synthèse vocale génère la voix de l’avatar. Pour plus d’informations, consultez la voix et la langue avatar.
  • Synthétise le texte vers la vidéo d’avatar vocal de manière asynchrone avec l’API de synthèse par lots ou en temps réel.
  • Utilisez l’outil avatar de synthèse vocale dans Microsoft Foundry pour créer du contenu vidéo sans coder.
  • Active les conversations d’avatar en temps réel via le Voice Live in Foundry.
  • Créez un agent vocal avec avatar dans Voice Live.

En utilisant les modèles avancés de réseau neuronal de l’avatar de synthèse vocale et le modèle Microsoft VASA de l’avatar photo, vous pouvez créer des vidéos d’avatars parlants synthétiques, réalistes et de haute qualité pour diverses applications, tout en respectant des pratiques responsables en matière d’IA.

Voix et langue de l’avatar

Vous pouvez choisir parmi une gamme de voix standard pour l’avatar. La prise en charge linguistique de l’avatar de synthèse vocale correspond à celle de la synthèse vocale. Pour plus d’informations, consultez la prise en charge de la langue et de la voix pour le service Speech. Vous pouvez accéder à des avatars standard de synthèse vocale via Microsoft Foundry Synthèse vocale avatar ou via l’API.

La voix de la vidéo synthétique peut être une voix standard Azure Speech dans Foundry Tools ou la voix personnalisée du talent vocal que vous avez sélectionné.

Type d’avatar

  • Avatar vidéo : L’avatar est généré à l’aide d’un modèle affiné avec un enregistrement vidéo pour le réglage précis. Il prend en charge les représentations de demi-corps et de corps intégral.
  • Avatar photo : vous créez un avatar à partir d’une unique image d’entrée utilisée comme requête et reste limité à une représentation de la tête uniquement. Photo Avatar est disponible en deux variantes : avatar photo standard, qui génère une vidéo de conversation à partir d’une seule photo et un avatar photo personnalisé, qui vous permet d’affiner l’apparence de l’avatar à partir de votre propre image. Pour plus d’informations sur la variante personnalisée, voir Qu’est-ce que l’avatar de synthèse vocale personnalisé ?

Sortie vidéo de l'avatar

Pour l’avatar vidéo ou l’avatar avec le corps, la synthèse par lots et la résolution de synthèse en temps réel sont par défaut de 1920 x 1080. Vous pouvez choisir d’entraîner des avatars personnalisés de résolution 4K, et le taux d’images par seconde (FPS) est de 25. Pour la synthèse par lots, le codec peut être H264, HEVC ou AV1 si le format est mp4. Il peut être VP9 ou AV1 si le format est webm. Seul vp9 peut contenir un canal alpha. Pour la synthèse en temps réel, le codec est H264. Vous pouvez configurer la vitesse de transmission vidéo dans la requête pour la synthèse par lots et la synthèse en temps réel. La valeur par défaut est 2 000 000. Vous trouverez des configurations plus détaillées dans l’exemple de code. La résolution d’avatar photo est de 512 x 512 pour la synthèse par lots et la synthèse en temps réel.

Avatar vidéo

Synthèse par lots Synthèse en temps réel
Résolution 1920 x 1080/3840 x 2160 1920 x 1080/3840 x 2160
FPS 25 25
Codec H264/HEVC/VP9/AV1 H264

Photo d'avatar

Synthèse par lots Synthèse en temps réel
Résolution 512x512 512x512
FPS 25 25
Codec H264/HEVC/VP9 H264

Avatar de synthèse vocale personnalisé

Vous pouvez créer des avatars de synthèse vocale personnalisés uniques à votre produit ou marque. Pour un avatar vidéo personnalisé, tout ce qu’il faut pour commencer est de 10 minutes d’enregistrements vidéo. Pour un avatar de photo personnalisé, vous avez besoin d’une photo avec environ une minute d’audio de consentement, que le service utilise pour mieux faire correspondre la voix à l’avatar. Si vous ajustez une voix professionnelle pour l’acteur, l’avatar peut être très réaliste.

Plusieurs options sont disponibles pour la partie vocale d’un avatar personnalisé :

1. Synchronisation vocale pour avatar

La synchronisation vocale pour avatar est l’option de voix personnalisée la plus efficace pour un avatar vidéo personnalisé. Il s’entraîne en même temps que l’avatar personnalisé à l’aide de l’audio de la vidéo d’entraînement. La voix associe exclusivement l’avatar personnalisé et ne peut pas être utilisée indépendamment. La synchronisation vocale pour avatar n’est disponible que pour l’avatar vidéo personnalisé. Pour plus d’informations, consultez Synchronisation vocale pour avatar.

2. Voix professionnelle

La voix professionnelle est un type de voix personnalisée qui offre une qualité de voix supérieure. L’ajustement précis de la voix et l’avatar personnalisé de synthèse vocale ont des processus distincts pour obtenir un accès limité et pour entraîner les modèles. Vous pouvez les utiliser indépendamment ou ensemble. Si vous envisagez également d’utiliser le réglage de la voix professionnelle avec un avatar de synthèse vocale, vous devez déployer ou copier votre modèle vocal professionnel affiné dans l’une des régions prises en charge par avatar.

3. Voix personnelle

La voix personnelle offre une qualité audio comparable à la synchronisation vocale pour avatar et peut être utilisée avec des avatars ou indépendamment.

Pour plus d’informations, consultez Présentation de l’avatar de synthèse vocale personnalisé.

Exemple de code

L’exemple de code pour l’avatar de synthèse vocale est disponible sur GitHub. Ces exemples couvrent les scénarios les plus populaires :

Prix

  • Pendant toute la durée d’une session en temps réel avec un avatar ou lors de la génération de contenu par lots, la synthèse vocale est facturée séparément.
  • La synchronisation vocale pour un avatar (par le biais d’une formation d’avatar personnalisée) coûte la même chose qu’une voix personnelle pour la création et la synthèse vocales. Le stockage de la voix est gratuit.
  • Pour savoir comment la facturation fonctionne pour la fonctionnalité d’avatar de synthèse vocale, consultez la note de tarification de l’avatar de synthèse vocale.
  • Pour obtenir des tarifs détaillés, consultez la tarification du service Speech. La tarification des avatars est visible uniquement pour les régions de service où la fonctionnalité est disponible. Pour obtenir la liste actuelle des régions prises en charge, consultez la table des régions du service Speech.

Emplacements disponibles

Pour obtenir la liste actuelle des régions qui prennent en charge l’avatar de synthèse vocale, consultez le tableau des régions du service Speech.

IA responsable

Microsoft s’intéresse aux personnes qui utilisent l’IA et les personnes qui sont affectées par elle autant qu’elle s’intéresse à la technologie. Pour plus d’informations, consultez les notes de transparence de l'IA responsable et les divulgations pour les talents de voix et d'avatar.

Étapes suivantes