Anpassen der Voice Live-Eingabe und -Ausgabe

Voice Live bietet mehrere Optionen zum Optimieren der Leistung und Qualität mithilfe von benutzerdefinierten Modellen. Die folgenden Anpassungsoptionen sind derzeit verfügbar:

  • Anpassung der Spracheingabe:
    • Begriffsliste: Eine einfache Just-in-Time-Anpassung basierend auf einer Liste von Wörtern oder Ausdrücken, die als Teil der Sitzungskonfiguration bereitgestellt werden, um die Erkennungsqualität zu verbessern. Weitere Informationen finden Sie unter Verbessern der Erkennungsgenauigkeit mit der Begriffsliste.
    • Benutzerdefinierte Spracherkennung: Mit benutzerdefinierter Spracherkennung können Sie die Genauigkeit der Spracherkennung für Ihre Anwendungen und Produkte bewerten und verbessern und die Erkennungsqualität an Ihre Geschäftlichen Anforderungen anpassen. Weitere Informationen finden Sie unter "Was ist benutzerdefinierte Spracherkennung?" .
  • Anpassung der Sprachausgabe:
    • Benutzerdefiniertes Lexicon: Benutzerdefiniertes Lexicon ermöglicht es Ihnen, die Aussprache für Standard-Azure Text für Sprachstimmen und benutzerdefinierte Stimmen einfach anzupassen, um die Sprachsynthesegenauigkeit für Ihren Anwendungsfall zu verbessern. Weitere Informationen finden Sie im benutzerdefinierten Lexicon für Text zu Sprache .
    • Benutzerdefinierte Stimme: Benutzerdefinierte Stimme gibt es in zwei Arten. Mit professioneller, benutzerdefinierter Stimme können Sie eine sehr natürlich klingende Stimme für Ihre Marke oder Ihre Charaktere erstellen, indem Sie menschliche Sprachbeispiele als Feinabstimmungsdaten bereitstellen. Persönliche Stimme ermöglicht Ihren Benutzern, eine KI-generierte Replikation ihrer eigenen Stimme durch ein kurzes Sprachbeispiel zu erhalten. Sehen Sie sich an, was ist benutzerdefinierte Stimme? Und was ist persönliche Stimme? Weitere Informationen.
    • Benutzerdefinierter Avatar: Mit einem benutzerdefinierten Text-zu-Sprache-Avatar können Sie für Ihre Anwendung einen angepassten, einzigartigen synthetischen Sprech-Avatar erstellen. Mit benutzerdefiniertem Text zu Sprach-Avatar können Sie einen einzigartigen und natürlichen Avatar für Ihr Produkt oder Ihre Marke erstellen, indem Sie Videoaufzeichnungsdaten Ihrer ausgewählten Schauspieler bereitstellen. Lesen Sie Was ist ein benutzerdefinierter Text-zu-Sprache-Avatar?, um mehr zu erfahren.

Anpassung der Spracheingabe

Begriffsliste

Verwenden Sie die Begriffsliste für einfache Just-in-Time-Anpassungen bei der Audioeingabe. Zum Konfigurieren der Begriffsliste können Sie die phrase_list in der session.update Nachricht festlegen.

{
    "session": {
        "input_audio_transcription": {
            "model": "azure-speech",
            "phrase_list": ["Neo QLED TV", "TUF Gaming", "AutoQuote Explorer"]
        }
    }
}

Hinweis

Die Begriffsliste unterstützt derzeit whisper-1, gpt-4o-transcribe, gpt-4o-mini-transcribe und gpt-4o-transcribe-diarize nicht. Weitere Informationen zur Begriffsliste finden Sie in der Begriffsliste für Spracherkennung.

Benutzerdefinierte Sprachkonfiguration

Sie können das feld custom_speech verwenden, um Ihre benutzerdefinierten Sprachmodelle anzugeben. Dieses Feld wird als Wörterbuch definiert, wobei jeder Schlüssel einen Gebietsschemacode darstellt und jeder Wert dem Model ID benutzerdefinierten Sprachmodell entspricht. Weitere Informationen zu benutzerdefinierter Spracherkennung finden Sie unter Was ist benutzerdefinierte Sprache?.

Voice Live unterstützt die Verwendung einer Kombination aus Basismodellen und benutzerdefinierten Modellen, solange jeder Typ pro Gebietsschema eindeutig ist, wobei maximal 10 Sprachen insgesamt angegeben sind.

Beispiel für die Sitzungskonfiguration mit benutzerdefinierten Sprachmodellen. In diesem Beispiel, wenn die erkannte Sprache Englisch ist, wird das Basismodell verwendet und, wenn die erkannte Sprache Chinesisch ist, das benutzerdefinierte Sprachmodell verwendet.

{
  "session": {
    "input_audio_transcription": {
      "model": "azure-speech",
      "language": "en",
      "custom_speech": {
        "zh-CN": "847cb03d-7f22-4b11-444-e1be1d77bf17"
      }
    }
  }
}

Hinweis

Um ein benutzerdefiniertes Sprachmodell mit voice Live-API zu verwenden, muss das Modell auf derselben Microsoft Foundry-Ressource verfügbar sein, die Sie zum Aufrufen der Voice Live-API verwenden. Wenn Sie das Modell auf einer anderen Microsoft Foundry oder Azure Speech in Foundry Tools-Ressource trainiert haben, müssen Sie das Modell in die Ressource kopieren, die Sie zum Aufrufen der Voice Live-API verwenden. Sie bezahlen separat für benutzerdefinierte Sprachschulungen und Modellhosting. Benutzerdefinierte Spracherkennung wird nur im azure-speech Modell unterstützt.

Anpassung der Sprachausgabe

Benutzerdefiniertes Lexicon

Verwenden Sie die Zeichenfolgeneigenschaft custom_lexicon_url, um die Aussprache für Standard-Azure-Text-to-Speech-Stimmen und benutzerdefinierte Sprachstimmen anzupassen. Weitere Informationen zum Formatieren des benutzerdefinierten Wörterbuchs (identisch mit Speech Synthesis Markup Language (SSML)) finden Sie unter benutzerdefiniertes Lexicon für Text zu Sprache.

{
  "voice": {
    "name": "en-US-Ava:DragonHDLatestNeural",
    "type": "azure-standard",
    "temperature": 0.8, // optional
    "custom_lexicon_url": "<custom lexicon url>"
  }
}

Azure benutzerdefinierte Stimmen

Sie können eine benutzerdefinierte Stimme für die Audioausgabe verwenden. Benutzerdefinierte Stimme ist in zwei Arten verfügbar: professionelle benutzerdefinierte Stimme, trainiert auf Studioaufzeichnungen für Ihre Marke oder Charaktere und persönliche Stimme, die die eigene Stimme eines Benutzers aus einem kurzen Sprachbeispiel repliziert.

Wichtig

Der benutzerdefinierte Sprachzugriff ist auf der Grundlage von Berechtigungs- und Nutzungskriterien eingeschränkt . Fordern Sie Zugriff auf das Aufnahmeformular an.

Hinweis

Um ein benutzerdefiniertes VoIP-Modell mit voice Live-API verwenden zu können, muss das Modell in derselben Microsoft Foundry-Ressource verfügbar sein, die Sie zum Aufrufen der Voice Live-API verwenden. Wenn Sie das Modell auf einer anderen Microsoft Foundry- oder Azure Speech-Ressource trainiert haben, müssen Sie das Modell in die Ressource kopieren, die Sie zum Aufrufen der Voice Live-API verwenden. Sie bezahlen separat für benutzerdefinierte Sprachschulungen und Modellhosting. Weitere Informationen zu unterstützten Regionen finden Sie unter unterstützte Regionen des Spracherkennungsdiensts.

Professionelle benutzerdefinierte Stimme

Mit einer professionellen, individuell angepassten, synthetischen Stimme können Sie eine einzigartige, benutzerdefinierte Voice für Ihre Anwendungen erstellen, indem Sie menschliche Sprachbeispiele als Feinabstimmungsdaten bereitstellen. Informationen zum Erstellen einer benutzerdefinierten Stimme finden Sie unter "Was ist benutzerdefinierte Stimme".

{
  "voice": {
    "type": "azure-custom",
    "name": "en-US-CustomNeural",
    "endpoint_id": "your-endpoint-id", // a guid string
    "temperature": 0.8 // optional, value range 0.0-1.0, only take effect when using HD voices
  }
}

Persönliche Stimme

Persönliche Stimme ermöglicht Ihren Benutzern, eine KI-generierte Replikation ihrer eigenen Stimme durch ein kurzes Sprachbeispiel zu erhalten. Informationen zum Erstellen einer persönlichen Stimme finden Sie unter "Was ist persönliche Stimme".

{
  "voice": {
    "type": "azure-personal",
    "model": "DragonLatestNeural",  // required, specify the base model for personal voice
    "name": "your-personal-voice-name", // the name of the personal voice
    "temperature": 0.8  // optional, value range 0.0-1.0
  }
}

Die model Eigenschaft gibt den Namen der Basismodellstimme an. Zu den unterstützten Basismodellnamen gehören DragonLatestNeural und DragonHDOmniLatestNeural. Weitere Informationen zu Basismodellunterschieden finden Sie unter Verwenden persönlicher Spracherkennung in Ihrer Anwendung. Das vollständige Schema finden Sie unter RealtimeAzurePersonalVoice.

Azure benutzerdefinierter Avatar

Text-in-Sprache-Avatar wandelt Text in ein digitales Video eines fotorealistischen Menschen um (entweder als Standard-Avatar oder als benutzerdefinierter Text-in-Sprache-Avatar), der mit einer natürlich klingenden Stimme spricht.

Die Konfiguration für einen benutzerdefinierten Avatar unterscheidet sich nicht von der Konfiguration eines Standard-Avatars. Für eine detailliertes Beispiel, siehe Verwendung der Voice Live API – Azure-Avatar Text-to-Speech.

Wichtig

Der Zugriff auf benutzerdefinierte Text-zu-Sprache-Avatare ist aufgrund von Berechtigungs- und Nutzungskriterien eingeschränkt. Fordern Sie Zugriff auf das Aufnahmeformular an.

Hinweis

Um ein benutzerdefiniertes VoIP-Modell mit voice Live-API verwenden zu können, muss das Modell in derselben Microsoft Foundry-Ressource verfügbar sein, die Sie zum Aufrufen der Voice Live-API verwenden. Wenn Sie das Modell auf einer anderen Microsoft Foundry- oder Azure Speech-Ressource trainiert haben, müssen Sie das Modell in die Ressource kopieren, die Sie zum Aufrufen der Voice Live-API verwenden. Sie bezahlen separat für benutzerdefinierte Avatarschulungen und Modellhosting. Weitere Informationen zu unterstützten Regionen finden Sie unter unterstützte Regionen des Spracherkennungsdiensts.

Sprachsynchronisierung für benutzerdefinierte Avatare

Wenn Sie einen benutzerdefinierten Video-Avatar zusammen mit der Sprachsynchronisierung für Avatar trainiert haben, können Sie die Stimme als Synthesestimme verwenden. Setzen Sie voice.type auf avatar-voice-sync und voice.model auf das Basismodell für die synchronisierte Stimme. Zu den unterstützten Basismodellnamen gehören DragonLatestNeural und DragonHDOmniLatestNeural. Weitere Informationen zu Basismodellunterschieden finden Sie unter Verwenden persönlicher Spracherkennung in Ihrer Anwendung. Weitere Informationen zu benutzerdefinierten Avataren, die mit der Sprachsynchronisierung trainiert wurden, finden Sie unter Was ist benutzerdefinierter Text für Sprach-Avatar?

{
  "voice": {
    "type": "avatar-voice-sync",
    "model": "DragonHDOmniLatestNeural",
    "temperature": 0.8  // optional, value range 0.0-1.0
  }
}

Wenn avatar-voice-sync verwendet wird, ist die Stimme an den benutzerdefinierten Avatar gekoppelt; die name-Eigenschaft ist nicht erforderlich. Konfigurieren Sie den benutzerdefinierten Avatar separat, indem Sie den Parameter avatar verwenden, wie in Azure text to speech avatar dargestellt.