Syntetiser tale

Fullført

Tip

Se fanen Tekst og bilder for mer informasjon!

Talesyntese, eller tekst-til-tale, er det motsatte av tale-til-tekst. Det innebærer å sende tekst til en modell, som returnerer en lydstrøm av den vokaliserte teksten.

Modeller som støtter tekst-til-tale-operasjoner inkluderer:

  • GPT-4O-TTS
  • GPT-4O-Mini-TTS

Bemerkning

Modelltilgjengeligheten varierer etter region. Se gjennom tabellen for regional tilgjengelighet i Microsoft Foundry-dokumentasjonen.

Bruk av en tekst-til-tale-modell

På samme måte som med tale-til-tekst-modeller kan du bruke AzureOpenAI-klienten i OpenAI SDK for å koble til endepunktet for Microsoft Foundry-ressursen din, og laste opp tekst til en tekst-til-tale-modell for talesyntese.

from openai import AzureOpenAI
from pathlib import Path

# Create an AzureOpenAI client
client = AzureOpenAI(
    azure_endpoint=YOUR_FOUNDRY_ENDPOINT,
    api_key=YOUR_FOUNDRY_KEY,
    api_version="2025-03-01-preview"
)

# Path for audio output file
speech_file_path = Path("output_speech.wav")

# Generate speech and save to file
with client.audio.speech.with_streaming_response.create(
            model=YOUR_MODEL_DEPLOYMENT,
            voice="alloy",
            input="This speech was AI-generated!",
            instructions="Speak in an upbeat, excited tone.",
    ) as response:
    response.stream_to_file(speech_file_path)

print(f"Speech generated and saved to {speech_file_path}")