Transkriber tale

Fullført

Tip

Se fanen Tekst og bilder for mer informasjon!

Taletranskripsjon, eller tale-til-tekst, innebærer å sende lydinnhold til en modell, som svarer med en tekstbasert transkripsjon av talen i lydkilden.

Modeller som støtter tale-til-tekst-operasjoner inkluderer:

  • GPT-4O-Transkribere
  • GPT-4o-mini-transkribering
  • GPT-4O-transkribere-diarize

Bemerkning

Modelltilgjengeligheten varierer etter region. Se gjennom tabellen for regional tilgjengelighet i Microsoft Foundry-dokumentasjonen.

Bruk av tale-til-tekst-modell

For å bruke en tale-til-tekst-modell i din egen applikasjon, kan du bruke AzureOpenAI-klienten i OpenAI SDK for å koble til endepunktet for Microsoft Foundry-ressursen din, og laste opp innholdet fra en lydfil til modellen for transkripsjon.

from openai import AzureOpenAI
from pathlib import Path

# Create an AzureOpenAI client
client = AzureOpenAI(
    azure_endpoint=YOUR_FOUNDRY_ENDPOINT,
    api_key=YOUR_FOUNDRY_KEY,
    api_version="2025-03-01-preview"
)

# Get the audio file
file_path = Path("speech.mp3")
audio_file = open(file_path, "rb")

# Use the model to transcribe the audio file
transcription = client.audio.transcriptions.create(
    model=YOUR_MODEL_DEPLOYMENT,
    file=audio_file,
    response_format="text"
)

print(transcription)