Udtræk information fra lyd og video

Fuldført

Tip

Se fanen Tekst og billeder for flere detaljer!

Forretningsinformation findes i stigende grad i multimedieformater som lyd- og videofiler. For eksempel optager virksomheder ofte opkald for at analysere dem senere. Væksten i videokonferencer betyder, at nyttig information ofte indfanges i optagede møder. Azure Content Understanding understøtter både lyd- og videodataudtrækning og analyse.

Udtrækning af strukturerede data fra lyd

Du kan bruge Azure Content Understanding til at levere transskriptioner, resuméer og andre vigtige indsigter fra lydfiler.

Lad os antage, at du vil have AI til at opsummere din talebesked. Du kan definere et skema med nøgleindsigt, der skal udtrækkes fra hvert optagede opkald, f.eks.:

  • Opkalds
  • Meddelelsesoversigt
  • Anmodede handlinger
  • Tilbagekaldsnummer
  • Alternative kontaktoplysninger

Lad os antage, at en opkalder efterlader dig følgende talebesked:

Hi, this is Ava from Contoso.

Just calling to follow up on our meeting last week.

I wanted to let you know that I've run the numbers and I think we can meet your price expectations.

Please call me back on 555-12345 or send me an e-mail at Ava@contoso.com and we'll discuss next steps.

Thanks, bye!

Ved at bruge Azure Content Understanding til at analysere lydoptagelsen og anvende dit skema giver du følgende resultater:

  • Kalder: Ava fra Contoso
  • Meddelelsesoversigt: Ava fra Contoso ringede for at følge op på et møde og nævnte, at de kan opfylde prisforventningerne. De bad om et opkald eller en e-mail for at drøfte næste skridt.
  • Anmodede handlinger: Ring tilbage, eller send en mail for at diskutere de næste trin.
  • Tilbagekaldsnummer: 555-12345
  • Alternative kontaktoplysninger: Ava@contoso.com

Analyse af lyd i Foundry-portalen

Ligesom med dokumentanalyse er brugen af Content Understanding i den nye Foundry-portal en hurtig måde at validere, at din analysator returnerer de felter, du forventer, før du automatiserer arbejdsgangen i koden.

I portalen kan du:

  • Vælg en lyd- eller videoanalysator og kør den på en mediefil.
  • Gennemgå output som transskriptioner (til lyd) og udtrukne indsigter baseret på dit skema.
  • Se de returnerede JSON-resultater for videre behandling i nedstrøms systemer.

Lad os se på, hvordan vi kan bruge indholdsforståelse til at analysere en opkaldsoptagelse. I stedet for at lytte til hele opkaldet, kan du køre den forudbyggede lydanalysator for at udtrække information fra lyden. Når analysen er færdig, kan du se en skriftlig transskription af opkaldet.

Skærmbillede af den nye Foundry-portal med lyd analyseret med Azure Content Understanding.

I de returnerede resultater kan du se specifik information fra opkaldet. Som med andre analysatorer i indholdsforståelse er resultaterne i JSON-format til videre behandling.

Skærmbillede af den nye Foundry-portal, hvor lyden analyseres, og JSON returneres.

Udtrækning af strukturerede data fra video

Azure Content Understanding understøtter også videoanalyse. For eksempel kan du analysere en optaget videokonference for at udtrække detaljer om fremmøde, placering og andre oplysninger.

Lad os først se på et billede fra mødelokalets kamera. Antag, at du definerede følgende skema:

  • Sted
  • Personer, der deltager personligt
  • Eksterne deltagere
  • Samlet antal deltagere

Du kunne bruge Azure Content Understanding til at analysere et billede fra mødelokalets kamera:

Foto af en person i et mødelokale ved et opkald med tre eksterne deltagere.

Efter at have anvendt skemaet på billedet, returnerede Azure Content Understanding strukturerede data:

  • Placering: Mødelokale
  • Personligt mødedeltagere: 1
  • Eksterne deltagere: 3
  • Deltagere i alt: 4

Overvej, hvad du kunne tilføje til skemaet til en videooptagelse af mødet. Du kan inkludere fremmødetællinger på forskellige tidspunkter, detaljer om hvem der talte under opkaldet, og hvad de sagde, et resumé af diskussionen og en liste over tildelte handlinger fra mødet.

At bygge en klientapplikation med lyd- eller videoanalysatorer

For at analysere lyd eller video programmatisk kan du bygge en letvægts klientapplikation ved hjælp af Content Understanding API'en.

Lad os se på et eksempel med Python SDK. Når du kører følgende kode, analyserer den en lydfil ved hjælp af en forudbygget analysator. Den forudbyggede analysator identificeres som prebuilt-audioSearch.

import os
from azure.ai.contentunderstanding import ContentUnderstandingClient
from azure.core.credentials import AzureKeyCredential

# Endpoint and key for your Foundry resource
endpoint = os.environ["FOUNDRY_ENDPOINT"]  # e.g., "https://<resource>.services.ai.azure.com/"
key = os.environ["FOUNDRY_KEY"]

client = ContentUnderstandingClient(
    endpoint=endpoint,
    credential=AzureKeyCredential(key)
)

# Choose a prebuilt analyzer for audio
# (The documents module lists examples like prebuilt-audioSearch / prebuilt-videoSearch.)
analyzer_id = "prebuilt-audioSearch"

# Provide an input audio file (URL shown here; you can swap in your own accessible media URL)
inputs = [
    {"url": "https://<your-host>/samples/voicemail.wav"}
]

# Start analysis (asynchronous long-running operation)
poller = client.begin_analyze(analyzer_id=analyzer_id, inputs=inputs)

# Wait for completion (SDK polls under the hood)
result = poller.result()

# Inspect the structured output (JSON-like objects)
for content in result.contents:
    # Some analyzers may return a transcript and/or extracted fields depending on the analyzer and schema
    print("=== MARKDOWN / TRANSCRIPT (if provided) ===")
    print(getattr(content, "markdown", None))

    print("\n=== EXTRACTED FIELDS ===")
    print(getattr(content, "fields", None))

Lyd- og videoanalyse med indholdsforståelse i Microsoft Foundry åbner op for en hel række muligheder for at frigøre potentialet i forretningsdata i ethvert format. Prøv derefter Content Understanding selv.