Opsamling
Tip
Se fanen Tekst og billeder for flere detaljer!
I dette modul udforskede vi visionskompatible modeller i Microsoft Foundry og hvordan man bruger dem til at analysere billeder og generere originale billeder og videoer.
Modulet dækkede multimodale modeller, som understøtter billedanalyse. Vi dækkede også billedgenereringsmodeller, såsom dem i GPT-Image-familien, til oprettelse og redigering af billeder fra prompts ved hjælp af Foundry-værktøjer og API'er. Endelig introducerede vi videogenerering med Sora-modeller, som muliggør tekst-til-video og billed-til-video skabelse gennem både interaktive legepladser og programmatiske, asynkrone REST-workflows.
Overordnet set hjælper visuelle AI-modeller i Microsoft Foundry med at bygge bro mellem visuelle data og sprogbaseret AI. De muliggør scenarier som dokument- og billedanalyse, visuelle assistenter, tilgængelighedsværktøjer og multimodale AI-agenter – hvilket gør billedforståelse til en naturlig udvidelse af moderne AI-applikationer.
For at lære mere, se følgende links:
- Prøv en billedanalyse quickstart fra dokumentationen.
- Lær mere om visionsaktiverede chatmodeller.
- Lær mere om Azure OpenAI billedgenereringsmodeller.
- Lær mere om videogenerering med Sora.