Opsamling

Fuldført

Tip

Se fanen Tekst og billeder for flere detaljer!

I dette modul udforskede vi visionskompatible modeller i Microsoft Foundry og hvordan man bruger dem til at analysere billeder og generere originale billeder og videoer.

Modulet dækkede multimodale modeller, som understøtter billedanalyse. Vi dækkede også billedgenereringsmodeller, såsom dem i GPT-Image-familien, til oprettelse og redigering af billeder fra prompts ved hjælp af Foundry-værktøjer og API'er. Endelig introducerede vi videogenerering med Sora-modeller, som muliggør tekst-til-video og billed-til-video skabelse gennem både interaktive legepladser og programmatiske, asynkrone REST-workflows.

Overordnet set hjælper visuelle AI-modeller i Microsoft Foundry med at bygge bro mellem visuelle data og sprogbaseret AI. De muliggør scenarier som dokument- og billedanalyse, visuelle assistenter, tilgængelighedsværktøjer og multimodale AI-agenter – hvilket gør billedforståelse til en naturlig udvidelse af moderne AI-applikationer.

For at lære mere, se følgende links: