Shrnutí

Dokončeno

Tip

Další podrobnosti najdete na kartě Text a obrázky .

V tomto modulu jsme prozkoumali modely podporující vizi v Microsoft Foundry a jejich použití k analýze obrázků a generování původních obrázků a videí.

Modul zahrnoval multimodální modely, které podporují analýzu obrázků. Probrali jsme také modely generování obrázků, jako jsou modely generování obrázků v GPT-Image rodině, pro vytváření a úpravy obrázků z výzev pomocí nástrojů a rozhraní API Foundry. Nakonec jsme představili generování videa s modely Sora, které umožňují vytváření text-to-video a obraz-na-video prostřednictvím interaktivních prostředí i asynchronních programových pracovních postupů REST.

Modely vizuální AI v Microsoft Foundry pomáhají překlenout mezeru mezi vizuálními daty a jazykovou AI. Umožňují scénáře, jako jsou analýza dokumentů a obrázků, vizuální asistenti, nástroje pro usnadnění přístupu a multimodální AI agenti—což dělá porozumění obrazům přirozeným rozšířením moderních aplikací umělé inteligence.

Další informace najdete na následujících odkazech: