Látásmodellek lekérdezése

Ebben a cikkben megtudhatja, hogyan írhat lekérdezési kéréseket a vizuális feladatokra optimalizált, a Unity AI Gateway által kiszolgált alapmodellekhez.

Tip

Genie Code (ügynöki módban) meg tudja tenni ezt Ön helyett. Próbálja ki ezt a példaüzenetet:

Query the databricks-claude-sonnet-4-5 model using the OpenAI client, sending a base64-encoded image from a URL alongside a text question, and print the response.

A Modellkiszolgáló egységes API-t biztosít a képek megértéséhez és elemzéséhez különböző alapmodellek használatával, így hatékony multimodális képességeket érhet el. Ez a funkció a Databricks által üzemeltetett modellek kiválasztásával érhető el az Alapmodell API-k részeként, valamint a külső modelleket kiszolgáló végpontok kiszolgálásával.

Requirements

Lekérdezési példák

Megjegyzés:

Az alábbi példák a Unity AI Gatewayen és a modellszolgáltatásokon alapulnak. Ha modellszolgáltatások helyett végpontokat kiszolgáló modellt használ, cserélje le a modellszolgáltatás nevét egy végpontnévre. A rendelkezésre álló alapmodellek, valamint azok modellszolgáltatásainak és végpontneveinek listáját a Foundation Model API-kban elérhető Databricks által üzemeltetett alapmodellek között találja.

OpenAI-ügyfél

Az OpenAI-ügyfél használatához adja meg bemenetként a model modellszolgáltatás nevét.


from openai import OpenAI
import base64
import requests

# Get the workspace API URL and token from the notebook context
API_ROOT = dbutils.notebook.entry_point.getDbutils().notebook().getContext().apiUrl().get()
API_TOKEN = dbutils.notebook.entry_point.getDbutils().notebook().getContext().apiToken().get()

client = OpenAI(
    api_key=API_TOKEN,
    base_url=f"{API_ROOT}/ai-gateway/mlflow/v1",
)

# Download and encode image
image_url = "https://upload.wikimedia.org/wikipedia/commons/a/a7/Camponotus_flavomarginatus_ant.jpg"
resp = requests.get(image_url)
resp.raise_for_status()
image_data = base64.b64encode(resp.content).decode("utf-8")

# OpenAI request
completion = client.chat.completions.create(
    model="system.ai.claude-sonnet-4-5",
    messages=[
        {
            "role": "user",
            "content": [
                {"type": "text", "text": "what's in this image?"},
                {
                    "type": "image_url",
                    "image_url": {"url": f"data:image/jpeg;base64,{image_data}"},
                },
            ],
        }
    ],
)

print(completion.choices[0].message.content)

A Csevegés befejezése API több képbemenetet is támogat, így a modell elemezheti az egyes képeket, és szintetizálhatja az összes bemenet információit, így választ kaphat a kérdésre.


from openai import OpenAI
import base64
import requests

# Get the workspace API URL and token from the notebook context
API_ROOT = dbutils.notebook.entry_point.getDbutils().notebook().getContext().apiUrl().get()
API_TOKEN = dbutils.notebook.entry_point.getDbutils().notebook().getContext().apiToken().get()

client = OpenAI(
    api_key=API_TOKEN,
    base_url=f"{API_ROOT}/ai-gateway/mlflow/v1",
)

# Download and encode multiple images
image1_url = "https://upload.wikimedia.org/wikipedia/commons/thumb/d/dd/Gfp-wisconsin-madison-the-nature-boardwalk.jpg/2560px-Gfp-wisconsin-madison-the-nature-boardwalk.jpg"
resp1 = requests.get(image1_url)
resp1.raise_for_status()
image1_data = base64.b64encode(resp1.content).decode("utf-8")

image2_url = "https://upload.wikimedia.org/wikipedia/commons/thumb/d/dd/Gfp-wisconsin-madison-the-nature-boardwalk.jpg/2560px-Gfp-wisconsin-madison-the-nature-boardwalk.jpg"
resp2 = requests.get(image2_url)
resp2.raise_for_status()
image2_data = base64.b64encode(resp2.content).decode("utf-8")

# OpenAI request
completion = client.chat.completions.create(
    model="system.ai.claude-sonnet-4-5",
    messages=[
        {
            "role": "user",
            "content": [
                {"type": "text", "text": "What are in these images? Is there any difference between them?"},
                {
                    "type": "image_url",
                    "image_url": {"url": f"data:image/jpeg;base64,{image1_data}"},
                },
                {
                    "type": "image_url",
                    "image_url": {"url": f"data:image/jpeg;base64,{image2_data}"},
                },
            ],
        }
    ],
)

print(completion.choices[0].message.content)

SQL

Fontos

Az alábbi példa a beépített SQL-függvényt használja, ai_query. Ez a függvény nyilvános előzetes verzióban érhető el , és a definíció változhat.

Az alábbi lekérdezések lekérdezik a Databricks Foundation Model API-k által támogatott alapmodellt a multimodális bemenethez az AI-függvény ai_query()használatával.


> SELECT *, ai_query(
  'system.ai.llama-4-maverick',
 'what is this image about?', files => content)
as output FROM READ_FILES("/Volumes/main/multimodal/unstructured/image.jpeg");

Támogatott modellek

A támogatott látásmodellek alapmodell-típusait lásd.

Bemeneti kép követelményei

Modell(ek) Támogatott formátumok Több kép kérésenként Képméret korlátozásai Kép átméretezési ajánlások Képminőségi szempontok
databricks-gpt-5
  • JPEG
  • PNG
  • WebP
  • GIF (Nem animált GIF)
Kérelemenként legfeljebb 500 egyéni képbemenet Fájlméretkorlát: Kérelemenként legfeljebb 10 MB hasznos adatméret N/A
  • Nincs vízjel vagy emblémák
  • Elég egyértelmű ahhoz, hogy egy ember megértse
databricks-gpt-5-mini
  • JPEG
  • PNG
  • WebP
  • GIF (Nem animált GIF)
Kérelemenként legfeljebb 500 egyéni képbemenet Fájlméretkorlát: Kérelemenként legfeljebb 10 MB hasznos adatméret N/A
  • Nincs vízjel vagy emblémák
  • Elég egyértelmű ahhoz, hogy egy ember megértse
databricks-gpt-5-nano
  • JPEG
  • PNG
  • WebP
  • GIF (Nem animált GIF)
Kérelemenként legfeljebb 500 egyéni képbemenet Fájlméretkorlát: Kérelemenként legfeljebb 10 MB hasznos adatméret N/A
  • Nincs vízjel vagy emblémák
  • Elég egyértelmű ahhoz, hogy egy ember megértse
databricks-gemma-3-12b
  • JPEG
  • PNG
  • WebP
  • GIF
API-kérésekhez legfeljebb 5 rendszerkép
  • A rendszer minden megadott képet feldolgoz egy kérésben.
Fájlméretkorlát: 10 MB az összes kép esetében összesen API-kérésenként N/A N/A
databricks-llama-4-maverick
  • JPEG
  • PNG
  • WebP
  • GIF
API-kérésekhez legfeljebb 5 rendszerkép
  • A rendszer minden megadott képet feldolgoz egy kérésben.
Fájlméretkorlát: 10 MB az összes kép esetében összesen API-kérésenként N/A N/A
  • databricks-claude-sonnet-5
  • databricks-claude-sonnet-4-6
  • databricks-claude-sonnet-4-5
  • databricks-claude-haiku-4-5
  • databricks-claude-opus-5
  • databricks-claude-opus-4-8
  • databricks-claude-opus-4-7
  • databricks-claude-opus-4-6
  • databricks-claude-opus-4-5
  • databricks-claude-opus-4-1
  • databricks-claude-sonnet-4
  • JPEG
  • PNG
  • GIF
  • WebP
  • Legfeljebb 20 kép Claude.ai
  • API-kérésekhez legfeljebb 100 rendszerkép
  • Az összes megadott kép feldolgozása kérelemben történik, ami hasznos lehet az összehasonlításukhoz vagy a kontrasztjukhoz.
  • A rendszer elutasítja a 8000x8000 képpontnál nagyobb képeket.
  • Ha egy API-kérelemben több mint 20 képet küld el, a maximálisan engedélyezett méret képenként, 2000 x 2000 képpont.
Az optimális teljesítmény érdekében méretezze át a képeket feltöltés előtt, ha túl nagyok.
  • Ha egy kép hosszú éle meghaladja az 1568 képpontot , vagy mérete meghaladja a ~1600 tokent, a rendszer automatikusan leskálázza , miközben megőrzi a képarányt.
  • A nagyon kis méretű képek ( bármely élen 200 képpont alatt) csökkenthetik a teljesítményt.
  • A késleltetés csökkentése érdekében tartsa a képek méretét 1,15 megapixel és legfeljebb 1568 képpont között mindkét dimenzióban.
  • Egyértelműség: Kerülje a homályos vagy képpontos képeket.
  • Szöveg képekben:
    • Győződjön meg arról, hogy a szöveg olvasható és nem túl kicsi.
    • A szöveg nagyításához ne vágja ki a fő vizuális környezetet.

Kép token konvertálása

Ez a szakasz csak az alapmodell API-kra vonatkozik. Külső modellek esetén tekintse meg a szolgáltató dokumentációját.

Az alapmodellhez tartozó kéréseknél minden kép növeli a tokenhasználatot. A képek díjszabásának becsléséhez tekintse meg a díjszabási kalkulátort a tokenhasználat és az alkalmazott modell alapján.

A képértelmezés korlátai

Ez a szakasz csak az alapmodell API-kra vonatkozik. Külső modellek esetén tekintse meg a szolgáltató dokumentációját.

A támogatott Databricks által üzemeltetett alapmodellek képfelismerési korlátozásai a következők:

Model Korlátozások
A következő Claude-modellek támogatottak:
  • databricks-claude-sonnet-5
  • databricks-claude-sonnet-4-6
  • databricks-claude-sonnet-4-5
  • databricks-claude-opus-4-1
  • databricks-claude-sonnet-4
A Databricks claude modelljeinek korlátai a következők:
  • Kerülje a Claude használatát olyan feladatokhoz, amelyek tökéletes pontosságot vagy érzékeny elemzést igényelnek emberi felügyelet nélkül.
  • Személyek azonosítása: A képeken lévő személyek nem azonosíthatók és nem nevezhetők el.
  • Pontosság: Tévesen értelmezheti az alacsony minőségű, elforgatott vagy nagyon kicsi képeket (200 px).
  • Térbeli érvelés: Küzd a pontos elrendezésekkel, például analóg órák olvasásával vagy sakkpozíciókkal.
  • Számlálás: Hozzávetőleges számokat ad meg, de sok kis objektum esetében pontatlan lehet.
  • Mesterséges intelligenciával létrehozott képek: Nem lehet megbízhatóan észlelni a szintetikus vagy hamis képeket.
  • Nem megfelelő tartalom: Letiltja a explicit vagy szabályzatsértő képeket.
  • Egészségügyi ellátás: Nem alkalmas komplex orvosi vizsgálatokra (például CT-k és MRI-k). Ez nem diagnosztikai eszköz.

További erőforrások