ビジョン対応チャット モデルの概念 (クラシック)

適用対象:Foundry (クラシック) ポータル。 この記事は、新しい Foundry ポータルでは使用できません。 新しいポータルの詳細を確認します

メモ

この記事のリンクは、現在表示している Foundry (クラシック) ドキュメントではなく、新しい Microsoft Foundry ドキュメントのコンテンツを開く場合があります。

ビジョン対応チャット モデルは、OpenAI によって開発された大規模なマルチモーダル モデル (LMM) であり、画像を分析し、それらに関する質問に対するテキスト応答を提供します。 自然言語処理と視覚的理解の両方が組み込まれています。 このガイドでは、その機能と制限事項について詳しく説明します。 画像入力をサポートするモデルを確認するには、「 モデル」ページを参照してください。

ビジョン対応のチャット モデルを試すには、 クイック スタートを参照してください。

ビジョン対応チャット

ビジョン対応モデルは、アップロードする画像に何が含まれているかについての一般的な質問に回答します。

入力の制限事項

このセクションでは、ビジョン対応チャット モデルの制限事項について説明します。

イメージのサポート

  • 最大入力イメージ サイズ: 入力イメージの最大サイズは 20 MB に制限されます。
  • 低解像度の精度: "低解像度" 設定を使用して画像を分析すると、応答が高速になり、特定のユース ケースで使用される入力トークンが少なくなります。 ただし、これは、画像内のオブジェクトとテキスト認識の精度に影響する可能性があります。
  • イメージ チャットの制限: Microsoft Foundry portal または API で画像をアップロードする場合、チャット呼び出しごとに 10 個の画像に制限されます。

特別価格情報

重要

次のコンテンツは一例であり、価格は将来変更される可能性があります。

ビジョン対応モデルでは、他の Azure OpenAI チャット モデルと同様に料金が発生します。 [ 価格] ページで詳しく説明されているプロンプトと入力候補に対してトークンごとの料金を支払います。 基本料金とその他の機能の概要を次に示します。

ビジョン付き GPT-4 Turbo の基本価格は次のとおりです。

  • 入力: 1,000 トークンあたり $0.01
  • 出力: 1,000 トークンあたり $0.03

テキストと画像 をトークン に変換する方法については、概要の「トークン」セクションを参照してください。

画像価格計算の例

一般的なユース ケースでは、表示されるオブジェクトとテキストの両方と 100 トークンのプロンプト入力を含む画像を取得します。 サービスがプロンプトを処理すると、100 個の出力トークンが生成されます。 画像では、テキストとオブジェクトの両方を検出できます。 このトランザクションの価格は次のようになります。

項目 詳細 コスト
テキスト プロンプトの入力 100 個のテキスト トークン $0.001
画像入力の例 ( イメージ トークンを参照) 170 + 85 個のイメージ トークン $0.00255
OCR 用の強化されたアドオン機能 $1.50 / 1,000 トランザクション $0.0015
オブジェクト 接地の強化されたアドオン機能 $1.50 / 1,000 トランザクション $0.0015
出力トークン 100 トークン (想定) $0.003
合計 $0.00955