Azure AI 検索 サービスのコストの計画と管理

Azure AI 検索は、Azure ポータルREST APIおよびAzure SDKから使用できます。 また、Foundry IQ は、エンタープライズ コンテンツを、Microsoft Foundry ポータルのエージェントの再利用可能なアクセス許可に対応したナレッジ ベースに変換するマネージド ナレッジ レイヤーです。

Azure AI 検索は、次の 2 つの価格モデルで利用できます。

  • 専用: 固定価格でプロビジョニングされた容量。 サービス レベルを選択すると、検索ユニット (SU) に基づいて 1 時間あたりに課金されます。 安定した予測可能で使用率の高いワークロードに最適です。

  • サーバーレス (プレビュー):インデックス付きストレージのコンピューティング ユニット/時間 (CU/時間) および GB/月単位で測定される使用量ベースの価格。 頻度の低い、バースト性の高い、または非常に変動の多いワークロードに最適です。

この記事では、各モデルでの課金のしくみについて説明し、コストの見積もり、最小化、監視に関するガイダンスを提供します。

価格モデルを理解する

Azure AI 検索には、専用とサーバーレスの 2 つの主要な価格モデルがあります。 どちらのモデルでも、セマンティック ランカー、エージェント検索、AI エンリッチメントなどの Premium 機能に対して個別の料金が発生します。

Azure AI 検索料金は、Azure請求書全体の構成要素の 1 つです。 サブスクリプションで使用されているすべてのAzure サービスとリソース (Azure AI 検索外のサービスを含む) に対して課金されます。

専用サービスの場合は、Azure 料金計算ツール を使用して、計画された capacity および機能に基づいてコストを見積もります。 容量計画ワークシートは、予想されるインデックス サイズ、インデックス作成のスループット、インデックス作成のコストをモデル化するのに役立ちます。

検索ワークロードの進化に合わせて、次のヒントに従って、デプロイと運用の両方でコストを最小限に抑えます。 組み込みのメトリックを使用してクエリ要求を監視したり 、Cost Management を使用して予算、アラート、データエクスポートを作成したりすることもできます。

専用の価格モデル

専用検索サービスを作成または使用する場合、必要なレプリカとパーティションの最小組み合わせ (R × P) に対して、選択したサービス レベルの日割り時間単価で支払います。 各レプリカとパーティションの組み合わせは、専用容量の単位を表します。

使用可能なサービス レベルの詳細については、「 価格モデルとサービス レベルの選択」を参照してください。

レプリカまたはパーティションの数を増減すると、検索ユニットの合計数が変化し、それに応じてコストがスケーリングされます。 詳細と例については、「 請求率」を参照してください。

サーバーレス価格モデル (プレビュー)

Important

サーバーレス開発者レベルは現在プレビュー段階です。 このプレビュー版はサービス レベル アグリーメントなしで提供されています。運用環境のワークロードに使用することはお勧めできません。 特定の機能がサポートされていないか、機能が制限されている可能性があります。 詳細については、「 Microsoft Azure プレビューの追加使用条件」を参照してください。

サーバーレス開発者レベルの課金は、2026 年 9 月 13 日に開始されます。 その日以降の使用量の料金は、Azureの請求書に表示されます。 2026 年 9 月 13 日より前の使用には課金されません。 サーバーレス開発者は、課金が開始されると有料レベルです。 サーバーレス開発者レベルでは、他の価格レベルとの間の移行はサポートされていません。また、他のレベルで使用できる一部の機能は、パブリック プレビュー中はサポートされていません。 サービスの制限、サポートされている機能、および価格の詳細は、一般公開前に変更される可能性があります。

プレビュー期間中、サーバーレス価格モデルは 特定のリージョンでのみサポートされます。

サーバーレス価格モデルは、事前にプロビジョニングされた容量またはアイドル状態の容量がない使用量に基づいて課金されます。 料金は、操作によって消費されたコンピューティング リソースと、インデックスによって使用されるストレージに対してのみ課金されます。

専用モデルとは異なり、レプリカやパーティションは構成しません。 サービスは、ワークロードの需要とサービスの制限に基づいて容量を自動的に管理します。

サーバーレス課金には、次の 2 つの独立したディメンションがあります。

  • コンピューティング (コンピューティング ユニット、CU):
    コンピューティング使用量は、1 時間あたりのコンピューティング ユニット数 (CU/時間) で測定されます。 コンピューティング コストは、クエリの複雑さ、インデックス サイズ、データ ボリューム、操作の種類 (クエリ、インデックス作成、エンリッチメント) などの要因によって決まります。

  • インデックス付きストレージ:
    ストレージは、インデックスのディスク上のサイズに基づいて、1 か月あたりの GB 単位で課金されます。 このサイズには、インデックス付きコンテンツと、取得に使用されるサポート データ構造が含まれます。

Premium 機能に対する課金方法

Premium 機能では、専用またはサーバーレスのどちらの価格モデルを使用するかにかかわらず、検索サービスのコンピューティング料金とストレージ料金に加えて料金が発生します。

次の表に、Premium 機能とその課金単位を示します。 これらの機能はすべて省略可能であるため、使用しない場合は料金は発生しません。

特徴 課金単位
画像抽出 (AI エンリッチメント) 1 1,000 画像あたり。 料金ページを参照してください。
カスタム エンティティ参照スキル (AI エンリッチメント) 1,000 テキスト レコードあたり。 価格に関するページ
組み込みスキルまたはカスタム スキル (AI エンリッチメント) 2 トランザクションの数。 Microsoft Foundry または Azure でホストされるモデルやリソースについては、モデル プロバイダーの料金体系に基づいて課金されます。
Vectorizers2 ベクター化操作の数。 モデル プロバイダー (Foundry Tools の Azure Vision、Azure OpenAI、Foundry) の料金で課金されます。
セマンティック ランカー queryType=semanticのクエリの数。 段階的な料金で課金されます。 料金ページを参照してください。
エージェンティック検索 エージェント推論トークンの数と、クエリの計画と回答の定式化で使用されるトークンの数。 料金ページを参照してください。
共有プライベート リンク 共有プライベート リンクが存在し、使用されている限り、帯域幅に対して課金されます

1 インデクサー パイプライン内のファイルから抽出されたイメージを参照します。 テキストの抽出は無料です。 イメージ抽出は、indexAction パラメーターを有効にした場合、またはドキュメント抽出スキルを呼び出すときに課金されます。

Azure OpenAI モデルと Foundry モデルの 2 つの料金は、これらのサービスの請求書に表示されます。

それ以外の課金方法

構成と使用状況によっては、次の料金が適用される場合があります。

  • データ トラフィックでは、ネットワーク コストが発生する可能性があります。 帯域幅の 価格を参照してください。

  • いくつかのプレミアム機能 (たとえば、ナレッジ ストアデバッグ セッション1エンリッチメント キャッシュなど) は Azure Storage を使用しており、ストレージ コストが発生します。 これらの機能の料金は、Azure Storage の請求書に表示されます。

  • 機密コンテンツの二重暗号化を提供するカスタマー マネージド キーには、課金対象の Azure Key Vault が必要です。

  • スキルセットには、 課金対象の組み込みスキル、非ビルドの組み込みユーティリティ スキル、およびカスタム スキルを含めることができます。 課金対象でないユーティリティ スキルには、条件付きシェ―パーテキスト結合テキスト分割が含まれます。 API キーの要件や 20 ドキュメントの制限はありません。

  • カスタム スキルは、自分が提供する機能です。 カスタム スキルは、他の課金対象サービスを呼び出す場合にのみ課金されます。 API キーの要件や 20 ドキュメントの制限はありません。

1 デバッグ セッションは、専用価格モデル サービスでのみ使用できます。

専用サービスでは、クエリごとに課金されません。 ただし、 サービスの制限は 各価格レベルに適用されます。 サーバーレスでは、クエリは複雑さとインデックス サイズに基づいて CU/時間を消費します。

専用価格モデルのコストを見積もって計画する

専用価格モデルのコストを見積もる場合は、Azure料金計算ツールを使用して、Azure AI 検索のベースライン コストを見積もります。 サービスの作成時に、[価格レベルの選択] ページで推定コストと レベル の比較を確認することもできます。

専用価格モデルの初期テストでは、容量計画ワークシートを作成します。 このワークシートは、インデックスとソースの比率、およびエンリッチメントまたはベクターの特徴が容量とコストの両方に及ぼす影響を理解するのに役立ちます。

容量計画ワークシートを作成するには:

  1. データの小さなサンプル (1 ~ 5%) のインデックスを作成します。 使用する予定の OCR、エンリッチメント、または埋め込みスキルを含めます。

  2. インデックス サイズ、インデックス作成のスループット、インデックス作成のコストを測定します。

  3. 結果を推定して、データの完全な要件を見積もります。

サーバーレス価格モデルのコストを見積もって計画する

サーバーレスのコストを見積もって管理するには、コンピューティング消費量とインデックス サイズの両方を監視し、クエリとスキーマ設計を最適化してリソース使用量を削減します。

最初に代表的なサンプルにインデックスを付け、次に一般的なクエリを実行し、 x-ms-request-chargeを使用して CU 消費量を測定します。 消費平均を取得したら、その平均に基づいてコストを推定します。 コンピューティング使用量の監視に関するガイダンスについては、「 サーバーレス価格モデルを使用してコストを最適化する」を参照してください。

専用価格モデルのコストを最小限に抑える

専用価格モデルのコストを最小限に抑えるには、次の戦略を使用します。

デプロイと構成

  • パーティションあたりのストレージ数が多いリージョンに検索サービスを作成します。

  • 帯域幅の料金を最小限に抑えたり排除したりするために、関連するすべての Azure リソースを同じリージョン (または可能な限り少数のリージョン) に作成します。

  • ニーズを満たす最も軽い サービス レベル を選択します。 Basic と S1 では、最新の API へのフル アクセスが SU ごとに最低時間単位で提供されます。 * トラフィックが可変またはバーストのワークロードの場合、サーバーレスの価格モデルは、継続的にプロビジョニングされる Basic または S1 サービスよりもコスト効率が高い場合があります。

  • フロントエンド アプリケーションに Azure Web Apps を使用して、要求と応答をデータ センターの境界内に保持します。

スケーリング

  • インデックス サイズまたはインジェスト スループットに必要な場合にのみ、パーティションを追加します。

  • レプリカを追加 するのは、1 秒あたりのクエリ数が増える場合、複雑なクエリによってサービスが調整されている場合、または高可用性が必要な場合のみです。

  • インデックス作成などのリソースを集中的に使用する操作に対してスケールアップし、通常のクエリ ワークロードに対して下方に再調整します。

  • 予測可能なワークロード パターンのスケーリングを自動化するコードを記述します。

  • 容量と価格は線形でないことを覚えておいてください。 容量を 2 倍にすると、同じレベルのコストが 2 倍以上になります。 同様の価格でパフォーマンスを向上させるには、 より高いレベルに切り替えることを検討してください。

インデックス作成とエンリッチメント

サーバーレス価格モデルのコストを最小限に抑える

専用価格モデルのコストを最小限に抑えるには、次の戦略を使用します。

  • CU/時間テレメトリを監視して、コストの高いクエリを特定します。
  • 関連性のニーズを満たす最も単純なクエリの種類を使用します。
  • 未使用のインデックスを削除して、ストレージ コストを削減します。

詳細情報: サーバーレス価格モデルを使用してコストを最適化する。

コストを監視する

サービス レベルでは、1 秒あたりのクエリ (QPS)、検索の待機時間、調整されたクエリ、インデックス サイズの 組み込みメトリックを監視 できます。

これらのメトリックの使用方法は、価格モデルによって異なります。

  • 専用の価格モデル:
    QPS、待機時間、調整のメトリックを使用して、レプリカまたはパーティションを追加または削除するタイミングを決定します。 容量のスケーリングはパフォーマンスとコストの両方に直接影響するため、これらのシグナルを監視すると、検索ユニットを最適化するのに役立ちます。

  • サーバーレス価格モデル:
    これらのメトリックを使用して、ワークロード パターンを理解し、コスト ドライバーを特定します。 サーバーレス容量は自動的に管理されるため、レプリカまたはパーティションを追加してもスケーリングされません。 代わりに、コンピューティング消費量の監視と使用状況の最適化に重点を置きます。

サーバーレスの場合は、x-ms-request-charge 応答ヘッダーを使用して要求ごとのコンピューティング使用量を監視し、Azure Monitor ログを使用してクエリ パターンを分析できます。 クエリの種類またはワークロード別に CU 消費量を追跡すると、クエリの最適化、スキーマ設計、またはワークロードの分散によってコストを削減する機会を特定できます。

Cost Management には、サブスクリプションまたはリソース グループ レベルで、 コスト を追跡、分析、および制御するためのツールが用意されています。 Cost Management を使用して次の手順を実行します。

  • 使用制限に対する進捗状況を定義して追跡する予算を作成します。 より詳細な監視を行う場合は、特定のAzure リソースまたはサービスに対して filters を使用して予算をカスタマイズします。 フィルターを使用すると、コスト追跡が特定のワークロードまたはデプロイに合わせて調整されます。

  • 支出の異常や過剰なリスクについて関係者に自動的に通知するアラートを作成します。 アラートは、予算とコストのしきい値と比較した支出に基づいており、サブスクリプションまたはリソース グループ レベルで適用されます。

  • より詳細な分析のために、コスト データをストレージ アカウントにエクスポートします。 たとえば、財務チームは、ExcelまたはPower BIを使用してエクスポートされたデータを分析できます。 コスト データセットを取得する場合は、スケジュールに従ってコスト データをエクスポートすることをお勧めします。

FAQ

検索サービスを一時的にシャットダウンしてコストを節約することはできますか?

検索は継続的なサービスとして実行されます。 専用リソースは常に運用可能であり、サービスの有効期間中は排他的に使用するために割り当てられます。

専用価格モデルでは、課金を完全に停止するには、サービスを削除する必要があります。 サービスの削除は永続的なものであり、関連付けられているデータも削除されます。

サーバーレス価格モデルでは、アイドル時にコンピューティング料金は発生しません。 サービスが要求を処理していない間は、インデックス付きストレージに対してのみ支払います。

既存の検索サービスの価格モデルまたは課金レート (レベル) を変更できますか?

専用またはサーバーレスの価格モデルを選択した後は、2 つの間で AI Search サービスを変換することはできません。

専用価格モデルを選択した場合、既存のサービスで Basic レベルと Standard レベル (S1、S2、S3) レベルを切り替えることができます。 現在のサービス構成がターゲット レベルの制限を超えることはできません。また、リージョンにターゲット レベルの容量制約を設定することはできません。 詳細については、「 価格レベルを変更する」を参照してください