Microsoft Copilot チューニングを使用すると、組織は独自の用語、コミュニケーション スタイル、ビジネス プロセスを反映するように AI モデルを調整できます。 独自のデータを使用して大規模言語モデル (LLM) を微調整すると、テナント全体の Copilot 応答の精度、トーン、関連性を向上させることができます。
Copilot チューニングは、保持と取得にとどまらず、堅牢なエンタープライズ セキュリティ、コンプライアンス、ガバナンス、管理制御を維持しながら、organization のデータでテナント固有の LLM をトレーニングします。 LLM は、ドキュメントの要約、ドキュメントの作成、専門家の回答、スタイルの編集、ドキュメントの検証、最適化などの特定のタスクに合わせて調整されます。
この記事では、organization の Microsoft Copilot でタスク固有のエージェントをチューニングするプロセスについて説明します。
重要
Microsoft Copilot のチューニングは現在、早期アクセス プログラムを通じて一部の顧客のみが利用できます。 Frontier 経由のアクセスは 2026 年 4 月を予定しています。 機能と要件は変更される可能性があります。
微調整プロセスの概要
Copilot チューニング - モデルの調整を使用して organization の AI モデルを微調整するには、次のトレーニングとチューニングの手順に従います:
タスク固有の適応 - トレーニング用データを準備します。 各タスクには、微調整に適したorganizationデータを準備するための独自のレシピがあります。
Fine-tuning training - 各タスクには独自のレシピと微調整テクニックがあり、organization データを使用して最良の結果を得ることができます。 これらの手法には、教師ありファイン チューニング (SFT)、強化学習 (RL)、推論ファイン チューニング (RFT) が含まれますが、これらに限定されません。 これらのレシピやテクニックも時間の経過とともに進化します。
評価 - 各タスクには、organization によって定義されたルーブリックを使用して出力を評価する方法に関する独自のレシピがあります。
注:
チューニングするモデルはプライベートです。 データは、他のテナントの一般的なモデルのトレーニングには使用されません。 データのすべての処理は、承認されたユーザーのみがアクセスしてトレーニングおよび使用できるテナントで行われます。 特定の個人 (通常は管理者) がトレーニング プロセスを制御できます。
タスク固有の適応
タスク固有の適応は、コーパスを取り込んだ後に行われます。 この適応には、organization のコンテンツを元の形式から、1 行に 1 つのステートメントを含むプレーン テキスト形式に処理することが含まれます。
監視あり微調整
教師あり微調整を使用して、ラベル付きの入出力ペアで事前トレーニング済みモデルを特定のタスクや組織の要件に適応させます。 このプロセスは、モデルがorganizationの優先形式、トーン、コンプライアンスのニーズに合った応答を生成することを学習するのに役立ちます。 監視あり微調整:
- 構造とトーンを教える - モデルは、organization's voiceを反映する方法で応答する方法を学びます。
- タスクの精度を向上 - 高品質の例でトレーニングを行うことで、エンタープライズ ユース ケースでのモデルの信頼性が向上します。
- コンプライアンスのサポート - 規制言語と内部分類を認識して応答するようにモデルをトレーニングできます。
強化学習
トレーニング後の手法として強化学習を使用して、LLM をorganization独自のコミュニケーションスタイル、トーン、ツールの使用設定に合わせて調整します。 ラベル付けされた例から正しい出力を生成するようにモデルに指示する教師あり微調整とは異なり、強化学習はフィードバック信号から学習することで主観的な品質を最適化します。
強化学習は、モデルで次のことを行う場合に役立ちます。
- 特定の声のトーン (共感的、フォーマル、簡潔) を反映させます。
- RAG ベースの取得よりも特定のツール (Microsoft Graph API など) を優先します。
- 機密性の高いソース (ACL タグ付きドキュメントなど) からコンテンツを取得することは避けます。
- ユーザー フィードバックから学び、継続的に改善します。
強化学習は、人間のフィードバックと自動フィードバックの両方を使用して学習を導き、組織の好みに基づいてアウトプットをスコアリングすることで、モデルを改良します。 たとえば、Copilot が休暇ポリシーに関する質問に対する回答に対して肯定的なフィードバックを受け取った場合、モデルはその回答を強化し、同様のコンテキストで再利用します。 逆に、応答にトーンまたはコンテンツのフラグが設定されている場合、モデルはそのパターンを回避することを学習します。
高度な適応とメンテナンス
さまざまな微調整手法を組み合わせることで、organization のトーン、タスク完了パターン、Microsoft Purview データ ガバナンスの要件を反映するモデルを作成できます。 これらの基礎となるモデルは、organization の独自の声と運用に関する知識を次のことに応用します。
- タスク全体で一貫したトーンと書式を維持します。
- ドキュメントの作成、要約、質問への専門家の回答の提供などのタスクにドメイン固有の知識を埋め込みます。
- トレーニングと推論中は、アクセス制御とデータ分類ポリシーを尊重します。
- 社内基準とユーザーの期待に沿った正確な回答を生成します。
すべての評価は機密であり、Microsoft の責任ある AI 原則に準拠しています。
新しいデータが利用可能になったらエージェントを進化させ続け、次の方法でモデルを調整できます。
- 新しいデータをアップロードしています。
- 新しいタスクの種類や規制の変更に適応するために、目標と評価指標を更新します。