This is the Trace Id: 6717076a066e466af28ac2a6ffb29a64
メイン コンテンツへスキップ 概要 原則とアプローチ 透明性レポート ツールとプラクティス 責任ある AI を Azure で AI トレーニング用のデータ セキュア フューチャー イニシアティブ SFI 進捗レポート パターンとプラクティスの概要 ゼロ トラスト プライバシーの概要 データ管理の概要 データ アクセス データの場所 EU データ境界 GDPR コンプライアンスの概要 コンプライアンスのサービス 規則 DORA コンプライアンス EU AI 法 ヨーロッパ デジタル レジリエンス NIS2 コンプライアンス 地域別/国別コンプライアンス アクセシビリティ 製品とサービス コンプライアンスのサービス コンプライアンス スコア 監査レポート データ保護のリソース Microsoft Security Azure Dynamics 365 Microsoft 365 Microsoft Teams Windows 365 Microsoft AI Azure Space Mixed Reality Microsoft HoloLens Microsoft Viva 量子コンピューティング 教育機関 自動車 金融サービス 行政機関 医療 製造業 小売業 パートナーを探す パートナーになる パートナー ネットワーク Microsoft Marketplace Marketplace Rewards ソフトウェア会社 ブログ Microsoft Advertising デベロッパー センター ドキュメント イベント ライセンス Microsoft Learn Microsoft Research サイトマップの表示

AI モデル開発用データ

生成 AI モデルのトレーニング用データに対する当社のアプローチをご確認ください。
2 人の人物がテーブルの前に座り、タブレットでコンテンツを確認しています。近くにコーヒー カップが 1 個あります。
Microsoft での AI モデルのトレーニング用データに対する取り組みにおいて、中核となるのが信頼と透明性です。

このページの目的は、当社のアプローチを共有し、トレーニングに使用するデータのカテゴリと、これらのモデルのトレーニングにおける自身のコンテンツの使用方法に関して Web パブリッシャーやコンテンツ クリエーターにどのようなコントロールを提供するのかについて、概要を説明することです。

AI モデルのトレーニングとは何ですか?

AI モデルはデータに基づいて予測を行います。トレーニング プロセスの間、AI モデルは、膨大な量のデータ全体から、パターン、相関関係、概念を識別したあと、学習した内容を使用して質問や要求に対する回答を生成します。自然言語、ソフトウェア コード、画像など、特定のクラスの情報における生成機能を最適化するために、さまざまなカテゴリのトレーニング データを使用してモデルを調整できます。また、たとえば農業、医療、小売などの業界で、組織独自のデータを基にすることもできます。

生成 AI モデルは、元のトレーニング データを保存、アクセス、再現するようには設計されていません。その代わりに、これらのモデルは新しい表現的作品やコンテンツを生成することを目的としています。

2 人の人物が屋内に立っており、大型モニターでグラフやメトリックが表示されたダッシュボードを確認しています。

Microsoft がどのように多様なデータで生成 AI モデルをトレーニングしているのかをご覧ください

今日の AI システムを構築するうえで、大規模で多様なデータセットは不可欠です。より正確で、さまざまな文化や言語をより的確に表現でき、人の経験と創意工夫の全範囲を学習して適用できるモデルを開発するには、幅広く多様なデータを使用することが重要です。
モデル カードやその他の公開ドキュメントで示しているように、Microsoft は、責任ある方法で生成 AI モデルをトレーニングするために、次のカテゴリのデータを使用しています。
  • 業界標準の機械学習データセットと Web クロールの組み合わせから、厳選された公開データでトレーニングしています。有料の制限があるソース、当社のポリシーに違反するコンテンツ、当社が公開した Web コントロールを使用してトレーニングからオプトアウトされたソースは除外します。Web クロールで収集されたデータは、適用法および Microsoft の責任ある AI ポリシーに従って、安全性フィルター処理が行われ、児童性的虐待コンテンツ (CSAM) などの違法コンテンツを削除するために処理されます。

    Web パブリッシャーが Web クロールからオプトアウトするために使用する robots.txt タグなどの標準を尊重します。Microsoft は、米国通商代表部 (USTR) による「模倣品・海賊版の悪名高き市場」リストに掲載されているドメインのデータは使用しません。
  • これは、出版社や著作権所有者などとの交渉による取り決めを通じてアクセスするトレーニング データです。
  • このデータは、厳選された Microsoft コンシューマー サービスから収集され、Microsoft プライバシー ステートメントに従って保護されます。当社の Microsoft Copilot ブログCopilot FAQ では、Copilot、Bing、Microsoft Start (MSN) のコンシューマー データをどのように使用して、Copilot のモデルのトレーニングに役立てているかを説明しています。ユーザーがオプトアウトしやすいようにし、ユーザーを特定できる識別子の削除など、プライバシーを保護するための安全対策を講じています。 お客様の許可なく、大規模組織のお客様のデータを使用することはありません。
  • 合成データセットでトレーニングすることもあります。これらは、不十分であるか限られた実世界のデータを補完するために特別に要求された出力を生成するために、大規模言語モデル (LLM) にプロンプトを与えることで作成しています。その結果は、人間のレビュー担当者による確認を含め、レビューとフィルター処理が行われ、トレーニング データセットの一部として十分な品質があることが確認されます。
  • トレーニング プロセスでは、AI トレーナー、レッド チーム、従業員、外部のアノテーション パートナーから、人によるフィードバックを取り入れています。これには、たとえば、ユーザーのプロンプトに対して品質の高い出力を強化し、エンド ユーザー エクスペリエンスを向上させる、人によるフィードバックが含まれます。レッド チームは、有害な要求や安全でない要求に対してもモデルをテストし、そのフィードバックは、モデルの安全性に関する動作を改善するために使用されます。
Microsoft 独自のモデルに加え、OpenAI などのさまざまなモデルを製品やサービスに組み込んでいます。OpenAI でのモデルのトレーニング方法に関する詳細情報

有益で包括的な AI のために、一部の Web パブリッシャーやコンテンツ所有者は、そのコンテンツの使用方法について、より多くの裁量を求めています。Web パブリッシャーのコントロールは有用ですが、完全な解決策ではありません。当社は、業界、出版社、標準化団体、コンテンツ コミュニティの他組織と協力し、誰もが推進し採用できる共通のアプローチを見つけるために取り組んでいます。
屋内に人物が立っており、明るいオフィス環境でノート PC を使っています。

Microsoft の責任ある AI

責任ある AI の原則を維持するために Microsoft が作成したツール、プラクティス、ポリシーをご覧ください。

その他のリソース

3 人の人物がリビング ルームでノート PC のコンテンツを一緒に確認しています。

責任ある AI の透明性レポート

当社がどのようにして責任ある方法で AI を構築し、お客様を支援し、進化し、成長しているのかをご覧ください。
2 人の人物がテーブルの前に座り、ノート PC を使いながら話し合っています。

コンシューマー データの使用における透明性と管理

Copilot がデータから学習する方法を管理します。
棒グラフと分析情報が表示されたタブレットを持っている人。

オープン データの推進

よりオープンでアクセスしやすいデータの利点を実感してください。

Microsoft をフォローする

日本語 (日本) コンシューマーの正常性のプライバシー Microsoft に問い合わせ プライバシー 特定商取引法に基づく表示 Cookie の管理 使用条件 商標 広告について