AI 模型會根據資料進行預測。在訓練過程中,AI 模型會辨識大量資料中的模式、關聯性和概念,接著運用所學,為問題或要求產生答案。模型可以使用不同類別的訓練資料來進行調整,以最佳化特定類型資訊的生成能力,例如自然語言、軟體程式碼或影像。它也可以使用組織自己的資料進行基礎設置,例如在農業、醫療或零售等產業領域。
生成式 AI 模型並非設計來儲存、存取或重現原始訓練資料。相反地,這些模型的用途是產生全新的表達性作品與內容。
了解 Microsoft 如何以多樣化資料訓練生成式 AI 模型
大型且多樣化的資料集,是建立現今 AI 系統不可或缺的一環。使用廣泛且多元的資料,對於開發更準確、更能代表不同文化與語言的模型至關重要,也能讓模型學習並應用人類經驗與創意的完整範疇。
如我們的模型卡及其他公開文件所述,Microsoft 會負責任地取得以下類別的資料,用於訓練我們的生成式 AI 模型:
我們會使用部分公開可取得的資料進行訓練,資料來源包括業界標準的機器學習資料集以及網路耙梳取得的資料。我們會排除設有付費牆的來源、違反我們原則的內容,以及透過我們發佈的網頁控制項選擇退出訓練的內容。透過網路耙梳的資料會經過安全性篩選及處理,以移除包括兒童性虐待材料 (CSAM) 在內的非法內容,並遵循適用法律及 Microsoft 的負責任 AI 原則。
這些資料取自 Microsoft 精選的消費者服務,並依照 Microsoft 隱私權聲明受到保護。我們的 Microsoft Copilot 部落格和 Copilot 常見問題集說明了我們如何使用 Copilot、Bing 和 Microsoft Start (MSN)的消費者資料,協助訓練 Copilot 中的模型。我們讓使用者可以輕鬆選擇退出,並採取例如移除可能識別您身分的識別資訊等防護措施,以保護使用者隱私。 我們不會在未經企業客戶許可的情況下使用其資料。
關注 Microsoft