This is the Trace Id: 0c9a04d4aeeee3907f0083a65bff8411

用于 AI 模型开发的数据

探索我们用于训练生成式 AI 模型的数据方案。
两个人坐在桌旁查看平板电脑上的内容,旁边放着一个咖啡杯。
信任和透明度是 Microsoft 处理 AI 模型训练数据的核心原则。

本页旨在介绍我们的做法,概述我们用于训练的数据类别,以及我们为让 Web 发布者和内容创作者控制其内容如何用于训练这些模型所做的工作。

训练 AI 模型意味着什么?

AI 模型基于数据进行预测。在训练过程中,AI 模型在海量数据中识别模式、相关性和概念,然后使用所学知识生成问题或请求的答案。可使用不同类别的训练数据对模型进行调整,优化针对特定信息类别(例如自然语言、软件代码或图像)的生成能力。它也可基于组织自己的数据,例如在农业、健康或零售等垂直行业中。

生成式 AI 模型并非为存储、访问或复制原始训练数据而设计。相反,这些模型旨在生成新的表达性作品和内容。

两个人站在室内,查看大型显示器上显示图表和指标的仪表板。

了解 Microsoft 如何使用多样化数据训练生成式 AI 模型

大型且多样化的数据集是创建当今 AI 系统不可或缺的一部分。使用广泛多样化的数据至关重要,这样才能开发出更准确、更能代表不同文化和语言的模型,并让模型学习和应用人类经验和智慧的方方面面。
正如我们的模型卡和其他公开文档中所述,Microsoft 负责任地获取以下类别的数据用于训练我们的生成式 AI 模型:
  • 我们使用选定的公开可用数据进行训练,数据源涵盖行业标准机器学习数据集和 Web 爬取内容。我们会排除以下来源:付费墙内容、违反我们政策的内容,以及使用我们发布的 Web 控制选择退出训练的内容。我们会对 Web 爬取数据进行安全筛选和处理,根据适用法律和 Microsoft 的负责任 AI 政策,移除包括儿童性虐待内容 (CSAM) 在内的非法内容。

    我们尊重 Web 发布者用于选择退出 Web 爬取的 robots.txt 标签等标准。我们不使用美国贸易代表办公室 (USTR) 假冒和盗版恶名市场名单中所列域名的数据。
  • 这是我们通过协商安排(例如与发布者和版权所有者)获取的训练数据。
  • 这些数据从选定的 Microsoft 消费者服务中收集,并根据我们的 Microsoft 隐私声明进行保护。我们的 Microsoft Copilot 博客Copilot 常见问题解答说明了我们如何使用来自 Copilot、必应和 Microsoft Start (MSN) 的消费者数据来帮助训练 Copilot 中的模型。我们让用户能够轻松选择退出,并实施保护措施,例如移除可能识别你身份的标识符来保护用户隐私。 未经企业客户许可,我们不会使用其数据。
  • 我们有时会使用合成数据集进行训练。我们通过提示大语言模型 (LLM) 生成特定需求的输出内容,用于补充稀缺或有限的真实世界数据,以此创建这类数据。然后,我们会对结果进行审阅和筛选(包括由人工审阅者进行),确保其质量足够高,能够成为训练数据集的一部分。
  • 我们在训练过程中纳入来自 AI 训练师、红队成员、员工和外部标注合作伙伴的人工反馈。例如,这包括强化对用户提示高质量输出的人工反馈,从而提升最终用户体验。红队成员还会针对有害或不安全的请求测试模型,他们的反馈用于改进模型的安全行为。
除了我们自己的 Microsoft 模型外,我们还将各种其他模型(包括来自 OpenAI 的模型)集成到我们的产品和服务中。详细了解 OpenAI 如何训练模型

为打造有益且具备包容性的 AI,一些 Web 发布者和内容所有者希望对其内容的使用方式拥有更多话语权。Web 发布者控制措施有帮助,但不是完整的解决方案。我们正与行业、出版界、标准机构和内容社区的其他各方合作,找出一个我们都可推进和采用的通用方法。
一个人在明亮的办公室环境中使用笔记本电脑。

Microsoft 的负责任 AI

探索我们为维护负责任 AI 原则而创建的工具、实践和策略。

更多资源

三个人在客厅环境中一起查看笔记本电脑上的内容。

负责任 AI 透明度报告

了解我们如何负责任地构建 AI、支持客户、发展和成长。
两个人坐在桌旁,一边讨论一边使用笔记本电脑。

关于消费者数据使用的透明度和控制

控制 Copilot 如何从你的数据中学习。
一个人拿着一台平板电脑,上面显示条形图和分析数据。

推动开放数据

实现更开放、更易获取的数据所带来的优势。