This is the Trace Id: 37050febf4940e228fecc12d52874cb8
Bỏ qua để tới nội dung chính Tổng quan Nguyên tắc và cách tiếp cận Báo cáo minh bạch Công cụ và biện pháp thực tiễn AI có trách nhiệm trong Azure Dữ liệu phục vụ đào tạo AI Sáng kiến tương lai an toàn Báo cáo tiến độ SFI Tổng quan về mẫu và thực tiễn Zero Trust Tổng quan về quyền riêng tư Tổng quan về quản lý dữ liệu Truy nhập dữ liệu Vị trí dữ liệu Ranh giới dữ liệu EU GDPR Tổng quan về tuân thủ Đề nghị tuân thủ Quy định Tuân thủ DORA Đạo luật AI của EU Khả năng phục hồi kỹ thuật số của Châu Âu Tuân thủ NIS2 Tuân thủ theo khu vực và quốc gia Trợ năng Sản phẩm và dịch vụ Đề nghị tuân thủ Điểm tuân thủ Báo cáo kiểm tra Tài nguyên bảo vệ dữ liệu Microsoft Security Azure Dynamics 365 Microsoft 365 Microsoft Teams Windows 365 Microsoft AI Không gian Azure Thực tế hỗn hợp Microsoft HoloLens Microsoft Viva Điện toán lượng tử Giáo dục Ô tô Dịch vụ tài chính Chính phủ Chăm sóc sức khỏe Sản xuất Bán lẻ Tìm đối tác Trở thành đối tác Mạng lưới Đối tác Microsoft Marketplace Các công ty phần mềm Blog Microsoft Advertising Trung tâm nhà phát triển Hướng dẫn sử dụng Sự kiện Cấp phép Microsoft Learn Microsoft Research Xem sơ đồ trang

Dữ liệu để phát triển mô hình AI

Khám phá cách tiếp cận của chúng tôi đối với dữ liệu để huấn luyện các mô hình AI tạo sinh.
Hai người ngồi tại một bàn, xem lại nội dung trên máy tính bảng, với một cốc cà phê ở gần đó.
Niềm tin và tính minh bạch là cốt lõi trong cách chúng tôi tiếp cận dữ liệu để huấn luyện các mô hình AI tại Microsoft.

Mục đích của trang này là chia sẻ cách tiếp cận của chúng tôi, phác thảo các danh mục dữ liệu chúng tôi dùng để huấn luyện, và những gì chúng tôi đang làm để trao cho nhà phát hành web và người sáng tạo nội dung quyền kiểm soát cách nội dung của họ được dùng để huấn luyện các mô hình này.

Huấn luyện một mô hình AI nghĩa là gì?

Các mô hình AI đưa ra dự đoán dựa trên dữ liệu. Trong quá trình huấn luyện, một mô hình AI xác định các mẫu, mối tương quan, và khái niệm trên khối lượng dữ liệu rất lớn, rồi dùng những gì đã học để tạo ra câu trả lời cho câu hỏi hoặc yêu cầu. Mô hình có thể được tinh chỉnh bằng các danh mục dữ liệu huấn luyện khác nhau để tối ưu hóa khả năng tạo ra cho các nhóm thông tin cụ thể như ngôn ngữ tự nhiên, mã phần mềm, hoặc hình ảnh. Mô hình cũng có thể được bổ sung bằng dữ liệu riêng của một tổ chức – ví dụ, trong một lĩnh vực ngành dọc như nông nghiệp, y tế, hoặc bán lẻ.

Các mô hình AI tạo sinh không được thiết kế để lưu trữ, truy cập, hoặc tái tạo dữ liệu huấn luyện gốc. Thay vào đó, các mô hình này được tạo ra để sinh ra các tác phẩm và nội dung mới, giàu tính biểu đạt.

Hai người đứng trong nhà, xem lại một bảng điều khiển trên màn hình lớn với các biểu đồ và số liệu hiển thị.

Khám phá cách Microsoft huấn luyện các mô hình AI tạo sinh trên dữ liệu đa dạng

Các tập dữ liệu lớn và đa dạng là yếu tố thiết yếu để tạo ra các hệ thống AI ngày nay. Việc sử dụng các nguồn dữ liệu đa dạng và phong phú là điều tối quan trọng để xây dựng các mô hình chính xác hơn, mang tính đại diện tốt hơn cho các nền văn hóa và ngôn ngữ khác nhau, đồng thời có thể học hỏi và áp dụng toàn bộ lăng kính kinh nghiệm cùng sự sáng tạo của con người.
Như được xác định trong thẻ mô hình và các tài liệu công khai khác, Microsoft lấy các danh mục dữ liệu sau để huấn luyện các mô hình AI tạo sinh của mình một cách có trách nhiệm:
  • Chúng tôi huấn luyện trên dữ liệu công khai được chọn lọc, từ sự kết hợp giữa các tập dữ liệu học máy theo tiêu chuẩn ngành, và hoạt động thu thập dữ liệu web. Chúng tôi không sử dụng các nguồn nội dung trả phí, nội dung vi phạm chính sách hoặc các nội dung đã kích hoạt tính năng chặn huấn luyện AI bằng các công cụ kiểm soát web do chúng tôi cung cấp. Dữ liệu được thu thập từ web được lọc an toàn và xử lý để loại bỏ nội dung bất hợp pháp, bao gồm tài liệu lạm dụng tình dục trẻ em (CSAM), theo luật hiện hành, và chính sách AI có trách nhiệm của Microsoft.

    Chúng tôi tôn trọng các tiêu chuẩn như thẻ robots.txt mà nhà phát hành web dùng để từ chối hoạt động thu thập dữ liệu web. Chúng tôi không dùng dữ liệu từ các miền được liệt kê trong danh sách Thị trường nổi tiếng về hàng giả và vi phạm bản quyền của Văn phòng đại diện thương mại Hoa Kỳ (USTR).
  • Đây là dữ liệu huấn luyện mà chúng tôi truy cập thông qua các thỏa thuận đã đàm phán, chẳng hạn như với nhà xuất bản và chủ sở hữu bản quyền.
  • Dữ liệu này được thu thập từ một số dịch vụ dành cho người tiêu dùng của Microsoft và được bảo vệ theo Điều khoản về quyền riêng tư của Microsoft. Blog Microsoft CopilotCâu hỏi thường gặp về Copilot giải thích cách chúng tôi dùng dữ liệu người tiêu dùng từ Copilot, Bing, và Microsoft Start (MSN) để giúp huấn luyện các mô hình của chúng tôi trong Copilot. Chúng tôi giúp người dùng dễ dàng từ chối tham gia, và áp dụng các biện pháp bảo vệ như loại bỏ các định danh có thể nhận diện bạn để bảo vệ quyền riêng tư của người dùng. Chúng tôi không dùng dữ liệu của khách hàng doanh nghiệp nếu không có sự cho phép của họ.
  • Đôi khi chúng tôi huấn luyện trên các bộ dữ liệu tổng hợp. Đây là dữ liệu mà chúng tôi tạo ra bằng cách yêu cầu các mô hình ngôn ngữ lớn (LLM) sinh ra đầu ra được yêu cầu cụ thể để bổ sung cho dữ liệu thực tế khan hiếm hoặc hạn chế. Sau đó, kết quả được xem xét và lọc, trong đó có cả người kiểm duyệt, để bảo đảm chất lượng đủ tốt để đưa vào tập dữ liệu huấn luyện.
  • Chúng tôi đưa phản hồi của con người từ các huấn luyện viên AI, đội đỏ, nhân viên và các đối tác chú thích bên ngoài vào quy trình huấn luyện của mình. Điều này bao gồm, ví dụ, phản hồi của con người giúp củng cố đầu ra chất lượng cho yêu cầu của người dùng, cải thiện trải nghiệm của người dùng cuối. Đội đỏ cũng kiểm thử mô hình trước các yêu cầu có hại hoặc không an toàn, và phản hồi của họ được dùng để cải thiện hành vi an toàn của mô hình.
Cùng với các mô hình riêng của Microsoft, chúng tôi tích hợp nhiều mô hình khác, bao gồm từ OpenAI, vào sản phẩm và dịch vụ của mình. Tìm hiểu thêm về cách OpenAI huấn luyện mô hình.

Vì mục tiêu phát triển một hệ thống AI có lợi và mang tính toàn diện, một số nhà xuất bản web và chủ sở hữu nội dung mong muốn có tiếng nói lớn hơn trong việc quyết định cách thức nội dung của họ được sử dụng. Các công cụ kiểm soát của nhà xuất bản web rất hữu ích nhưng không phải là giải pháp hoàn chỉnh. Chúng tôi đang làm việc cùng những bên khác trong ngành, lĩnh vực xuất bản, các tổ chức tiêu chuẩn, và cộng đồng nội dung để xác định một cách tiếp cận chung mà tất cả chúng ta có thể thúc đẩy và áp dụng.
Một người đứng trong nhà, sử dụng máy tính xách tay trong bối cảnh văn phòng sáng sủa.

AI có trách nhiệm tại Microsoft

Khám phá các công cụ, thực tiễn và chính sách mà chúng tôi đã tạo để tuân thủ các nguyên tắc AI có trách nhiệm.

Tài nguyên khác

Ba người cùng xem lại nội dung trên máy tính xách tay trong bối cảnh phòng khách.

Báo cáo minh bạch AI có trách nhiệm

Tìm hiểu cách chúng tôi xây dựng AI một cách có trách nhiệm, hỗ trợ khách hàng, cải tiến và phát triển.
Hai người ngồi tại bàn, dùng máy tính xách tay trong lúc thảo luận.

Tính minh bạch và khả năng kiểm soát trong việc sử dụng dữ liệu người tiêu dùng

Kiểm soát cách Copilot học từ dữ liệu của bạn.
Một người đang cầm máy tính bảng hiển thị biểu đồ cột và phân tích.

Thúc đẩy dữ liệu mở

Hiện thực hóa lợi ích của dữ liệu cởi mở và dễ tiếp cận hơn.

Theo dõi Microsoft

Tiếng Việt (Việt Nam) Quyền riêng tư về Sức khỏe người tiêu dùng Liên hệ với Microsoft Quyền riêng tư Quản lý cookie Điều khoản sử dụng Nhãn hiệu Giới thiệu về quảng cáo của chúng tôi