This is the Trace Id: 4d9b44228fc2c7416c082a152ee0b2f4

Data untuk pengembangan model AI

Jelajahi pendekatan kami terhadap data untuk model AI generatif pelatihan.
Dua orang duduk di meja meninjau konten di tablet, dengan secangkir kopi di dekatnya.
Kepercayaan dan transparansi adalah inti dari cara kami melakukan pendekatan data untuk model AI pelatihan di Microsoft.

Tujuan halaman ini adalah untuk membagikan pendekatan kami, yang menguraikan kategori data yang kami gunakan untuk pelatihan dan hal yang kami lakukan untuk memberikan kontrol kepada penerbit web dan kreator konten atas cara konten mereka digunakan untuk melatih model ini.

Apa artinya melatih model AI?

Model AI membuat prediksi berdasarkan data. Selama proses pelatihan, model AI mengidentifikasi pola, korelasi, dan konsep di sejumlah besar data, lalu menggunakan hal yang dipelajari untuk menghasilkan jawaban atas pertanyaan atau permintaan. Model dapat disetel menggunakan kategori data pelatihan yang berbeda untuk mengoptimalkan kemampuan pembuatan untuk kelas informasi tertentu seperti bahasa alami, kode perangkat lunak, atau gambar. Data ini juga dapat didasarkan pada data milik organisasi sendiri — misalnya, dalam kelompok industri seperti pertanian, kesehatan, atau ritel.

Model AI generatif tidak dirancang untuk menyimpan, mengakses, atau mereproduksi data pelatihan asli. Sebagai gantinya, model ini ditujukan untuk menghasilkan karya dan konten ekspresif baru.

Dua orang berdiri di dalam ruangan, meninjau dasbor di monitor besar dengan bagan dan metrik ditampilkan.

Temukan cara Microsoft melatih model AI generatif pada data yang beragam

Himpunan data yang besar dan beragam sangat penting untuk membuat sistem AI saat ini. Sangat penting untuk menggunakan keragaman data yang luas demi mengembangkan model yang lebih akurat, lebih mewakili budaya dan bahasa yang berbeda, dan yang mempelajari dan menerapkan spektrum penuh pengalaman dan kecerdasan manusia.
Seperti yang diidentifikasi dalam kartu model kami dan dokumentasi lain yang tersedia secara publik, Microsoft mendekripsi kategori data berikut untuk melatih model AI generatif kami secara bertanggung jawab:
  • Kami melatih data tertentu yang tersedia untuk publik, dari campuran himpunan data pembelajaran mesin dan perayapan web standar industri. Kami mengecualikan sumber dengan paywall dan konten yang melanggar kebijakan kami, dan yang telah menolak ikut serta pelatihan menggunakan kontrol web yang kami terbitkan. Data yang dirayapi web difilter dan diproses keamanan untuk menghapus konten ilegal, termasuk materi pelecehan seksual anak (CSAM), sesuai dengan hukum yang berlaku dan kebijakan AI yang Bertanggung Jawab dari Microsoft.

    Kami menghargai standar seperti tag robots.txt yang digunakan penerbit web untuk menolak perayapan web. Kami tidak menggunakan data dari domain yang tercantum di daftar Kantor United States Trade Representative (USTR) sebagai Pemalsuan dan Pembajakan.
  • Ini adalah data pelatihan yang kami akses melalui pengaturan yang dinegosiasikan dengan, misalnya, penerbit dan pemilik hak cipta.
  • Data ini dikumpulkan dari layanan konsumen Microsoft terpilih dan dilindungi sesuai dengan Pernyataan Privasi Microsoft kami. Blog Microsoft Copilot dan FAQ Copilot menjelaskan cara kami menggunakan data konsumen dari Copilot, Bing, dan Microsoft Start (MSN) untuk membantu melatih model kami di Copilot. Kami memudahkan pengguna untuk memilih tidak ikut serta dan menerapkan perlindungan seperti menghapus pengenal yang mungkin dapat mengidentifikasi Anda untuk melindungi privasi pengguna. Kami tidak menggunakan data pelanggan perusahaan tanpa izin mereka.
  • Kami terkadang melatih himpunan data sintetis. Hal ini kami buat dengan meminta model bahasa besar (LLM) untuk menghasilkan output yang diminta secara khusus yang menambah data dunia nyata yang langka atau terbatas. Hasil kemudian ditinjau dan difilter, termasuk oleh peninjau manusia, untuk memastikan hasil memiliki kualitas yang memadai untuk menjadi bagian dari himpunan data pelatihan.
  • Kami menyertakan umpan balik manusia dari pelatih AI, anggota red team, karyawan, dan mitra anotasi eksternal, dalam proses pelatihan kami. Hal ini mencakup, misalnya, umpan balik manusia yang memperkuat output kualitas terhadap perintah pengguna, sehingga meningkatkan pengalaman pengguna akhir. Anggota red team juga menguji model terhadap permintaan yang berbahaya atau tidak aman, dan umpan balik mereka digunakan untuk meningkatkan perilaku keamanan model.
Bersama model Microsoft kami sendiri, kami menggabungkan berbagai model lain, termasuk dari OpenAI, ke dalam produk dan layanan kami. Pelajari selengkapnya tentang cara OpenAI melatih model.

Untuk AI yang bermanfaat dan inklusif, beberapa penerbit web dan pemilik konten ingin memiliki kendali lebih besar atas cara konten mereka digunakan. Kontrol penerbit web berguna, tetapi bukan merupakan solusi utuh. Kami bekerja sama dengan orang lain dalam industri, penerbitan, isi standar, dan komunitas konten untuk mengidentifikasi pendekatan umum yang dapat kita tingkatkan dan adopsi bersama.
Orang berdiri di dalam ruangan menggunakan laptop dalam suasana kantor yang cerah.

AI yang bertanggung jawab di Microsoft

Jelajahi alat, praktik, dan kebijakan yang telah kami buat untuk menegakkan prinsip AI yang bertanggung jawab.

Sumber daya lainnya

Tiga orang meninjau konten bersama di laptop dalam lingkungan ruang tamu.

Laporan Transparansi AI yang Bertanggung Jawab

Pelajari cara kami membangun AI secara bertanggung jawab, mendukung pelanggan kami, berkembang, dan bertumbuh.
Dua orang duduk di meja menggunakan laptop selama diskusi.

Transparansi dan Kontrol dalam Penggunaan Data Konsumen

Kontrol cara Copilot belajar dari data Anda.
Orang yang memegang tablet menampilkan bagan batang dan analitik.

Memajukan data terbuka

Wujudkan manfaat data yang lebih terbuka dan mudah diakses.

Ikuti Microsoft