This is the Trace Id: ce805f27cb3541583eac480407803c20
Pređi na glavni sadržaj Pregled Principi i pristup Izveštaj o transparentnosti Alatke i prakse Odgovorni AI u sistemu Azure Podaci za obuku veštačke inteligencije Inicijativa za bezbednu budućnost Izveštaj napretka Inicijative za bezbednu budućnost Pregled obrazaca i praksi Nulta pouzdanost Pregled privatnosti Pregled upravljanjem podacima Pristup podacima Lokacija podataka Granica podataka za EU GDPR Pregled usaglašenosti Ponude usaglašenosti Propisi Usaglašenost sa uredbom DORA Zakon EU o veštačkoj inteligenciji Evropska digitalna otpornost Usaglašenost sa direktivom NIS2 Usaglašenost regiona i zemalja Pristupačnost Proizvodi i usluge Ponude usaglašenosti Ocena usaglašenosti Izveštaji o nadzoru Resursi zaštite podataka Microsoft Security Azure Dynamics 365 Microsoft 365 Microsoft Teams Windows 365 Microsoft AI Azure Space Mešovita realnost Microsoft HoloLens Microsoft Viva Kvantno računarstvo Education Automobili Finansijske usluge Vlada Zdravstvo Proizvodnja Maloprodaja Pronađite partnera Postanite partner Partnerske mreže Microsoft Marketplace Softverska preduzeća Blog Microsoft Advertising Razvojni centar Documentation Events Licensing Microsoft Learn Microsoft Research Prikaži mapu lokacije

Podaci za razvoj AI modela

Istražite naš pristup podacima za obučavanje generativnih AI modela.
Dve osobe sede za stolom i pregledaju sadržaj na tabletu, dok je u blizini šolja za kafu.
Poverenje i transparentnost su osnova našeg pristupa podacima za obučavanje AI modela ovde u korporaciji Microsoft.

Svrha ove stranice je da podelimo naš pristup, navodeći kategorije podataka koje koristimo za obuku i šta radimo kako bismo veb izdavačima i kreatorima sadržaja dali kontrolu nad načinom na koji se njihov sadržaj koristi za obuku ovih modela.

Šta znači obučavati AI model?

AI modeli daju predviđanja na osnovu podataka. Tokom procesa obuke, AI model identifikuje obrasce, korelacije i koncepte u ogromnim količinama podataka, a zatim koristi ono što je naučio da generiše odgovore na pitanja ili zahteve. Model se može podesiti pomoću različitih kategorija podataka za obuku za optimizaciju mogućnosti generisanja za određene klase informacija kao što su prirodni jezik, softverski kôd ili slike. Može i da se zasniva na sopstvenim podacima neke organizacije – na primer, u industrijskom sektoru kao što su poljoprivreda, zdravstvo ili maloprodaja.

Generativni AI modeli nisu dizajnirani da skladište originalne podatke za obučavanje, pristupaju im ili reprodukuju. Umesto toga, ovi modeli treba da generišu nova izražajna dela i sadržaj.

Dve osobe stoje u zatvorenom prostoru i pregledaju kontrolnu tablu na velikom monitoru sa prikazanim grafikonima i metrikama.

Saznajte kako Microsoft obučava generativne AI modele na raznovrsnim podacima

Veliki i raznovrsni skupovi podataka sastavni su deo kreiranja današnjih AI sistema. Ključno je da se širok spektar podataka koristi za razvoj modela koji su tačniji, reprezentativniji za različite kulture i jezike, i koji uče i primenjuju ceo spektar ljudskog iskustva i domišljatosti.
Kao što je navedeno u našim karticama modela i drugoj javno dostupnoj dokumentaciji, Microsoft odgovorno nabavlja sledeće kategorije podataka za obuku naših generativnih AI modela:
  • Obučavamo se na odabranim javno dostupnim podacima, iz kombinacije standardnih skupova podataka mašinskog učenja i veb pretraživača. Isključujemo izvore iza platnih zidova i sadržaj koji krši naše smernice, kao i one koji su se isključili iz obučavanja pomoću veb kontrola koje smo objavili. Podaci pretraživani na vebu se bezbednosno filtriraju i obrađuju kako bi se uklonio ilegalni sadržaj, uključujući materijal o seksualnom zlostavljanju dece (CSAM), u skladu sa važećim zakonima i smernicama odgovorne veštačke inteligencije korporacije Microsoft.

    Poštujemo standarde kao što su oznake robots.txt koje izdavači na vebu koriste da bi se isključili iz indeksiranja veba. Ne koristimo podatke sa domena navedenih na listi ozloglašenih tržišta za falsifikovanje i pirateriju Kancelarije trgovinskog predstavnika Sjedinjenih Država (USTR).
  • Ovo su podaci za obučavanje kojima pristupamo putem dogovorenih aranžmana, kao što su oni sa izdavačima i vlasnicima autorskih prava.
  • Ovi podaci se prikupljaju iz odabranih Microsoft usluga za potrošače i zaštićeni su u skladu sa našom Microsoft izjavom o privatnosti. Naš blog o usluzi Microsoft Copilot i Najčešća pitanja o usluzi Copilot objašnjavaju kako koristimo podatke o potrošačima iz usluga Copilot, Bing i Microsoft Start (MSN) kako bismo obučavali naše modele u usluzi Copilot. Koristimo jednostavno isključivanje za korisnike i uvodimo zaštitne mere kao što je uklanjanje identifikatora koji bi mogli da vas identifikuju kako bismo zaštitili privatnost korisnika. Ne koristimo podatke velikih preduzeća kao klijenata bez njihove dozvole.
  • Ponekad obučavamo modele na sintetičkim skupovima podataka. Njih kreiramo tako što velikim jezičkim modelima (LLM) zadajemo upite da generišu konkretno tražene rezultate koji dopunjuju oskudne ili ograničene podatke iz stvarnog sveta. Rezultate zatim pregledamo i filtriramo, uključujući i uz pomoć ljudskih redaktora, kako bismo osigurali da su dovoljno kvalitetni da budu deo skupa podataka za obuku.
  • U proces obuke uključujemo povratne informacije ljudi od AI trenera, članova red tima, zaposlenih i eksternih partnera za anotaciju. Ovo uključuje, na primer, ljudske povratne informacije koje pojačavaju kvalitetan rezultat korisničkog upita, poboljšavajući iskustvo krajnjeg korisnika. Članovi crvenog tima takođe testiraju model na štetne ili nebezbedne zahteve, a njihove povratne informacije koriste se za poboljšanje bezbednosnog ponašanja modela.
Pored naših Microsoft modela, u naše proizvode i usluge ugrađujemo razne druge modele, uključujući i one iz OpenAI-ja. Saznajte više o tome kako OpenAI obučava modele.

Za koristan i inkluzivan AI, neki izdavači na vebu i vlasnici sadržaja žele veću reč u tome kako se njihov sadržaj koristi. Kontrole veb izdavača su korisne, ali ne i kompletno rešenje. Radimo zajedno sa drugima u industriji, izdavaštvu, standardizacionim telima i zajednicom autora sadržaja da bismo identifikovali zajednički pristup koji svi možemo da unapredimo i usvojimo.
Osoba stoji u zatvorenom prostoru i koristi laptop u svetloj kancelariji.

Odgovorni AI u korporaciji Microsoft

Istražite alatke, prakse i smernice koje smo kreirali sa ciljem očuvanja naših principa za korišćenje usluge odgovorni AI.

Dodatni resursi

Tri osobe zajedno pregledaju sadržaj na laptopu u dnevnoj sobi.

Izveštaj o transparentnosti odgovorne veštačke inteligencije

Saznajte kako odgovorno pravimo AI, podržavamo naše korisnike, razvijamo se i rastemo.
Dve osobe sede za stolom i koriste laptopove tokom razgovora.

Transparentnost i kontrola u korišćenju podataka potrošača

Kontrolišite kako Copilot uči iz vaših podataka.
Osoba koja drži tablet koji prikazuje stubičaste grafikone i analitiku.

Unapređivanje otvorenih podataka

Iskoristite prednosti otvorenijih i pristupačnijih podataka.

Prati Microsoft