This is the Trace Id: 708075978322a92160337581390b6865
Preskoči na glavni sadržaj Pregled Načela i pristup Izvješće o transparentnosti Alati i prakse Odgovorni AI na platformi Azure Podaci za obučavanje AI-ja Inicijativa za sigurnu budućnost Izvješće o napretku Inicijative za sigurnu budućnost Pregled obrazaca i praksi Model „svi su nepouzdani” Pregled zaštite privatnosti Pregled upravljanja podacima Pristup podacima Lokacija podataka Granica podataka za EU GDPR Pregled usklađenosti Rješenja za usklađenost Propisi Usklađenost – DORA Zakon EU-a o umjetnoj inteligenciji Europska digitalna otpornost Usklađenost – NIS2 Regionalna i državna usklađenost Pristupačnost Proizvodi i usluge Rješenja za usklađenost Ocjena usklađenosti Izvješća o nadzoru Resursi za zaštitu podataka Microsoft Security Azure Dynamics 365 Microsoft 365 Microsoft Teams Windows 365 Microsoft AI Azure Space Mixed reality Microsoft HoloLens Microsoft Viva Quantum computing Obrazovanje Automobili Financijske usluge Državna uprava Zdravstvo Proizvodnja Maloprodaja Pronađi partnera Postani partner Mreža partnera Microsoft Marketplace Softverske tvrtke Blog Microsoftovo oglašavanje Centar za razvojne inženjere Dokumentacija Događaji Licenciranje Microsoft Learn Microsoft Research Prikaz karte web-mjesta

Podaci za razvoj modela umjetne inteligencije

Istražite naš pristup podacima za obuku modela generativnog AI-ja.
Dvije osobe sjede za stolom i pregledavaju sadržaj na tabletu, a u blizini je šalica s kavom.
Pouzdanost i transparentnost ključne su za način na koji pristupamo podacima za obuku modela umjetne inteligencije u Microsoftu.

Svrha je ove stranice podijeliti naš pristup, navodeći kategorije podataka koje upotrebljavamo za obuku i ono što činimo kako bismo izdavačima na webu i autorima sadržaja omogućili kontrolu nad time kako se njihov sadržaj upotrebljava za obuku tih modela.

Što znači obučavati model umjetne inteligencije?

Modeli umjetne inteligencije predviđaju na temelju podataka. Tijekom procesa obuke model umjetne inteligencije prepoznaje obrasce, korelacije i koncepte u golemim količinama podataka, a zatim upotrebljava ono što je naučio za generiranje odgovora na pitanja ili zahtjeve. Model je moguće prilagoditi pomoću različitih kategorija podataka za obuku radi optimizacije mogućnosti generiranja za određene vrste informacija kao što su prirodni jezik, programski kod ili slike. Moguće ga je utemeljiti i pomoću podataka same tvrtke ili ustanove – na primjer, u određenoj grani djelatnosti kao što su poljoprivreda, zdravstvo ili maloprodaja.

Modeli generativnog AI-ja nisu osmišljeni za pohranu, pristup ni reprodukciju izvornih podataka za obuku. Umjesto toga, ti su modeli namijenjeni generiranju novih izražajnih djela i sadržaja.

Dvije osobe stoje u zatvorenom prostoru i pregledavaju nadzornu ploču na velikom monitoru s prikazom grafikona i metrike.

Saznajte kako Microsoft obučava modele generativnog AI-ja na raznovrsnim podacima

Veliki i raznoliki skupovi podataka sastavni su dio stvaranja današnjih AI sustava. Ključno je da se upotrebljava velika raznolikost podataka za razvoj točnijih modela koji su reprezentativniji za različite kulture i jezike i koji uče i primjenjuju cijeli spektar ljudskog iskustva i domišljatosti.
Kao što je navedeno na našim karticama modela i u drugoj javno dostupnoj dokumentaciji, Microsoft za odgovornu obuku modela generativnog AI-ja upotrebljava sljedeće kategorije podataka:
  • Obučavamo na odabranim javno dostupnim podacima, iz kombinacije standardnih skupova podataka za strojno učenje i pretraživanja weba radi indeksiranja. Izuzimamo izvore s naplatom pristupa i sadržaj koji krši naše pravilnike, kao i one koji su odbili obuku pomoću web-kontrola koje smo objavili. Podaci indeksirani pretraživanjem weba sigurnosno se filtriraju i obrađuju radi uklanjanja nezakonitog sadržaja, uključujući materijal o seksualnom zlostavljanju djece (CSAM), u skladu s mjerodavnim zakonima i Microsoftovim pravilnicima o odgovornom AI-ju.

    Poštujemo standarde kao što su oznake robots.txt koje izdavači na webu upotrebljavaju za odbijanje sudjelovanja u pretraživanje weba radi indeksiranja. Ne upotrebljavamo podatke s domena navedenih na popisu Office of the United States Trade Representative (USTR) Notorious Markets for Counterfeiting and Piracy.
  • To su podaci za obuku kojima pristupamo putem ugovorenih aranžmana, primjerice s izdavačima i vlasnicima autorskih prava.
  • Ti se podaci prikupljaju iz odabranih Microsoftovih klijentskih servisa i zaštićeni su u skladu s Microsoftovom izjavom o zaštiti privatnosti. Microsoft Copilot blog i Najčešća pitanja o značajci Copilot objašnjavaju kako upotrebljavamo korisničke podatke iz značajke Copilot, servisa Bing i Microsoft Start (MSN) za obuku naših modela u značajci Copilot. Korisnicima olakšavamo odbijanje i uvodimo zaštitne mjere, kao što je uklanjanje identifikatora koji bi ih mogli identificirati, kako bismo zaštitili privatnost korisnika. Ne upotrebljavamo podatke poslovnih klijenata bez njihova dopuštenja.
  • Ponekad obučavamo modele na sintetičkim skupovima podataka. Stvaramo ih slanjem upita velikim jezičnim modelima (LLM-ovima) da generiraju posebno zatražen rezultat koji dopunjuje oskudne ili ograničene stvarne podatke. Rezultati se zatim pregledavaju i filtriraju, uključujući pregled ljudskih revizora, kako bi se provjerilo jesu li dovoljno kvalitetni da budu dio skupa podataka za obuku.
  • U proces obuke uključujemo povratne informacije osoba koje obučavaju AI, članova crvenog tima, zaposlenika i vanjskih partnera za označavanje podataka. To uključuje, primjerice, ljudske povratne informacije koje potkrepljuju kvalitetan odgovor na korisnikov upit, čime se poboljšava iskustvo krajnjeg korisnika. Članovi crvenog tima također testiraju model na štetne ili nesigurne zahtjeve, a njihove se povratne informacije upotrebljavaju za poboljšanje sigurnosnog ponašanja modela.
Uz vlastite Microsoftove modele, u naše proizvode i servise uključujemo različite druge modele, uključujući one tvrtke OpenAI. Saznajte više o tome kako OpenAI obučava modele.

Za korisnu i inkluzivnu umjetnu inteligenciju neki izdavači na webu i vlasnici sadržaja žele više prostora za odlučivanje o tome kako se njihov sadržaj upotrebljava. Kontrole izdavača na webu korisne su, ali nisu cjelovito rješenje. Radimo zajedno s drugima u djelatnosti, objavljivanju, tijelima za standarde i zajednicom za stvaranje sadržaja na prepoznavanju zajedničkog pristupa koji svi možemo unaprijediti i usvojiti.
Osoba stoji u zatvorenom prostoru i upotrebljava prijenosno računalo u svijetlom uredskom okruženju.

Odgovorni AI u Microsoftu

Istražite alate, praksu i pravilnike koje smo stvorili za podršku načelima odgovornog AI-ja.

Još resursa

Tri osobe zajedno pregledavaju sadržaj na prijenosnom računalu u dnevnom boravku.

Izvješće o transparentnosti odgovornog AI-ja

Saznajte kako odgovorno izrađujemo umjetnu inteligenciju, podržavamo klijente, razvijamo se i rastemo.
Dvije osobe sjede za stolom i tijekom razgovora upotrebljavaju prijenosna računala.

Transparentnost i kontrola u upotrebi korisničkih podataka

Upravljajte načinom na koji Copilot uči iz vaših podataka.
Osoba drži tablet s prikazom trakastih grafikona i analitike.

Unaprjeđivanje otvorenih podataka

Ostvarite prednosti otvorenijih i pristupačnijih podataka.

Pratite Microsoft

Hrvatski (Hrvatska) Zaštita privatnosti podataka o zdravlju potrošača Kontaktirajte Microsoft Zaštita privatnosti Upravljanje kolačićima Uvjeti korištenja Zaštitni znakovi O našim oglasima EU Compliance DoCs