This is the Trace Id: 642bcced786b1f4c551f2f3417f9c598
Siirry pääsisältöön Yleiskatsaus Periaatteet ja lähestymistapa Läpinäkyvyysraportti Työkalut ja käytännöt Vastuullinen tekoäly Azuressa Tiedot tekoälyn koulutusta varten Secure Future Initiative SFI-tilanneraportti Mallit ja käytännöt -yleiskatsaus Zero Trust -suojausmalli Tietosuojayleiskatsaus Tietojen hallinnan yleiskatsaus Tietopalvelu Tietojen sijainti EU Data Boundary GDPR Yhteensopivuusyleiskatsaus Yhteensopivuustarjoukset Säädökset DORA-vaatimustenmukaisuus EU:n tekoälyasetus Euroopan digitaalinen resilienssi NIS2-vaatimustenmukaisuus Alueellinen ja maakohtainen yhteensopivuus Helppokäyttötoiminnot Tuotteet ja palvelut Yhteensopivuustarjoukset Vaatimustenmukaisuuspisteet Auditointiraportit Tietosuojaresurssit Microsoft Security Azure Dynamics 365 Microsoft 365 Microsoft Teams Windows 365 Microsoftin tekoäly Azure Space Yhdistetty todellisuus Microsoft HoloLens Microsoft Viva Kvanttilaskenta Koulutus Autoilu Talouspalvelut Julkishallinto Terveydenhoito Teollinen valmistus Vähittäiskauppa Etsi kumppani Ryhdy kumppaniksi Kumppaniverkosto Microsoft Marketplace Ohjelmistoyritykset Blogi Microsoft Advertising Kehittäjäkeskus Ohjeet Tapahtumat Käyttöoikeudet Microsoft Learn Microsoft Research Näytä sivustokartta

Tekoälymallin kehittämisen tiedot

Tutustu lähestymistapaamme generatiivisten tekoälymallien koulutuksessa käytettävään dataan.
Kaksi ihmistä istuu pöydän ääressä ja tarkastelee sisältöä tabletilla. Lähellä on kahvikuppi.
Luottamus ja läpinäkyvyys ovat keskeisiä siinä, miten lähestymme tekoälymallien koulutuksessa käytettävää dataa täällä Microsoftilla.

Tämän sivun tarkoitus on kuvata lähestymistapaamme. Kerromme, mitä datakategorioita käytämme koulutuksessa ja mitä teemme, jotta verkkojulkaisijat ja sisällöntuottajat voivat hallita sitä, miten heidän sisältöään käytetään näiden mallien kouluttamiseen.

Mitä tekoälymallin kouluttaminen tarkoittaa?

Tekoälymallit tekevät ennusteita datan perusteella. Koulutusprosessin aikana tekoälymalli tunnistaa kuvioita, yhteyksiä ja käsitteitä valtavista tietomääristä. Sen jälkeen se käyttää oppimaansa vastatakseen kysymyksiin tai pyyntöihin. Mallia voi hienosäätää käyttämällä erilaisia koulutusdatan kategorioita, jotta sen kyky tuottaa sisältöä voidaan optimoida tietyille tietotyypeille, kuten luonnolliselle kielelle, ohjelmistokoodille tai kuville. Se voi perustua myös organisaation omaan dataan. Esimerkiksi toimialoilla, kuten maataloudessa, terveydenhuollossa tai vähittäiskaupassa.

Generatiivisia tekoälymalleja ei ole suunniteltu tallentamaan, käyttämään tai jäljentämään alkuperäistä koulutusdataa. Sen sijaan nämä mallit on tarkoitettu tuottamaan uusia ilmaisullisia teoksia ja sisältöä.

Kaksi ihmistä seisoo sisätiloissa ja tarkastelee koontinäyttöä suurelta näytöltä, jossa näkyy kaavioita ja mittareita.

Tutustu siihen, miten Microsoft kouluttaa generatiivisia tekoälymalleja monipuolisella datalla

Suuret ja monipuoliset tietoaineistot ovat olennainen osa nykyisten tekoälyjärjestelmien luomista. On ratkaisevan tärkeää, että mallien kehityksessä käytetään laajasti erilaista dataa, jotta niistä tulee tarkempia, paremmin eri kulttuureja ja kieliä edustavia ja jotta ne oppivat tunnistamaan ja hyödyntämään koko inhimillisen kokemuksen ja kekseliäisyyden kirjon.
Kuten mallikorteissamme ja muussa julkisesti saatavilla olevassa dokumentaatiossa on kuvattu, Microsoft käyttää generatiivisten tekoälymalliensa koulutuksessa vastuullisesti seuraavia datakategorioita:
  • Koulutamme malleja valikoidulla julkisesti saatavilla olevalla datalla. Lähteitä ovat muun muassa alan vakiintuneet koneoppimisaineistot ja verkon indeksointi. Suljemme pois lähteet, joissa on maksumuureja, sekä sisällön, joka rikkoo käytäntöjämme tai joka on kieltäytynyt koulutuksesta käyttämällä verkko-ohjaimia, jotka olemme julkaisseet. Verkosta indeksoitu data suodatetaan turvallisuuden vuoksi ja käsitellään niin, että laiton sisältö, mukaan lukien lapsiin kohdistuvaa seksuaalista hyväksikäyttöä esittävä materiaali (CSAM), poistetaan sovellettavien lakien ja Microsoftin vastuullisen tekoälyn käytäntöjen mukaisesti.

    Kunnioitamme esimerkiksi robots.txt-tunnisteita, joita verkkojulkaisijat käyttävät kieltäytyäkseen verkon indeksoinnista. Emme käytä dataa verkkotunnuksista, jotka on listattu United States Trade Representative (USTR) Notorious Markets for Counterfeiting and Piracy -luetteloon.
  • Tämä on koulutusdataa, jota käytämme neuvoteltujen järjestelyjen perusteella esimerkiksi kustantajien ja tekijänoikeuksien omistajien kanssa.
  • Tämä data kerätään valikoiduista Microsoftin kuluttajapalveluista, ja sitä suojataan Microsoftin tietosuojalausekkeen mukaisesti. Microsoft Copilot -blogissa ja Copilotin usein kysytyissä kysymyksissä kerromme, miten käytämme Copilotin, Bingin ja Microsoft Startin (MSN) kuluttajadataa, jotta voimme auttaa mallien kouluttamisessa Copilotissa. Teemme kieltäytymisen helpoksi käyttäjille ja käytämme suojatoimia, kuten tunnisteiden poistamista, jotta yksityisyytesi säilyy suojattuna. Emme käytä yritysasiakkaidemme dataa ilman heidän lupaansa.
  • Koulutamme joskus synteettisillä aineistoilla. Nämä luodaan pyytämällä suuria kielimalleja (LLM) tuottamaan nimenomaan pyydettyä sisältöä, joka täydentää niukkaa tai rajallista todellisen maailman dataa. Tulokset tarkistetaan ja suodatetaan, mukaan lukien ihmistarkistajien toimesta, jotta varmistetaan, että ne ovat riittävän laadukkaita osaksi koulutusdataa.
  • Otamme koulutusprosessissamme huomioon ihmisiltä saadun palautteen, jota saamme tekoälyn kouluttajilta, red team -jäseniltä, työntekijöiltä ja ulkoisilta annotointikumppaneilta. Tähän sisältyy esimerkiksi ihmispalaute, joka vahvistaa laadukasta vastausta käyttäjän kehotteeseen ja parantaa loppukäyttäjän kokemusta. Red team testaa mallia myös haitallisia tai vaarallisia pyyntöjä vastaan, ja heidän palautettaan käytetään parantamaan mallin turvallisuuskäyttäytymistä.
Omien Microsoft-malliemme lisäksi sisällytämme tuotteisiimme ja palveluihimme useita muita malleja, kuten OpenAI:ltä. Lue lisää siitä, miten OpenAI kouluttaa malleja.

Hyödyllisen ja inklusiivisen tekoälyn vuoksi jotkut verkkojulkaisijat ja sisällön omistajat haluavat enemmän vaikutusvaltaa siihen, miten heidän sisältöään käytetään. Verkkojulkaisijan hallintamahdollisuudet ovat hyödyllisiä, mutta ne eivät yksin riitä. Teemme yhteistyötä alan toimijoiden, julkaisijoiden, standardointielinten ja sisältöyhteisön kanssa, jotta voimme määrittää yhteisen lähestymistavan, jota kaikki voivat kehittää ja ottaa käyttöön.
Henkilö seisoo sisätiloissa ja käyttää kannettavaa tietokonetta valoisassa toimistoympäristössä.

Vastuullinen tekoäly Microsoftilla

Tutustu työkaluihin ja käytäntöihin, jotka olemme luoneet vastuullisten tekoälyperiaatteiden noudattamiseksi.

Lisäresurssit

Kolme ihmistä tarkastelee sisältöä yhdessä kannettavalta tietokoneelta olohuoneessa.

Vastuullisen tekoälyn läpinäkyvyysraportti

Lue, miten kehitämme tekoälyä vastuullisesti, tuemme asiakkaitamme, kehitämme ja kasvamme.
Kaksi ihmistä istuu pöydän ääressä ja käyttää kannettavia tietokoneita keskustelun aikana.

Läpinäkyvyys ja hallinta kuluttajatietojen käytössä

Määritä, miten Copilot oppii datastasi.
Henkilö pitelee tablettia, jossa näkyy pylväskaavioita ja analytiikkaa.

Avoimen datan edistäminen

Hyödynnä avoimemman ja helpommin saatavilla olevan datan edut.

Seuraa Microsoftia

Suomi (Suomi) Kuluttajien terveystietojen tietosuoja Ota yhteyttä Microsoftiin Tietosuoja Hallitse evästeitä Käyttöluvat Tavaramerkit Tietoja mainoksista EU Compliance DoCs