This is the Trace Id: 7b0cf57cdff895fee0bc5b800c5d538b
Gå til hovedinnhold Oversikt Prinsipper og tilnærming Åpenhetsrapporter Verktøy og praksiser Ansvarlig KI i Azure Data for KI-trening Secure Future Initiative SFI-fremdriftsrapport Oversikt over Patterns and Practices Nulltillit Oversikt over personvern Oversikt over dataadministrasjon Datatilgang Dataplassering EU Data Boundary EUs personvernforordning (GDPR) Oversikt over overholdelse av regler og standarder Tilbud for overholdelse av regler og standarder Forordninger Overholdelse av DORA EUs KI-forordning Europeisk digital tilpasningsdyktighet Overholdelse av NIS2 Regionalt og landsspesifikt samsvar Tilgjengelighet Produkter og tjenester Tilbud for overholdelse av regler og standarder Samsvarspoeng Overvåkingsrapporter Ressurser for databeskyttelse Microsoft Sikkerhet Azure Dynamics 365 Microsoft 365 Microsoft Teams Windows 365 Microsoft kunstig intelligens Azure Space Blandet virkelighet Microsoft HoloLens Microsoft Viva Kvantedatabehandling Utdanning Bilbransjen Finansielle tjenester Offentlig sektor Helsevesen Produksjon Detaljhandel Finn en partner Bli en partner Partner Network Microsoft Marketplace Programvareselskaper Blogg Microsoft Advertising Utviklingssenter Dokumentasjon Arrangementer Lisensiering Microsoft Learn Microsoft Research Vis områdekart

Data for KI-modellutvikling

Utforsk vår tilnærming til data for å lære opp generative KI-modeller.
To personer sitter ved et bord og ser gjennom innhold på et nettbrett, med en kaffekopp i nærheten.
Tillit og gjennomsiktighet er kjernen i hvordan vi nærmer oss data for opplæring av KI-modeller her hos Microsoft.

Formålet med denne siden er å dele tilnærmingen vår, som beskriver kategoriene med data vi bruker til opplæring, og hva vi gjør for å gi nettutgivere og innholdsskapere kontroll over hvordan innholdet brukes til å lære opp disse modellene.

Hva betyr det å lære opp en KI-modell?

KI-modeller gjør forutsigelser basert på data. Under opplæringsprosessen identifiserer en KI-modell mønstre, korrelasjoner og konsepter på tvers av store mengder data, og bruker deretter det den har lært til å generere svar på spørsmål eller forespørsler. Modellen kan justeres ved hjelp av ulike kategorier med opplæringsdata for å optimalisere genereringsevner for bestemte klasser med informasjon, for eksempel naturlig språk, programvarekode eller bilder. Den kan også være forankret i en organisasjons egne data – for eksempel i en bransjevertikal som landbruk, helse eller detaljhandel.

Generative KI-modeller er ikke utformet for å lagre, få tilgang til eller reprodusere de opprinnelige opplæringsdataene. I stedet er disse modellene ment å generere nye uttrykksfulle verk og innhold.

To personer som står innendørs og går gjennom et instrumentbord på en stor skjerm som viser diagrammer og måledata.

Oppdag hvordan Microsoft lærer opp generative KI-modeller på varierte data

Store og varierte datasett er avgjørende for å utvikle dagens KI-systemer. Det er avgjørende at et bredt mangfold av data brukes til å utvikle modeller som er mer nøyaktige, mer representative for ulike kulturer og språk, og som lærer og bruker hele spekteret av menneskelig erfaring og oppfinnelsesevne.
Som identifisert i modellkortene våre og annen offentlig tilgjengelig dokumentasjon, henter Microsoft følgende datakategorier for å lære opp våre generative KI-modeller på en ansvarlig måte:
  • Vi lærer opp på utvalgte offentlig tilgjengelige data, fra en blanding av maskinlæringsdatasett og web-crawls av bransjestandard. Vi ekskluderer kilder med betalingsmurer og innhold som bryter policyene våre, og som har valgt bort opplæring ved hjelp av nettkontroller som vi har publisert. Web-crawlede data sikkerhetsfiltreres og behandles for å fjerne ulovlig innhold, inkludert materiale om seksuelt misbruk av barn (CSAM), i samsvar med gjeldende lover og Microsofts policyer for ansvarlig KI.

    Vi respekterer standarder som robots.txt-merker som nettutgivere bruker til å velge bort web-crawling. Vi bruker ikke data fra domener som er oppført på listen over beryktede markeder for forfalskning og piratkopiering fra Office of the United States Trade Representative (USTR).
  • Dette er opplæringsdata som vi får tilgang til gjennom forhandlede avtaler, for eksempel med utgivere og opphavsrettseiere.
  • Disse dataene samles inn fra utvalgte Microsoft-forbrukertjenester og beskyttes i samsvar med Microsofts personvernerklæring. Vår Microsoft Copilot-blogg og vanlige spørsmål om Copilot forklarer hvordan vi bruker forbrukerdata fra Copilot, Bing og Microsoft Start (MSN) til å lære opp modellene våre i Copilot. Vi gjør det enkelt for brukere å velge bort dette, og iverksetter sikkerhetstiltak, som for eksempel å fjerne identifikatorer som kan identifisere deg, for å beskytte brukernes personvern. Vi bruker ikke dataene til våre foretakskunder uten deres tillatelse.
  • Noen ganger driver vi med opplæring på syntetiske datasett. Disse oppretter vi ved å instruere store språkmodeller (LLM-er) om å generere spesifikt forespurte utdata som forsterker knappe eller begrensede data fra den virkelige verden. Resultatene gjennomgås og filtreres deretter, inkludert av menneskelige vurderere, for å sikre at de har tilstrekkelig kvalitet til å være en del av opplæringsdatasettet.
  • Vi inkluderer menneskelig tilbakemelding fra KI-instruktører, røde teamere, ansatte og eksterne merknadspartnere i opplæringsprosessen vår. Dette inkluderer for eksempel menneskelig tilbakemelding som forsterker utdata av høy kvalitet for en brukers instruks, noe som forbedrer sluttbrukeropplevelsen. Røde teamere tester også modellen mot skadelige eller usikre forespørsler, og tilbakemeldingene deres brukes til å forbedre modellens sikkerhetsvirkemåte.
Sammen med våre egne Microsoft-modeller integrerer vi ulike andre modeller, inkludert fra OpenAI, i produktene og tjenestene våre. Lær mer om hvordan OpenAI lærer opp modeller.

For at KI skal være gunstig og inkluderende, ønsker noen nettutgivere og innholdseiere å ha mer å si om hvordan innholdet deres brukes. Nettutgiverkontroller er nyttige, men ikke den fullstendige løsningen. Vi samarbeider med andre i bransjen, innen publisering, i standardiseringsorganer og i innholdsfellesskapet for å identifisere en felles tilnærming vi alle kan fremme og ta i bruk.
Person som står innendørs og bruker en bærbar datamaskin i et lyst kontormiljø.

Ansvarlig KI i Microsoft

Utforsk verktøyene, praksisene og policyene vi har opprettet for å opprettholde våre prinsipper for ansvarlig KI.

Flere ressurser

Tre personer som ser gjennom innhold sammen på en bærbar datamaskin i et oppholdsrom.

Rapport om gjennomsiktighet innen ansvarlig KI

Finn ut hvordan vi bygger KI på en ansvarlig måte, støtter kundene våre, utvikler oss og vokser.
To personer sitter ved et bord og bruker bærbare datamaskiner under en diskusjon.

Gjennomsiktighet og kontroll i bruk av forbrukerdata

Kontroller hvordan Copilot lærer av dataene dine.
Person som holder et nettbrett som viser stolpediagrammer og analyser.

Fremme åpne data

Realiser fordelene med mer åpne og tilgjengelige data.

Følg Microsoft

Norsk bokmål (Norge) Personvern for forbrukerhelse Kontakt Microsoft Personvern Behandle informasjonskapsler Vilkår for bruk Varemerker Om annonsene