This is the Trace Id: 14f823167398fd124ad754b0eaec2931

Data för utveckling av AI-modeller

Utforska vårt arbetssätt för data för träning av generativa AI-modeller.
Två personer sitter vid ett bord och granskar innehåll på en surfplatta, med en kaffekopp i närheten.
Tillit och transparens är centrala i hur vi hanterar data för träning av AI-modeller här på Microsoft.

Syftet med den här sidan är att dela vårt arbetssätt, beskriva vilka kategorier av data vi använder för träning och vad vi gör för att ge webbpublicister och innehållsskapare kontroll över hur deras innehåll används för att träna de här modellerna.

Vad betyder det att träna en AI-modell?

AI-modeller gör förutsägelser baserat på data. Under träningsprocessen identifierar en AI-modell mönster, samband och begrepp i enorma mängder data och använder sedan det den har lärt sig för att generera svar på frågor eller begäranden. Modellen kan finjusteras med olika kategorier av träningsdata för att optimera genereringsfunktionerna för specifika typer av information, till exempel naturligt språk, programkod eller bilder. Den kan också förankras i en organisations egna data – till exempel inom en branschvertikal som jordbruk, hälsa eller detaljhandel.

Generativa AI-modeller är inte utformade för att lagra, komma åt eller återskapa den ursprungliga träningsdatan. I stället är de avsedda att generera nya uttrycksfulla verk och innehåll.

Två personer står inomhus och granskar en instrumentpanel på en stor bildskärm med diagram och måttvärden.

Upptäck hur Microsoft tränar generativa AI-modeller på varierade data

Stora och varierade datamängder är en viktig del i att skapa dagens AI-system. Det är avgörande att en bred mångfald av data används för att utveckla modeller som är mer exakta, mer representativa för olika kulturer och språk och som lär sig och använder hela spektrumet av mänskliga erfarenheter och uppfinningsrikedom.
Som anges i våra modellkort och annan offentligt tillgänglig dokumentation använder Microsoft följande kategorier av data för att ansvarsfullt träna våra generativa AI-modeller:
  • Vi tränar på utvald offentligt tillgänglig data, från en blandning av branschstandardiserade maskininlärningsdatamängder och webbinsamlingar. Vi exkluderar källor med betalväggar och innehåll som bryter mot våra principer och som har valt bort utbildning med hjälp av webbkontroller som vi har publicerat. Data som samlas in från webben säkerhetsfiltreras och bearbetas för att ta bort olagligt innehåll, inklusive material med sexuella övergrepp mot barn (CSAM), i enlighet med tillämpliga lagar och Microsofts policyer för ansvarsfull AI.

    Vi respekterar standarder som robots.txt-taggar som webbpublicister använder för att välja bort webbinsamling. Vi använder inte data från domäner som finns med på Office of the United States Trade Representative (USTR):s lista Notorious Markets for Counterfeiting and Piracy.
  • Det här är träningsdata som vi får tillgång till genom förhandlade överenskommelser, till exempel med publicister och upphovsrättsinnehavare.
  • De här uppgifterna samlas in från utvalda Microsoft-konsumenttjänster och skyddas i enlighet med vår Microsofts sekretesspolicy. Vår Microsoft Copilot-blogg och vanliga frågor och svar om Copilot förklara hur vi använder konsumentdata från Copilot, Bing och Microsoft Start (MSN) för att träna våra modeller i Copilot. Vi gör det enkelt för användare att välja bort och inför skyddsåtgärder som att ta bort identifierare som kan identifiera dig för att skydda användarnas integritet. Vi använder inte våra företagskunders data utan deras tillstånd.
  • Vi tränar ibland på syntetiska datamängder. De här skapar vi genom att uppmana stora språkmodeller (LLM:er) att generera specifikt begärd utdata som kompletterar knapp eller begränsad verklig data. Resultaten granskas och filtreras sedan, bland annat av mänskliga granskare, för att säkerställa att de håller tillräckligt hög kvalitet för att ingå i träningsdatamängden.
  • Vi inkluderar mänsklig feedback från AI-tränare, red team-medlemmar, anställda och externa annoteringspartners i vår träningsprocess. Det här omfattar till exempel mänsklig feedback som förstärker utdata av hög kvalitet på en användares prompt och förbättrar slutanvändarupplevelsen. Red team-medlemmar testar också modellen mot skadliga eller osäkra begäranden, och deras feedback används för att förbättra modellens säkerhetsbeteenden.
Tillsammans med våra egna Microsoft-modeller integrerar vi olika andra modeller, inklusive från OpenAI, i våra produkter och tjänster. Läs mer om hur OpenAI tränar modeller.

För en AI som är fördelaktig och inkluderande vill vissa webbpublicister och innehållsägare ha större inflytande över hur deras innehåll används. Kontroller för webbpublicister är hjälpsamma men inte hela lösningen. Vi arbetar tillsammans med andra inom branschen, publicering, standardiseringsorgan och innehållsgemenskapen för att identifiera ett gemensamt arbetssätt som vi alla kan vidareutveckla och anta.
Person står inomhus och använder en bärbar dator i en ljus kontorsmiljö.

Ansvarsfull AI på Microsoft

Utforska de verktyg, metoder och principer som vi har skapat för att upprätthålla våra ansvarsfulla AI-principer.

Fler resurser

Tre personer granskar innehåll tillsammans på en bärbar dator i en vardagsrumsmiljö.

Rapport om ansvarsfull AI-transparens

Lär dig hur vi bygger AI ansvarsfullt, stöttar våra kunder, utvecklas och växer.
Två personer sitter vid ett bord och använder bärbara datorer under ett samtal.

Transparens och kontroll i användningen av konsumentdata

Kontrollera hur Copilot lär sig av dina data.
Person håller i en surfplatta som visar stapeldiagram och analys.

Främja öppna data

Ta del av fördelarna med mer öppen och tillgänglig data.

Följ Microsoft

Svenska (Sverige) Sekretess för konsumenthälsa Kontakta Microsoft Integritet Hantera cookies Juridiskt meddelande Varumärken Om våra annonser EU Compliance DoCs