This is the Trace Id: bc4860f3f68104d1cd7a08eb012a4e84

Gegevens voor AI-modelontwikkeling

Verken onze aanpak omtrent gegevens voor het trainen van generatieve AI-modellen.
Twee personen die aan een tafel zitten en content op een tablet bekijken, met een koffiekopje in de buurt.
Vertrouwen en transparantie staan centraal in hoe we hier bij Microsoft omgaan met gegevens voor het trainen van AI-modellen.

Het doel van deze pagina is om onze aanpak te delen, met een overzicht van de gegevenscategorieën die we gebruiken voor training en wat we doen om webuitgevers en contentmakers besturingselementen te geven over hoe hun content wordt gebruikt om deze modellen te trainen.

Wat betekent het om een AI-model te trainen?

AI-modellen doen voorspellingen op basis van gegevens. Tijdens het trainingsproces herkent een AI-model patronen, correlaties en concepten in enorme hoeveelheden gegevens en gebruikt vervolgens wat het heeft geleerd om antwoorden te genereren op vragen of verzoeken. Het model kan worden afgestemd met verschillende categorieën trainingsgegevens om de generatiecapaciteiten te optimaliseren voor specifieke soorten informatie, zoals natuurlijke taal, softwarecode of afbeeldingen. Het kan ook worden gegrond op de eigen gegevens van een organisatie, bijvoorbeeld in een sector als landbouw, Gezond­heids­zorg of retail.

Generatieve AI-modellen zijn niet ontworpen om de oorspronkelijke trainingsgegevens op te slaan, te openen of te reproduceren. Deze modellen zijn voornamelijk bedoeld om nieuwe expressieve werken en content te genereren.

Twee personen die binnen staan, een dashboard op een groot beeldscherm bekijken met grafieken en cijfers.

Ontdek hoe Microsoft generatieve AI-modellen traint op diverse gegevens

Grote en diverse gegevenssets zijn onmisbaar voor het maken van hedendaagse AI-systemen. Het is cruciaal dat een brede diversiteit aan gegevens wordt gebruikt om modellen te ontwikkelen die nauwkeuriger zijn, representatiever voor verschillende culturen en talen, en die het volledige spectrum van menselijke ervaring en vindingrijkheid leren en toepassen.
Zoals aangegeven in onze modelkaarten en andere openbaar beschikbare documentatie, haalt Microsoft op verantwoorde wijze de volgende categorieën gegevens voor het trainen van onze generatieve AI-modellen:
  • We trainen op geselecteerde openbaar beschikbare gegevens, met een combinatie van standaard machine learning-gegevenssets en webcrawls. We sluiten bronnen uit met paywalls en content die ons beleid schendt, en die zich hebben afgemeld voor training met behulp van webbesturingselementen die we hebben gepubliceerd. Webgecrawlde gegevens worden gefilterd op veiligheid en verwerkt om illegale content te verwijderen, waaronder materiaal over seksueel misbruik van kinderen (CSAM), in overeenstemming met toepasselijke wetgeving en Microsofts Verantwoorde AI-beleid.

    We respecteren standaarden zoals robots.txt-tags die webuitgevers gebruiken om zich af te melden voor webcrawling. We gebruiken geen gegevens van domeinen die voorkomen op de lijst van de Office of the United States Trade Representative (USTR) met beruchte markten voor namaak en piraterij.
  • Dit zijn trainingsgegevens waartoe we toegang hebben via onderhandelde afspraken, zoals met uitgevers en auteursrechthebbenden.
  • Deze gegevens worden verzameld uit geselecteerde consumentendiensten van Microsoft en beschermd in overeenstemming met onze Privacyverklaring van Microsoft. Onze Microsoft Copilot-blog en de Copilot-veelgestelde vragen leggen uit hoe we consumentengegevens van Copilot, Bing en Microsoft Start (MSN) gebruiken om onze modellen in Copilot te helpen trainen. We maken het eenvoudig voor gebruikers om zich af te melden en nemen waarborgen op, zoals het verwijderen van identificatiegegevens die jou mogelijk kunnen identificeren, om de privacy van gebruikers te beschermen. We gebruiken de gegevens van onze zakelijke klanten niet zonder hun toestemming.
  • We trainen soms op synthetische gegevenssets. Die maken we door grote taalmodellen (LLM's) aan te sturen om specifiek gevraagde uitvoer te genereren die schaarse of beperkte praktijkgegevens aanvult. De resultaten worden daarna beoordeeld en gefilterd, onder andere door menselijke beoordelaars, om ervoor te zorgen dat ze van voldoende kwaliteit zijn om deel uit te maken van de trainingsgegevensset.
  • We nemen menselijke feedback van AI-trainers, red teamers, werknemers en externe annotatiepartners op in ons trainingsproces. Dit omvat bijvoorbeeld menselijke feedback die kwalitatieve uitvoer bij een prompt van een gebruiker versterkt en de ervaring van de eindgebruiker verbetert. Red teamers testen het model ook tegen schadelijke of onveilige verzoeken, en hun feedback wordt gebruikt om de veiligheidsgedragingen van het model te verbeteren.
Naast onze eigen Microsoft-modellen nemen we verschillende andere modellen op in onze producten en services, waaronder van OpenAI. Meer informatie over hoe OpenAI modellen traint.

Voor nuttige en inclusieve AI willen sommige webuitgevers en eigenaren van content meer zeggenschap over hoe hun content wordt gebruikt. Bedieningselementen voor webuitgevers zijn nuttig, maar niet de volledige oplossing. We werken samen met anderen in de sector, bij uitgevers, in normeringsorganisaties en in de contentcommunity om een gemeenschappelijke aanpak te vinden die we allemaal kunnen bevorderen en overnemen.
Persoon die binnen staat en een laptop gebruikt in een lichte kantooromgeving.

Verantwoorde AI bij Microsoft

Verken de hulpprogramma's, procedures en beleidslijnen die we hebben gemaakt om onze verantwoorde AI-principes na te leven.

Meer resources

Drie personen die samen content bekijken op een laptop in een woonkameromgeving.

Rapport over transparantie van verantwoorde AI

Leer hoe we AI verantwoord bouwen, onze klanten ondersteunen, ons ontwikkelen en groeien.
Twee personen die aan een tafel zitten en laptops gebruiken tijdens een gesprek.

Transparantie en controle bij het gebruik van consumentengegevens

Bepaal hoe Copilot leert van jouw gegevens.
Persoon die een tablet vasthoudt waarop staafdiagrammen en analyses worden weergegeven.

Open gegevens verbeteren

Profiteer van de voordelen van meer open en toegankelijke gegevens.

Volg Microsoft

Nederlands (Nederland) Privacy van consumentenstatus Contact opnemen met Microsoft Privacy Cookies beheren Gebruiksvoorwaarden Handelsmerken Over onze advertenties EU Compliance DoCs