This is the Trace Id: daf48f762e99a2cf48c7c956667ccac2
Prejsť na hlavný obsah Prehľad Zásady a prístup Správa o transparentnosti Nástroje a postupy Zodpovedná AI v Azure Údaje na trénovanie AI Iniciatíva Bezpečná budúcnosť Správa o priebehu iniciatívy Bezpečná budúcnosť (SFI) Prehľad vzorov a postupov Nulová dôvera (Zero Trust) Prehľad ochrany osobných údajov Prehľad správy údajov Prístup k údajom Umiestnenie údajov Hranice údajov v rámci EÚ GDPR Prehľad dodržiavania súladu Ponuky dodržiavania súladu Nariadenia Súlad s DORA Zákon EÚ o AI Európska digitálna odolnosť Súlad s NIS2 Dodržiavanie súladu v rámci oblasti a krajiny Zjednodušenie ovládania Produkty a služby Ponuky dodržiavania súladu Skóre dodržiavania súladu Zostavy auditu Zdroje na ochranu údajov Zabezpečenie od spoločnosti Microsoft Azure Dynamics 365 Microsoft 365 Microsoft Teams Windows 365 Microsoft AI Azure Space Zmiešaná realita Microsoft HoloLens Microsoft Viva Kvantové výpočtové prostriedky Vzdelávanie Automobilový priemysel Finančné služby Vládne inštitúcie İş ortakları Výroba Maloobchod Vyhľadať partnera Staňte sa partnerom Sieť partnerov Microsoft Marketplace Softvérové spoločnosti Blog Microsoft Advertising Stredisko pre vývojárov Dokumentácia Udalosti Licencovanie Microsoft Learn Microsoft Research Zobraziť mapu stránky

Údaje na vývoj modelov AI

Preskúmajte náš prístup k údajom na trénovanie generatívnych modelov AI.
Dvaja ľudia sedia pri stole a prezerajú si obsah na tablete, pričom vedľa nich je šálka kávy.
Dôvera a transparentnosť sú základom nášho prístupu k údajom na trénovanie modelov AI v spoločnosti Microsoft.

Cieľom tejto stránky je predstaviť náš prístup, opísať kategórie údajov, ktoré používame na trénovanie, a vysvetliť, čo robíme, aby sme webovým vydavateľom a tvorcom obsahu umožnili rozhodovať o tom, ako sa ich obsah používa na trénovanie týchto modelov.

Čo znamená trénovať model AI?

Modely AI vytvárajú predpovede na základe údajov. Počas trénovania model AI identifikuje vzory, korelácie a koncepty v obrovskom množstve údajov a potom využíva to, čo sa naučil, na generovanie odpovedí na otázky alebo požiadavky. Model možno doladiť pomocou rôznych kategórií tréningových údajov tak, aby sa optimalizovali jeho možnosti generovania pre konkrétne typy informácií, ako sú prirodzený jazyk, softvérový kód alebo obrázky. Model možno tiež ukotviť pomocou vlastných údajov organizácie – napríklad z konkrétneho odvetvia, ako je poľnohospodárstvo, zdravotníctvo alebo maloobchod.

Generatívne modely AI nie sú navrhnuté tak, aby ukladali pôvodné tréningové údaje, pristupovali k nim alebo ich reprodukovali. Namiesto toho sú tieto modely určené na generovanie nových tvorivých diel a obsahu.

Dvaja ľudia stoja v interiéri a prezerajú si tabuľu na veľkom monitore, na ktorom sú zobrazené grafy a metriky.

Zistite, ako Microsoft trénuje generatívne modely AI na rozmanitých údajoch

Veľké a rozmanité množiny údajov sú neoddeliteľnou súčasťou tvorby dnešných systémov AI. Je nevyhnutné používať rozmanité údaje, aby sme mohli vyvíjať modely, ktoré sú presnejšie, lepšie reprezentujú rôzne kultúry a jazyky a učia sa z celého spektra ľudských skúseností a vynaliezavosti a dokážu ich uplatniť.
Ako uvádzame v kartách našich modelov a ďalšej verejne dostupnej dokumentácii, Microsoft zodpovedne získava údaje z týchto kategórií na trénovanie svojich generatívnych modelov AI:
  • Na trénovanie používame vybrané verejne dostupné údaje zo zmesi množín údajov pre strojové učenie, ktoré sú štandardom v odvetví, a údajov získaných prehľadávaním webu. Vylučujeme zdroje s plateným prístupom, zdroje s obsahom, ktorý porušuje naše zásady, a zdroje, ktoré sa z trénovania odhlásili pomocou webových ovládacích prvkov, ktoré sme zverejnili. Údaje získané prehľadávaním webu sa filtrujú z hľadiska bezpečnosti a spracúvajú tak, aby sa odstránil nezákonný obsah vrátane materiálov zobrazujúcich sexuálne zneužívanie detí (CSAM), v súlade s platnými právnymi predpismi a zásadami zodpovednej umelej inteligencie spoločnosti Microsoft.

    Rešpektujeme štandardy, napríklad značky robots.txt, pomocou ktorých weboví vydavatelia môžu odmietnuť prehľadávanie webu. Nepoužívame údaje z domén uvedených v zozname Notorious Markets for Counterfeiting and Piracy Úradu obchodného zástupcu Spojených štátov (USTR).
  • Ide o tréningové údaje, ku ktorým máme prístup na základe dohodnutých podmienok, napríklad s vydavateľmi a vlastníkmi autorských práv.
  • Tieto údaje sa zhromažďujú z vybraných spotrebiteľských služieb spoločnosti Microsoft a chránia sa v súlade s Vyhlásením spoločnosti Microsoft o ochrane osobných údajov. V našom blogu Microsoft Copilot a v najčastejších otázkach o Copilotovi vysvetľujeme, ako používame údaje spotrebiteľov zo služieb Copilot, Bing a Microsoft Start (MSN) na pomoc pri trénovaní našich modelov v Copilotovi. Používateľom uľahčujeme možnosť odmietnuť používanie ich údajov na trénovanie a na ochranu súkromia zavádzame bezpečnostné opatrenia, napríklad odstraňujeme identifikátory, podľa ktorých by vás bolo možné identifikovať. Údaje našich podnikových zákazníkov nepoužívame bez ich súhlasu.
  • Na trénovanie niekedy používame syntetické množiny údajov. Tieto množiny vytvárame tak, že veľkým jazykovým modelom (LLMs) zadávame pokyny na generovanie konkrétne požadovaných výstupov, ktoré dopĺňajú údaje z reálneho sveta, ktorých je málo alebo sú obmedzené. Výsledky sa potom kontrolujú a filtrujú vrátane posúdenia ľuďmi, aby sa zabezpečila dostatočná kvalita na zaradenie do tréningovej množiny údajov.
  • Do procesu trénovania zahŕňame spätnú väzbu od trénerov AI, členov red tímov, zamestnancov a externých partnerov na anotáciu. Patrí sem napríklad spätná väzba od ľudí, ktorá podporuje kvalitné výstupy v reakcii na zadanie používateľa a zlepšuje tak skúsenosť koncových používateľov. Členovia red tímov tiež overujú, ako model reaguje na škodlivé alebo nebezpečné požiadavky, a ich spätná väzba sa používa na zlepšovanie bezpečnostného správania modelu.
Okrem vlastných modelov spoločnosti Microsoft začleňujeme do svojich produktov a služieb rôzne ďalšie modely vrátane modelov od OpenAI. Ďalšie informácie o tom, ako OpenAI trénuje modely.

V záujme prospešnej a inkluzívnej AI chcú niektorí weboví vydavatelia a vlastníci obsahu viac ovplyvňovať, ako sa ich obsah používa. Ovládacie prvky pre webových vydavateľov sú užitočné, nie sú však úplným riešením. Spolupracujeme s ostatnými v odvetví, vydavateľstve, normalizačných orgánoch a komunite tvorcov obsahu, aby sme určili spoločný prístup, ktorý môžeme všetci rozvíjať a prijať.
Osoba stojí v svetlej kancelárii a používa prenosný počítač.

Zodpovedná umelá inteligencia v spoločnosti Microsoft

Preskúmajte nástroje, postupy a zásady, ktoré sme vytvorili na dodržiavanie našich princípov zodpovednej umelej inteligencie.

Ďalšie zdroje informácií

Traja ľudia si v obývačke spoločne prezerajú obsah na prenosnom počítači.

Správa o transparentnosti zodpovednej AI

Zistite, ako zodpovedne vytvárame AI, podporujeme našich zákazníkov, vyvíjame sa a rastieme.
Dvaja ľudia sedia pri stole, používajú prenosné počítače a diskutujú.

Transparentnosť a kontrola používania údajov spotrebiteľov

Majte pod kontrolou, ako sa Copilot učí z vašich údajov.
Osoba drží tablet, na ktorom sú zobrazené stĺpcové grafy a analytické údaje.

Rozvoj otvorených údajov

Využite výhody otvorenejších a prístupnejších údajov.

Sledujte Microsoft

Slovenčina (Slovensko) Ochrana osobných údajov spotrebiteľa v zdravotníctve Kontaktovať Microsoft Ochrana osobných údajov Správa súborov cookie Podmienky používania Ochranné známky Informácie o reklamách EU Compliance DoCs