This is the Trace Id: d42f5223670662a6e4883296cb844029
Přeskočit na hlavní obsah Přehled Principy a přístup Zpráva o transparentnosti Nástroje a postupy Odpovědná AI v Azure Data pro trénování AI Iniciativa za bezpečnou budoucnost SFI – sestava průběhu Patterns and Practices – přehled Nulová důvěra (Zero Trust) Ochrana osobních údajů – přehled Správa dat – přehled Přístup k datům Umístění dat Hranice dat EU GDPR Dodržování předpisů – přehled Nabídky týkající se dodržování předpisů Předpisy Dodržování nařízení DORA Legislativa EU o AI Evropská digitální odolnost Dodržování směrnice NIS2 Dodržování předpisů v jednotlivých zemích a oblastech Přístupnost Produkty a služby Nabídky týkající se dodržování předpisů Skóre dodržování předpisů Sestavy auditování Zdroje informací k ochraně dat Microsoft Security Azure Dynamics 365 Microsoft 365 Microsoft Teams Windows 365 Microsoft AI Azure Space Hybridní realita Microsoft HoloLens Microsoft Viva Kvantové výpočetní prostředky Vzdělávání Automobilový průmysl Finanční služby Státní správa Zdravotní péče Výroba Maloobchod Najít partnera Staňte se partnerem Partnerská síť Microsoft Marketplace Softwarové společnosti Blog Microsoft Advertising Středisko pro vývojáře Dokumentace Události Licencování Microsoft Learn Microsoft Research Zobrazit mapu stránek

Data pro vývoj modelů AI

Prozkoumejte náš přístup k datům pro trénování modelů generativní AI.
Dva lidé, kteří sedí u stolu a prohlížejí si obsah na tabletu. Nedaleko je šálek kávy.
Důvěra a transparentnost jsou základem našeho přístupu k datům pro trénování modelů AI v Microsoftu.

Účelem této stránky je představit náš přístup, popsat kategorie dat, která používáme k trénování, a vysvětlit, co děláme pro to, aby vydavatelé webového obsahu a tvůrci obsahu měli kontrolu nad tím, jak se jejich obsah používá k trénování těchto modelů.

Co znamená trénovat model AI?

Modely AI vytvářejí předpovědi na základě dat. Během procesu trénování model AI identifikuje vzorce, korelace a koncepty v obrovském množství dat a následně využívá získané poznatky ke generování odpovědí na otázky nebo požadavky. Model je možné ladit pomocí různých kategorií trénovacích dat a optimalizovat tak jeho schopnosti generování pro konkrétní třídy informací, jako je přirozený jazyk, softwarový kód nebo obrázky. Model je také možné podložit vlastními daty organizace, například daty z určitého odvětví, jako je zemědělství, zdravotnictví nebo maloobchod.

Modely generativní AI nejsou navrženy tak, aby ukládaly původní trénovací data, měly k nim přístup nebo je reprodukovaly. Místo toho jsou tyto modely určeny ke generování nových tvůrčích děl a obsahu.

Dva lidé, kteří stojí uvnitř a prohlížejí si řídicí panel na velkém monitoru, na kterém jsou zobrazené grafy a metriky.

Zjistěte, jak Microsoft trénuje modely generativní AI na různorodých datech

Rozsáhlé a různorodé datové sady jsou nedílnou součástí vytváření dnešních AI systémů. Je zásadní, aby se k vývoji modelů používala široká škála různorodých dat, díky nimž budou modely přesnější, budou lépe reprezentovat různé kultury a jazyky a budou se učit z celého spektra lidských zkušeností a vynalézavosti a využívat je.
Jak je uvedeno v našich kartách modelů a další veřejně dostupné dokumentaci, Microsoft zodpovědně získává následující kategorie dat pro trénování našich modelů generativní AI:
  • Trénujeme na vybraných veřejně dostupných datech pocházejících z kombinace standardních datových sad strojového učení používaných v oboru a procházení webu. Vylučujeme zdroje s placeným přístupem a obsah, který porušuje naše zásady, a také zdroje, které pomocí námi publikovaných kontrolních mechanismů pro web vyjádřily výslovný nesouhlas s použitím k trénování. Data získaná procházením webu jsou filtrována z hlediska bezpečnosti a zpracovávána za účelem odebrání nezákonného obsahu, včetně materiálů zobrazujících sexuální zneužívání dětí (CSAM), v souladu s platnými právními předpisy a zásadami Microsoftu pro odpovědnou AI.

    Respektujeme standardy, jako jsou značky robots.txt, které vydavatelé webového obsahu používají k vyjádření výslovného nesouhlasu s procházením webu. Nepoužíváme data z domén uvedených na seznamu Notorious Markets for Counterfeiting and Piracy úřadu United States Trade Representative (USTR).
  • Jde o trénovací data, ke kterým získáváme přístup prostřednictvím sjednaných ujednání, například s vydavateli a vlastníky autorských práv.
  • Tato data se shromažďují z vybraných uživatelských služeb Microsoftu a jsou chráněna v souladu s Prohlášením společnosti Microsoft o ochraně osobních údajů. Náš blog k Microsoft Copilotovi a časté otázky ke Copilotovi vysvětlují, jak používáme uživatelská data z Copilota, Bingu a Microsoft Startu (MSN) k trénování našich modelů v Copilotovi. Uživatelům usnadňujeme vyjádření výslovného nesouhlasu a zavádíme ochranné mechanismy, jako je odebírání identifikátorů, podle kterých by vás bylo možné identifikovat, abychom chránili soukromí uživatelů. Data našich podnikových zákazníků bez jejich svolení nepoužíváme.
  • Někdy trénujeme na syntetických datových sadách. Ty vytváříme tak, že velké jazykové modely (LLM) pomocí výzev žádáme o vygenerování konkrétně požadovaného výstupu, který doplňuje nedostatková nebo omezená data z reálného světa. Výsledky jsou poté kontrolovány a filtrovány, mimo jiné lidskými kontrolory, aby byla zajištěna dostatečná kvalita pro jejich zařazení do trénovací datové sady.
  • Do procesu trénování zahrnujeme zpětnou vazbu od školitelů AI, členů red teamu, zaměstnanců a externích partnerů pro anotace. Patří sem například zpětná vazba od lidí, která posiluje kvalitní výstup na výzvu uživatele a zlepšuje prostředí koncového uživatele. Členové red teamu také testují model pomocí škodlivých nebo nebezpečných požadavků a jejich zpětná vazba se používá ke zlepšování chování modelu z hlediska zabezpečení.
Vedle vlastních modelů Microsoftu začleňujeme do našich produktů a služeb různé další modely, včetně modelů od OpenAI. Zjistěte více o tom, jak OpenAI trénuje modely.

V zájmu prospěšné a inkluzivní AI chtějí někteří vydavatelé webového obsahu a vlastníci obsahu více ovlivňovat způsob používání svého obsahu. Kontrolní mechanismy pro vydavatele webového obsahu jsou užitečné, ale nepředstavují úplné řešení. Spolupracujeme s dalšími subjekty v odvětví, vydavateli, standardizačními organizacemi a komunitou tvůrců obsahu na určení společného přístupu, který můžeme všichni prosazovat a přijmout.
Osoba, která stojí ve světlé kanceláři a používá notebook.

Odpovědná AI v Microsoftu

Seznamte se s nástroji, postupy a zásadami, které jsme vytvořili za účelem dodržování našich principů odpovědné AI.

Další zdroje informací

Tři lidé, kteří si společně prohlížejí obsah na notebooku v obývacím pokoji

Zpráva o transparentnosti odpovědné AI

Zjistěte, jak odpovědně vytváříme AI, podporujeme naše zákazníky, vyvíjíme se a rosteme.
Dva lidé, kteří sedí u stolu a během diskuse používají notebooky

Transparentnost a kontrola při používání uživatelských dat

Určete, jak se Copilot učí z vašich dat.
Osoba, která drží tablet, na kterém jsou zobrazené pruhové grafy a analýzy.

Posun k otevřeným datům

Využijte výhody otevřenějších a přístupnějších dat.

Sledujte Microsoft

Čeština (Česko) Ochrana osobních údajů spotřebitele ve zdravotnictví Kontaktovat Microsoft Ochrana osobních údajů Spravovat soubory cookie Podmínky používání Ochranné známky O našich reklamách EU Compliance DoCs