This is the Trace Id: 7b4903b04d39615345df9cb00f5b29a6
Ugrás a tartalomtörzsre Áttekintés Alapelvek és megközelítésmód Átláthatósági jelentés Eszközök és eljárások Felelősen alkalmazott mesterséges intelligencia az Azure-ban AI-betanítási adatok Biztonságos Jövő Kezdeményezés BJK-állapotjelentés Fejlesztői ajánlások áttekintése Teljes felügyelet Adatvédelmi áttekintés Adatkezelési áttekintés Adathozzáférés Az adatok helye EU-adathatár GDPR Megfelelőségi áttekintés Megfelelőségi ajánlatok Rendeletek Megfelelés a digitális működési reziliencia rendelet (DORA) előírásainak Az EU mesterséges intelligenciáról szóló rendelete Európai digitális ellenálló képesség Megfelelés a NIS2 irányelv előírásainak Területi és országonkénti megfelelőség Akadálymentesség Termékek és szolgáltatások Megfelelőségi ajánlatok Megfelelőségi pontszám Naplójelentések Adatvédelmi források Microsoft-biztonság Azure Dynamics 365 Microsoft 365 Microsoft Teams Windows 365 Microsoft AI Azure Space Vegyes valóság Microsoft HoloLens Microsoft Viva Kvantumszámítógép Oktatás Autóipar Pénzügyi szolgáltatások Kormányzat Egészségügy Gyártóipar Kiskereskedelem Partner keresése Legyen a partnerünk! Partner Network Microsoft Marketplace Szoftvervállalatok Blog Microsoft Advertising Fejlesztői központ Dokumentáció Események Licencelés Microsoft Learn Microsoft Research Oldaltérkép megtekintése

Adatok AI-modellek fejlesztéséhez

Fedezze fel a generatív AI-modellek betanításához használt adatokkal kapcsolatos megközelítésünket.
Két ember ül egy asztalnál, és egy táblagépen tartalmakat nézeget, mellettük egy kávéscsésze.
A bizalom és az átláthatóság központi szerepet játszanak abban, ahogyan a Microsoftnál az AI-modellek betanításához szükséges adatok kezelését végezzük.

Az oldal célja, hogy bemutassuk megközelítésünket, ismertetve a betanításhoz használt adatkategóriákat, valamint azokat az intézkedéseket, amelyekkel biztosítjuk a webes kiadók és a tartalomkészítők számára az irányítást arra vonatkozóan, hogy tartalmukat hogyan használjuk fel a modellek képzéséhez.

Mit jelent egy AI-modell betanítása?

Az AI-modellek adatok alapján készítenek előrejelzéseket. A betanítási folyamat során egy AI-modell azonosítja a mintákat, a korrelációkat és a fogalmakat nagy mennyiségű adatban, majd a tanultak alapján választ hoz létre a kérdésekre vagy kérelmekre. A modell különböző kategóriájú képzési adatokkal hangolható, hogy optimális legyen a generálási képessége bizonyos információosztályok – például természetes nyelv, szoftverkód vagy képek – esetében. Alapozható továbbá a szervezet saját adataira is – például olyan iparági szegmensekben, mint a mezőgazdaság, az egészségügy vagy a kiskereskedelem.

A generatív AI-modellek nem az eredeti betanítási adatok tárolására, elérésére vagy reprodukálására szolgálnak. Ezek a modellek inkább új, kifejező erejű alkotások és tartalmak létrehozására szolgálnak.

Két ember áll egy beltéri helyiségben, és egy nagy monitoron megjelenő irányítópultot vizsgálnak, a képernyőn grafikonok és metrikák láthatók.

Ismerje meg, hogyan tanítja be a Microsoft a generatív AI-modelleket különböző adatok használatával

A nagyméretű és változatos adathalmazok a mai AI-rendszerek létrehozásának szerves részét képezik. Rendkívül fontos, hogy a modellek fejlesztéséhez széles körű és sokszínű adatokat használjanak, amelyek pontosabbak, jobban tükrözik a különböző kultúrákat és nyelveket, és amelyek segítségével az emberi tapasztalatok és szellemi képességek teljes spektrumát képesek elsajátítani és alkalmazni.
Ahogyan azt a modellkártyáinkban és egyéb nyilvánosan elérhető dokumentációinkban feltüntettük, a Microsoft a következő adatkategóriákat használja fel a generatív AI-modellek felelős betanításához:
  • Kiválasztott, nyilvánosan elérhető adatokkal végezzük a képzést, amelyek az iparági szabványnak megfelelő gépi tanulási adatkészletek és webes adatgyűjtések keverékéből állnak. Kizárjuk azokat a forrásokat, amelyek fizetős tartalommal rendelkeznek, vagy olyan tartalmat szolgáltatnak, amely megsérti irányelveinket, valamint azokat, amelyek az általunk közzétett webes vezérlők segítségével leiratkoztak a betanításról. A webes keresés során begyűjtött adatokat biztonsági szűréssel és feldolgozással ellenőrizzük, hogy az alkalmazandó jogszabályoknak és a Microsoft „Felelősen alkalmazott mesterséges intelligencia” irányelveinek megfelelően eltávolítsuk az illegális tartalmakat, beleértve a gyermekek szexuális bántalmazását ábrázoló anyagokat (CSAM) is.

    Tiszteletben tartjuk az olyan szabványokat, mint a robots.txt címkék, amelyeket a webhelyek üzemeltetői használnak arra, hogy jelezzék: nem szeretnék, ha a webhelyüket feltérképeznénk. Nem használjuk fel az Egyesült Államok Kereskedelmi Képviselőjének Hivatala (USTR) által összeállított „Hamisításról és Kalózkodásról Hírhedt Piacok” listájában felsorolt tartományok adatait.
  • Ezek olyan betanítási adatok, amelyeket egyeztetett megoldásokon keresztül érhetünk el, például közzétevőkkel és szerzői jogi tulajdonosokkal.
  • Ezeket az adatokat a Microsoft egyes fogyasztói szolgáltatásaiból gyűjtjük, és a Microsoft adatvédelmi nyilatkozatának megfelelően védjük. A Microsoft Copilot blogunk és a Copilot GYIK ismerteti, hogyan használjuk fel a Copilot, a Bing és a Microsoft Start (MSN) fogyasztói adatait a modelljeink Copilotban történő képzésének támogatására. Megkönnyítjük a felhasználóknak a leiratkozást, és olyan védelmi intézkedéseket vezetünk be, mint az azonosítók eltávolítása, amelyek alapján Önt be lehetne azonosítani, hogy megvédjük a felhasználók adatait. Vállalati ügyfeleink adatait nem használjuk fel az engedélyük nélkül.
  • Időnként szintetikus adathalmazok segítségével végezzük a betanítást. Ezeket úgy hozzuk létre, hogy nagy nyelvi modelleket (LLM-eket) arra kérünk, hogy konkrétan kérdezett kimenetet generáljanak, amely kiegészíti a szűkös vagy korlátozott valós adatokat. Az eredményeket ezután áttekintik és szűrik, beleértve az emberi felülvizsgálókat is, hogy meggyőződjenek arról, hogy megfelelő minőségűek ahhoz, hogy a betanítási adathalmaz részei legyenek.
  • A betanítási folyamatba belefoglaljuk az AI-oktatók, a red team csapattagok, az alkalmazottak és a külső értékelést végző partnerek visszajelzéseit is. Ide tartozik például az olyan emberi visszajelzés, amely a felhasználó kérésére adott minőségi eredményt erősíti, javítva ezzel a végfelhasználói élményt. A red team csapattagok emellett tesztelik a modellt a káros vagy nem biztonságos kérésekkel szemben, és a visszajelzéseik alapján javul a modell biztonsági viselkedése.
Saját Microsoft-modelljeink mellett más modelleket is beépítünk termékeinkbe és szolgáltatásainkba, beleértve az OpenAI modelljeit is. További információ arról, hogy az OpenAI hogyan tanítja be a modelleket.

A hasznos és inkluzív mesterséges intelligencia érdekében egyes webes kiadók és tartalomtulajdonosok nagyobb beleszólást szeretnének abba, hogy tartalmukat hogyan használják fel. A webes kiadói ellenőrzések hasznosak, de nem jelentenek teljes körű megoldást. Együttműködünk az ipar, a kiadói szektor, a szakmai szervezetek és a tartalomszolgáltatók képviselőivel annak érdekében, hogy olyan közös megközelítést határozzunk meg, amelyet mindannyian támogathatunk és alkalmazhatunk.
Egy személy, aki beltérben, egy világos irodai környezetben áll és laptopot használ.

Felelősen alkalmazott mesterséges intelligencia a Microsoftnál

Fedezze fel azokat az eszközöket, eljárásokat és szabályzatokat, amelyeket a felelősen alkalmazott mesterséges intelligencia alapelveink betartása érdekében hoztunk létre.

További források

Három személy együtt néz át tartalmat egy laptopon egy nappaliban.

A felelősen alkalmazott mesterséges intelligencia átlátszósági jelentése

Megtudhatja, hogyan fejlesztjük felelősségteljesen a mesterséges intelligenciát, hogyan támogatjuk ügyfeleinket, hogyan fejlődünk és hogyan növekszünk.
Két ember ül egy asztalnál, és egy beszélgetés közben laptopot használ.

Átláthatóság és szabályozás a fogyasztói adatok felhasználása során

Szabályozhatja, hogy a Copilot hogyan tanul az adataiból.
Sávdiagramokat és elemzéseket megjelenítő táblagépet tartó személy.

A nyitott adatok támogatása

Használja ki a nyitottabb és könnyebben hozzáférhető adatok előnyeit.

A Microsoft követése

Magyar (Magyarország) Fogyasztói állapot adatainak védelme Kapcsolatfelvétel a Microsofttal Adatvédelem Cookie-k kezelése Használati feltételek Védjegyek A hirdetéseinkről EU Compliance DoCs