This is the Trace Id: 149792a1877fda3c1c07325e82b51007
Преминаване към основното съдържание Общ преглед Принципи и подход Отчет за прозрачност Инструменти и практики Отговорен ИИ в Azure Данни за обучение на ИИ Инициатива за защитено бъдеще Отчет за напредъка на SFI Общ преглед на схеми и практики Zero Trust Общ преглед на поверителността Преглед на управлението на данни Достъп до данните Местоположение на данните Граница на данните в ЕС ОРЗД Общ преглед на съответствието Предложения за съответствие Разпоредби Съответствие с DORA Законодателен акт на ЕС за ИИ Законодателен акт на ЕС за ИИ Съответствие с NIS2 Съответствие за региона и страната Достъпност Продукти и услуги Предложения за съответствие Резултат за съответствие Отчети от проверка Ресурси за защита на данни Microsoft Security Azure Dynamics 365 Microsoft 365 Microsoft Teams Windows 365 ИИ на Microsoft Azure Space Смесена реалност Microsoft HoloLens Microsoft Viva Квантови изчисления Образование Автомобилен Финансови услуги Държавни организации Здравеопазване Производство Търговия на дребно Намерете партньор Станете партньор Мрежа от партньори Microsoft Marketplace Софтуерни фирми Блог Реклами на Microsoft Център за разработчици Документация Събития Лицензиране Microsoft Learn Microsoft Research Преглед на картата на сайта

Данни за разработване на ИИ модел

Разгледайте нашия подход към данните за обучение на генеративни AI модели.
Двама души седят на маса и преглеждат съдържание на таблет, като наблизо има чаша кафе.
Доверието и прозрачността са в основата на начина, по който подхождаме към данните за обучение на AI модели тук в Microsoft.

Целта на тази страница е да сподели нашия подход, като очертае категориите данни, които използваме за обучение, и какво правим, за да дадем на уеб издателите и създателите на съдържание контрол върху начина, по който съдържанието им се използва за обучение на тези модели.

Какво означава да обучавате ИИ модел?

ИИ моделите правят прогнози въз основа на данни. По време на процеса на обучение един AI модел идентифицира модели, връзки и концепции в огромни количества данни и след това използва наученото, за да генерира отговори на въпроси или заявки. Моделът може да се настройва с помощта на различни категории данни за обучение, за да оптимизира възможностите за генериране за конкретни класове информация, като естествен език, софтуерен код или изображения. Той може също да бъде обвързан със собствените данни на дадена организация – например в конкретен отрасъл като земеделие, Здраве­опазване или търговия на дребно.

Генеративните AI модели не са проектирани да съхраняват, осъществяват достъп или възпроизвеждат оригиналните данни за обучение. Вместо това тези модели са предназначени да генерират нови изразни произведения и съдържание.

Двама души стоят на закрито и преглеждат табло на голям монитор, на който са показани диаграми и показатели.

Открийте как Microsoft обучава генеративни AI модели върху разнообразни данни

Големите и разнообразни набори от данни са неразделна част от създаването на съвременните AI системи. От решаващо значение е да се използва широка разнообразност от данни, за да се разработват модели, които са по-точни, по-представителни за различните култури и езици и които се учат и прилагат пълния спектър от човешки опит и изобретателност.
Както е посочено в нашите моделни карти и друга публично достъпна документация, Microsoft използва следните категории данни за обучение на нашите генеративни AI модели по отговорен начин:
  • Обучаваме върху подбрани публично достъпни данни, от комбинация от стандартни за индустрията набори от данни за машинно обучение и уеб обхождания. Изключваме източници с платени стени и съдържание, което нарушава нашите правила, както и такива, които са се отказали от обучение чрез уеб контроли, които сме публикували. Данните от уеб обхождане се филтрират за безопасност и се обработват, за да се премахне незаконно съдържание, включително материали за сексуално насилие над деца (CSAM), в съответствие с приложимите закони и политиките на Microsoft за отговорен AI.

    Уважаваме стандарти като таговете robots.txt, които уеб издателите използват, за да се откажат от уеб обхождане. Ние не използваме данни от домейни, включени в списъка на Службата на търговския представител на Съединените щати (USTR) „Известни пазари за фалшифициране и пиратство“.
  • Това са данни за обучение, до които имаме достъп чрез договорени споразумения, например с издатели и носители на авторски права.
  • Тези данни се събират от избрани потребителски услуги на Microsoft и са защитени в съответствие с нашата Декларация за поверителност на Microsoft. Нашият блог на Microsoft Copilot и Copilot FAQ обясняват как използваме потребителски данни от Copilot, Bing и Microsoft Start (MSN), за да помогнем за обучението на нашите модели в Copilot. Правим така, че потребителите лесно да могат да се откажат, и въвеждаме предпазни мерки, като премахване на идентификатори, които могат да ви идентифицират, за да защитим поверителността на потребителите. Не използваме данните на нашите корпоративни клиенти без тяхното разрешение.
  • Понякога обучаваме с изкуствено създадени набори от данни. Създаваме ги, като подканваме големи езикови модели (LLM) да генерират конкретно поискан резултат, който допълва оскъдни или ограничени реални данни. След това резултатите се преглеждат и филтрират, включително от човешки рецензенти, за да се гарантира, че са с достатъчно качество, за да бъдат част от набора от данни за обучение.
  • Включваме обратна връзка от обучители по ИИ, членове на „червения екип“, служители и външни партньори по анотиране в нашия процес на обучение. Това включва, например, човешка обратна връзка, която подсилва качествения резултат спрямо подканата на потребителя и подобрява изживяването на крайния потребител. Членове на „червения екип“ също така тестват модела срещу вредни или опасни заявки, а тяхната обратна връзка се използва за подобряване на поведението на модела по отношение на безопасността.
Наред с нашите собствени модели на Microsoft, включваме в нашите продукти и услуги и различни други модели, включително от OpenAI. Научете повече за това как OpenAI обучава модели.

За полезен и приобщаващ AI някои уеб издатели и притежатели на съдържание искат повече дума за начина, по който се използва тяхното съдържание. Контролите за уеб издатели са полезни, но не са цялостното решение. Работим заедно с други участници в индустрията, издателската дейност, организациите по стандартизация и общността на създателите на съдържание, за да определим общ подход, който всички да можем да развиваме и прилагаме.
Човек стои на закрито и използва лаптоп в светла офис среда.

Отговорният ИИ в Microsoft

Запознайте се с инструментите, практиките и политиките, които сме създали, за да спазваме принципите си за отговорен ИИ.

Още ресурси

Трима души заедно преглеждат съдържание на лаптоп в среда на дневна.

Отчет за прозрачността на отговорния ИИ

Научете как изграждаме AI отговорно, подкрепяме нашите клиенти, развиваме се и растем.
Двама души са седнали на маса и използват лаптопи по време на разговор.

Прозрачност и контрол при използването на потребителски данни

Управлявайте как Copilot се учи от вашите данни.
Човек държи таблет, на който са показани стълбовидни диаграми и анализи.

Усъвършенстване на отворените данни

Възползвайте се от предимствата на по-отворените и по-достъпни данни.

Следвайте Microsoft

Български (България) Поверителност на здравето на потребителите Връзка с Microsoft Поверителност Управление на бисквитките Условия за използване Търговски марки За нашите реклами EU Compliance DoCs