This is the Trace Id: 87dcd8100d668b3110fca78a5028b640
Перейти до основного Огляд Принципи й підхід Звіти про прозорість Інструменти та методи Відповідальний ШІ в Azure Дані для навчання ШІ Ініціатива щодо безпечного майбутнього Звіт про перебіг виконання ІБМ Ініціатива "Ресурси та методи" Нульова довіра Загальні відомості про конфіденційність Загальні відомості про керування даними Доступ до даних Розташування даних План EU Data Boundary GDPR Загальні відомості про забезпечення відповідності вимогам Пропозиції щодо забезпечення відповідності Нормативні документи Відповідність вимогам DORA Закон ЄС про ШІ Європейська цифрова стійкість Відповідність вимогам NIS2 Відповідність вимогам країни та регіону Спеціальні можливості Продукти та служби Пропозиції щодо забезпечення відповідності Оцінка відповідності Аудиторські звіти Ресурси, присвячені захисту даних Захисний комплекс Microsoft Azure Dynamics 365 Microsoft 365 Microsoft Teams Windows 365 Microsoft AI Azure Space Гібридна реальність Microsoft HoloLens Microsoft Viva Квантові обчислення Освіта Автомобілі Фінансові послуги Державні установи Охорона здоров’я Виробництво Торгівля Знайти партнера Стати партнером Мережа партнерів Microsoft Marketplace Компанії з розробки ПЗ Блоґ Microsoft Advertising Центр розробників Документація Заходи Ліцензування Microsoft Learn Дослідження Microsoft Переглянути карту сайту

Дані для розробки моделей ШІ

Ознайомтеся з нашим підходом до використання даних для навчання моделей генеративного ШІ.
Двоє людей сидять за столом і переглядають вміст на планшеті, поруч стоїть чашка кави.
Довіра та прозорість є невід’ємною частиною підходу Microsoft до використання даних для навчання моделей ШІ.

Мета цієї сторінки – розповісти про наш підхід, окреслити категорії даних, які ми використовуємо для навчання, і розповісти про наші дії, спрямовані на те, щоб вебвидавці і автори вмісту мали контроль над тим, як їхній вміст використовують для навчання цих моделей.

Що означає навчати модель ШІ?

Моделі ШІ роблять прогнози на основі даних. Під час навчання модель ШІ виявляє закономірності, кореляції та поняття у великих обсягах даних, а потім використовує те, чого навчилася, щоб генерувати відповіді на запитання або запити. Модель можна налаштувати, використовуючи різні категорії навчальних даних, щоб оптимізувати можливості генерування для певних класів інформації, наприклад природної мови, програмного коду або зображень. Навчання також можна ґрунтува́ти на власних даних організації – наприклад, у вертикальному ринку, як-от сільське господарство, охорона здоров’я або роздрібна торгівля.

Генеративні моделі ШІ не призначено для зберігання, доступу або відтворення оригінальних навчальних даних. Натомість ці моделі призначені, щоб генерувати нові виразні твори та вміст.

Двоє людей стоять у приміщенні та переглядають на великому моніторі інформаційну панель із діаграмами та показниками.

Дізнайтеся, як Microsoft навчає генеративні моделі ШІ на різноманітних даних

Великі й різноманітні набори даних є невід’ємною складовою створення сучасних систем ШІ. Критично важливо використовувати великий діапазон даних, щоб створювати точніші моделі, які краще представляють різні культури та мови, а також навчаються та застосовують повний спектр людського досвіду та винахідливості.
Як зазначено в наших картках моделей та іншій загальнодоступній документації, Microsoft відповідально використовує такі категорії даних для навчання моделей генеративного ШІ:
  • Навчання проводяться на загальнодоступних даних, використовуючи поєднання стандартних для галузі наборів даних машинного навчання та збору вмісту в Інтернеті. Ми виключаємо джерела з платним доступом і вміст, який порушує наші політики, а також вміст, автор якого відмовився від використання в навчанні за допомогою вебзасобів керування, які ми опублікували. Дані, зібрані з Інтернету, проходять фільтрування безпеки та обробку для видалення протизаконного вмісту, зокрема матеріалів сексуального зловживання щодо дітей (CSAM), відповідно до чинного законодавства та політик Microsoft щодо відповідального використання ШІ.

    Ми дотримуємося таких стандартів, як теги robots.txt, які вебвидавці використовують, щоб відмовитися від збору вмісту. Ми не використовуємо дані з доменів, перелічених у списку Офісу торгового представника США (USTR) "Notorious Markets for Counterfeiting and Piracy" (Список ринків підробки та піратства).
  • Це навчальні дані, до яких ми отримуємо доступ через узгоджені домовленості, як-от із видавцями та власниками авторських прав.
  • Ці дані збираються з вибраних служб для споживачів Microsoft і захищаються відповідно до Положення про конфіденційність Microsoft. Наш блоґ Microsoft Copilot і Запитання та відповіді про Copilot пояснюють, як ми використовуємо дані споживачів із Copilot, Bing і Microsoft Start (MSN), щоб допомогти навчати наші моделі в Copilot. Ми робимо так, щоб користувачі могли легко дати відмову та впроваджуємо засоби захисту, наприклад видалення ідентифікаторів, які можуть вас ідентифікувати, щоб захистити конфіденційність користувачів. Ми не використовуємо дані наших корпоративних клієнтів без їхнього дозволу.
  • Іноді навчання проводяться на синтетичних наборах даних. Щоб створити їх, ми надсилаємо підказки великим мовним моделям (LLM) задля того, щоб вони згенерували спеціальну вихідну інформацію запиту, що доповнює малодоступні або обмежені реальні дані. Потім результати переглядають і фільтрують, зокрема спеціалісти-контролери, щоб переконатися, що вони достатньо якісні, щоб бути включеними до набору даних для навчання.
  • Ми включаємо в процес навчання відгуки людей – зокрема інструкторів ШІ, учасників червоної команди, співробітників і зовнішніх партнерів з анотації даних. Серед них, наприклад, відгуки людей, які підвищують якість вихідної інформації у відповідь на підказку користувача та покращують взаємодію з кінцевим користувачем. Учасники червоної команди також перевіряють реакцію моделі на шкідливі або небезпечні запити, а їх відгуки використовують, щоб покращити безпечні поведінки моделі.
Окрім власних моделей Microsoft, ми інтегруємо в наші продукти та служби різні інші моделі, зокрема від OpenAI. Дізнайтеся більше про те, як OpenAI навчає моделі.

Задля того, щоб ШІ був корисним і інклюзивним, деякі вебвидавці та власники вмісту хочуть мати більше впливу на те, як використовується їхній вміст. Засоби керування для вебвидавців корисні, але вони не є комплексним рішенням. Ми працюємо разом з іншими представниками галузі, представниками видавничої сфери, органами зі стандартизації та спільнотою творців вмісту, щоб визначити спільний підхід, який ми всі зможемо розвивати й запроваджувати.
Людина у яскраво освітленому офісі використовує ноутбук.

Відповідальний ШІ в корпорації Майкрософт

Ознайомтеся з інструментами, методами й політиками, які ми створили, щоб дотримуватися наших принципів відповідального ШІ.

Додаткові ресурси

Троє людей разом переглядають вміст на ноутбуці в вітальні.

Звіт щодо прозорості відповідального ШІ

Дізнайтеся, як ми відповідально створюємо ШІ, підтримуємо наших клієнтів, розвиваємося та зростаємо.
Двоє людей сидять за столом і використовують ноутбуки під час обговорення.

Прозорість і контроль у використанні даних споживачів

Керуйте тим, як Copilot навчається на ваших даних.
Людина тримає планшет із гістограмами та аналітикою.

Розвиток відкритих даних

Розкрийте переваги більш відкритих і доступних даних.

Стежте за новинами корпорації Майкрософт

Українська (Україна) Конфіденційність інформації про здоров’я споживачів Звернутися до корпорації Microsoft Конфіденційність Керування файлами cookie Умови використання Товарні знаки Відомості про рекламу