This is the Trace Id: c58a4c29f1a79e4a0209e55bcb36e2a3

AI 모델 개발용 데이터

생성형 AI 모델 학습을 위한 데이터에 대한 우리의 접근 방식을 살펴보세요.
두 사람이 테이블에 앉아 태블릿으로 콘텐츠를 검토하고 있고, 옆에 커피잔이 놓여 있습니다.
신뢰와 투명성은 Microsoft에서 AI 모델 학습용 데이터를 다루는 우리의 핵심 원칙입니다.

이 페이지의 목적은 우리의 접근 방식을 공유하는 데 있습니다. 여기에는 학습에 사용하는 데이터 범주와 웹 게시자 및 콘텐츠 크리에이터가 자신의 콘텐츠가 이 모델 학습에 어떻게 사용되는지 제어할 수 있도록 하기 위해 우리가 하고 있는 일이 포함됩니다.

AI 모델을 학습한다는 것은 무슨 뜻인가요?

AI 모델은 데이터에 기반해 예측합니다. 학습 과정에서 AI 모델은 방대한 데이터에서 패턴, 상관관계 및 개념을 식별한 다음, 학습한 내용을 바탕으로 질문이나 요청에 대한 답변을 생성합니다. 모델은 자연어, 소프트웨어 코드 또는 이미지 같은 특정 정보 범주에 맞게 생성 기능을 최적화하도록 다양한 학습 데이터 범주를 사용해 조정할 수 있습니다. 또한 조직의 자체 데이터로 기반을 다질 수도 있습니다. 예를 들어 농업, 의료 또는 소매 같은 산업 분야에서 사용할 수 있습니다.

생성형 AI 모델은 원본 학습 데이터를 저장, 액세스 또는 재현하도록 설계되지 않았습니다. 대신 이 모델은 새로운 표현형 작품과 콘텐츠를 생성하도록 설계되어 있습니다.

실내에서 두 사람이 대형 모니터에 표시된 차트와 지표가 있는 대시보드를 검토하고 있습니다.

Microsoft가 다양한 데이터를 사용해 생성형 AI 모델을 학습하는 방법 알아보기

크고 다양한 데이터셋은 오늘날의 AI 시스템을 만드는 데 필수적입니다. 더 정확하고, 다양한 문화와 언어를 더 잘 대표하며, 인간의 경험과 창의성 전체를 배우고 적용하는 모델을 개발하려면 폭넓고 다양한 데이터를 사용하는 것이 중요합니다.
모델 카드와 기타 공개 문서에 명시된 바와 같이, Microsoft는 생성형 AI 모델을 책임 있게 학습시키기 위해 다음 데이터 범주를 사용합니다.
  • 우리는 업계 표준 머신 러닝 데이터셋과 웹 크롤링 데이터를 혼합한, 선택한 공개 데이터로 학습합니다. 우리는 유료 벽 뒤에 있는 소스와 정책을 위반하는 콘텐츠, 그리고 우리가 게시한 웹 제어를 사용해 학습 제외를 선택한 소스를 제외합니다. 웹 크롤링 데이터는 관련 법률과 Microsoft의 책임 있는 AI 정책에 따라 안전 필터링과 처리를 거쳐 CSAM(아동 성적 학대 자료)을 비롯한 불법 콘텐츠를 제거합니다.

    우리는 웹 게시자가 웹 크롤링에서 제외하도록 사용하는 robots.txt 태그 같은 표준을 존중합니다. 우리는 USTR(미국 무역대표부)의 위조 및 불법 복제 악명 높은 시장 목록에 있는 도메인의 데이터는 사용하지 않습니다.
  • 이 데이터는 게시자 및 저작권 소유자와 같은 협의된 계약을 통해 우리가 액세스하는 학습 데이터입니다.
  • 이 데이터는 일부 Microsoft 소비자 서비스에서 수집되며 Microsoft 개인정보처리방침에 따라 보호됩니다. 우리의 Microsoft Copilot 블로그Copilot FAQ에서 Copilot, Bing 및 Microsoft Start(MSN)의 소비자 데이터를 사용해 Copilot의 모델 학습을 돕는 방법을 설명합니다. 사용자가 쉽게 제외를 선택할 수 있도록 하고, 개인정보를 보호하기 위해 사용자를 식별할 수 있는 식별자를 제거하는 등의 안전장치를 마련합니다. 우리는 기업 고객의 허락 없이 해당 고객의 데이터를 사용하지 않습니다.
  • 가끔은 합성 데이터 세트로 학습합니다. 이러한 데이터는 희소하거나 제한적인 실제 데이터를 보완하도록, LLM(대규모 언어 모델)에 구체적으로 요청된 출력을 생성하게 프롬프트하여 만듭니다. 그런 다음 결과를 사람 검토자를 포함해 검토하고 필터링하여 학습 데이터셋에 포함할 만큼 품질이 충분한지 확인합니다.
  • 우리는 AI 트레이너, 레드팀원, 직원 및 외부 주석 파트너의 인간 피드백을 학습 과정에 포함합니다. 예를 들어 사용자 프롬프트에 대해 높은 품질의 출력을 강화하는 인간 피드백을 포함하며, 이는 최종 사용자 경험을 개선합니다. 레드팀원은 유해하거나 안전하지 않은 요청에 대해서도 모델을 테스트하며, 그 피드백은 모델의 안전 동작을 개선하는 데 사용됩니다.
우리는 자체 Microsoft 모델과 함께 OpenAI를 비롯한 다양한 다른 모델도 제품 및 서비스에 통합합니다. OpenAI가 모델을 학습하는 방법을 자세히 알아보세요.

유익하고 포용적인 AI를 위해 일부 웹 게시자와 콘텐츠 소유자는 자신의 콘텐츠가 어떻게 사용되는지에 대해 더 많은 발언권을 원합니다. 웹 게시자 제어 기능은 도움이 되지만, 완전한 해결책은 아닙니다. 우리는 업계, 표준 기구 및 콘텐츠 커뮤니티의 다른 관계자들과 함께 모두가 발전시키고 채택할 수 있는 공통 접근 방식을 찾고 있습니다.
밝은 사무실 환경에서 노트북을 사용하는 사람이 실내에 서 있습니다.

Microsoft의 책임 있는 AI

책임 있는 AI 원칙을 지키기 위해 우리가 만든 도구, 실무 및 정책을 살펴보세요.

기타 리소스

거실 환경에서 세 사람이 노트북으로 콘텐츠를 함께 검토하고 있습니다.

책임 있는 AI 투명성 보고서

AI를 책임 있게 구축하고, 고객을 지원하고, 진화하고, 성장하는 방법을 알아보세요.
대화 중에 테이블에 앉아 노트북을 사용하는 두 사람입니다.

소비자 데이터 사용의 투명성과 제어

Copilot이 여러분의 데이터에서 학습하는 방식을 제어하세요.
막대 차트와 분석이 표시된 태블릿을 들고 있는 사람입니다.

개방형 데이터 발전

더 개방적이고 접근하기 쉬운 데이터의 이점을 확인해 보세요.

Microsoft 팔로우

한국어(대한민국) 소비자 상태 개인정보처리방침 Microsoft에 문의 개인정보처리방침 및 위치정보이용약관 쿠키 관리 사용약관 상표 광고 정보