This is the Trace Id: cdb09db82eada8a6ee6185e703a0b08a

Dados para desenvolvimento de Modelo de IA

Explore nossa abordagem para dados usados no treinamento de modelos de IA generativa.
Duas pessoas sentadas à mesa analisando conteúdo em um tablet, com uma xícara de café por perto.
Confiança e transparência são fundamentais para nossa abordagem de dados para treinamento de modelos de IA aqui na Microsoft.

O objetivo desta página é compartilhar nossa abordagem, descrevendo as categorias de dados que usamos no treinamento e o que estamos fazendo para dar aos editores da Web e criadores de conteúdo controle sobre como o conteúdo deles é usado para treinar esses modelos.

O que significa treinar um modelo de IA?

Os modelos de IA fazem previsões com base em dados. Durante o processo de treinamento, um modelo de IA identifica padrões, correlações e conceitos em grandes volumes de dados e usa o que aprendeu para gerar respostas a perguntas ou solicitações. O modelo pode ser ajustado usando diferentes categorias de dados de treinamento para otimizar os recursos de geração para classes específicas de informações, como linguagem natural, código de software ou imagens. Ele também pode ser fundamentado com os próprios dados de uma organização, por exemplo, em um setor vertical como agricultura, saúde ou varejo.

Os modelos de IA generativa não foram projetados para armazenar, acessar ou reproduzir os dados de treinamento originais. Em vez disso, esses modelos têm como objetivo gerar novas obras e conteúdos expressivos.

Duas pessoas em pé em ambiente interno analisando um painel em um monitor grande com gráficos e métricas exibidos.

Descubra como a Microsoft treina modelos de IA generativa com dados variados

Conjuntos de dados grandes e variados são essenciais para criar os sistemas de IA atuais. É fundamental usar uma ampla diversidade de dados para desenvolver modelos mais precisos, mais representativos de diferentes culturas e idiomas e que aprendam e apliquem todo o espectro da experiência e engenhosidade humanas.
Conforme identificado em nossos cartões de modelo e em outra documentação disponível publicamente, a Microsoft obtém as seguintes categorias de dados para treinar nossos modelos de IA generativa de forma responsável:
  • Treinamos com dados públicos selecionados, provenientes de uma combinação de conjuntos de dados de aprendizado de máquina padrão do setor e rastreamentos da Web. Excluímos fontes com paywalls e conteúdo que viola nossas políticas, bem como fontes que recusaram o treinamento usando os controles da Web que publicamos. Os dados rastreados na Web são filtrados quanto à segurança e processados para remover conteúdo ilegal, incluindo material de abuso sexual infantil (CSAM), de acordo com as leis aplicáveis e as políticas de IA responsável da Microsoft.

    Respeitamos padrões como as tags robots.txt que os editores da Web usam para recusar o rastreamento da Web. Não usamos dados de domínios incluídos na lista de Mercados Notórios por Falsificação e Pirataria do Escritório do Representante de Comércio dos Estados Unidos (USTR).
  • Estes são dados de treinamento aos quais acessamos por meio de acordos negociados, como aqueles com editores e detentores de direitos autorais.
  • Esses dados são coletados de serviços selecionados da Microsoft para consumidores e protegidos de acordo com nossa Política de Privacidade da Microsoft. Nosso blog do Microsoft Copilot e as Perguntas frequentes sobre o Copilot explicam como usamos dados de consumidores do Copilot, Bing e Microsoft Start (MSN) para ajudar a treinar nossos modelos no Copilot. Facilitamos a recusa dos usuários e implementamos proteções, como a remoção de identificadores que possam identificar você, para proteger a privacidade dos usuários. Não usamos os dados de nossos clientes empresariais sem a permissão deles.
  • Às vezes, treinamos com conjuntos de dados sintéticos. Nós os criamos solicitando a grandes modelos de linguagem (LLMs) que gerem resultados especificamente solicitados, os quais complementam dados do mundo real escassos ou limitados. Os resultados são então revisados e filtrados, inclusive por revisores humanos, para garantir que tenham qualidade suficiente para fazer parte do conjunto de dados de treinamento.
  • Incluímos comentários humanos de treinadores de IA, equipes vermelhas, funcionários e parceiros externos de anotação em nosso processo de treinamento. Isso inclui, por exemplo, comentários humanos que reforçam resultados de qualidade para o prompt de um usuário, melhorando a experiência do usuário final. As equipes vermelhas também testam o modelo com solicitações prejudiciais ou inseguras, e os comentários delas é usado para aprimorar os comportamentos de segurança do modelo.
Além de nossos próprios modelos da Microsoft, incorporamos vários outros modelos, inclusive da OpenAI, em nossos produtos e serviços. Saiba mais sobre como a OpenAI treina modelos.

Para uma IA benéfica e inclusiva, alguns editores da Web e proprietários de conteúdo querem ter mais participação nas decisões sobre como o conteúdo deles é usado. Os controles para editores da Web são úteis, mas não são a solução completa. Estamos trabalhando com outras partes dos setores de indústria e publicação, órgãos de padronização e a comunidade de conteúdo para identificar uma abordagem comum que todos possamos promover e adotar.
Pessoa em pé em ambiente interno usando um laptop em um escritório bem iluminado.

IA Responsável na Microsoft

Explore as ferramentas, práticas e políticas que criamos para defender nossos princípios de IA responsável.

Mais recursos

Três pessoas analisando conteúdo juntas em um laptop em uma sala de estar.

Relatório de Transparência de IA Responsável

Saiba como criamos IA de forma responsável, damos suporte aos nossos clientes, evoluímos e crescemos.
Duas pessoas sentadas à mesa usando laptops durante uma discussão.

Transparência e Controle no Uso de Dados do Consumidor

Controle como o Copilot aprende com seus dados.
Pessoa segurando um tablet que exibe gráficos de barras e análises.

Promovendo dados abertos

Aproveite os benefícios de dados mais abertos e acessíveis.

Siga a Microsoft

Português (Brasil) Privacidade dos Dados de Saúde do Consumidor Entre em contato com a Microsoft Privacidade Gerenciar cookies Ética e Compliance Nota Legal Marcas Sobre os nossos anúncios