This is the Trace Id: d3de083ee2e6671b915d2cf681bca5bf
Saltar al contenido principal Información general Principios y enfoque Informe de transparencia Herramientas y procedimientos IA responsable en Azure Datos para el entrenamiento de la IA Iniciativa para un futuro seguro Informe de progreso de SFI Información general sobre patrones y prácticas Confianza cero Información general sobre la privacidad Información general sobre la administración de los datos Acceso a los datos Ubicación de los datos EU Data Boundary RGPD Información general sobre el cumplimiento Ofertas de cumplimiento Reglamentos Cumplimiento de DORA Ley sobre IA de la UE Resiliencia Digital Europea Cumplimiento de NIS2 Cumplimiento regional y nacional Accesibilidad Productos y servicios Ofertas de cumplimiento Puntuación de cumplimiento Informes de auditoría Recursos de protección de datos Seguridad de Microsoft Azure Dynamics 365 Microsoft 365 Microsoft Teams Windows 365 Microsoft AI Azure Space Realidad mixta Microsoft HoloLens Microsoft Viva Computación cuántica Educación Automotriz Servicios financieros Gobierno Sanidad Fabricación Comercios minoristas Encuentra un asociado Conviértete en asociado Red de asociados Microsoft Marketplace AppSource Blog Microsoft Advertising Centro de desarrolladores Documentación Eventos Licenciamiento Microsoft Learn Microsoft Research Ver mapa del sitio

Datos para el desarrollo de modelos de IA

Descubra nuestro enfoque para el uso de datos en el entrenamiento de modelos de IA generativa.
Dos personas sentadas a una mesa revisando contenido en una tableta, con una taza de café cerca.
La confianza y la transparencia son fundamentales en la forma en que abordamos los datos para el entrenamiento de modelos de IA aquí en Microsoft.

El objetivo de esta página es compartir nuestro enfoque, describiendo las categorías de datos que utilizamos para el entrenamiento y lo que estamos haciendo para que los editores web y los creadores de contenido tengan control sobre cómo se utiliza su contenido para entrenar estos modelos.

¿Qué significa entrenar un modelo de IA?

Los modelos de IA realizan predicciones basadas en datos. Durante el proceso de entrenamiento, un modelo de IA identifica patrones, correlaciones y conceptos en grandes cantidades de datos y luego utiliza lo aprendido para generar respuestas a preguntas o solicitudes. El modelo se puede ajustar utilizando diferentes categorías de datos de entrenamiento para optimizar las capacidades de generación para clases específicas de información, como lenguaje natural, código de software o imágenes. También puede basarse en los datos propios de la organización, por ejemplo, en un sector vertical como la agricultura, la salud o el comercio minorista.

Los modelos de IA generativa no están diseñados para almacenar, acceder o reproducir los datos de entrenamiento originales. En cambio, estos modelos están diseñados para generar nuevas obras y contenidos expresivos.

Dos personas de pie en el interior, revisando un panel de control en un monitor grande con gráficos y métricas.

Descubre cómo Microsoft entrena modelos de IA generativa con datos variados

Los conjuntos de datos amplios y variados son fundamentales para la creación de los sistemas de IA actuales. Es fundamental utilizar una amplia diversidad de datos para desarrollar modelos más precisos, más representativos de las diferentes culturas e idiomas, y que aprendan y apliquen todo el espectro de la experiencia y el ingenio humanos.
Tal como se indica en nuestras fichas de modelos y otra documentación disponible públicamente, Microsoft obtiene de forma responsable las siguientes categorías de datos para entrenar nuestros modelos de IA generativa:
  • Entrenamos nuestros modelos con datos seleccionados disponibles públicamente, procedentes de una combinación de conjuntos de datos de aprendizaje automático estándar de la industria y rastreos web. Excluimos las fuentes con muros de pago y contenido que viola nuestras políticas, y que han optado por no participar en la capacitación utilizando los controles web que publicamos. Los datos recopilados mediante rastreo web se filtran y procesan para eliminar el contenido ilegal, incluido el material de abuso sexual infantil (CSAM), de conformidad con las leyes aplicables y las políticas de IA responsable de Microsoft.

    Respetamos estándares como las etiquetas robots.txt que utilizan los editores web para evitar el rastreo web. No utilizamos datos de dominios incluidos en la lista de Mercados Notorios de Falsificación y Piratería de la Oficina del Representante Comercial de los Estados Unidos (USTR).
  • Se trata de datos de entrenamiento a los que accedemos mediante acuerdos negociados, por ejemplo, con editores y titulares de derechos de autor.
  • Estos datos se recopilan a partir de determinados servicios de consumo de Microsoft y están protegidos de acuerdo con nuestra Declaración de privacidad de Microsoft. Nuestro blog de Microsoft Copilot y las preguntas frecuentes de Copilot explican cómo utilizamos los datos de los consumidores de Copilot, Bing y Microsoft Start (MSN) para ayudar a entrenar nuestros modelos en Copilot. Facilitamos a los usuarios la opción de darse de baja e implementamos medidas de seguridad, como la eliminación de identificadores que puedan identificarle, para proteger su privacidad. No utilizamos los datos de nuestros clientes empresariales sin su permiso.
  • En ocasiones, entrenamos con conjuntos de datos sintéticos. Los creamos haciendo que grandes modelos de lenguaje (LLM, por sus siglas en inglés) generen resultados específicamente solicitados que complementen los datos escasos o limitados del mundo real. Posteriormente, los resultados se revisan y filtran, incluso por revisores humanos, para garantizar que tengan la calidad suficiente para formar parte del conjunto de datos de entrenamiento.
  • En nuestro proceso de formación, incluimos comentarios humanos de formadores de IA, miembros de equipos de pruebas de penetración, empleados y socios externos de anotación. Esto incluye, por ejemplo, la retroalimentación humana que refuerza la calidad de la respuesta a las indicaciones del usuario, mejorando así la experiencia del usuario final. Los miembros del equipo rojo también prueban el modelo frente a solicitudes dañinas o inseguras, y sus comentarios se utilizan para mejorar el comportamiento de seguridad del modelo.
Además de nuestros propios modelos de Microsoft, incorporamos otros modelos, incluidos los de OpenAI, en nuestros productos y servicios. Obtenga Obtener más información sobre cómo OpenAI entrena modelos .

Para lograr una IA beneficiosa e inclusiva, algunos editores web y propietarios de contenido desean tener más voz en cómo se utiliza su contenido. Los controles para editores web son útiles, pero no constituyen la solución completa. Estamos colaborando con otros actores de la industria, el sector editorial, los organismos de normalización y la comunidad de contenidos para identificar un enfoque común que todos podamos impulsar y adoptar.
Persona de pie en el interior de una oficina luminosa, utilizando un ordenador portátil.

IA responsable en Microsoft

Descubre las herramientas, las prácticas y las políticas que hemos creado para defender nuestros principios de IA responsable.

Más recursos

Tres personas revisando contenido juntas en una computadora portátil en una sala de estar.

Informe de transparencia sobre IA responsable

Descubre cómo desarrollamos IA de forma responsable, cómo apoyamos a nuestros clientes, cómo evolucionamos y cómo crecemos.
Dos personas sentadas a una mesa usando sus computadoras portátiles durante una conversación.

Transparencia y control en el uso de datos del consumidor

Controla cómo Copilot aprende de tus datos.
Persona sosteniendo una tableta que muestra gráficos de barras y análisis.

Promoviendo los datos abiertos

Aprovecha las ventajas de unos datos más abiertos y accesibles.

Seguir a Microsoft