This is the Trace Id: d961368602a3df8bbf5301f1bd37379b

Dati per lo sviluppo di modelli di intelligenza artificiale

Esplora il nostro approccio ai dati per il training dei modelli di IA generativa.
Due persone sedute a un tavolo esaminano contenuti su un tablet, con una tazza di caffè vicino.
Fiducia e trasparenza sono fondamentali per il nostro approccio ai dati per il training dei modelli di intelligenza artificiale qui in Microsoft.

Lo scopo di questa pagina è condividere il nostro approccio, illustrando le categorie di dati che usiamo per il training e cosa stiamo facendo per offrire a editori web e creatori di contenuti il controllo su come i loro contenuti vengono usati per eseguire il training di questi modelli.

Cosa significa eseguire il training di un modello di intelligenza artificiale?

I modelli di IA effettuano previsioni basate sui dati. Durante il processo di training, un modello di IA identifica modelli, correlazioni e concetti in grandi quantità di dati e poi usa ciò che ha imparato per generare risposte a domande o richieste. Il modello può essere ottimizzato usando diverse categorie di dati di training per migliorare le capacità di generazione per classi specifiche di informazioni, come linguaggio naturale, codice software o immagini. Può anche basarsi sui dati di un'organizzazione, ad esempio in un settore verticale come agricoltura, sanità o vendita al dettaglio.

I modelli di IA generativa non sono progettati per archiviare o riprodurre i dati originali del training o accedervi. Questi modelli hanno invece lo scopo di generare nuove opere espressive e nuovi contenuti.

Due persone in piedi al chiuso esaminano un dashboard su un grande monitor con grafici e metriche visualizzati.

Scopri come Microsoft esegue il training dei modelli di intelligenza artificiale generativa su dati vari

Set di dati ampi e vari sono essenziali per creare i sistemi di IA di oggi. È fondamentale usare un'ampia varietà di dati per sviluppare modelli più accurati, più rappresentativi di culture e lingue diverse e in grado di apprendere e applicare lo spettro completo dell'esperienza e dell’ingegno umano.
Come indicato nelle schede dei modelli e in altra documentazione pubblicamente disponibile, Microsoft analizza le categorie di dati seguenti per il training dei propri modelli di IA generativa in modo responsabile:
  • Eseguiamo il training di dati specifici, disponibili a livello pubblico, da un mix di set di dati di machine learning standard di settore e ricerche per indicizzazione sul Web. Escludiamo le origini a pagamento e i contenuti che violano i nostri criteri, e che hanno scelto di non essere inclusi nel training usando controlli Web che abbiamo pubblicato. I dati raccolti dal Web vengono filtrati per garantire la sicurezza ed elaborati per rimuovere contenuti illegali, inclusi eventuale materiale su abusi sessuali su minori (CSAM), in conformità alle normative applicabili e ai criteri sull'intelligenza artificiale responsabile di Microsoft.

    Rispettiamo standard come i tag robots.txt che gli editori Web usano per escludere la ricerca per indicizzazione sul Web. Non usiamo dati provenienti da domini elencati nel Notorious Markets for Counterfeiting and Piracy dell'Office of the United States Trade Representative (USTR).
  • Sono dati di training a cui accediamo tramite accordi negoziati, ad esempio con editori e titolari di copyright.
  • Questi dati vengono raccolti da alcuni servizi per i consumatori Microsoft e protetti in conformità all'Informativa sulla privacy di Microsoft. Il nostro blog di Microsoft Copilot e le Domande frequenti su Copilot spiegano come usiamo i dati sui consumatori di Copilot, Bing e Microsoft Start (MSN) per aiutare a eseguire il training dei modelli in Copilot. Consentiamo agli utenti di rifiutare esplicitamente con facilità e mettiamo in atto protezioni, come la rimozione di identificatori che potrebbero identificarli, per proteggere la loro privacy. Non usiamo i dati dei nostri clienti aziendali senza la loro autorizzazione.
  • A volte eseguiamo il training di set di dati sintetici. Li creiamo richiedendo ai modelli linguistici di grandi dimensioni di generare output specifici che ampliano dati reali scarsi o limitati. I risultati vengono poi esaminati e filtrati, anche da revisori umani, per garantire che abbiano una qualità sufficiente per far parte del set di dati di training.
  • Nel nostro processo di training includiamo il feedback umano di IA trainer, red teamer, dipendenti e partner di annotazione esterni. Sono inclusi, ad esempio, il feedback umano che rafforza la qualità degli output in risposta ai prompt degli utenti, migliorando l'esperienza utente finale. I red teamer testano anche il modello rispetto a richieste dannose o non sicure e il loro feedback viene usato per migliorare i comportamenti di sicurezza del modello.
Insieme ai nostri modelli Microsoft, integriamo vari altri modelli, inclusi quelli di OpenAI, nei nostri prodotti e servizi. Altre informazioni su come OpenAI esegue il training dei modelli.

Per un'IA utile e inclusiva, alcuni editori web e proprietari di contenuti vogliono più voce in capitolo su come vengono usati i loro contenuti. I controlli degli editori web sono utili ma non rappresentano una soluzione completa. Stiamo lavorando insieme ad altri soggetti del settore, agli editori, agli enti di standardizzazione e alla community dei contenuti per individuare un approccio comune che tutti possiamo ottimizzare e adottare.
Persona in piedi al chiuso che usa un portatile in un ufficio luminoso.

Intelligenza artificiale responsabile di Microsoft

Esplora gli strumenti, le procedure e i criteri creati per rispettare i principi di intelligenza artificiale responsabile.

Altre risorse

Tre persone esaminano insieme contenuti su un portatile in un ambiente domestico.

Report sulla trasparenza dell'intelligenza artificiale responsabile

Scopri come creiamo un'IA responsabile, supportiamo i nostri clienti, evolviamo e cresciamo.
Due persone sedute a un tavolo mentre usano portatili durante una discussione.

Trasparenza e controllo nell'ambito dell'uso dei dati dei consumatori

Controlla come Copilot apprende dai tuoi dati.
Persona che tiene un tablet con grafici a barre e analisi visualizzati.

Promuovere dati aperti

Sfrutta i vantaggi di dati più aperti e accessibili.

Segui Microsoft

Italiano (Italia) Privacy per l'integrità dei consumer Riferimenti societari Contatta Microsoft Privacy Gestisci i cookie Condizioni per l'utilizzo Marchi Informazioni sulle inserzioni EU Compliance DoCs