Contents — find the section you need

Laddove un modello discriminativo apprende p(y|x), un modello generativo rappresenta p(x) o p(x|c), spesso massimizzando

\max_\theta\;\mathbb E_{x\sim p_{data}}[\log p_\theta(x)]

Le VAE utilizzano variabili latenti e un limite variazionale; le GAN addestrano generatore e discriminatore in modo avversariale; i modelli di diffusione imparano a invertire un processo di rumore.

Diagram 1 · Use the button to switch views
Generazione condizionale

Diagramma: Duskcoil. Non stabilisce la veridicità, i diritti, la provenienza o la sicurezza dell'output generato.

Valutare l'aderenza alle condizioni, la veridicità, la privacy, il copyright, i pregiudizi, l'output dannoso e la divulgazione, non solo le metriche visive. Non trattare il materiale generato come prova senza verifica da fonti primarie.

Tre famiglie e i relativi compromessi di implementazione

Un VAE utilizza il codificatore q_\phi(z|x) e il decodificatore p_\theta(x|z) e massimizza un ELBO che Bilancia la ricostruzione con la regolarizzazione della distribuzione latente. Una GAN addestra un generatore e un discriminatore nel gioco minimax \min_G\max_D\mathbb E[\log D(x)]+\mathbb E[\log(1-D(G(z)))]. Può produrre output nitidi, ma il collasso modale e l'instabilità dell'addestramento rimangono problematiche. Un modello di diffusione aggiunge gradualmente rumore a x_0 e impara a prevedere il rumore \epsilon in modo che il processo inverso possa essere approssimato. Qualità, velocità, controllabilità, verosimiglianza e memoria sono compromessi diversi.

Famiglia Forza Punto di osservazione Controllo tipico
VAE Rappresentazione latente interpretabile Sfocatura ed errore di approssimazione Variabile latente e condizione
GAN Aspetto nitido ad alta frequenza Collasso modale e instabilità del discriminatore Condizione e ricerca latente
Diffusione Alta qualità e condizionamento Campionamento iterativo e provenienza Testo, immagine, guida

Casi di errore e valutazione

Immagini plausibili e Le affermazioni generate automaticamente non sono automaticamente vere. La memorizzazione di frasi di addestramento, la divulgazione di informazioni personali, marchi registrati o dati riservati, la generazione di output non pertinenti alle istruzioni, l'amplificazione dei pregiudizi e le citazioni inventate sono errori comuni. È preferibile combinare la tracciabilità della provenienza, la ricerca di similarità, la revisione da parte di esperti, il red teaming e la valutazione umana specifica per la situazione, anziché affidarsi a un singolo parametro automatico. Non utilizzare mai l'output generato come prova primaria per operazioni mediche, legali o di sicurezza.

Registrare la condizione di input, il prompt del sistema, la versione del modello, il seed casuale, i filtri e il tempo di generazione. Verificare il copyright, la privacy e i termini di utilizzo; non inviare input riservati a servizi esterni. Rifiutare le richieste pericolose e richiedere chiarimenti in caso di ambiguità. Le immagini generate devono essere etichettate come sintetiche e, per quanto riguarda le persone, è necessario considerare il consenso e le modalità di distribuzione.

  1. Specificare l'obiettivo della generazione e gli usi proibiti.

  2. Tracciare la provenienza, la licenza e le richieste di cancellazione.

  3. Valutare separatamente la conformità, la veridicità, la divulgazione e i pregiudizi.

  4. Prevedere l'approvazione umana, la verifica della fonte, il rifiuto e il rollback.

  5. Profilo di IA generativa NIST

Condizionamento, ricerca e riproducibilità

Fornire una condizione non garantisce che venga rispettata. Una guida robusta senza classificatore può migliorare l'aderenza riducendo al contempo la diversità o generando saturazione. Temperatura, top-p, numero di iterazioni e scala di guida sono sia parametri di qualità che specifiche per la riproducibilità e il costo computazionale. Salvare l'identificativo del modello, l'hash del peso, lo scheduler, il seed e la preelaborazione anziché affidarsi ai valori predefiniti.

Quando si generano condizioni di recupero o di dati esterni, mantenere il testo generato separato dalle prove recuperate. Un URL esistente non dimostra che un'affermazione sia supportata. Memorizzare il tempo di ricerca, la query, la versione del documento e l'intervallo citato; se le prove sono insufficienti, dichiararlo esplicitamente invece di fare supposizioni. Convalidare l'output strutturato con JSON Schema e testare la sintassi e la veridicità in modo indipendente.

Confronto tra i modelli di valutazione

Asse Esempio automatico Verifica umana/operativa Trappola

Fedeltà | FID, distanza percettiva | Artefatti e plausibilità | Overfitting della distribuzione metrica |

Diversità | Copertura, tasso di duplicati | Intervallo in una condizione | Le modifiche irrilevanti contano come diversità |

Aderenza alle condizioni | Classificatore, corrispondenza di stringhe | Punteggio a livello di istruzione | Bias del valutatore |

Fattibilità | Tasso di corrispondenza delle prove | Revisione delle affermazioni da parte di esperti | Confondere la fluidità con la verità |

Sicurezza e diritti | Tasso di rilevamento dei filtri | Contesto, consenso, scopo | Elusione o rifiuto eccessivo |

Includere istruzioni ambigue, condizioni contrastanti, somiglianze con persone note, stringhe dall'aspetto personale, domini pericolosi e lingue non supportate nel set di valutazione. Riportare i casi peggiori gravi e il tasso di rifiuto oltre alle medie. La valutazione umana dovrebbe documentare i prompt, l'ordine, il mascheramento e la concordanza tra valutatori.

Caso di fallimento: da una demo di successo al rilascio non supervisionato

Un piccolo set di esempi accattivanti nasconde l'instabilità su prompt ripetuti, prompt iniezione, output simile ai dati di addestramento e perdita di condizioni in conversazioni lunghe. L'invio diretto dell'input dell'utente all'addestramento futuro può rendere persistenti dati personali o abusivi. Definire i percorsi di consenso, scopo, conservazione ed eliminazione; isolare e rivedere i candidati all'addestramento. Assegnare ai modelli che utilizzano strumenti il minimo privilegio, la convalida degli argomenti, la conferma prima dell'esecuzione e limiti di costo e di chiamata.

Un'implementazione piccola e graduale

  1. Separare i punti che necessitano realmente di generazione da quelli in cui sono sufficienti la ricerca, i modelli o le persone.

  2. Convertire le condizioni di accettazione e divieto in un set di valutazione fisso con esempi.

  3. Mantenere i filtri di input/output, i controlli delle prove e la convalida dello schema indipendenti dal modello.

  4. Eseguire test di simulazione con un pubblico limitato e misurare le classi di errore, la latenza, i tentativi e lo sforzo di revisione.

  5. Bloccare le versioni, implementare gradualmente e tornare a una risposta sicura o disabilitare la funzionalità in caso di incidente grave.

  6. Rieseguire i set fissi e di incidente dopo ogni aggiornamento per rilevare regressioni e miglioramenti.

La qualità non è un singolo parametro di riferimento. Una specifica di prodotto deve indicare cosa non viene generato, quali prove vengono raccolte. mostrati e chi approva il risultato.

Confini operativi e gestione delle modifiche

Il confine di responsabilità dovrebbe essere visibile nell'interfaccia. Le bozze che gli utenti possono modificare, i riepiloghi verificati e i comandi che vengono eseguiti automaticamente non dovrebbero avere lo stesso trattamento visivo. Mostrare che viene generato un output, cosa è stato verificato, le fonti di riferimento e l'ora dell'ultimo aggiornamento. Le azioni ad alto impatto dovrebbero essere convertite in candidati tipizzati e passare l'autorizzazione e l'approvazione dell'utente anziché essere eseguite direttamente dal testo generato.

Gli aggiornamenti del provider, le modifiche ai filtri e le modifiche ai prompt sono modifiche di comportamento. Bloccare le versioni riproducibili e confrontare le differenze, inclusi i nuovi input normali rifiutati, le regressioni specifiche della lingua, i costi e la latenza. Al momento della dismissione, verificare l'ambito di eliminazione per log, embedding, cache e dati di fine-tuning. Aggiungi Analisi dei fallimenti anonimizzati del red team nei test di regressione, incluse le parafrasi, e interpretazione del numero di incidenti insieme all'utilizzo, al tasso di rifiuto e ai rifiuti delle revisioni.

Verifica la tua comprensione
Un output generato plausibile è prova di un fatto?

La somiglianza con i dati appresi non stabilisce la verità. Verifica le fonti, i vincoli e la validazione esterna appropriati al compito.

What to read next

Review the backgroundIntroduzione all'apprendimento automatico: stima della posaContinue the seriesConfronto tra LLM locali: prima risposta, tasso di generazione e memoriaExplore another aspect of this fieldIntroduzione al rilevamento di oggetti e alla segmentazione semantica: leggere "cosa si trova dove" in un'immagine.