Glossario del machine learning: metriche

Questa pagina contiene i termini del glossario delle metriche. Per tutti i termini del glossario, fai clic qui.

A

accuracy

#fundamentals
#Metric

Il numero di previsioni di classificazione corrette diviso per il numero totale di previsioni. Ossia:

$$\text{Accuracy} = \frac{\text{correct predictions}} {\text{correct predictions + incorrect predictions }}$$

Ad esempio, un modello che ha effettuato 40 previsioni corrette e 10 errate avrebbe un'accuratezza pari a:

$$\text{Accuracy} = \frac{\text{40}} {\text{40 + 10}} = \text{80%}$$

La classificazione binaria fornisce nomi specifici per le diverse categorie di previsioni corrette e previsioni errate. Pertanto, la formula dell'accuratezza per la classificazione binaria è la seguente:

$$\text{Accuracy} = \frac{\text{TP} + \text{TN}} {\text{TP} + \text{TN} + \text{FP} + \text{FN}}$$

dove:

Confronta e metti a confronto l'accuratezza con la precisione e il richiamo.

Per saperne di più, consulta Classificazione: accuratezza, richiamo, precisione e metriche correlate in Machine Learning Crash Course.

area sotto la curva PR

#Metric

Vedi AUC PR (area sotto la curva PR).

area sotto la curva ROC

#Metric

Consulta la sezione AUC (Area sotto la curva ROC).

AUC (area sotto la curva ROC)

#fundamentals
#Metric

Un numero compreso tra 0,0 e 1,0 che rappresenta la capacità di un modello di classificazione binaria di separare le classi positive dalle classi negative. Più l'AUC è vicino a 1,0, migliore è la capacità del modello di separare le classi tra loro.

Ad esempio, la seguente illustrazione mostra un modello di classificazione che separa perfettamente le classi positive (ovali verdi) da quelle negative (rettangoli viola). Questo modello perfetto in modo non realistico ha un'AUC pari a 1,0:

Una retta numerica con 8 esempi positivi da un lato e
          9 esempi negativi dall'altro.

Al contrario, l'illustrazione seguente mostra i risultati per un modello di classificazione che ha generato risultati casuali. Questo modello ha un AUC di 0,5:

Una retta numerica con 6 esempi positivi e 6 esempi negativi.
          La sequenza di esempi è positiva, negativa,
          positiva, negativa, positiva, negativa, positiva, negativa, positiva
          negativa, positiva, negativa.

Sì, il modello precedente ha un'AUC di 0,5, non di 0.

La maggior parte dei modelli si trova a metà strada tra i due estremi. Ad esempio, il seguente modello separa in qualche modo i positivi dai negativi e pertanto ha un'AUC compresa tra 0,5 e 1,0:

Una retta numerica con 6 esempi positivi e 6 esempi negativi.
          La sequenza di esempi è negativo, negativo, negativo, negativo,
          positivo, negativo, positivo, positivo, negativo, positivo, positivo,
          positivo.

L'AUC ignora qualsiasi valore impostato per la soglia di classificazione. L'AUC, invece, prende in considerazione tutte le possibili soglie di classificazione.

Per saperne di più, consulta Classificazione: ROC e AUC in Machine Learning Crash Course.

precisione media a k

#Metric

Una metrica per riassumere il rendimento di un modello su un singolo prompt che genera risultati classificati, ad esempio un elenco numerato di consigli di libri. La precisione media a k è la media dei valori di precisione a k per ogni risultato pertinente. La formula per la precisione media a k è quindi:

\[{\text{average precision at k}} = \frac{1}{n} \sum_{i=1}^n {\text{precision at k for each relevant item} } \]

dove:

  • \(n\) è il numero di elementi pertinenti nell'elenco.

Contrasto con il richiamo a k.

B

base di riferimento

#Metric

Un modello utilizzato come punto di riferimento per confrontare il rendimento di un altro modello (in genere, uno più complesso). Ad esempio, un modello di regressione logistica può fungere da buona base di riferimento per un modello profondo.

Per un problema specifico, la baseline aiuta gli sviluppatori di modelli a quantificare il rendimento minimo previsto che un nuovo modello deve raggiungere per essere utile.

Boolean Questions (BoolQ)

#Metric

Un set di dati per valutare la competenza di un LLM nel rispondere a domande con risposta sì o no. Ognuna delle sfide nel set di dati è composta da tre componenti:

  • Una query
  • Un passaggio che implica la risposta alla query.
  • La risposta corretta, che è o no.

Ad esempio:

  • Query: ci sono centrali nucleari in Michigan?
  • Passaggio: ...tre centrali nucleari forniscono al Michigan circa il 30% della sua elettricità.
  • Risposta corretta: sì

I ricercatori hanno raccolto le domande da query di ricerca Google anonimizzate e aggregate e poi hanno utilizzato le pagine di Wikipedia per basare le informazioni.

Per saperne di più, consulta BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions.

BoolQ è un componente dell'ensemble SuperGLUE.

BoolQ

#Metric

Abbreviazione di Boolean Questions.

C

CB

#Metric

Abbreviazione di CommitmentBank.

Punteggio F di n-grammi di caratteri (ChrF)

#Metric

Una metrica per valutare i modelli di traduzione automatica. L'F-score degli n-grammi di caratteri determina il grado di sovrapposizione degli n-grammi nel testo di riferimento con gli n-grammi nel testo generato di un modello ML.

Il punteggio F di N-grammi di caratteri è simile alle metriche delle famiglie ROUGE e BLEU, tranne per il fatto che:

  • Il punteggio F degli n-grammi di caratteri opera sugli n-grammi di caratteri.
  • ROUGE e BLEU operano su n-grammi di parole o token.

Scelta di alternative plausibili (COPA)

#Metric

Un set di dati per valutare la capacità di un LLM di identificare la migliore tra due risposte alternative a una premessa. Ciascuna delle sfide nel set di dati è composta da tre componenti:

  • Una premessa, che in genere è un'affermazione seguita da una domanda
  • Due possibili risposte alla domanda posta nella premessa, una delle quali è corretta e l'altra errata
  • La risposta corretta

Ad esempio:

  • Premessa:l'uomo si è rotto un dito del piede. Qual è stata la CAUSA?
  • Risposte possibili:
    1. Ha un buco nel calzino.
    2. Si è fatto cadere un martello sul piede.
  • Risposta corretta: 2

COPA è un componente dell'ensemble SuperGLUE.

CommitmentBank (CB)

#Metric

Un set di dati per valutare la competenza di un LLM nel determinare se l'autore di un passaggio crede in una clausola di destinazione all'interno di quel passaggio. Ogni voce del set di dati contiene:

  • Un passaggio
  • Una clausola di destinazione all'interno del passaggio
  • Un valore booleano che indica se l'autore del passaggio ritiene che la clausola di destinazione

Ad esempio:

  • Passaggio:che divertimento sentire ridere Artemide. È una bambina molto seria. Non sapevo che avesse un senso dell'umorismo.
  • Clausola di targeting: aveva un senso dell'umorismo
  • Booleano: True, il che significa che l'autore ritiene che la clausola di destinazione

CommitmentBank è un componente dell'insieme SuperGLUE.

COPA

#Metric

Abbreviazione di Scelta di alternative plausibili.

costo

#Metric

Sinonimo di perdita.

equità controfattuale

#responsible
#Metric

Una metrica di equità che controlla se un modello di classificazione produce lo stesso risultato per un individuo e per un altro individuo identico al primo, tranne per uno o più attributi sensibili. La valutazione di un modello di classificazione per l'equità controfattuale è un metodo per individuare potenziali fonti di bias in un modello.

Per ulteriori informazioni, consulta una delle seguenti risorse:

entropia incrociata

#Metric

Una generalizzazione della perdita logaritmica per problemi di classificazione multiclasse. L'entropia incrociata quantifica la differenza tra due distribuzioni di probabilità. Vedi anche perplessità.

funzione di distribuzione cumulativa (CDF)

#Metric

Una funzione che definisce la frequenza dei campioni minore o uguale a un valore target. Ad esempio, considera una distribuzione normale di valori continui. Una CDF indica che circa il 50% dei campioni deve essere inferiore o uguale alla media e che circa l'84% dei campioni deve essere inferiore o uguale a una deviazione standard sopra la media.

D

parità demografica

#responsible
#Metric

Una metrica di equità che viene soddisfatta se i risultati della classificazione di un modello non dipendono da un determinato attributo sensibile.

Ad esempio, se sia i lillipuziani che i brobdingnagiani fanno domanda all'Università di Glubbdubdrib, la parità demografica viene raggiunta se la percentuale di lillipuziani ammessi è la stessa di quella dei brobdingnagiani ammessi, indipendentemente dal fatto che un gruppo sia in media più qualificato dell'altro.

Contrasta con probabilità equalizzate e uguaglianza delle opportunità, che consentono ai risultati della classificazione aggregata di dipendere da attributi sensibili, ma non consentono ai risultati della classificazione per determinate etichette verità di riferimento specificate di dipendere da attributi sensibili. Consulta "Attacking discrimination with smarter machine learning" per una visualizzazione che esplora i compromessi quando si esegue l'ottimizzazione per la parità demografica.

Per saperne di più, consulta Equità: parità demografica in Machine Learning Crash Course.

E

Distanza di movimento terra (EMD)

#Metric

Una misura della similarità relativa di due distribuzioni. Più bassa è la distanza del movimento di terra, più simili sono le distribuzioni.

edit distance

#Metric

Una misurazione del grado di somiglianza tra due stringhe di testo. Nel machine learning, la distanza di modifica è utile per i seguenti motivi:

  • La distanza di modifica è facile da calcolare.
  • La distanza di modifica può confrontare due stringhe note per essere simili tra loro.
  • La distanza di modifica può determinare il grado di somiglianza di stringhe diverse rispetto a una determinata stringa.

Esistono diverse definizioni di distanza di modifica, ognuna delle quali utilizza operazioni sulle stringhe diverse. Per un esempio, consulta Distanza di Levenshtein.

funzione di distribuzione cumulativa empirica (eCDF o EDF)

#Metric

Una funzione di distribuzione cumulativa basata su misurazioni empiriche di un set di dati reale. Il valore della funzione in qualsiasi punto dell'asse x è la frazione di osservazioni nel set di dati che sono minori o uguali al valore specificato.

entropia

#df
#Metric

Nella teoria dell'informazione, una descrizione di quanto sia imprevedibile una distribuzione di probabilità. In alternativa, l'entropia è anche definita come la quantità di informazioni contenute in ogni esempio. Una distribuzione ha l'entropia più alta possibile quando tutti i valori di una variabile casuale sono ugualmente probabili.

L'entropia di un insieme con due possibili valori "0" e "1" (ad esempio, le etichette in un problema di classificazione binaria) ha la seguente formula:

  H = -p log p - q log q = -p log p - (1-p) * log (1-p)

dove:

  • H è l'entropia.
  • p è la frazione di esempi "1".
  • q è la frazione di esempi "0". Tieni presente che q = (1 - p)
  • log è generalmente log2. In questo caso, l'unità di entropia è un bit.

Ad esempio, supponiamo quanto segue:

  • 100 esempi contengono il valore "1"
  • 300 esempi contengono il valore "0"

Pertanto, il valore di entropia è:

  • p = 0,25
  • q = 0,75
  • H = (-0,25)log2(0,25) - (0,75)log2(0,75) = 0,81 bit per esempio

Un insieme perfettamente bilanciato (ad esempio, 200 "0" e 200 "1") avrebbe un'entropia di 1 bit per esempio. Man mano che un set diventa più sbilanciato, la sua entropia tende a 0.0.

Negli alberi decisionali, l'entropia aiuta a formulare il guadagno di informazioni per aiutare lo splitter a selezionare le condizioni durante la crescita di un albero decisionale di classificazione.

Confronta l'entropia con:

L'entropia viene spesso chiamata entropia di Shannon.

Per saperne di più, consulta la sezione Splitter esatto per la classificazione binaria con funzionalità numeriche del corso Decision Forests.

uguaglianza di opportunità

#responsible
#Metric

Una metrica di equità per valutare se un modello prevede il risultato desiderabile altrettanto bene per tutti i valori di un attributo sensibile. In altre parole, se il risultato desiderabile per un modello è la classe positiva, l'obiettivo sarebbe che il tasso di veri positivi sia uguale per tutti i gruppi.

L'uguaglianza delle opportunità è correlata alle probabilità equalizzate, che richiedono che entrambi i tassi di veri positivi e i tassi di falsi positivi siano uguali per tutti i gruppi.

Supponiamo che l'Università di Glubbdubdrib ammetta sia i lillipuziani che i brobdingnagiani a un rigoroso programma di matematica. Le scuole secondarie di Lilliput offrono un solido programma di corsi di matematica e la stragrande maggioranza degli studenti è qualificata per il programma universitario. Le scuole secondarie di Brobdingnag non offrono corsi di matematica e, di conseguenza, molti meno studenti sono qualificati. L'uguaglianza delle opportunità è soddisfatta per l'etichetta preferita di "ammesso" rispetto alla nazionalità (lillipuziana o brobdingnagiana) se gli studenti qualificati hanno la stessa probabilità di essere ammessi indipendentemente dal fatto che siano lillipuziani o brobdingnagiani.

Ad esempio, supponiamo che 100 lillipuziani e 100 brobdingnaghi facciano domanda all'Università di Glubbdubdrib e che le decisioni di ammissione vengano prese come segue:

Tabella 1. Candidati lillipuziani (il 90% è qualificato)

  Qualificato Non qualificato
Ammesso 45 3
Rifiutato 45 7
Totale 90 10
Percentuale di studenti qualificati ammessi: 45/90 = 50%
Percentuale di studenti non qualificati respinti: 7/10 = 70%
Percentuale totale di studenti Lillipuziani ammessi: (45+3)/100 = 48%

 

Tabella 2. Candidati brobdingnaghi (il 10% è qualificato):

  Qualificato Non qualificato
Ammesso 5 9
Rifiutato 5 81
Totale 10 90
Percentuale di studenti qualificati ammessi: 5/10 = 50%
Percentuale di studenti non qualificati respinti: 81/90 = 90%
Percentuale totale di studenti di Brobdingnag ammessi: (5+9)/100 = 14%

Gli esempi precedenti soddisfano la parità di opportunità per l'accettazione di studenti qualificati perché i lillipuziani e i brobdingnagiani qualificati hanno entrambi il 50% di possibilità di essere ammessi.

Sebbene l'uguaglianza delle opportunità sia soddisfatta, le seguenti due metriche di equità non sono soddisfatte:

  • Parità demografica: lillipuziani e brobdingnagiani vengono ammessi all'università a tassi diversi; il 48% degli studenti lillipuziani viene ammesso, ma solo il 14% degli studenti brobdingnagiani.
  • Probabilità equalizzate: mentre gli studenti lillipuziani e brobdingnagiani qualificati hanno la stessa probabilità di essere ammessi, il vincolo aggiuntivo che gli studenti lillipuziani e brobdingnagiani non qualificati abbiano la stessa probabilità di essere respinti non è soddisfatto. I Lillipuziani non qualificati hanno un tasso di rifiuto del 70%, mentre i Brobdingnagiani non qualificati hanno un tasso di rifiuto del 90%.

Per saperne di più, consulta Equità: pari opportunità in Machine Learning Crash Course.

probabilità equalizzate

#responsible
#Metric

Una metrica di equità per valutare se un modello prevede i risultati in modo equo per tutti i valori di un attributo sensibile rispetto sia alla classe positiva sia alla classe negativa, non solo a una classe o all'altra esclusivamente. In altre parole, sia la percentuale di veri positivi sia la percentuale di falsi negativi devono essere uguali per tutti i gruppi.

Le probabilità equalizzate sono correlate all'uguaglianza di opportunità, che si concentra solo sui tassi di errore per una singola classe (positiva o negativa).

Ad esempio, supponiamo che l'Università di Glubbdubdrib ammetta sia i lillipuziani che i brobdingnagiani a un rigoroso programma di matematica. Le scuole secondarie lillipuziane offrono un solido programma di corsi di matematica e la stragrande maggioranza degli studenti è qualificata per il programma universitario. Le scuole secondarie di Brobdingnag non offrono corsi di matematica e, di conseguenza, molti meno studenti sono qualificati. Le pari opportunità sono soddisfatte a condizione che, indipendentemente dal fatto che un candidato sia un lillipuziano o un brobdingnagiano, se è qualificato, ha la stessa probabilità di essere ammesso al programma e, se non è qualificato, ha la stessa probabilità di essere rifiutato.

Supponiamo che 100 Lillipuziani e 100 Brobdingnagiani facciano domanda all'Università di Glubbdubdrib e che le decisioni di ammissione vengano prese come segue:

Tabella 3. Candidati lillipuziani (il 90% è qualificato)

  Qualificato Non qualificato
Ammesso 45 2
Rifiutato 45 8
Totale 90 10
Percentuale di studenti qualificati ammessi: 45/90 = 50%
Percentuale di studenti non qualificati respinti: 8/10 = 80%
Percentuale totale di studenti lillipuziani ammessi: (45+2)/100 = 47%

 

Tabella 4. Candidati brobdingnaghi (il 10% è qualificato):

  Qualificato Non qualificato
Ammesso 5 18
Rifiutato 5 72
Totale 10 90
Percentuale di studenti qualificati ammessi: 5/10 = 50%
Percentuale di studenti non qualificati respinti: 72/90 = 80%
Percentuale totale di studenti di Brobdingnag ammessi: (5+18)/100 = 23%

La parità di probabilità è soddisfatta perché gli studenti lillipuziani e brobdingnaghi qualificati hanno entrambi il 50% di possibilità di essere ammessi, mentre quelli non qualificati hanno l'80% di possibilità di essere respinti.

Le probabilità equalizzate sono definite formalmente in "Equality of Opportunity in Supervised Learning" come segue: "il predittore Ŷ soddisfa le probabilità equalizzate rispetto all'attributo protetto A e al risultato Y se Ŷ e A sono indipendenti, condizionati a Y".

evals

#generativeAI