La distribuzione binomiale: formula, esempi e calcolo in R

Su dieci visitatori che arrivano sulla scheda di un prodotto, ciascuno con il 20% di probabilità di comprare, quante possibilità abbiamo che almeno tre concludano l’acquisto? E quante che non compri nessuno?
Sono domande che nella pratica quotidiana ci facciamo di continuo (con le conversioni, con i clic, con i lanci di una moneta) e hanno tutte la stessa struttura: un certo numero di tentativi, ognuno dei quali può andare bene o male.

Lo strumento che risponde è la distribuzione binomiale, la più usata (e la più amichevole) fra le distribuzioni di probabilità discrete.
Vediamo da dove nasce, qual è la sua formula e come calcolarla al volo in R e con la calcolatrice.

Leggi tutto “La distribuzione binomiale: formula, esempi e calcolo in R”

Tabelle di contingenza e probabilità condizionata

Avete mai notato come gli utenti che arrivano da mobile si comportano diversamente da quelli da desktop? Non è una sensazione: è una relazione tra due variabili categoriche. La variabile “dispositivo” (mobile o desktop) e la variabile “ha convertito” (sì o no) — mettendole in una tabella incrociata possiamo vedere se c’è un legame sistematico.

Le tabelle di contingenza (dette anche tabelle a doppia entrata) sono lo strumento base per farlo. Ci permettono di valutare l’interazione tra due variabili categoriche (qualitative) e di quantificare la probabilità condizionata — cioè quanto è probabile un evento “dato che” un altro si è verificato.

La domanda sulle differenze tra mobile e desktop, per esempio, si traduce in una probabilità condizionata: P(conversione | dispositivo = mobile) è diversa da P(conversione | dispositivo = desktop)? Se sì, c’è una relazione. Se no, le due variabili sono indipendenti.

Vediamo come funziona, partendo da un esempio volutamente leggero.

Leggi tutto “Tabelle di contingenza e probabilità condizionata”

Indice di Gini: come misurare (davvero) la concentrazione del traffico SEO

Hai mai notato come poche pagine del tuo sito si portino a casa la parte del leone del traffico?
La homepage, il blog, la pagina prodotti — e poi un lunghissimo elenco di pagine che, messe insieme, pesano meno di quelle tre.

È il principio di Pareto, lo conosciamo bene. Ma “l’80% del traffico viene dal 20% delle pagine” è un’euristica, non una misura.
Come facciamo a sapere se il nostro sito è più o meno concentrato della media? E se vogliamo confrontare due siti tra loro — o lo stesso sito in due momenti diversi?

Ci serve un indice che quantifichi la concentrazione in un numero solo.
Un numero che vale 0 quando tutto è distribuito in parti uguali, e 1 quando una singola pagina si prende tutto. Tra questi due estremi, lo spazio di tutte le distribuzioni reali.

Questo numero esiste. Si chiama indice di Gini, e misura la concentrazione di una variabile quantitativa trasferibile (una grandezza che può essere redistribuita senza cambiarne il totale: reddito, traffico, quote di mercato). Fu introdotto nel 1912 dallo statistico italiano Corrado Gini proprio per studiare la disuguaglianza nella distribuzione del reddito.
Da allora è diventato uno degli indicatori più usati in economia, sociologia — e sì, anche in analisi SEO.

Vediamo come funziona.

Leggi tutto “Indice di Gini: come misurare (davvero) la concentrazione del traffico SEO”