Su dieci visitatori che arrivano sulla scheda di un prodotto, ciascuno con il 20% di probabilità di comprare, quante possibilità abbiamo che almeno tre concludano l’acquisto? E quante che non compri nessuno?
Sono domande che nella pratica quotidiana ci facciamo di continuo (con le conversioni, con i clic, con i lanci di una moneta) e hanno tutte la stessa struttura: un certo numero di tentativi, ognuno dei quali può andare bene o male.
Lo strumento che risponde è la distribuzione binomiale, la più usata (e la più amichevole) fra le distribuzioni di probabilità discrete.
Vediamo da dove nasce, qual è la sua formula e come calcolarla al volo in R e con la calcolatrice.
In sintesi: la distribuzione binomiale dà la probabilità di ottenere esattamente r successi in n prove indipendenti, ciascuna con la stessa probabilità di successo p. La formula è \(P(X=r)={n \choose r}\,p^r(1-p)^{n-r}\), la media è \(np\) e la varianza \(np(1-p)\). In R si calcola con dbinom(r, n, p); per le probabilità cumulate («almeno», «al massimo») si usa pbinom().
Una premessa, prima di arrivare alla binomiale: due parole su cosa sia una variabile casuale, e su quali tipi ne incontreremo.
Una variabile casuale (o variabile aleatoria, o stocastica) è una variabile che può assumere valori diversi in dipendenza da qualche fenomeno aleatorio. In molti libri di statistica è indicata semplicemente come v.c.
E’ un valore numerico.
Quando valori di probabilità sono assegnati a tutti i possibili valori numerici di una variabile casuale x, il risultato è una distribuzione di probabilità.
In termini ancora più semplici: una variabile casuale è una variabile i cui valori sono associati a una probabilità di essere osservati. L’insieme di tutti i possibili valori di una variabile casuale e le probabilità ad essi associati è chiamato distribuzione di probabilità. La somma di tutte le probabilità è 1.
Ci sono due tipologie principali di variabili aleatorie: discrete e continue.
A seconda dei casi abbiamo a che fare, quindi, con varie tipologie di distribuzioni. Queste sono le più comuni:
Consideriamo una prova nella quale ha interesse solo verificare se un certo evento si verificato o meno.
La variabile casuale generata da tale prova assumerà valore 1 se l’evento si è verificato, 0 altrimenti.
Tale v.c. viene detta variabile casuale di Bernoulli.
Una qualunque prova dicotomica può essere rappresentata da una variabile casuale di Bernoulli.
Un po’ di simboli. Indichiamo una v.c. di Bernoulli in questo modo:
ha per media:
\( E(x)=\pi \\ \)e per varianza:
\( V(x)=\pi(1-\pi) \\ \)Tutte le prove che producono solo 2 possibili risultati generano v.c. di Bernoulli (ad esempio il lancio di una moneta).
Partendo da questo semplice assunto, il passo è brevissimo per arrivare alla Distribuzione Binomiale.
Non ho intenzione in questa sede di soffermarmi sugli aspetti concettuali, peraltro molto importanti, per i quali rimando a testi specifici. Quello che mi preme è mostrare in pratica, e in maniera spero chiara, di cosa stiamo parlando. Partiamo da una definizione e poi vediamo le caratteristiche e qualche esempio pratico.
La variabile casuale binomiale può essere intesa come una somma di variabili casuali bernoulliane.
Cosa significa? Semplicemente che se ripetiamo, per n volte e nelle stesse condizioni, lo schema dicotomico successo-insuccesso della variabile casuale di Bernoulli, avremo come risultato una sequenza di n sottoprove indipendenti, a ciascuna delle quali possiamo associare una variabile casuale di Bernoulli.
Quali sono le caratteristiche della distribuzione binomiale? Queste:
Se anche solo una di queste caratteristiche non è presente, niente da fare. No caratteristica, no binomiale…
Da un punto di vista pratico, la distribuzione binomiale ci consente di calcolare la probabilità di ottenere r successi in n prove indipendenti.
La probabilità di un certo numero, r, dipende da r stesso, dal numero di “esperimenti” n e dalla probabilità individuale che indichiamo con p.
La probabilità di r successi in n esperimenti è data da questa espressione:
Sembra difficile, vero? Eppure non lo è (e in pratica si rivela utile e persino divertente!)
Innanzitutto ricordiamo che con il simbolo ! in matematica indichiamo il fattoriale. Come certamente ricorderete, il fattoriale di 3, cioè 3! è:
3 x 2 x 1 = 6, il fattoriale di 4, cioè 4! è:
4 x 3 x 2 x 1 = 24
e via dicendo (non sfuggirà il fatto che il fattoriale cresce molto, molto velocemente all’aumentare del numero…).
Il fattoriale di un numero naturale indica il prodotto del numero per tutti i suoi antecedenti.
Detto questo, vediamo prima come trovare la media, il centro della nostra distribuzione, e come la varianza. In questo modo, avremo tutto ciò che ci serve per qualche esempio pratico…
Per calcolare ad esempio C62
6CATALOG [Shift-F7]C [tasto ln]2 — sullo schermo avrò 6C2EXEe otterrò il risultato, 15.
6MATHPRB3-nCr2ENTERChiamiamo x la nostra variabile binomiale, con n prove e probabilità di successo p. La scriviamo così:
\( x \sim Binomiale(n, p) \)
La media è:
La varianza è:
Ok, a questo punto urge un esempio.
Calcoliamo la varianza della distribuzione con dimensione n=10 e probabilità individuale p=0.5 (cioè il 50%). Ad esempio, si potrebbe trattare di dieci lanci di monete…
\( x \sim Binomiale(10, 0.5) \\\)Quindi la varianza sarà:
\(Var (x) = 10 \times 0.5 \times (1 – 0.5) = 2.5 \\\)La media, naturalmente, risulterà essere:
\(E (x) = 10 \times 0.5 = 5 \\\)
Nota a margine: è intuitivo che se p= 1-p = 0,5 la distribuzione di probabilità risulterà simmetrica. Mentre se p < 0,5 sarà asimmetrica verso destra e se p > 0,5 sarà asimmetrica verso sinistra.
Introduciamo ora il concetto di densità di probabilità (per le variabili discrete si parla più propriamente di funzione di probabilità; R la chiama comunque density, da cui la «d» di dbinom), che poi è quello che più spesso useremo in applicazioni reali… E’ quando, ad esempio, vogliamo sapere la probabilità che due lanci su 10 di una moneta diano testa…
Per spiegare meglio la cosa, prendo un problema da un libro. Ecco il problema:
Se incrocio un topo nero e uno bianco, ho 3/4 di probabilità che il topo nasca nero e 1/4 bianco. Qual è la probabilità che su 7 figli 3 siano bianchi?
Ottimo: scriviamo subito i dati!
E ora? Faccio i calcoli a mano? Ma sì, ecco:
\( \frac{n!}{r!(n-r)!} \times p^r (1-p)^{n-r} \\ \\\)quindi
\(\frac{7!}{3!4!} \times 0,25^{3} \times 0,75^{4}= \\
vale a dire 17,3%.
Fare i calcoli a mano è divertente, ma noi siamo pigri e abbiamo a disposizione R, oppure magari sul tavolo la vecchia e fidata TI-83.
In R la densità di probabilità viene computata da una semplice funzione:
dbinom()
Il problema è quindi risolto con la semplice istruzione:
dbinom(3,7,0.25) che mi dà come risultato 0,173, quindi la soluzione è 17,3%
La TI-83 ci fornisce invece la funzione binompdf, e la soluzione viene trovata con il comando:
binompdf(7,0.25,3) (sì, l’ordine degli elementi purtroppo è diverso e non bisogna confondersi…)
Se invece utilizzo una calcolatrice Casio, la funzione da utilizzare sarà BinomialPD:
BinomialPD(3,7,0.25) Torniamo alla domanda da cui siamo partiti: dieci visitatori sulla scheda prodotto, ciascuno con il 20% di probabilità di comprare. Quante probabilità ci sono che almeno tre acquistino?
Qui non ci interessa un valore preciso, ma un intervallo: 3, 4, 5… fino a 10. Potremmo sommare otto probabilità calcolate con la formula, ma c’è una strada molto più corta: calcolare la probabilità dell’evento opposto (0, 1 o 2 acquisti) e sottrarla da 1.
Le tre probabilità «piccole», con n = 10 e p = 0,2, sono:
\( P(X=0) = 0{,}8^{10} = 0{,}1074 \\ P(X=1) = 10 \times 0{,}2 \times 0{,}8^{9} = 0{,}2684 \\ P(X=2) = {10 \choose 2} \times 0{,}2^{2} \times 0{,}8^{8} = 45 \times 0{,}04 \times 0{,}1678 = 0{,}3020 \)Dunque la probabilità di al massimo due acquisti è 0,1074 + 0,2684 + 0,3020 = 0,6778, e quella di almeno tre è 1 − 0,6778 = 0,3222: circa una possibilità su tre.
(Per inciso, la media è n × p = 2: in media due acquisti ogni dieci visite.)
In R la probabilità cumulata si calcola con pbinom(), che somma per noi tutte le probabilità fino a un certo valore. Calcolo direttamente la coda «almeno 3» in R:
pbinom(2, 10, 0.2, lower.tail = FALSE)
# [1] 0.3222 Un avvertimento: il primo argomento è 2, non 3. Con lower.tail = FALSE R calcola la probabilità di superare quel valore, cioè P(X > 2), che per una variabile discreta è proprio P(X ≥ 3). Per «almeno r» si passa r − 1: è un errore facilissimo da fare, e va sempre tenuto bene a mente.
Sulla TI-83 lo stesso risultato si ottiene con la funzione cumulata binomcdf:
1 - binomcdf(10,0.2,2) A calcolare la probabilità di ottenere un certo numero di successi in n prove indipendenti, ognuna con due soli esiti possibili (successo o insuccesso) e con la stessa probabilità di successo p: quante conversioni su 10 visite, quante teste su 5 lanci. Si può vedere come la somma di n variabili di Bernoulli.
Nella formula n! / (r!(n−r)!) × p^r × (1−p)^(n−r), la prima parte è il coefficiente binomiale: conta in quanti modi gli r successi possono disporsi fra le n prove. Il resto è la probabilità di una singola sequenza con r successi.
La media è n × p e la varianza n × p × (1 − p). Con 10 lanci di una moneta equa (p = 0,5) la media è 5 teste e la varianza 2,5.
Con dbinom(r, n, p) per la probabilità di esattamente r successi e con pbinom(r, n, p) per la probabilità di al massimo r successi. Per «almeno r» si usa pbinom(r − 1, n, p, lower.tail = FALSE).
Dipende da p: con p = 0,5 è simmetrico, con p minore di 0,5 è asimmetrico verso destra, con p maggiore di 0,5 verso sinistra. All’aumentare del numero di prove la forma si avvicina a quella di una distribuzione normale.
La binomiale fissa il numero di prove e conta i successi; la binomiale negativa fissa il numero di successi e conta le prove necessarie per ottenerli. Alla prima chiediamo «quante teste in 5 lanci?», alla seconda «a quale lancio arriva la terza testa?».
Esistono dei quesiti altrettanto interessanti, che chiamano in causa altre distribuzioni discrete. Come fare se fossimo interessati a sapere, ad esempio, quanti tentativi devo attendermi di fare prima di potermi aspettare un successo?
Ecco entrare in scena la distribuzione geometrica.
E se invece volessimo sapere a quale tentativo arriverà il terzo successo? È il territorio della distribuzione binomiale negativa, che rovescia la domanda della binomiale: non quanti successi in un numero fisso di prove, ma quante prove per un numero fisso di successi.
Oppure: quante volte posso attendermi il verificarsi oppure il non verificarsi di un evento in un dato lasso di tempo?
E’ il caso di scomodare la distribuzione di Poisson
Operiamo campionando da una popolazione senza reintroduzione?
Usiamo la distribuzione ipergeometrica.
Come si vede, è un argomento vastissimo e molto interessante, che cercheremo di approfondire (ma con leggerezza) in vari articoli.
Per chi vuole ripassare le distribuzioni di probabilità con un linguaggio accessibile, Finalmente ho capito la statistica di Maurizio De Pra dedica alla binomiale e alle altre distribuzioni discrete una trattazione semplice e ricca di esempi.
Capita spesso che si esporti l'elenco delle keyword da Search Console o da un tool,…
Chi passa le giornate dentro Search Console conosce bene una situazione di questo tipo: una…
Nell'articolo sul multi-armed bandit abbiamo usato Bayes per decidere fra varianti: spostare il traffico verso…
Nell'articolo sull'A/B test bayesiano abbiamo confrontato due varianti a campione fisso: si raccolgono i dati…
Abbiamo avuto modo di esaminare, nell'articolo sull'A/B testing classico, come confrontare due varianti con il…
Abbiamo avuto modo di esaminare, nell'articolo sulle fondamenta della statistica bayesiana, come l'aggiornamento bayesiano funzioni…
View Comments
grazie di cuore!! ❤️❤️❤️