statistica

La distribuzione Beta spiegata semplice

Immaginiamo di avere 800 sessioni su una landing page e 65 conversioni. Il tasso grezzo è 65/800 ≈ 8,1%. Sembra un numero preciso, ma lo è davvero? È la vera probabilità di conversione della pagina, o potrebbe essere diversa? E se qualcuno sostenesse che la pagina converte almeno al 10% — i dati lo confermano o lo smentiscono?
Domande come questa sono all’ordine del giorno per chi lavora con dati di traffico e conversioni. La statistica bayesiana ci offre uno strumento elegante e diretto per rispondere: la distribuzione Beta.

La distribuzione Beta è una distribuzione di probabilità continua definita sull’intervallo [0, 1]. Detta così sembra astratta, ma è esattamente ciò di cui abbiamo bisogno ogni volta che vogliamo modellare l’incertezza intorno a una proporzione: un tasso di conversione, un CTR, una percentuale di clic, una probabilità di successo. Intuitivamente, Beta è una distribuzione sulle possibili probabilità dell’evento, e questo la rende unica.

In sintesi: la distribuzione Beta è una distribuzione di probabilità continua definita sull’intervallo [0, 1], che modella l’incertezza intorno a una proporzione — un tasso di conversione, un CTR, una probabilità di successo. È governata da due parametri, \(\alpha\) e \(\beta\), che ne controllano la forma: possono renderla a campana, asimmetrica o a forma di U. In statistica bayesiana è la distribuzione naturale per le probabilità, perché combina i dati osservati con le convinzioni a priori.

Di cosa parleremo:


Che cos’è una distribuzione sulle probabilità?

Nella vita reale, a differenza dei problemi teorici di calcolo delle probabilità, non abbiamo quasi mai il valore esatto di una probabilità: abbiamo dati.
Abbiamo 65 conversioni su 800 visite, non il “vero” tasso di conversione della pagina. Il nostro lavoro è risalire da quei dati a una stima del valore nascosto — e, soprattutto, a un’idea di quanto sia incerta quella stima.

Una distribuzione di probabilità come la Beta risolve proprio questo problema: invece di un singolo numero (l’8,1% grezzo), otteniamo una curva che assegna un grado di plausibilità a ogni possibile valore della proporzione. Punti della curva più alti corrispondono a valori più probabili; punti più bassi a valori meno probabili. L’incertezza non è un difetto della stima, ma parte del risultato.

In termini tecnici, la Beta è definita dalla sua funzione di densità di probabilità (PDF):

\( Beta(p; \alpha, \beta) = \frac{p^{\alpha-1} \times (1-p)^{\beta-1}}{B(\alpha, \beta)} \\ \)

Dove:

  • \(p\) — la proporzione che stiamo stimando (un valore tra 0 e 1)
  • \(\alpha\) e \(\beta\) — i parametri di forma, che determinano l’aspetto della distribuzione

Più avanti vedremo che α e β possono essere interpretati come i conteggi di successi e fallimenti osservati, a partire da un valore iniziale scelto come prior. Per ora concentriamoci sulla loro influenza sulla forma.

La funzione \(B(\alpha, \beta)\) al denominatore serve esclusivamente a normalizzare la distribuzione, facendo sì che l’area totale sotto la curva sia uguale a 1 — come deve essere per ogni distribuzione di probabilità.


Che cosa fanno i parametri α e β?

Il vero punto di forza della Beta è la flessibilità. A seconda dei valori di α e β, la sua forma cambia radicalmente, rendendola adatta a descrivere situazioni molto diverse:

  • Quando α e β sono uguali, la distribuzione è simmetrica intorno a 0,5
  • Quando α > β, la distribuzione è sbilanciata verso destra (valori alti più probabili)
  • Quando α < β, la distribuzione è sbilanciata verso sinistra (valori bassi più probabili)
  • Quando α = β = 1, la Beta diventa una distribuzione uniforme — tutti i valori tra 0 e 1 sono ugualmente probabili (prior non informativo)
  • Quando α e β sono entrambi minori di 1, la distribuzione assume una forma a U (probabilità alta agli estremi, bassa al centro)

La media della Beta si calcola con una formula semplice:

\( \text{Media} = \frac{\alpha}{\alpha + \beta} \\ \)

E la moda (per α > 1 e β > 1):

\( \text{Moda} = \frac{\alpha – 1}{\alpha + \beta – 2} \\ \)

Che forma ha la Beta e cosa racconta?

Vediamo quattro combinazioni dei parametri per capire visivamente quanto la Beta sia versatile:

Distribuzione Beta con quattro diverse combinazioni di parametri: Beta(0,5; 0,5) a forma di U, Beta(2; 5) asimmetrica a sinistra, Beta(5; 2) asimmetrica a destra, Beta(5; 5) a campana simmetrica.
  • Beta(0,5; 0,5) — forma a U: probabilità alta agli estremi (vicino a 0% e 100%) e bassa al centro. Un prior usato quando si sospetta che il fenomeno sia “tutto o nulla”.
  • Beta(2; 5) — asimmetrica a destra (la coda lunga è verso 1): utile quando la proporzione tende a essere bassa.
  • Beta(5; 2) — asimmetrica a sinistra, per proporzioni che tendono a essere alte.
  • Beta(5; 5) — campana simmetrica centrata su 0,5: quando l’evidenza è bilanciata.

La stessa famiglia matematica produce forme così diverse: è per questo che la Beta è la distribuzione più usata per modellare proporzioni e probabilità in ambito bayesiano.


Un esempio: il gioco online

Facciamo un esempio al volo. L’organizzatore di un gioco online afferma che almeno 1 giocatore ogni 10 vince un premio. Abbiamo a disposizione i dati degli ultimi 800 giocatori, tra cui ci sono stati 65 vincitori.
L’organizzatore dice il vero? Basandoci sui dati, riteniamo che la probabilità di vincere sia almeno del 10%?

Usiamo la Beta. Il nostro prior — ciò che sappiamo prima di vedere i dati — è Beta(1, 1), la distribuzione uniforme che assegna la stessa plausibilità a ogni valore possibile. Dopo aver osservato 65 vincitori su 800, il posterior è Beta(66, 736). Perché 66 e 736? Perché con il prior Beta(1, 1), il posterior ha parametri α = 1 + successi e β = 1 + fallimenti, quindi α = 1 + 65 = 66 e β = 1 + 735 = 736.

Calcoliamo la probabilità che il vero tasso di vincita sia almeno del 10%:

# Prior non informativo: Beta(1,1)
# Dati: 65 vincitori su 800 giocatori
# Posterior: Beta(1 + 65, 1 + 735) = Beta(66, 736)
a_post <- 66; b_post <- 736

# Probabilità che p >= 0.10 — due modi equivalenti
integrate(function(x) dbeta(x, a_post, b_post), 0.10, 1)
1 - pbeta(0.10, a_post, b_post)

Output:

0.03974288 with absolute error < 2.3e-06
0.03974288

Alla luce dei dati, la probabilità che il vero tasso di vincita sia almeno del 10% è circa il 4%. L’affermazione dell’organizzatore appare poco plausibile.

Posterior Beta(66, 736) con prior non informativo Beta(1,1). L’area rossa corrisponde a P(p ≥ 10%) ≈ 4% — la regione in cui l’affermazione dell’organizzatore sarebbe vera.

La figura mostra il prior uniforme (linea arancione orizzontale) e il posterior Beta(66, 736) (curva blu). L’area ombreggiata in rosso a destra della soglia del 10% è minuscola — circa il 4% — mentre la stragrande maggioranza della distribuzione si trova sotto il 10%.

Possiamo anche leggere l’intervallo credibile della distribuzione — l’equivalente bayesiano dell’intervallo di confidenza, ma con un significato più diretto:

# Media e CI 95% del posterior
cat("Media:", round(66/(66+736), 3), "\n")
cat("CI 95%:", round(qbeta(c(0.025, 0.975), 66, 736), 3))

Output:

Media: 0.082
CI 95%: 0.064 0.102
Posterior Beta(66, 736) con media (verde), moda (arancione) e intervallo credibile al 95% (segmento rosso): la distribuzione è concentrata tra il 6,4% e il 10,2%.

Il valore più probabile della proporzione di vincite è intorno all’8,2%, con un intervallo credibile al 95% compreso tra il 6,4% e il 10,2%. L’organizzatore aveva dichiarato il 10% — valore che si trova al limite superiore della nostra stima, con circa il 4% di probabilità che il vero valore sia superiore. Non è impossibile, ma è decisamente poco plausibile.


Un esempio SEO: come stimare un tasso di conversione

Riprendiamo il caso dell’inizio: 65 conversioni su 800 sessioni su una landing page. Stimiamo il tasso di conversione con la Beta, esattamente come abbiamo appena fatto.

Con prior non informativo Beta(1, 1) e i dati osservati, il posterior è Beta(66, 736). La media è 66/802 ≈ 8,2%, con un CI al 95% tra 6,4% e 10,2%.

Questo intervallo è la risposta statistica alla domanda “quanto posso fidarmi del mio tasso di conversione?” L’8,1% grezzo che vediamo in GA4 è solo il centro della distribuzione: il vero valore potrebbe essere ragionevolmente tra il 6,4% e il 10,2%.

Se accumuliamo più dati — ad esempio 200 conversioni su 2200 sessioni totali — con prior Beta(1, 1) il posterior diventa Beta(201, 2001), la media 201/2202 ≈ 9,1% ma il CI 95% si restringe a [8,0%; 10,4%]: l’incertezza diminuisce perché abbiamo più evidenza.

Se invece abbiamo pochissimi dati (5 conversioni su 50 sessioni), il posterior Beta(6, 46) dà media 6/52 ≈ 11,5% e CI 95% [4,9%; 20,6%] — un’incertezza enorme. In questo caso la Beta non nasconde l’incertezza: la mostra onestamente.

Un avvertimento: la Beta modella la nostra incertezza sulla proporzione, non la proporzione stessa. Il risultato non è “il tasso di conversione è 8,2%”, ma “sulla base dei dati, la distribuzione della nostra incertezza sul tasso è Beta(66, 736)”. È una differenza sottile ma fondamentale — ed è il cuore dell’approccio bayesiano.


Perché la Beta è perfetta per aggiornamenti sequenziali?

Una delle proprietà più eleganti della Beta è che funziona come aggiornamento sequenziale: se dopo le prime 65 conversioni su 800 sessioni ne osserviamo altre 40 su 500 nuove sessioni, non dobbiamo ricominciare da capo. Prendiamo il posterior Beta(66, 736) come nuovo prior e lo aggiorniamo con i nuovi dati:

# Nuovo posterior: Beta(66 + 40, 736 + 460) = Beta(106, 1196)
a_new <- 66 + 40; b_new <- 736 + 460
cat("Nuova media:", round(a_new/(a_new + b_new), 3), "\n")
cat("Nuovo CI 95%:", round(qbeta(c(0.025, 0.975), a_new, b_new), 3))

Output:

Nuova media: 0.081
Nuovo CI 95%: 0.067 0.097

La media è rimasta stabile (conferma che i nuovi dati sono coerenti), ma l’intervallo si è ristretto: da [6,4%; 10,2%] a [6,7%; 9,7%]. Ogni nuovo dato affina la stima.

Questa proprietà — il posterior di oggi è il prior di domani — è ciò che rende la Beta lo strumento d’elezione per l’analisi bayesiana delle proporzioni, e il fondamento su cui poggiano strumenti più avanzati come l’A/B test bayesiano e il Thompson sampling.


Domande frequenti

Che cos’è la distribuzione Beta?

È una distribuzione di probabilità continua definita sull’intervallo [0, 1], ideale per modellare l’incertezza intorno a una proporzione: un tasso di conversione, un CTR, una probabilità di successo. È una distribuzione sulle possibili probabilità di un evento, non sui valori di una variabile qualunque.

Che cosa fanno i parametri α e β?

Controllano la forma della distribuzione: a parità di dati, valori più alti di α spingono la Beta verso l’alto (probabilità più alte), valori più alti di β verso il basso. Possono renderla a campana simmetrica, asimmetrica a destra o a sinistra, o persino a forma di U con valori estremi come Beta(0,5; 0,5).

Come si usa la Beta in statistica bayesiana?

Come distribuzione a priori sulle probabilità: i dati osservati (successi e insuccessi) si sommano ai parametri α e β del prior, producendo il posterior. Con un prior Beta(1, 1), dopo 65 conversioni su 800 sessioni il posterior è Beta(66, 736). Il posterior di oggi diventa il prior di domani: ogni nuovo dato affina la stima.

Che differenza c’è tra media, moda e intervallo credibile?

La media è il valore medio della distribuzione, la moda è il valore più probabile, e l’intervallo credibile al 95% è il segmento che contiene il 95% della massa di probabilità. Nell’esempio dell’articolo, con posterior Beta(66, 736), la media è circa 8,2%, la moda 8,1% e l’intervallo va da circa il 6,4% al 10,2%.

A cosa serve la Beta per le conversioni di una landing page?

A rispondere con onestà a domande come “questa pagina converte almeno al 10%?”: la Beta permette di calcolare la probabilità che la proporzione vera superi una soglia, invece di affidarsi al tasso grezzo come a una verità assoluta. Con i dati dell’esempio, la probabilità che la conversione superi il 10% è solo circa il 4%.

Come cambia la Beta quando arrivano nuovi dati?

Si aggiorna in modo semplice: basta sommare i nuovi successi e insuccessi ai parametri correnti. Il posterior si ristringe attorno al valore più probabile. Nell’esempio, aggiungendo nuovi dati l’intervallo credibile passa da [6,4%; 10,2%] a [6,7%; 9,7%]: ogni osservazione affina la stima.

Prova tu

Un sito lead generation ha 12 conversioni su 350 sessioni.

  1. Calcola il posterior Beta con prior non informativo Beta(1, 1). Quali sono i parametri α e β del posterior?
  2. Qual è la media del posterior? E il CI 95%?
  3. Il proprietario del sito afferma che il tasso di conversione è almeno del 5%. I dati gli danno ragione? (Suggerimento: calcola P(p ≥ 0.05) con pbeta)
  4. Se lo stesso sito avesse 120 conversioni su 3500 sessioni (stesso tasso grezzo, 10× i dati), come cambierebbe l’intervallo? Perché?

In questo articolo abbiamo visto cos’è la distribuzione Beta, come i parametri α e β ne determinano la forma, e come si usa per stimare proporzioni a partire da dati osservati. È il mattoncino fondamentale dell’inferenza bayesiana per i tassi di conversione.
Nel prossimo articolo faremo il passo successivo: stimare un conversion rate con la Beta, usando prior informativi e non informativi in un caso SEO concreto.


Per approfondire

Due letture per proseguire: Finalmente ho capito la statistica di Maurizio De Pra per inquadrare la Beta tra le altre distribuzioni, e Bayesian Statistics the Fun Way di Will Kurt per scoprire perché questa distribuzione è la regina dell’inferenza bayesiana, con esempi in R come quelli che usiamo qui.

Questo articolo fa parte del percorso «L’approccio bayesiano», la guida ragionata agli articoli su statistica e inferenza bayesiana applicate alla SEO.

paolo

Recent Posts

Clustering delle keyword: raggruppare migliaia di query con K-means e clustering gerarchico

Capita spesso che si esporti l'elenco delle keyword da Search Console o da un tool,…

1 mese ago

CTR atteso vs reale: trovare le pagine che rendono meno della loro posizione

Chi passa le giornate dentro Search Console conosce bene una situazione di questo tipo: una…

1 mese ago

Naive Bayes: classificare l’intento delle query con il teorema di Bayes

Nell'articolo sul multi-armed bandit abbiamo usato Bayes per decidere fra varianti: spostare il traffico verso…

1 mese ago

Multi-armed bandit: ottimizzare le varianti mentre il test è ancora in corso

Nell'articolo sull'A/B test bayesiano abbiamo confrontato due varianti a campione fisso: si raccolgono i dati…

1 mese ago

A/B test bayesiano: non solo “se” B è meglio di A, ma “di quanto”

Abbiamo avuto modo di esaminare, nell'articolo sull'A/B testing classico, come confrontare due varianti con il…

1 mese ago

Stima bayesiana di un conversion rate: quanto possiamo fidarci dei pochi dati che abbiamo

Abbiamo avuto modo di esaminare, nell'articolo sulle fondamenta della statistica bayesiana, come l'aggiornamento bayesiano funzioni…

1 mese ago