Quante probabilità ci sono che una pagina vada in prima pagina? O che un test A/B dia un risultato affidabile? Domande come queste — all’apparenza molto diverse — condividono la stessa radice: per rispondere servono probabilità e combinatoria. In questo post gettiamo le basi, esplorando insieme gli strumenti fondamentali che ci accompagneranno per tutto il percorso.
Leggi tutto “I primi passi nel mondo della probabilità: spazio campionario, eventi, permutazioni e combinazioni”Categoria: statistica
Regressione Logistica: prevedere il risultato di un evento
La regressione logistica è un modello statistico utilizzato per prevedere la probabilità di un evento in base a un insieme di variabili indipendenti.
E’ particolarmente utile quando si vuole classificare un evento come appartenente o meno ad una determinata categoria (ad esempio, un cliente che acquisterà o meno un prodotto, un paziente che svilupperà o meno una malattia).
Si tratta di un algoritmo di Apprendimento Automatico Supervisionato che può essere utilizzato per modellare la probabilità di una determinata classe o evento. Viene utilizzato quando i dati sono linearmente separabili – cioè se esiste una linea o un piano che possono essere utilizzati per separare i dati in diverse classi in modo univoco – e l’esito è binario o dicotomico.
Ciò significa che la regressione logistica viene solitamente utilizzata per problemi di classificazione binaria (Sì/No, Corretto/Sbagliato, Vero/Falso, ecc.),
Nel corso di questo post mostrerò come eseguire una regressione logistica binomiale per creare un modello di classificazione, al fine di prevedere risposte binarie su un determinato insieme di predittori.
Leggi tutto “Regressione Logistica: prevedere il risultato di un evento”Capire i concetti di base del Machine Learning: una guida per principianti
Introduzione
Il Machine Learning sta cambiando il modo in cui vediamo il mondo intorno a noi.
Dalla previsione del tempo alla diagnosi medica, dalla raccomandazione di contenuti su una piattaforma di streaming all’identificazione di frodi finanziarie, il Machine Learning è sempre più presente nella nostra vita quotidiana.
Ma cos’è esattamente e come funziona? In questo post ti guiderò attraverso i concetti fondamentali del Machine Learning e ti mostrerò come può essere utilizzato per risolvere problemi reali. Ti mostrerò anche come iniziare ad apprendere il Machine Learning, quali sono le risorse disponibili e come utilizzare questa tecnologia per migliorare la tua vita e il tuo lavoro.
Leggi tutto “Capire i concetti di base del Machine Learning: una guida per principianti”Test non parametrici: il test di Wilcoxon per dati non normali (con esempi R)
Immagina di confrontare la durata delle sessioni tra due gruppi di pagine: quelle con featured snippet e quelle senza. Prendi i dati, esegui un test t di Student, e il p-value è 0,08. Non significativo, apparentemente. Ma guardando i dati, noti che le distribuzioni sono fortemente asimmetriche: poche pagine con durate lunghissime, molte con durate brevissime. Il test t assume la normalità della distribuzione, e qui siamo lontani anni luce.
Il test di Wilcoxon è un test non parametrico che non richiede alcuna assunzione sulla forma della distribuzione. Lavora sui ranghi, non sui valori originali: ordina tutti i dati dal più piccolo al più grande e assegna un punteggio basato sulla posizione. Questo lo rende particolarmente utile in SEO, dove molti indicatori (sessioni, CTR, posizioni) sono tutto tranne che normali.
Leggi tutto “Test non parametrici: il test di Wilcoxon per dati non normali (con esempi R)”La distribuzione Beta spiegata semplice
Immaginiamo di avere 800 sessioni su una landing page e 65 conversioni. Il tasso grezzo è 65/800 ≈ 8,1%. Sembra un numero preciso, ma lo è davvero? È la vera probabilità di conversione della pagina, o potrebbe essere diversa? E se qualcuno sostenesse che la pagina converte almeno al 10% — i dati lo confermano o lo smentiscono?
Domande come questa sono all’ordine del giorno per chi lavora con dati di traffico e conversioni. La statistica bayesiana ci offre uno strumento elegante e diretto per rispondere: la distribuzione Beta.
La distribuzione Beta è una distribuzione di probabilità continua definita sull’intervallo [0, 1]. Detta così sembra astratta, ma è esattamente ciò di cui abbiamo bisogno ogni volta che vogliamo modellare l’incertezza intorno a una proporzione: un tasso di conversione, un CTR, una percentuale di clic, una probabilità di successo. Intuitivamente, Beta è una distribuzione sulle possibili probabilità dell’evento, e questo la rende unica.
Leggi tutto “La distribuzione Beta spiegata semplice”