Capire i concetti di base del Machine Learning: una guida per principianti

Introduzione

Il Machine Learning sta cambiando il modo in cui vediamo il mondo intorno a noi.
Dalla previsione del tempo alla diagnosi medica, dalla raccomandazione di contenuti su una piattaforma di streaming all’identificazione di frodi finanziarie, il Machine Learning è sempre più presente nella nostra vita quotidiana.

Ma cos’è esattamente e come funziona? In questo post ti guiderò attraverso i concetti fondamentali del Machine Learning e ti mostrerò come può essere utilizzato per risolvere problemi reali. Ti mostrerò anche come iniziare ad apprendere il Machine Learning, quali sono le risorse disponibili e come utilizzare questa tecnologia per migliorare la tua vita e il tuo lavoro.

Leggi tutto “Capire i concetti di base del Machine Learning: una guida per principianti”

Test non parametrici: il test di Wilcoxon per dati non normali (con esempi R)

Immagina di confrontare la durata delle sessioni tra due gruppi di pagine: quelle con featured snippet e quelle senza. Prendi i dati, esegui un test t di Student, e il p-value è 0,08. Non significativo, apparentemente. Ma guardando i dati, noti che le distribuzioni sono fortemente asimmetriche: poche pagine con durate lunghissime, molte con durate brevissime. Il test t assume la normalità della distribuzione, e qui siamo lontani anni luce.

Il test di Wilcoxon è un test non parametrico che non richiede alcuna assunzione sulla forma della distribuzione. Lavora sui ranghi, non sui valori originali: ordina tutti i dati dal più piccolo al più grande e assegna un punteggio basato sulla posizione. Questo lo rende particolarmente utile in SEO, dove molti indicatori (sessioni, CTR, posizioni) sono tutto tranne che normali.

Leggi tutto “Test non parametrici: il test di Wilcoxon per dati non normali (con esempi R)”

La distribuzione Beta spiegata semplice

Immaginiamo di avere 800 sessioni su una landing page e 65 conversioni. Il tasso grezzo è 65/800 ≈ 8,1%. Sembra un numero preciso, ma lo è davvero? È la vera probabilità di conversione della pagina, o potrebbe essere diversa? E se qualcuno sostenesse che la pagina converte almeno al 10% — i dati lo confermano o lo smentiscono?
Domande come questa sono all’ordine del giorno per chi lavora con dati di traffico e conversioni. La statistica bayesiana ci offre uno strumento elegante e diretto per rispondere: la distribuzione Beta.

La distribuzione Beta è una distribuzione di probabilità continua definita sull’intervallo [0, 1]. Detta così sembra astratta, ma è esattamente ciò di cui abbiamo bisogno ogni volta che vogliamo modellare l’incertezza intorno a una proporzione: un tasso di conversione, un CTR, una percentuale di clic, una probabilità di successo. Intuitivamente, Beta è una distribuzione sulle possibili probabilità dell’evento, e questo la rende unica.

Leggi tutto “La distribuzione Beta spiegata semplice”

Multicollinearità, eteroschedasticità, autocorrelazione: tre concetti dai nomi difficili (spiegati semplici)

Nel corso dei vari post, e in particolar in quelli riferiti all’analisi di regressione, all’analisi della varianza e alle serie temporali, abbiamo incontrato dei termini che sembrano fatti appositamente per spaventare il lettore.
Lo scopo di questi miei articoli è proprio quello di spiegare con semplicità i concetti chiave, al di là dell’apparente complessità (è ciò che avrei tanto voluto quando ero studente, anzichè confrontarmi con testi dalla forma volutamente – e inutilmente – involuta) .
E’ giunto dunque il momento di spendere qualche parola per tre importantissimi concetti che ricorrono assai spesso nelle analisi statistiche, e che dunque devono essere ben compresi. La realtà è molto, molto più chiara rispetto all’apparente complessità, dunque… nessuna paura!

Leggi tutto “Multicollinearità, eteroschedasticità, autocorrelazione: tre concetti dai nomi difficili (spiegati semplici)”

L’analisi della varianza: ANOVA spiegata semplice

Hai tre campagne Google Ads. Oppure quattro landing page. O ancora cinque versioni di una newsletter. Le medie sembrano diverse, ma sono differenze reali o semplice rumore statistico?

È esattamente il problema che risolve l’analisi della varianza (ANOVA): stabilire se almeno uno dei gruppi è realmente diverso dagli altri, senza cadere nella trappola di eseguire decine di confronti separati.

Leggi tutto “L’analisi della varianza: ANOVA spiegata semplice”