Test statistici parametrici e non parametrici

Avete mai lanciato un test A/B e vi siete chiesti se il test giusto sia il t-test o il Wilcoxon? La scelta non è banale: usare il test sbagliato può farvi perdere un risultato significativo — o, peggio, farvi credere significativo ciò che non lo è.

I test statistici si dividono in due grandi famiglie: parametrici e non parametrici. La differenza fondamentale? I primi assumono che i dati seguano una distribuzione nota (di solito la normale); i secondi no. Questa distinzione non è un dettaglio tecnico: determina quali test puoi usare, quanto sono potenti, e quanto puoi fidarti dei risultati.

In questo articolo vediamo le differenze, quando usare l’uno o l’altro, e come la scelta impatta sull’analisi dei dati del tuo sito.

Leggi tutto “Test statistici parametrici e non parametrici”

L’analisi di regressione multipla, spiegata semplice.

La lunghezza del testo aiuta il ranking? I backlink portano traffico? Le pagine più veloci convertono di più?
Prese una alla volta, queste domande hanno quasi sempre la stessa risposta pigra: «sì, un po’». Il guaio è che nella realtà i fattori non arrivano mai uno alla volta. Le pagine lunghe tendono anche ad attirare più link; quelle con più link sono spesso le più curate, e magari anche le più lente. Tutto si muove insieme, e la domanda che conta davvero è un’altra: quale di questi fattori pesa sul traffico al netto degli altri?

Abbiamo visto, parlando di correlazione, che si può misurare quanto due variabili si muovono insieme; e con la regressione lineare semplice che si può usarne una per prevedere l’altra.
Ma una correlazione alla volta è cieca di fronte all’intreccio: rischia di darci la stessa medaglia a un fattore e al suo compare, senza saperli distinguere. È l’anticamera di una trappola che conosciamo già, il paradosso di Simpson: un’associazione che cambia segno o svanisce non appena teniamo conto di una terza variabile. La regressione multipla è lo strumento che affronta di petto proprio questo — molte cause insieme, ciascuna misurata tenendo ferme le altre.

Leggi tutto “L’analisi di regressione multipla, spiegata semplice.”

I dati: le 4 scale di misura

Una domanda: quante volte abbiamo visto — o fatto — l’errore di calcolare la posizione media in SERP per un insieme di keyword e usare quel numero come se fosse un dato qualsiasi?
La posizione media è 4,3, la keyword A è 3 e la B è 7, “in media siamo quarti”.
Il problema è che una posizione in classifica non è un numero: è un dato ordinale. La distanza tra la posizione 1 e la posizione 3 non è la stessa che tra la 3 e la 5, e fare la media di numeri che non hanno una distanza interpretabile — questa sì che è una operazione priva di senso.

Prima di fare qualsiasi calcolo su dei dati, dobbiamo chiederci: che tipo di dato è? La risposta decide tutto ciò che possiamo — e non possiamo — fare dopo. E la risposta viene da una classificazione che, pur risalendo al 1946, resta il fondamento di ogni analisi statistica che si rispetti: le 4 scale di misura di Stanley Smith Stevens.

La scala di misura non serve a descrivere i dati: serve a stabilire quali operazioni hanno significato su quei dati. Più una scala contiene informazione, maggiore è il numero di analisi statistiche che possiamo applicare. È questo il criterio che rende la classificazione di Stevens così potente e dura nella pratica.

Leggi tutto “I dati: le 4 scale di misura”

La regressione lineare semplice: correlazione, R² e un caso studio in R

Abbiamo avuto modo di esaminare nel corso dei precedenti post concetti come la media o lo scarto quadratico medio, capaci di descrivere una singola variabile. Si tratta di statistiche che rivestono una grande importanza; tuttavia, nella pratica quotidiana, capita sovente di dover indagare le relazioni tra due o più variabili. Ecco dunque emergere nuovi concetti chiave: la correlazione e l’analisi di regressione.

La correlazione e l’analisi della regressione sono strumenti assai utilizzati durante l’analisi dei nostri set di dati.
Implicano la stima della relazione tra una variabile dipendente e una o più variabili indipendenti.

Leggi tutto “La regressione lineare semplice: correlazione, R² e un caso studio in R”

Analisi delle serie storiche e previsioni di serie temporali in R

Cosa si intende per serie storica, o serie temporale

Una serie storica consta dei valori osservati in un insieme di periodi ordinati sequenzialmente. Questo, per chi fa SEO, è già un elemento del massimo interesse.

I dati di traffico del nostro sito web, considerati lungo una sequenza temporale, sono infatti un esempio di serie storica.

L’analisi delle serie storiche è un insieme di metodi che ci consentono di ricavare schemi o statistiche significative dai dati con informazioni temporali.

In termini molto generali, possiamo dire che una serie temporale è una sequenza di variabili casuali indicizzate nel tempo.

Lo scopo dell’analisi di una serie storica può essere di tipo descrittivo (si pensi alla decomposizione della serie per rimuovere elementi di stagionalità o per evidenziare tendenze di fondo) oppure inferenziale, includendo in quest’ultimo la previsione dei valori per periodi di tempo futuri, ancora non occorsi (forecasting).

Leggi tutto “Analisi delle serie storiche e previsioni di serie temporali in R”