{"id":2225,"date":"2021-07-22T16:37:11","date_gmt":"2021-07-22T15:37:11","guid":{"rendered":"https:\/\/www.gironi.it\/blog\/?p=2225"},"modified":"2026-10-04T21:00:42","modified_gmt":"2026-10-04T20:00:42","slug":"regressione-multipla-spiegata-semplice","status":"publish","type":"post","link":"https:\/\/www.gironi.it\/blog\/regressione-multipla-spiegata-semplice\/","title":{"rendered":"L&#8217;analisi di regressione multipla, spiegata semplice."},"content":{"rendered":"\n<p class=\"wp-block-paragraph\">La lunghezza del testo aiuta il ranking? I backlink portano traffico? Le pagine pi\u00f9 veloci convertono di pi\u00f9?<br>Prese una alla volta, queste domande hanno quasi sempre la stessa risposta pigra: \u00abs\u00ec, un po&#8217;\u00bb. Il guaio \u00e8 che nella realt\u00e0 i fattori non arrivano mai uno alla volta. Le pagine lunghe tendono anche ad attirare pi\u00f9 link; quelle con pi\u00f9 link sono spesso le pi\u00f9 curate, e magari anche le pi\u00f9 lente. Tutto si muove insieme, e la domanda che conta davvero \u00e8 un&#8217;altra: <strong>quale di questi fattori pesa sul traffico <em>al netto<\/em> degli altri?<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Abbiamo visto, parlando di <a href=\"https:\/\/www.gironi.it\/blog\/correlazione\/\">correlazione<\/a>, che si pu\u00f2 misurare quanto due variabili si muovono insieme; e con la <a href=\"https:\/\/www.gironi.it\/blog\/regressione-lineare-semplice\/\">regressione lineare semplice<\/a> che si pu\u00f2 usarne una per prevedere l&#8217;altra.<br>Ma una correlazione alla volta \u00e8 cieca di fronte all&#8217;intreccio: rischia di darci la stessa medaglia a un fattore e al suo compare, senza saperli distinguere. \u00c8 l&#8217;anticamera di una trappola che conosciamo gi\u00e0, il <a href=\"https:\/\/www.gironi.it\/blog\/il-paradosso-di-simpson-nella-seo-quando-i-dati-aggregati-possono-mentire\/\">paradosso di Simpson<\/a>: un&#8217;associazione che cambia segno o svanisce non appena teniamo conto di una terza variabile. La regressione multipla \u00e8 lo strumento che affronta di petto proprio questo \u2014 molte cause insieme, ciascuna misurata tenendo ferme le altre.<\/p>\n\n\n\n<!--more-->\n\n\n\n<p class=\"wp-block-paragraph\"><strong>In sintesi:<\/strong> la <strong>regressione multipla<\/strong> \u00e8 una tecnica che misura quanto ciascun fattore contribuisce a un risultato <strong>tenendo fermi tutti gli altri<\/strong> \u2014 risponde alla domanda &#8220;a parit\u00e0 di backlink, la lunghezza conta ancora?&#8221;. L&#8217;equazione combina pi\u00f9 cause in un solo effetto: \\(Y = b_0 + b_1 X_1 + b_2 X_2 + \\dots + b_k X_k\\), e i coefficienti \\(b_i\\) dicono quanto pesa ogni fattore al netto degli altri. \u00c8 lo strumento che smaschera l&#8217;intreccio tra variabili che una correlazione alla volta non sa distinguere.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Di cosa parleremo<\/strong>:<\/p>\n\n\n\n<ul class=\"wp-block-list\"><li><a href=\"#perche-multipla\">Perch\u00e9 una correlazione alla volta non basta<\/a><\/li><li><a href=\"#equazione\">Qual \u00e8 l&#8217;equazione della regressione multipla?<\/a><\/li><li><a href=\"#esempio\">Un esempio: cosa spinge il traffico di una pagina<\/a><\/li><li><a href=\"#coefficienti\">Leggere i coefficienti: chi pesa davvero<\/a><\/li><li><a href=\"#validita\">Quanto \u00e8 valido il modello?<\/a><\/li><li><a href=\"#domande-frequenti\">Domande frequenti<\/a><\/li><li><a href=\"#prova-tu\">Prova tu<\/a><\/li><li><a href=\"#per-approfondire\">Per approfondire<\/a><\/li><\/ul>\n\n\n\n<hr class=\"wp-block-separator has-alpha-channel-opacity\"\/>\n\n\n\n<h2 class=\"wp-block-heading\" id=\"perche-multipla\">Perch\u00e9 una correlazione alla volta non basta<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Immaginiamo di misurare, sul nostro sito, la correlazione fra la lunghezza dei contenuti e il traffico che ricevono. Quasi certamente la troveremo positiva: le pagine pi\u00f9 lunghe ricevono pi\u00f9 traffico.<br>La tentazione, a quel punto, \u00e8 la scorciatoia di ogni consulente di fretta: \u00abscrivo pi\u00f9 lungo e il traffico sale\u00bb. Ma quella correlazione, da sola, non ci dice <em>perch\u00e9<\/em> le pagine lunghe vanno meglio. Vanno meglio perch\u00e9 sono lunghe, o perch\u00e9 \u2014 essendo lunghe e ben fatte \u2014 hanno raccolto negli anni pi\u00f9 <em>backlink<\/em>, e sono i link a portare il traffico?<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Sono due storie completamente diverse, con due piani d&#8217;azione opposti, e la correlazione fra traffico e lunghezza le confonde in un unico numero. Per separarle dobbiamo poter chiedere: <em>a parit\u00e0 di backlink<\/em>, la lunghezza conta ancora?<br>\u00c8 esattamente la domanda a cui la regressione multipla sa rispondere. <strong>La regressione multipla non misura se un fattore \u00e8 associato al risultato, ma quanto vi contribuisce una volta che tutti gli altri sono tenuti fermi<\/strong>: \u00e8 la differenza tra guardare il mondo una variabile alla volta e guardarlo per intero.<\/p>\n\n\n\n<hr class=\"wp-block-separator has-alpha-channel-opacity\"\/>\n\n\n\n<h2 class=\"wp-block-heading\" id=\"equazione\">Qual \u00e8 l&#8217;equazione della regressione multipla?<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">La forma dell&#8217;equazione \u00e8 la naturale espansione di quella della regressione semplice: al posto di una sola variabile predittiva ne mettiamo diverse, ciascuna con il suo coefficiente. Vogliamo spiegare una variabile <em>responso<\/em> (unica) a partire da un insieme di variabili <em>predittive<\/em>:<\/p>\n\n\n\n\\( y = b + a_1 x_1 + a_2 x_2 + \\dots + a_k x_k \\\\ \\)\n\n\n\n<p class=\"wp-block-paragraph\">dove \\( y \\) \u00e8 la variabile che vogliamo spiegare (il traffico), \\( x_1, x_2, \\dots, x_k \\) sono le variabili predittive (lunghezza, backlink, velocit\u00e0), \\( a_1, a_2, \\dots, a_k \\) sono i <strong>coefficienti di regressione<\/strong> e \\( b \\) \u00e8 l&#8217;intercetta.<br>Il cuore di tutto \u00e8 il significato di ciascun \\( a_i \\): \u00e8 di quanto cambia \\( y \\) quando \\( x_i \\) aumenta di un&#8217;unit\u00e0 <strong>e tutte le altre variabili restano costanti<\/strong>. Quel \u00abrestano costanti\u00bb \u00e8 la magia \u2014 e la responsabilit\u00e0 \u2014 del metodo: \u00e8 l\u00ec che avviene la separazione degli effetti che a occhio nudo restano ingarbugliati.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">In altri termini: la regressione multipla stima simultaneamente il contributo di ogni fattore, depurato da quello di tutti gli altri presenti nel modello. Il modo migliore per capirlo \u00e8 vederlo smontare un caso costruito apposta per ingannarci.<\/p>\n\n\n\n<hr class=\"wp-block-separator has-alpha-channel-opacity\"\/>\n\n\n\n<h2 class=\"wp-block-heading\" id=\"esempio\">Un esempio: cosa spinge il traffico di una pagina<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Costruisco in R una tabella d&#8217;esempio con sessanta pagine di un sito. Per ciascuna ho il traffico mensile, il numero di parole, i <em>backlink<\/em> ricevuti e il tempo di caricamento in secondi. Nella realt\u00e0 questi dati si esportano da Search Console, da un <em>crawler<\/em> e da un tool per i link; qui, trattandosi di un esempio, li simulo \u2014 ma con un meccanismo preciso in testa, che sar\u00e0 il nostro banco di prova:<\/p>\n\n\n\n<pre class=\"wp-block-code\"><code>set.seed(42)\nn &lt;- 60\nparole   &lt;- round(rnorm(n, 1200, 380)); parole[parole &lt; 350] &lt;- 350\nvelocita &lt;- round(pmax(0.6, rnorm(n, 2.6, 0.8)), 2)\n# i contenuti piu' lunghi attirano piu' backlink: ecco l'intreccio\nbacklink &lt;- round(pmax(0, 0.018 * parole + rnorm(n, 0, 6)))\n# il traffico e' guidato DA backlink e velocita', NON dalle parole\ntraffico &lt;- round(38 * backlink - 260 * velocita + 900 + rnorm(n, 0, 220))\ntraffico[traffico &lt; 0] &lt;- 0\n\npagine &lt;- data.frame(traffico, parole, backlink, velocita)<\/code><\/pre>\n\n\n\n<p class=\"wp-block-paragraph\">Ho costruito i dati in modo che il traffico dipenda <em>davvero<\/em> solo dai backlink e dalla velocit\u00e0, mentre la lunghezza non ha alcun effetto diretto. Ma ho anche legato la lunghezza ai backlink \u2014 le pagine lunghe ne attirano di pi\u00f9 \u2014 cos\u00ec come accade nella realt\u00e0. Quanto sono legati?<\/p>\n\n\n\n<pre class=\"wp-block-code\"><code>cor(pagine$parole, pagine$backlink)\n# [1] 0.81<\/code><\/pre>\n\n\n\n<p class=\"wp-block-paragraph\">Un legame forte: <strong>0,81<\/strong>. Vediamo ora cosa succede se, ingenuamente, studiamo il traffico guardando solo la lunghezza, con una regressione semplice:<\/p>\n\n\n\n<pre class=\"wp-block-code\"><code>coef(summary(lm(traffico ~ parole, data = pagine)))\n#              Estimate Std. Error t value  Pr(&gt;|t|)\n# (Intercept) 241.1577   137.9404   1.748 0.0857...\n# parole        0.6128     0.1088   5.635 0.0000...<\/code><\/pre>\n\n\n\n<p class=\"wp-block-paragraph\">Il verdetto sembra schiacciante: ogni cento parole in pi\u00f9 valgono una sessantina di sessioni in pi\u00f9, con un <em>p-value<\/em> minuscolo (sotto lo 0,001). La lunghezza \u00abconta\u00bb, e conta parecchio.<br>Se ci fermassimo qui, andremmo a scrivere una direttiva editoriale \u2014 <em>facciamo tutti i contenuti pi\u00f9 lunghi<\/em> \u2014 su una base che sta per rivelarsi un miraggio. Aggiungiamo al modello gli altri due fattori e guardiamo cosa resta della lunghezza:<\/p>\n\n\n\n<pre class=\"wp-block-code\"><code>modello &lt;- lm(traffico ~ parole + backlink + velocita, data = pagine)\ncoef(summary(modello))\n#              Estimate Std. Error t value Pr(&gt;|t|)\n# (Intercept) 1100.797   120.119    9.164  0.0000\n# parole         0.107     0.102    1.041  0.3025\n# backlink      29.444     4.804    6.129  0.0000\n# velocita    -322.943    34.515   -9.357  0.0000<\/code><\/pre>\n\n\n\n<p class=\"wp-block-paragraph\">Ecco il ribaltamento. Il coefficiente della lunghezza \u00e8 crollato da 0,613 a <strong>0,107<\/strong>, e il suo <em>p-value<\/em> \u00e8 schizzato a <strong>0,30<\/strong>: non pi\u00f9 distinguibile dallo zero.<br>La lunghezza, <em>a parit\u00e0 di backlink e velocit\u00e0<\/em>, non porta praticamente nulla. Quel che nella regressione semplice sembrava il suo merito era in realt\u00e0 un riflesso dei backlink: le pagine lunghe ricevono pi\u00f9 traffico non perch\u00e9 lunghe, ma perch\u00e9 \u2014 essendo lunghe \u2014 attirano pi\u00f9 link, e sono i link a fare il lavoro.<\/p>\n\n\n\n<div class=\"wp-block-group has-background\" style=\"background-color:#f5f7f9;margin-top:2.5rem;margin-bottom:2.5rem;padding-top:1.5rem;padding-right:1.5rem;padding-bottom:1rem;padding-left:1.5rem\"><div class=\"wp-block-group__inner-container is-layout-constrained wp-container-core-group-is-layout-eed7543b wp-block-group-is-layout-constrained\">\n\n<figure class=\"wp-block-image size-large\"><img loading=\"lazy\" decoding=\"async\" width=\"1020\" height=\"690\" src=\"https:\/\/www.gironi.it\/blog\/wp-content\/uploads\/2026\/07\/regressione-multipla-confondente.png\" alt=\"Il traffico contro il numero di parole, con i punti colorati per livello di backlink. La retta rossa \u00e8 la regressione semplice: pendenza +0,61, la lunghezza \u00absembra\u00bb spingere il traffico. La retta verde tratteggiata \u00e8 l'effetto della lunghezza a parit\u00e0 di backlink e velocit\u00e0: quasi piatta. I punti con molti backlink (blu scuro) si affollano in alto a destra \u2014 sono loro a creare la pendenza apparente.\" class=\"wp-image-4395\" srcset=\"https:\/\/www.gironi.it\/blog\/wp-content\/uploads\/2026\/07\/regressione-multipla-confondente.png 1020w, https:\/\/www.gironi.it\/blog\/wp-content\/uploads\/2026\/07\/regressione-multipla-confondente-300x203.png 300w\" sizes=\"auto, (max-width: 709px) 85vw, (max-width: 909px) 67vw, (max-width: 1362px) 62vw, 840px\" \/><figcaption class=\"wp-element-caption\">Il traffico contro il numero di parole, con i punti colorati per livello di backlink. La retta rossa \u00e8 la regressione semplice: pendenza +0,61, la lunghezza \u00absembra\u00bb spingere il traffico. La retta verde tratteggiata \u00e8 l&#8217;effetto della lunghezza a parit\u00e0 di backlink e velocit\u00e0: quasi piatta. I punti con molti backlink (blu scuro) si affollano in alto a destra \u2014 sono loro a creare la pendenza apparente.<\/figcaption><\/figure>\n\n<\/div><\/div>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>\u00c8 questo il senso profondo della regressione multipla: distingue il fattore che agisce da quello che si limita ad accompagnarlo.<\/strong> Un compito che nessuna correlazione presa singolarmente potr\u00e0 mai svolgere.<\/p>\n\n\n\n<hr class=\"wp-block-separator has-alpha-channel-opacity\"\/>\n\n\n\n<h2 class=\"wp-block-heading\" id=\"coefficienti\">Leggere i coefficienti: chi pesa davvero<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Dal modello completo ricaviamo tre coefficienti, ma confrontarli cos\u00ec come sono sarebbe un errore: hanno unit\u00e0 di misura diverse. Il coefficiente delle parole (0,107) \u00e8 per <em>parola<\/em>, quello dei backlink (29,4) \u00e8 per <em>link<\/em>, quello della velocit\u00e0 (\u2212323) \u00e8 per <em>secondo<\/em>. Dire che la velocit\u00e0 \u00abconta di pi\u00f9\u00bb perch\u00e9 il suo numero \u00e8 pi\u00f9 grande non ha senso: un secondo e una parola non sono la stessa cosa.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Per confrontarli bisogna metterli sulla stessa scala. Il modo standard \u00e8 standardizzare tutte le variabili \u2014 esprimerle in deviazioni standard \u2014 e rifare la regressione: i coefficienti che ne escono, detti <strong>coefficienti standardizzati<\/strong> (o <em>beta<\/em>), dicono di quante deviazioni standard cambia il traffico per una deviazione standard in pi\u00f9 di ciascun fattore. Ora sono confrontabili. Li calcolo in R standardizzando i dati con <code>scale<\/code>:<\/p>\n\n\n\n<pre class=\"wp-block-code\"><code>z &lt;- as.data.frame(scale(pagine))\nround(coef(lm(traffico ~ parole + backlink + velocita, data = z))[-1], 3)\n#   parole backlink velocita\n#    0.104    0.610   -0.552<\/code><\/pre>\n\n\n\n<p class=\"wp-block-paragraph\">Il quadro diventa leggibile a colpo d&#8217;occhio: i <strong>backlink<\/strong> sono il motore (+0,61), la <strong>velocit\u00e0<\/strong> una potente zavorra (\u22120,55: pi\u00f9 una pagina \u00e8 lenta, meno traffico raccoglie), e le <strong>parole<\/strong> un&#8217;inezia (+0,10) che, come gi\u00e0 sappiamo, non \u00e8 nemmeno distinguibile dal caso.<br>Un coefficiente da solo, per\u00f2, non basta a fidarsi: attorno a ogni stima c&#8217;\u00e8 un margine d&#8217;incertezza. Se l&#8217;intervallo di confidenza di un coefficiente include lo zero, quel fattore potrebbe benissimo non avere alcun effetto \u2014 \u00e8 precisamente la situazione della lunghezza.<\/p>\n\n\n\n<div class=\"wp-block-group has-background\" style=\"background-color:#f5f7f9;margin-top:2.5rem;margin-bottom:2.5rem;padding-top:1.5rem;padding-right:1.5rem;padding-bottom:1rem;padding-left:1.5rem\"><div class=\"wp-block-group__inner-container is-layout-constrained wp-container-core-group-is-layout-eed7543b wp-block-group-is-layout-constrained\">\n\n<figure class=\"wp-block-image size-large\"><img loading=\"lazy\" decoding=\"async\" width=\"990\" height=\"600\" src=\"https:\/\/www.gironi.it\/blog\/wp-content\/uploads\/2026\/07\/regressione-multipla-coefficienti.png\" alt=\"Coefficient plot: ogni fattore con il suo coefficiente standardizzato e l'intervallo di confidenza al 95%. Backlink (+0,61) e velocit\u00e0 (\u22120,55) stanno nettamente da un lato della linea dello zero; le parole (+0,10) la attraversano \u2014 effetto non distinguibile dal caso. La lunghezza dell'intervallo racconta anche la precisione della stima.\" class=\"wp-image-4396\" srcset=\"https:\/\/www.gironi.it\/blog\/wp-content\/uploads\/2026\/07\/regressione-multipla-coefficienti.png 990w, https:\/\/www.gironi.it\/blog\/wp-content\/uploads\/2026\/07\/regressione-multipla-coefficienti-300x182.png 300w\" sizes=\"auto, (max-width: 709px) 85vw, (max-width: 909px) 67vw, (max-width: 1362px) 62vw, 840px\" \/><figcaption class=\"wp-element-caption\">Coefficient plot: ogni fattore con il suo coefficiente standardizzato e l&#8217;intervallo di confidenza al 95%. Backlink (+0,61) e velocit\u00e0 (\u22120,55) stanno nettamente da un lato della linea dello zero; le parole (+0,10) la attraversano \u2014 effetto non distinguibile dal caso. La lunghezza dell&#8217;intervallo racconta anche la precisione della stima.<\/figcaption><\/figure>\n\n<\/div><\/div>\n\n\n\n<div class=\"wp-block-group has-background\" style=\"background-color:#f5f7f9;margin-top:2.5rem;margin-bottom:2.5rem;padding-top:1.5rem;padding-right:1.5rem;padding-bottom:1.5rem;padding-left:1.5rem\"><div class=\"wp-block-group__inner-container is-layout-flow wp-block-group-is-layout-flow\">\n<p>Un avvertimento: nel nostro esempio parole e backlink erano correlati all&#8217;<strong>81%<\/strong>, e questo non \u00e8 un dettaglio innocuo. Quando due predittori si somigliano troppo, il modello fa fatica a separare i loro effetti, e i coefficienti diventano instabili e imprecisi \u2014 \u00e8 la <strong>multicollinearit\u00e0<\/strong>, una delle insidie che affronteremo parlando di <a href=\"https:\/\/www.gironi.it\/blog\/multicollinearita-eteroschedasticita-autocorrelazione\/\">diagnostica del modello<\/a>. Qui ha giocato a nostro favore, aiutando a smascherare il finto effetto della lunghezza; ma in generale <strong>un coefficiente non significativo non prova che un fattore sia irrilevante: pu\u00f2 solo dirci che, dati questi predittori cos\u00ec intrecciati, non riusciamo a isolarne il contributo.<\/strong><\/p>\n<\/div><\/div>\n\n\n\n<hr class=\"wp-block-separator has-alpha-channel-opacity\"\/>\n\n\n\n<h2 class=\"wp-block-heading\" id=\"validita\">Quanto \u00e8 valido il modello?<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Sapere quali fattori contano \u00e8 met\u00e0 del lavoro; l&#8217;altra met\u00e0 \u00e8 chiedersi quanto bene, nel complesso, il modello ricostruisce la realt\u00e0. La misura di riferimento \u00e8 il <strong>coefficiente di determinazione<\/strong> \\( R^2 \\): la quota di variabilit\u00e0 del traffico che il modello riesce a spiegare, da 0 (nulla) a 1 (tutto). Lo leggo dal riepilogo:<\/p>\n\n\n\n<pre class=\"wp-block-code\"><code>summary(modello)$r.squared      # 0.805\nsummary(modello)$adj.r.squared  # 0.795<\/code><\/pre>\n\n\n\n<p class=\"wp-block-paragraph\">Un \\( R^2 \\) di <strong>0,805<\/strong> dice che i nostri tre fattori spiegano insieme l&#8217;80,5% della variabilit\u00e0 del traffico fra le pagine \u2014 il resto \u00e8 rumore, o fattori che non abbiamo incluso.<br>Accanto compare l&#8217;\\( R^2 \\) <em>aggiustato<\/em> (0,795), un valore leggermente pi\u00f9 basso: penalizza l&#8217;aggiunta di variabili inutili, e va guardato al posto dell&#8217;\\( R^2 \\) grezzo quando si confrontano modelli con un numero diverso di predittori. Serve a non farsi ingannare: aggiungere variabili fa <em>sempre<\/em> salire l&#8217;\\( R^2 \\) grezzo, anche quando quelle variabili non aggiungono nulla di reale.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Il modo pi\u00f9 onesto per giudicare un modello, per\u00f2, \u00e8 guardarlo all&#8217;opera: mettere il traffico che <em>predice<\/em> contro quello <em>osservato<\/em>, pagina per pagina. Pi\u00f9 i punti si stringono attorno alla bisettrice, meglio il modello coglie la realt\u00e0.<\/p>\n\n\n\n<div class=\"wp-block-group has-background\" style=\"background-color:#f5f7f9;margin-top:2.5rem;margin-bottom:2.5rem;padding-top:1.5rem;padding-right:1.5rem;padding-bottom:1rem;padding-left:1.5rem\"><div class=\"wp-block-group__inner-container is-layout-constrained wp-container-core-group-is-layout-eed7543b wp-block-group-is-layout-constrained\">\n\n<figure class=\"wp-block-image size-large\"><img loading=\"lazy\" decoding=\"async\" width=\"930\" height=\"750\" src=\"https:\/\/www.gironi.it\/blog\/wp-content\/uploads\/2026\/07\/regressione-multipla-osservati-predetti.png\" alt=\"Traffico osservato contro traffico predetto dal modello a tre variabili. I punti si stringono attorno alla bisettrice (la predizione perfetta); i segmenti grigi verticali sono gli scarti fra osservato e predetto. Il modello spiega l'80,5% della variabilit\u00e0.\" class=\"wp-image-4397\" srcset=\"https:\/\/www.gironi.it\/blog\/wp-content\/uploads\/2026\/07\/regressione-multipla-osservati-predetti.png 930w, https:\/\/www.gironi.it\/blog\/wp-content\/uploads\/2026\/07\/regressione-multipla-osservati-predetti-300x242.png 300w\" sizes=\"auto, (max-width: 709px) 85vw, (max-width: 909px) 67vw, (max-width: 1362px) 62vw, 840px\" \/><figcaption class=\"wp-element-caption\">Traffico osservato contro traffico predetto dal modello a tre variabili. I punti si stringono attorno alla bisettrice (la predizione perfetta); i segmenti grigi verticali sono gli scarti fra osservato e predetto. Il modello spiega l&#8217;80,5% della variabilit\u00e0.<\/figcaption><\/figure>\n\n<\/div><\/div>\n\n\n\n<p class=\"wp-block-paragraph\">Un \\( R^2 \\) alto, va detto, non \u00e8 una promozione automatica: dietro c&#8217;\u00e8 una lista di <strong>requisiti<\/strong> che il modello d\u00e0 per scontati \u2014 che le relazioni siano lineari, che i residui si comportino bene, che i predittori non siano ridondanti (la multicollinearit\u00e0 di poco fa). Quando queste assunzioni saltano, i coefficienti restano numeri, ma smettono di essere affidabili. \u00c8 il territorio della diagnostica, e merita un discorso a parte.<\/p>\n\n\n\n<hr class=\"wp-block-separator has-alpha-channel-opacity\"\/>\n\n\n\n<h2 class=\"wp-block-heading\" id=\"domande-frequenti\">Domande frequenti<\/h2>\n\n\n\n<h3 class=\"wp-block-heading\">Che cos&#8217;\u00e8 la regressione multipla?<\/h3>\n\n\n\n<p class=\"wp-block-paragraph\">\u00c8 una tecnica statistica che stima quanto ciascun fattore contribuisce a un risultato tenendo fermi tutti gli altri. Non misura se un fattore \u00e8 associato all&#8217;esito, ma quanto vi contribuisce al netto delle altre variabili: risponde a domande del tipo &#8220;a parit\u00e0 di backlink, la lunghezza del testo conta ancora?&#8221;.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\">Che differenza c&#8217;\u00e8 tra regressione semplice e multipla?<\/h3>\n\n\n\n<p class=\"wp-block-paragraph\">La regressione semplice usa un solo predittore per spiegare il risultato; la multipla ne usa molti insieme. \u00c8 la differenza tra guardare il mondo una variabile alla volta e guardarlo per intero: la multipla separa l&#8217;effetto di ciascun fattore dall&#8217;intreccio con gli altri, cosa che una correlazione alla volta non pu\u00f2 fare.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\">Come si leggono i coefficienti della regressione multipla?<\/h3>\n\n\n\n<p class=\"wp-block-paragraph\">Ogni coefficiente dice quanto cambia il risultato quando quel fattore aumenta di un&#8217;unit\u00e0, con tutti gli altri tenuti fermi. Un coefficiente vicino a zero (con l&#8217;intervallo di confidenza che attraversa lo zero) indica un effetto non distinguibile dal caso; un coefficiente lontano da zero da un lato netto dice che quel fattore pesa davvero.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\">Cosa significa R\u00b2 = 0,80?<\/h3>\n\n\n\n<p class=\"wp-block-paragraph\">Che i predittori inclusi nel modello spiegano insieme l&#8217;80% della variabilit\u00e0 del risultato. Il restante 20% \u00e8 rumore o fattori non considerati. Meglio guardare l&#8217;R\u00b2 aggiustato, che penalizza le variabili inutili: a differenza dell&#8217;R\u00b2 grezzo, non sale solo perch\u00e9 abbiamo aggiunto un predittore qualsiasi.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\">Perch\u00e9 la regressione multipla smaschera correlazioni ingannevoli?<\/h3>\n\n\n\n<p class=\"wp-block-paragraph\">Perch\u00e9 le pagine lunghe tendono ad attirare pi\u00f9 backlink e quelli portano traffico: la correlazione semplice tra lunghezza e traffico &#8220;regala&#8221; ai link il merito che \u00e8 loro. Tenendo fermi i backlink, la regressione multipla fa emergere che la lunghezza, da sola, conta quasi nulla. \u00c8 l&#8217;anticamera del paradosso di Simpson: un&#8217;associazione che svanisce quando si controlla una terza variabile.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\">Quali sono i limiti della regressione multipla?<\/h3>\n\n\n\n<p class=\"wp-block-paragraph\">Il modello d\u00e0 per scontati alcuni requisiti: relazioni lineari, residui ben comportati, predittori non ridondanti (niente multicollinearit\u00e0). Quando queste assunzioni saltano, i coefficienti restano numeri ma smettono di essere affidabili \u2014 ed \u00e8 l\u00ec che serve la diagnostica del modello.<\/p>\n\n\n\n<script type=\"application\/ld+json\">{\"@context\": \"https:\/\/schema.org\", \"@type\": \"FAQPage\", \"mainEntity\": [{\"@type\": \"Question\", \"name\": \"Che cos'\u00e8 la regressione multipla?\", \"acceptedAnswer\": {\"@type\": \"Answer\", \"text\": \"\u00c8 una tecnica statistica che stima quanto ciascun fattore contribuisce a un risultato tenendo fermi tutti gli altri. Non misura se un fattore \u00e8 associato all'esito, ma quanto vi contribuisce al netto delle altre variabili: risponde a domande del tipo \\\"a parit\u00e0 di backlink, la lunghezza del testo conta ancora?\\\".\"}}, {\"@type\": \"Question\", \"name\": \"Che differenza c'\u00e8 tra regressione semplice e multipla?\", \"acceptedAnswer\": {\"@type\": \"Answer\", \"text\": \"La regressione semplice usa un solo predittore per spiegare il risultato; la multipla ne usa molti insieme. \u00c8 la differenza tra guardare il mondo una variabile alla volta e guardarlo per intero: la multipla separa l'effetto di ciascun fattore dall'intreccio con gli altri, cosa che una correlazione alla volta non pu\u00f2 fare.\"}}, {\"@type\": \"Question\", \"name\": \"Come si leggono i coefficienti della regressione multipla?\", \"acceptedAnswer\": {\"@type\": \"Answer\", \"text\": \"Ogni coefficiente dice quanto cambia il risultato quando quel fattore aumenta di un'unit\u00e0, con tutti gli altri tenuti fermi. Un coefficiente vicino a zero (con l'intervallo di confidenza che attraversa lo zero) indica un effetto non distinguibile dal caso; un coefficiente lontano da zero da un lato netto dice che quel fattore pesa davvero.\"}}, {\"@type\": \"Question\", \"name\": \"Cosa significa R\u00b2 = 0,80?\", \"acceptedAnswer\": {\"@type\": \"Answer\", \"text\": \"Che i predittori inclusi nel modello spiegano insieme l'80% della variabilit\u00e0 del risultato. Il restante 20% \u00e8 rumore o fattori non considerati. Meglio guardare l'R\u00b2 aggiustato, che penalizza le variabili inutili: a differenza dell'R\u00b2 grezzo, non sale solo perch\u00e9 abbiamo aggiunto un predittore qualsiasi.\"}}, {\"@type\": \"Question\", \"name\": \"Perch\u00e9 la regressione multipla smaschera correlazioni ingannevoli?\", \"acceptedAnswer\": {\"@type\": \"Answer\", \"text\": \"Perch\u00e9 le pagine lunghe tendono ad attirare pi\u00f9 backlink e quelli portano traffico: la correlazione semplice tra lunghezza e traffico \\\"regala\\\" ai link il merito che \u00e8 loro. Tenendo fermi i backlink, la regressione multipla fa emergere che la lunghezza, da sola, conta quasi nulla. \u00c8 l'anticamera del paradosso di Simpson: un'associazione che svanisce quando si controlla una terza variabile.\"}}, {\"@type\": \"Question\", \"name\": \"Quali sono i limiti della regressione multipla?\", \"acceptedAnswer\": {\"@type\": \"Answer\", \"text\": \"Il modello d\u00e0 per scontati alcuni requisiti: relazioni lineari, residui ben comportati, predittori non ridondanti (niente multicollinearit\u00e0). Quando queste assunzioni saltano, i coefficienti restano numeri ma smettono di essere affidabili \u2014 ed \u00e8 l\u00ec che serve la diagnostica del modello.\"}}]}<\/script>\n\n\n\n<h2 class=\"wp-block-heading\" id=\"prova-tu\">Prova tu<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Il modo migliore per fissare il meccanismo \u00e8 metterci le mani sopra. Riprendendo il codice qui sopra, ci sono tre direzioni interessanti da esplorare:<\/p>\n\n\n\n<ol class=\"wp-block-list\"><li>Togli i backlink dal modello \u2014 <code>lm(traffico ~ parole + velocita)<\/code> \u2014 e osserva cosa succede al coefficiente delle parole: torna grande e \u00absignificativo\u00bb. \u00c8 la controprova che quel finto effetto vive solo finch\u00e9 il confondente resta fuori dal modello.<\/li><li>Aggiungi una variabile del tutto <strong>inventata e casuale<\/strong> (<code>pagine$rumore &lt;- rnorm(60)<\/code>) e rimettila nel modello: guarda l&#8217;\\( R^2 \\) grezzo salire di un pelo e l&#8217;\\( R^2 \\) aggiustato restare fermo o scendere. \u00c8 il senso pratico dell&#8217;aggiustamento.<\/li><li>Cambia il meccanismo generatore: fai dipendere il traffico <em>anche<\/em> dalle parole (aggiungi un <code>+ 0.3 * parole<\/code> alla formula del <code>traffico<\/code>) e verifica che ora, nel modello completo, il coefficiente della lunghezza sopravvive. Serve a <em>sentire<\/em> la differenza fra un effetto vero e uno solo apparente.<\/li><\/ol>\n\n\n\n<p class=\"wp-block-paragraph\">Suggerimento: la struttura non cambia mai \u2014 si stima il modello, si leggono i coefficienti <em>a parit\u00e0 degli altri<\/em>, si controlla l&#8217;\\( R^2 \\) e la nuvola osservati-predetti. \u00c8 giocando con le variabili dentro e fuori dal modello che si capisce quanto di ci\u00f2 che chiamiamo \u00abfattore di ranking\u00bb sia causa e quanto, semplicemente, compagnia.<\/p>\n\n\n\n<hr class=\"wp-block-separator has-alpha-channel-opacity\"\/>\n\n\n\n<p class=\"wp-block-paragraph\">Finora la nostra variabile risposta \u00e8 stata un numero che scorre senza salti \u2014 il traffico, che pu\u00f2 valere 300 sessioni come 1.520. Ma moltissime domande della SEO non hanno questa forma: una pagina <em>converte o non converte<\/em>, un utente <em>torna o non torna<\/em>, una keyword <em>entra in prima pagina o resta fuori<\/em>. La risposta \u00e8 un s\u00ec o un no, e allora una retta che predice numeri continui non basta pi\u00f9: servirebbe un modello che predica una <em>probabilit\u00e0<\/em>, costretta a stare fra 0 e 1. \u00c8 il mestiere della <a href=\"https:\/\/www.gironi.it\/blog\/la-regressione-logistica\/\">regressione logistica<\/a>, il passo naturale da cui proseguire.<\/p>\n\n\n\n<hr class=\"wp-block-separator has-alpha-channel-opacity\"\/>\n\n\n\n<h3 class=\"wp-block-heading\" id=\"per-approfondire\">Per approfondire<\/h3>\n\n\n\n<p class=\"wp-block-paragraph\">Se vuoi approfondire la regressione multipla, l&#8217;interpretazione dei coefficienti <em>a parit\u00e0 degli altri<\/em> e la lettura dell&#8217;\\( R^2 \\) \u2014 l&#8217;ossatura esatta di ci\u00f2 che abbiamo costruito qui \u2014 <em><a href=\"https:\/\/www.amazon.it\/dp\/8891906190?tag=consulenzeinf-21&#038;ascsubtag=regressione-multipla-spiegata-semplice\" rel=\"nofollow sponsored noopener\" target=\"_blank\">Introduzione all&#8217;econometria<\/a><\/em> di Stock e Watson \u00e8 il riferimento che consiglio: costruisce il metodo con cura partendo sempre da problemi applicati, e dedica pagine limpide proprio al significato del \u00abtenere ferme le altre variabili\u00bb e alle trappole dei fattori correlati.<\/p>\n","protected":false},"excerpt":{"rendered":"<p>La lunghezza del testo aiuta il ranking? I backlink portano traffico? Le pagine pi\u00f9 veloci convertono di pi\u00f9?Prese una alla volta, queste domande hanno quasi sempre la stessa risposta pigra: \u00abs\u00ec, un po&#8217;\u00bb. Il guaio \u00e8 che nella realt\u00e0 i fattori non arrivano mai uno alla volta. Le pagine lunghe tendono anche ad attirare pi\u00f9 &hellip; <a href=\"https:\/\/www.gironi.it\/blog\/regressione-multipla-spiegata-semplice\/\" class=\"more-link\">Leggi tutto<span class=\"screen-reader-text\"> &#8220;L&#8217;analisi di regressione multipla, spiegata semplice.&#8221;<\/span><\/a><\/p>\n","protected":false},"author":1,"featured_media":0,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"_uag_custom_page_level_css":"","footnotes":""},"categories":[629],"tags":[689],"class_list":["post-2225","post","type-post","status-publish","format-standard","hentry","category-statistica-it","tag-regressione-multipla-it"],"lang":"it","translations":{"it":2225,"en":3311},"uagb_featured_image_src":{"full":false,"thumbnail":false,"medium":false,"medium_large":false,"large":false,"1536x1536":false,"2048x2048":false,"post-thumbnail":false},"uagb_author_info":{"display_name":"paolo","author_link":"https:\/\/www.gironi.it\/blog\/author\/paolo\/"},"uagb_comment_info":793,"uagb_excerpt":"La lunghezza del testo aiuta il ranking? I backlink portano traffico? Le pagine pi\u00f9 veloci convertono di pi\u00f9?Prese una alla volta, queste domande hanno quasi sempre la stessa risposta pigra: \u00abs\u00ec, un po&#8217;\u00bb. Il guaio \u00e8 che nella realt\u00e0 i fattori non arrivano mai uno alla volta. Le pagine lunghe tendono anche ad attirare pi\u00f9&hellip;","_links":{"self":[{"href":"https:\/\/www.gironi.it\/blog\/wp-json\/wp\/v2\/posts\/2225","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/www.gironi.it\/blog\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/www.gironi.it\/blog\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/www.gironi.it\/blog\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/www.gironi.it\/blog\/wp-json\/wp\/v2\/comments?post=2225"}],"version-history":[{"count":5,"href":"https:\/\/www.gironi.it\/blog\/wp-json\/wp\/v2\/posts\/2225\/revisions"}],"predecessor-version":[{"id":4450,"href":"https:\/\/www.gironi.it\/blog\/wp-json\/wp\/v2\/posts\/2225\/revisions\/4450"}],"wp:attachment":[{"href":"https:\/\/www.gironi.it\/blog\/wp-json\/wp\/v2\/media?parent=2225"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/www.gironi.it\/blog\/wp-json\/wp\/v2\/categories?post=2225"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/www.gironi.it\/blog\/wp-json\/wp\/v2\/tags?post=2225"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}