-----------------------------------

Acquista i software ArcGIS tramite Studio A&T srl, rivenditore autorizzato dei prodotti Esri.

I migliori software GIS, il miglior supporto tecnico!

I migliori software GIS, il miglior supporto tecnico!
Azienda operante nel settore GIS dal 2001, specializzata nell’utilizzo della tecnologia ArcGIS e aderente ai programmi Esri Italia Business Network ed Esri Partner Network

-----------------------------------



mercoledì 7 ottobre 2026

From Embedding Space to Explanation Space: capire come ragiona la GeoAI con AutoML e SHAP in ArcGIS Pro

Un embedding geospaziale può rappresentare un luogo con centinaia di numeri. Ma se quel vettore entra in un modello predittivo, come possiamo capire quali aspetti del territorio stanno realmente guidando la previsione?

È una delle domande più interessanti della GeoAI moderna, perché riguarda un punto di tensione fondamentale tra representation learning e interpretabilità: più lasciamo che sia il modello a costruire autonomamente rappresentazioni compatte e sofisticate del territorio, più perdiamo la semantica immediata delle tradizionali variabili GIS.

Un recente articolo del team Esri GeoAI, Interpret embeddings using AutoML and SHAP in ArcGIS Pro, pubblicato il 6 ottobre 2026, affronta proprio questo problema combinando quattro tecnologie:

  • USA Geodemographic Embeddings
  • Geodemographic Foundation Model (GDFM)
  • AutoML di ArcGIS Pro
  • SHAP – SHapley Additive exPlanations

Il workflow Esri utilizza come caso di studio la previsione della food insecurity negli Stati Uniti, ma il concetto è molto più generale.

Dietro l'esempio applicativo c'è infatti qualcosa di più importante: un possibile passaggio da un GIS costruito principalmente su feature progettate dall'uomo a un GIS nel quale parte della conoscenza geografica viene rappresentata attraverso latent spaces appresi da foundation model.

Ed è qui che nasce una nuova domanda:

come interpretiamo non soltanto ciò che il modello predice, ma il modo in cui utilizza una rappresentazione appresa del territorio?

1. Dal feature engineering al representation learning geografico

Nel machine learning GIS tradizionale, il processo parte normalmente da variabili esplicite:

Population density
Median household income
Age
Education
Land cover
Distance from roads
Distance from hospitals
House value
Employment rate
Slope
Elevation
...

Ogni feature ha un significato noto.

Possiamo quindi costruire una matrice:

X = [x1, x2, x3, ... xn]

e addestrare un modello:

ŷ = f(X)

Il problema è che un territorio reale può essere descritto da migliaia di variabili correlate tra loro.

La selezione manuale delle feature diventa allora costosa, fragile e fortemente dipendente dal dominio.

Il paradigma degli embedding cambia radicalmente il problema.

Thousands of geographic variables
                |
                v
       Foundation Model
                |
                v
        Latent Embedding
                |
                v
        256 dimensions

Non chiediamo più direttamente:

quali dieci variabili devo scegliere?

Chiediamo invece a un modello di apprendere una rappresentazione compatta capace di preservare strutture, correlazioni e similarità presenti nei dati.

In termini matematici:

z = E(x)

x ∈ R^n
z ∈ R^256

dove E è l'encoder e z è la rappresentazione latente del luogo.

Questo z diventa una sorta di fingerprint geografico.

2. USA Geodemographic Embeddings: circa 5.300 variabili diventano 256 numeri

Gli USA Geodemographic Embeddings di Esri rappresentano ogni area geografica attraverso un vettore denso di 256 dimensioni.

La sorgente non è un singolo dataset ma quattro differenti “view” del territorio.

View Numero di variabili Informazione principale
Housing & Household Characteristics 1.521 Housing units, occupancy, tenure, household composition
Environment 113 Climate, precipitation, land cover e contesto ambientale
American Community Survey 1.617 Income, employment, education, commuting, household structure
Age & Race Census 2.049 Population, age, race e struttura demografica

Complessivamente siamo quindi nell'ordine delle:

1,521
+ 113
+ 1,617
+ 2,049
----------------
≈ 5,300 variables

che vengono compresse in:

256 latent dimensions

È un rapporto di compressione concettualmente molto significativo.

Ma non dobbiamo interpretarlo come una semplice PCA.

Dietro gli embedding si trova il Geodemographic Foundation Model di Esri.

3. Dentro GDFM: un multiview autoencoder geografico

La caratteristica particolarmente interessante del GDFM è l'uso di una architettura multiview autoencoder.

Le quattro sorgenti non vengono semplicemente concatenate in un gigantesco vettore da dare a un singolo encoder.

Concettualmente abbiamo:

Housing & Household
       |
       v
   Encoder H
       |
       +----------> zH ∈ R^64


Environment
       |
       v
   Encoder E
       |
       +----------> zE ∈ R^64


American Community Survey
       |
       v
   Encoder A
       |
       +----------> zA ∈ R^64


Age & Race Census
       |
       v
   Encoder D
       |
       +----------> zD ∈ R^64


z = [zH | zE | zA | zD]

z ∈ R^256

Questa architettura produce una proprietà estremamente utile ai fini dell'interpretabilità:

dimensions   1 -  64 → Housing / Household
dimensions  65 - 128 → Environment
dimensions 129 - 192 → ACS / Socioeconomic
dimensions 193 - 256 → Age / Race / Demographic

Non conosciamo necessariamente il significato semantico della singola dimensione, ma conosciamo la view dalla quale quella parte dello spazio latente è stata appresa.

È una distinzione fondamentale.

4. Perché embedding_137 non significa “income”

Supponiamo che il modello identifichi:

embedding_137

come feature molto importante.

Sarebbe sbagliato concludere:

embedding_137 = income

Una dimensione latente generalmente rappresenta una combinazione non lineare di molte feature originarie.

Potrebbe catturare qualcosa che emerge dall'interazione tra:

income
education
employment
commuting
household composition
urban structure
...

La rappresentazione è distributed.

L'informazione non deve necessariamente trovarsi in una singola coordinata.

Quello che invece possiamo affermare è che la dimensione 137 appartiene al blocco:

129 - 192

e quindi deriva dalla rappresentazione latente costruita dalla view American Community Survey.

È già un'informazione molto potente.

5. Il downstream model: dall'Embedding Space al Prediction Space

Dopo aver costruito il vettore geografico:

z = [z1, z2, ..., z256]

possiamo utilizzarlo come input di un modello supervisionato:

ŷ = f(z)

Nel caso discusso da Esri:

USA Geodemographic Embedding
            |
            v
      256 predictors
            |
            v
        ArcGIS AutoML
            |
            v
     Food insecurity %

Qui avviene una separazione concettuale molto importante.

Il foundation model non sta prevedendo direttamente la food insecurity.

Sta producendo una rappresentazione generale del territorio.

Un secondo modello utilizza successivamente quella rappresentazione per un task specifico.

Abbiamo quindi:

REAL WORLD
    |
    v
Geographic data
    |
    v
GDFM
    |
    v
EMBEDDING SPACE
    |
    v
Downstream ML model
    |
    v
PREDICTION SPACE

6. ArcGIS Pro AutoML

ArcGIS Pro permette di utilizzare queste dimensioni direttamente tramite Train Using AutoML.

AutoML automatizza diverse fasi del processo di modellazione, tra cui, a seconda della modalità utilizzata:

  • exploratory data analysis;
  • model selection;
  • feature selection;
  • feature engineering;
  • cross validation;
  • hyperparameter tuning;
  • model training;
  • evaluation;
  • model packaging.

Il risultato può essere salvato come modello ArcGIS:

.dlpk

e successivamente utilizzato attraverso Predict Using AutoML.

Nel workflow illustrato da Esri viene utilizzato Basic Mode, perché è orientato soprattutto alla comprensione delle variabili e consente di produrre gli output necessari all'analisi dell'importanza.

Tra gli algoritmi utilizzabili troviamo anche modelli tree-based come LightGBM, particolarmente interessanti quando si lavora con embedding tabellari densi.

7. Perché LightGBM è interessante con un embedding

Un embedding a 256 dimensioni produce una matrice:

X ∈ R^(N × 256)

Le relazioni tra coordinate latenti e target possono essere fortemente non lineari.

Una regressione lineare assumerebbe essenzialmente:

ŷ = β0 + β1z1 + β2z2 + ... + β256z256

Un modello gradient boosting può invece apprendere:

  • threshold effects;
  • nonlinearità;
  • interazioni tra dimensioni;
  • relazioni condizionali;
  • combinazioni di feature latenti.

Per esempio:

IF z137 > thresholdA
AND z151 < thresholdB
AND z42 > thresholdC
THEN ...

può identificare configurazioni dello spazio latente difficili da rappresentare con un modello lineare.

Il prezzo da pagare è naturalmente una minore interpretabilità diretta.

Ed è qui che entra SHAP.

8. SHAP: spiegare il comportamento del modello

SHAP significa SHapley Additive exPlanations.

La teoria deriva dai valori di Shapley della teoria dei giochi cooperativi.

L'idea fondamentale consiste nell'assegnare a ogni feature un contributo alla previsione.

In forma semplificata:

f(x) = E[f(X)] + Σ φi

dove:

  • E[f(X)] rappresenta il valore di baseline del modello;
  • φi rappresenta il contributo attribuito alla feature i.

Per una specifica location potremmo avere qualcosa come:

Model baseline                       10.7

embedding_137                        +2.1
embedding_041                        +0.8
embedding_208                        -0.6
embedding_152                        +0.4
other dimensions                    +0.0

-----------------------------------------
Prediction                           13.4

Questo è il concetto di local explanation.

9. Il segno del valore SHAP conta

Un valore:

φi > 0

indica che quella feature spinge la previsione rispetto alla baseline in una direzione positiva.

Viceversa:

φi < 0

la spinge nella direzione opposta.

Questa informazione diventa però importante quando passiamo dall'explainability locale alla feature importance globale utilizzata nel workflow Esri.

10. Mean Absolute SHAP: cosa misura davvero ArcGIS

L'importance table prodotta da AutoML contiene sostanzialmente:

VARIABLE
IMPORTANCE

L'IMPORTANCE è una misura globale basata sul mean absolute SHAP.

Concettualmente:

Ii = E(|φi|)

Ovvero:

quanto, mediamente, quella feature modifica le previsioni del modello in termini di magnitudine.

Supponiamo di ottenere:

embedding_137   0.32
embedding_144   0.27
embedding_201   0.18
embedding_041   0.14

Possiamo concludere che embedding_137 riceve una forte attribuzione dal modello.

Ma attenzione:

|+0.32| = |-0.32|

L'importance globale non ci dice se quella dimensione tende ad aumentare o diminuire il target.

La direzione è stata eliminata dal valore assoluto.

11. Il trucco elegante di Esri: aggregare SHAP per segmento

A questo punto entra in gioco la struttura 4 × 64 dell'embedding.

Possiamo calcolare:

Housing importance
    = Σ IMPORTANCE dimensions 1..64

Environment importance
    = Σ IMPORTANCE dimensions 65..128

ACS importance
    = Σ IMPORTANCE dimensions 129..192

Demographic importance
    = Σ IMPORTANCE dimensions 193..256

Formalmente:

S1 = Σ Ii       i = 1...64
S2 = Σ Ii       i = 65...128
S3 = Σ Ii       i = 129...192
S4 = Σ Ii       i = 193...256

Trasformiamo quindi:

256 opaque latent dimensions

in quattro macro-dimensioni interpretabili:

Housing
Environment
Socioeconomic
Demographic

Nel caso food insecurity discusso da Esri, è il Segment 3, derivato dall'American Community Survey, a mostrare la maggiore aggregate mean absolute SHAP importance.

Il modello sta quindi facendo largo uso delle strutture socioeconomiche apprese dal GDFM.

Ma questa frase deve essere letta con molta precisione.

12. La sottigliezza matematica: non è Group SHAP

Questo è probabilmente uno dei punti tecnicamente più importanti dell'intero workflow.

Esri precisa correttamente che sommare le mean absolute SHAP importance delle singole dimensioni:

Σ E(|φi|)

non equivale a calcolare:

E(|Σ φi|)

Le due quantità sono matematicamente differenti.

Consideriamo due feature appartenenti allo stesso segmento:

φ129 = +0.8
φ130 = -0.7

Sommando le magnitudini otteniamo:

|0.8| + |-0.7| = 1.5

Ma il contributo netto combinato è:

|0.8 - 0.7| = 0.1

Quindi la segment importance utilizzata in questo workflow misura meglio:

la quantità complessiva di attività attributiva presente nelle dimensioni del segmento

che non:

il contributo netto del segmento alla previsione.

Non è una distinzione accademica: cambia radicalmente il significato del risultato.

13. Feature importance non significa predictive value

C'è un secondo errore interpretativo molto comune.

Supponiamo di ottenere:

Housing          20%
Environment      11%
ACS              47%
Demographics     22%

Non possiamo concludere:

senza ACS il modello perderebbe il 47% della propria accuratezza.

SHAP non misura questo.

Misura come il modello già addestrato distribuisce le proprie attribuzioni.

Per misurare il predictive value incrementale di un segmento servirebbe invece una vera ablation study.

14. Ablation study: il test che farei in un progetto reale

Addestriamo inizialmente il modello completo:

Model FULL

Housing
Environment
ACS
Demographic

R² = 0.82

Poi rimuoviamo sistematicamente interi segmenti.

FULL                         R² = 0.82

without Housing              R² = 0.80
without Environment          R² = 0.81
without ACS                  R² = 0.67
without Demographics         R² = 0.78

Ora possiamo osservare:

ΔR² ACS = 0.82 - 0.67
        = 0.15

Questa misura risponde a una domanda differente:

quanto valore predittivo perde il modello quando elimino l'informazione contenuta in quella rappresentazione?

Esiste poi un'altra possibilità: effettuare una joint permutation di tutte le 64 dimensioni del segmento e misurare la degradazione delle performance.

SHAP, ablation e permutation importance diventano quindi strumenti complementari.

SHAP
    → attribution

Ablation
    → incremental predictive value

Permutation
    → dependence of performance on information

Causal analysis
    → entirely different question

15. Il problema nascosto: le latent feature sono correlate

Gli aspetti che descrivono un territorio non sono indipendenti.

Consideriamo:

income
   ↕
education
   ↕
employment
   ↕
house value
   ↕
urban form
   ↕
mobility
   ↕
accessibility

Queste strutture sono fortemente correlate nel mondo reale.

Il representation learning trasferisce parte di queste dipendenze anche nello spazio latente.

Quindi le dimensioni:

z1 ... z256

non devono essere considerate automaticamente indipendenti.

Questo crea una delle classiche difficoltà dei metodi di feature attribution.

Se due variabili contengono informazione ridondante, il modello può distribuirne il “credito” in modi differenti.

Perciò:

SHAP importance of latent dimension

non deve essere trasformata impropriamente in:

importance of a real-world phenomenon

Il secondo concetto è molto più forte del primo.

16. SHAP non decodifica l'embedding

Questa distinzione merita di essere evidenziata.

SHAP non sta facendo:

embedding_137
      |
      v
"this dimension means income"

Sta facendo:

embedding_137
      |
      v
downstream model
      |
      v
"the fitted predictor relies strongly
 on this latent coordinate"

In altre parole:

SHAP non spiega necessariamente ciò che il foundation model ha imparato. Spiega come il downstream model utilizza ciò che il foundation model ha rappresentato.

È probabilmente la distinzione concettuale più importante da portarsi a casa.

17. Tre differenti livelli di interpretabilità

Possiamo formalizzare il problema distinguendo tre livelli.

LEVEL 1
REPRESENTATION INTERPRETATION

What information is encoded in z?


LEVEL 2
MODEL ATTRIBUTION

Which parts of z does f(z) use?


LEVEL 3
CAUSAL INTERPRETATION

Which real-world mechanisms cause Y?

Il workflow AutoML + SHAP opera principalmente al livello 2.

La conoscenza della struttura 4 × 64 consente parzialmente di risalire verso il livello 1.

Ma non arriviamo automaticamente al livello 3.

18. SHAP non implica causalità

Se il segmento ACS ha la maggiore importance nella previsione della food insecurity, possiamo affermare:

il modello utilizza fortemente pattern latenti appresi dal contesto socioeconomico.

Non possiamo automaticamente affermare:

il contesto socioeconomico causa la food insecurity nella misura indicata da SHAP.

Il modello rappresenta una relazione:

P(Y | X)

non necessariamente un intervento causale:

P(Y | do(X))

Questa distinzione tra predictive ML e causal inference diventa ancora più importante con gli embedding, perché la semantica delle feature non è esplicita.

19. Nel GIS compare un problema ancora più serio: spatial autocorrelation

Finora abbiamo ragionato come se le osservazioni fossero indipendenti.

Ma nel mondo geografico questo spesso non è vero.

La prima legge della geografia di Tobler rimane estremamente pertinente:

Everything is related to everything else, but near things are more related than distant things.

Due aree vicine possono condividere:

  • struttura demografica;
  • mercato immobiliare;
  • infrastrutture;
  • clima;
  • mobilità;
  • servizi;
  • accessibilità;
  • politiche locali;
  • storia economica.

Di conseguenza possono avere embedding molto simili.

20. Random train/test split e spatial leakage

Consideriamo un classico split casuale:

TRAIN

County A
County B
County C


TEST

County D

Se D confina con A, B e C e appartiene allo stesso regime geografico, il test potrebbe essere meno indipendente di quanto sembri.

Il modello potrebbe ottenere ottime performance semplicemente interpolando nello stesso contesto spaziale.

Non abbiamo necessariamente dimostrato:

generalization to unseen geography

ma magari soltanto:

interpolation inside a known spatial regime

Per un workflow GeoAI rigoroso affiancherei quindi al normale test una spatial cross-validation.

21. Spatial cross-validation

Una strategia migliore può essere:

Geography
    |
    v
Spatial blocks
    |
    +---- Fold A
    +---- Fold B
    +---- Fold C
    +---- Fold D
    +---- Fold E

I blocchi possono essere costruiti utilizzando:

  • H3;
  • grid regolari;
  • macroregioni amministrative;
  • clustering spaziale;
  • buffered holdout;
  • spatial blocking.

L'obiettivo è verificare se:

Model trained here
        |
        | geographic separation
        v
Predicts there

mantiene davvero performance elevate.

È una distinzione fondamentale quando vogliamo utilizzare foundation model geospaziali in produzione.

22. Performance globale e performance geografica non sono la stessa cosa

In un problema spaziale non mi fermerei quindi a:

R²
RMSE
MAE
F1
Accuracy

Analizzerei anche:

metric by region
metric by urban/rural context
metric by density
metric by embedding cluster
metric by distance from training data
metric by spatial regime

Per esempio un modello può avere:

Overall R² = 0.84

ma:

Urban areas      R² = 0.90
Suburban areas   R² = 0.87
Rural areas      R² = 0.58

Il singolo valore aggregato nasconde completamente il problema.

23. H3 Resolution 7 e il problema della scala

Gli USA Geodemographic Embeddings vengono distribuiti a livello di Uber H3 resolution 7.

Questa scelta crea una tessellazione geografica regolare e molto utile per la costruzione di rappresentazioni spatially consistent.

Ma spesso il nostro problema lavora a un'altra scala:

H3 cells
   |
   v
County

oppure

H3 cells
   |
   v
Municipality

oppure

H3 cells
   |
   v
Custom catchment area

Serve quindi aggregare gli embedding.

24. Non basta necessariamente fare la media dei 256 numeri

Qui incontriamo un punto matematicamente sottile.

Per un encoder non lineare E, generalmente:

Aggregate(E(x))
        ≠
E(Aggregate(x))

Il significato è importante.

L'embedding medio di dieci territori non equivale necessariamente all'embedding che avremmo ottenuto addestrando o applicando l'encoder sulla descrizione aggregata di quei territori.

Per questo ArcGIS introduce strumenti embedding-aware come:

Merge Embeddings

anziché ridurre il problema a una semplice operazione arbitraria sulle colonne.

25. MAUP non scompare con gli embedding

Il Modifiable Areal Unit Problem, uno dei problemi classici della spatial analysis, continua quindi ad esistere.

Gli embedding non lo eliminano.

Cambiando:

  • scala;
  • aggregazione;
  • confini;
  • unità geografica;

possono cambiare le strutture statistiche osservate.

In futuro dovremo probabilmente parlare molto di più di:

representation stability across geographic scales.

È un problema molto interessante per la ricerca GeoAI.

26. Il workflow concreto in ArcGIS Pro

La pipeline pratica diventa approssimativamente:

USA Geodemographic Embeddings
            |
            | H3 resolution 7
            v
      Merge Embeddings
            |
            v
        BLOB field
            |
            v
Extract Embedding To Fields
            |
            +--- emb_1
            +--- emb_2
            +--- ...
            +--- emb_256
            |
            v
      Train Using AutoML
            |
            +--- model selection
            +--- training
            +--- evaluation
            +--- importance
            |
            v
           DLPK
            |
            v
      Predict Using AutoML

ArcGIS può memorizzare gli embedding in un campo BLOB, mantenendoli come singolo oggetto vettoriale per gli strumenti embedding-aware.

Quando occorre utilizzare algoritmi tabellari tradizionali, Extract Embedding To Fields deserializza il vettore nelle singole colonne.

27. Embedding come predictor oppure come augmentation?

Ci sono due strategie differenti.

Prima strategia:

Embeddings
    |
    v
Model
    |
    v
Prediction

Gli embedding costituiscono l'intero set di predictor.

Seconda strategia:

Domain variables
       +
Geodemographic embeddings
       |
       v
      Model
       |
       v
   Prediction

La seconda è probabilmente quella più interessante per molti problemi reali.

28. Un esempio: flood vulnerability

Immaginiamo di voler prevedere vulnerabilità o impatto potenziale di un evento alluvionale.

Potremmo costruire feature fisiche:

DEM
Slope
Flow accumulation
Distance from river
Terrain roughness
Soil permeability
Building elevation
Rainfall
Hydraulic variables

e aggiungere:

Geodemographic Embedding

Housing context
Environmental context
Socioeconomic context
Demographic context

Otteniamo:

PHYSICAL SYSTEM
      +
HUMAN CONTEXT
      |
      v
 GeoAI MODEL

Questa combinazione può essere estremamente potente perché distingue due categorie di informazione.

Explicit domain features

        +

Learned contextual representation

Il modello può così utilizzare contemporaneamente conoscenza fisica progettata dall'esperto e rappresentazioni apprese dal foundation model.

29. SHAP può dirci se l'embedding aggiunge contesto realmente usato dal modello

Supponiamo che il modello abbia:

Elevation
Slope
DistanceRiver
FlowAccumulation

+

emb_1 ... emb_256

SHAP può mostrarci che:

physical variables               62%

geodemographic embedding         38%

e all'interno dell'embedding:

Housing            8%
Environment        13%
Socioeconomic      12%
Demographics        5%

Questo crea una sorta di osservabilità del modello che sarebbe impossibile limitandosi alle sole metriche predittive.

30. Global SHAP è solo l'inizio: il GIS vuole Local SHAP

Il vero salto concettuale arriva quando smettiamo di pensare a SHAP soltanto come a un grafico.

Nel GIS ogni osservazione possiede una geometria.

Questo significa che le spiegazioni possono essere riportate nello spazio.

Per ogni feature geografica possiamo immaginare:

ID = 10382

Prediction            0.74

Housing SHAP          +0.08
Environment SHAP      +0.05
Socioeconomic SHAP    +0.21
Demographic SHAP      -0.03

Ora questi valori possono diventare attributi geografici.

31. Da Explainable AI a Spatial Explainable AI

Possiamo costruire quattro mappe:

Housing Attribution Map

Environment Attribution Map

Socioeconomic Attribution Map

Demographic Attribution Map

A questo punto non stiamo più chiedendo soltanto:

quali feature sono importanti?

Possiamo chiedere:

dove determinate famiglie di feature sono importanti?

Questo piccolo cambiamento introduce una dimensione analitica completamente nuova.

Feature attribution
       +
Geography
       =
Spatial attribution

32. Cercare autocorrelazione nelle spiegazioni

Una volta ottenuto uno SHAP value geografico, possiamo addirittura applicare strumenti spatial statistics alle spiegazioni del modello.

Per esempio:

Local Moran's I(SHAP_ACS)

Getis-Ord Gi*(SHAP_ENV)

Spatial clustering(SHAP_HOUSING)

La domanda diventa:

esistono cluster geografici nei quali il modello utilizza sistematicamente lo stesso tipo di informazione?

Questo è molto più interessante della tradizionale feature importance globale.

33. Possiamo costruire un vero Explanation Space

Facciamo un ulteriore passo.

Per ogni location definiamo:

S(x) = [

  SHAP_Housing,
  SHAP_Environment,
  SHAP_Socioeconomic,
  SHAP_Demographics

]

Ora ogni luogo non è descritto da ciò che è, ma da come il modello ragiona su quel luogo.

Abbiamo creato un nuovo spazio vettoriale:

Explanation Space.

34. Clusterizzare il modo in cui il modello ragiona

Possiamo applicare clustering agli explanation vector.

                    EXPLANATION SPACE

                          |
          +---------------+---------------+
          |               |               |
          v               v               v

      Cluster A        Cluster B       Cluster C

 socioeconomic         environmental      housing
    driven                driven          driven

Questi cluster non significano:

questi territori sono geograficamente simili.

Significano qualcosa di diverso:

il modello utilizza pattern simili per formulare una previsione su questi territori.

È una distinzione sottile ma potentissima.

35. Embedding Space, Prediction Space, Explanation Space

Possiamo quindi descrivere l'intero sistema attraverso tre spazi.

                 REAL WORLD
                     |
                     v
            Raw geographic data
                     |
                     v
             Foundation Model
                     |
                     v

             EMBEDDING SPACE
        "What is this place like?"
                     |
                     v
            Downstream model
                     |
                     v

             PREDICTION SPACE
       "What may happen here?"
                     |
                     v
                   SHAP
                     |
                     v

             EXPLANATION SPACE
       "Why did the model think so?"

Questa, a mio avviso, è una delle chiavi concettuali più interessanti dell'evoluzione futura della GeoAI.

36. E potremmo aggiungere un quarto spazio: Uncertainty Space

Per un sistema realmente maturo manca però ancora qualcosa.

Embedding
    |
    v
Prediction
    |
    v
Explanation
    |
    v
Uncertainty

Non basta sapere:

Prediction = 0.83

Vorremmo sapere anche:

How uncertain is 0.83?

How far is this location
from training distribution?

Is this geography represented
inside the training set?

How stable is the SHAP explanation?

Questo porta verso temi come:

  • out-of-distribution detection;
  • epistemic uncertainty;
  • prediction intervals;
  • embedding distance;
  • explanation stability;
  • model calibration.

37. Embedding distance come possibile segnale di OOD

Consideriamo una nuova location x*.

Otteniamo:

z* = E(x*)

Possiamo misurare la distanza da regioni note del training embedding space.

d(z*, TrainingEmbeddingSpace)

Se la distanza è molto elevata, potremmo trovarci davanti a una geografia che il downstream model non ha mai realmente incontrato.

A quel punto un valore:

Prediction = 0.91

non dovrebbe avere lo stesso significato operativo di un'altra previsione 0.91 effettuata nel cuore della distribuzione di training.

Un GIS realmente AI-native dovrebbe probabilmente mostrare entrambe.

Prediction     0.91
Confidence     LOW
OOD distance   HIGH

38. Explainability stability: un altro problema poco discusso

Anche la spiegazione dovrebbe essere sottoposta a test di stabilità.

Se piccolissime variazioni dell'input producono:

Location A

ACS importance = 60%


Almost identical Location A'

ACS importance = 12%
Environment    = 55%

potremmo avere una spiegazione fragile.

In futuro potrebbe quindi essere utile introdurre metriche del tipo:

Explanation Stability Score

ottenute perturbando ragionevolmente gli input e osservando la varianza delle attribuzioni.

39. Foundation models stanno cambiando il concetto stesso di GIS feature

Storicamente una GIS feature è stata qualcosa come:

Geometry
+
Attributes

Per esempio:

Polygon

POPULATION = 12450
INCOME     = 38200
AREA       = 18.3
...

Con i foundation model possiamo iniziare a immaginare:

Geometry

+

Explicit Attributes

+

Embedding

+

Prediction

+

Explanation

+

Uncertainty

Questa potrebbe diventare una forma molto più ricca di AI-enabled geographic feature.

40. Dal Semantic GIS al Latent GIS

Tradizionalmente attribuiamo significato al territorio mediante uno schema progettato dall'uomo.

FIELD_NAME
FIELD_TYPE
DOMAIN
VALUE

Gli embedding introducono invece una seconda forma di conoscenza:

human-defined semantic attributes

             +

machine-learned latent attributes

Potremmo pensare a questo come a un passaggio da:

Semantic GIS

verso un sistema ibrido:

Semantic + Latent GIS.

Il primo rimane interpretabile dall'uomo.

Il secondo può catturare strutture troppo complesse per essere progettate manualmente.

41. E qui arriva il collegamento con GeoAI e GeoAgents

Questo tipo di rappresentazione diventa ancora più interessante se pensiamo ai futuri agenti geospaziali.

Un GeoAgent potrebbe interrogare contemporaneamente:

Feature attributes
Spatial relationships
Raster data
Vector embeddings
Geodemographic embeddings
Satellite embeddings
Document embeddings
Model predictions
SHAP explanations

La query:

trova aree simili a questa, ma nelle quali il rischio previsto è più elevato e spiegami quale differenza socioeconomica sta guidando il modello

potrebbe essere trasformata in una pipeline:

User question
      |
      v
GeoAgent
      |
      +------ Spatial Query
      |
      +------ Embedding Similarity
      |
      +------ ML Prediction
      |
      +------ SHAP Explanation
      |
      +------ Spatial Statistics
      |
      v
Natural-language answer
+
Map
+
Evidence

Questa è una prospettiva decisamente più interessante del semplice chatbot sopra una mappa.

42. Non soltanto geodemographic embeddings

Lo stesso paradigma può essere esteso ad altri foundation model geospaziali.

Satellite imagery
      |
      v
Vision Foundation Model
      |
      v
Image embedding


Demographic/environmental data
      |
      v
GDFM
      |
      v
Geodemographic embedding


Documents / reports
      |
      v
Language model
      |
      v
Text embedding


Mobility graph
      |
      v
Graph model
      |
      v
Network embedding

Una location potrebbe quindi essere descritta attraverso una rappresentazione multimodale:

Zlocation = [

  Zgeo,
  Zsatellite,
  Ztext,
  Znetwork,
  Ztemporal

]

A quel punto l'explainability non dovrà più rispondere solamente:

quale feature è importante?

ma anche:

quale modalità informativa sta guidando la decisione?

43. Una possibile architettura GeoAI di nuova generazione

                 ┌─────────────────────┐
                 │   GEOGRAPHIC WORLD  │
                 └──────────┬──────────┘
                            │
           ┌────────────────┼────────────────┐
           │                │                │
           v                v                v
      Tabular Data      Imagery          Documents
           │                │                │
           v                v                v
         GDFM          Vision FM            LLM
           │                │                │
           v                v                v
      Geo Embedding    Image Embedding   Text Embedding
           │                │                │
           └────────────────┼────────────────┘
                            │
                            v
                    MULTIMODAL SPACE
                            │
                            v
                    Downstream Model
                            │
                 ┌──────────┴──────────┐
                 │                     │
                 v                     v
             Prediction            Retrieval
                 │                     │
                 └──────────┬──────────┘
                            │
                            v
                       Explainability
                            │
                            v
                  Spatial Explainability
                            │
                            v
                         GeoAgent

Se questa direzione continuerà, la GeoAI non sarà semplicemente “AI applicata ai dati GIS”.

Diventerà un sistema nel quale il territorio stesso possiede rappresentazioni vettoriali riutilizzabili da molteplici modelli e task.

44. Il punto più importante: prediction non basta più

Per anni abbiamo valutato un modello quasi esclusivamente attraverso metriche come:

Accuracy
Precision
Recall
F1
RMSE
MAE
R²

Nella GeoAI moderna questo non è sufficiente.

Dovremmo iniziare a valutare contemporaneamente:

Predictive performance

Spatial generalization

Representation quality

Explanation quality

Explanation stability

Out-of-distribution behavior

Uncertainty calibration

Geographic fairness

Scale sensitivity

Il modello migliore non è necessariamente quello che guadagna l'ultimo 0,01 di R².

Potrebbe essere quello che mantiene:

  • buone performance;
  • buona generalizzazione geografica;
  • spiegazioni stabili;
  • incertezza calibrata;
  • comportamento prevedibile fuori distribuzione.

45. La vera rivoluzione: rappresentazioni geografiche riutilizzabili

Il passaggio fondamentale introdotto dai geodemographic embeddings non è quindi semplicemente:

5300 variables
      ↓
256 variables

È qualcosa di più profondo:

task-specific geographic variables

              ↓

reusable geographic representation

Una volta costruita la rappresentazione, possiamo riutilizzarla per:

  • regression;
  • classification;
  • clustering;
  • segmentation;
  • similarity search;
  • feature enrichment;
  • anomaly detection;
  • retrieval;
  • spatial reasoning.

Questo è esattamente ciò che i foundation model hanno fatto in altri domini.

Ora stiamo iniziando a vedere lo stesso paradigma entrare seriamente nel GIS.

46. From Embedding Space to Explanation Space

Il workflow mostrato da Esri sembra inizialmente molto semplice:

Embeddings
    +
AutoML
    +
SHAP

ma dietro questi tre elementi c'è un cambiamento architetturale importante.

RAW GEOGRAPHY
      |
      v
REPRESENTATION LEARNING
      |
      v
EMBEDDING SPACE
      |
      v
MACHINE LEARNING
      |
      v
PREDICTION SPACE
      |
      v
EXPLAINABLE AI
      |
      v
EXPLANATION SPACE
      |
      v
SPATIAL ANALYSIS
      |
      v
GEOGRAPHIC UNDERSTANDING

Il passaggio veramente interessante è l'ultimo.

Non vogliamo soltanto modelli capaci di fare previsioni sul territorio.

Vogliamo poter analizzare geograficamente come e perché quei modelli arrivano alle proprie conclusioni.

Conclusioni

L'approccio mostrato da Esri rappresenta un passo importante verso una GeoAI più interpretabile.

La struttura del Geodemographic Foundation Model permette di trasformare 256 dimensioni latenti apparentemente opache in quattro grandi domini semantici:

Housing
Environment
Socioeconomic
Demographic

SHAP permette poi di osservare come un downstream model utilizza quelle rappresentazioni.

Ma bisogna evitare scorciatoie interpretative.

Mean absolute SHAP non rappresenta causalità.

Segment SHAP non equivale a Group SHAP.

Feature attribution non equivale a predictive value.

Una latent dimension non corrisponde automaticamente a una variabile originaria.

Un'ottima cross-validation casuale non garantisce generalizzazione geografica.

Gli embedding non eliminano problemi classici del GIS come autocorrelazione spaziale e MAUP.

Ma, utilizzati correttamente, introducono qualcosa di estremamente potente: la possibilità di lavorare con rappresentazioni geografiche apprese, riutilizzabili e interrogabili.

Il prossimo salto potrebbe essere quello di trasformare SHAP da semplice strumento di interpretazione ML in un vero oggetto geografico:

Prediction Map
      +
Explanation Map
      +
Uncertainty Map

e quindi passare definitivamente:

from Embedding Space to Explanation Space.

Quando arriveremo a questo punto, explainability e spatial analysis non saranno più due discipline separate.

Potremo utilizzare gli strumenti GIS non soltanto per studiare il fenomeno geografico, ma anche per studiare geograficamente il comportamento dell'intelligenza artificiale che lo sta interpretando.

E questa potrebbe diventare una delle aree più interessanti della prossima generazione di GeoAI.


Riferimenti