Un embedding geospaziale può rappresentare un luogo con centinaia di numeri. Ma se quel vettore entra in un modello predittivo, come possiamo capire quali aspetti del territorio stanno realmente guidando la previsione?
È una delle domande più interessanti della GeoAI moderna, perché riguarda un punto di tensione fondamentale tra representation learning e interpretabilità: più lasciamo che sia il modello a costruire autonomamente rappresentazioni compatte e sofisticate del territorio, più perdiamo la semantica immediata delle tradizionali variabili GIS.
Un recente articolo del team Esri GeoAI, Interpret embeddings using AutoML and SHAP in ArcGIS Pro, pubblicato il 6 ottobre 2026, affronta proprio questo problema combinando quattro tecnologie:
- USA Geodemographic Embeddings
- Geodemographic Foundation Model (GDFM)
- AutoML di ArcGIS Pro
- SHAP – SHapley Additive exPlanations
Il workflow Esri utilizza come caso di studio la previsione della food insecurity negli Stati Uniti, ma il concetto è molto più generale.
Dietro l'esempio applicativo c'è infatti qualcosa di più importante: un possibile passaggio da un GIS costruito principalmente su feature progettate dall'uomo a un GIS nel quale parte della conoscenza geografica viene rappresentata attraverso latent spaces appresi da foundation model.
Ed è qui che nasce una nuova domanda:
come interpretiamo non soltanto ciò che il modello predice, ma il modo in cui utilizza una rappresentazione appresa del territorio?
1. Dal feature engineering al representation learning geografico
Nel machine learning GIS tradizionale, il processo parte normalmente da variabili esplicite:
Population density
Median household income
Age
Education
Land cover
Distance from roads
Distance from hospitals
House value
Employment rate
Slope
Elevation
...
Ogni feature ha un significato noto.
Possiamo quindi costruire una matrice:
X = [x1, x2, x3, ... xn]
e addestrare un modello:
ŷ = f(X)
Il problema è che un territorio reale può essere descritto da migliaia di variabili correlate tra loro.
La selezione manuale delle feature diventa allora costosa, fragile e fortemente dipendente dal dominio.
Il paradigma degli embedding cambia radicalmente il problema.
Thousands of geographic variables
|
v
Foundation Model
|
v
Latent Embedding
|
v
256 dimensions
Non chiediamo più direttamente:
quali dieci variabili devo scegliere?
Chiediamo invece a un modello di apprendere una rappresentazione compatta capace di preservare strutture, correlazioni e similarità presenti nei dati.
In termini matematici:
z = E(x)
x ∈ R^n
z ∈ R^256
dove E è l'encoder e z è la rappresentazione latente del luogo.
Questo z diventa una sorta di fingerprint geografico.
2. USA Geodemographic Embeddings: circa 5.300 variabili diventano 256 numeri
Gli USA Geodemographic Embeddings di Esri rappresentano ogni area geografica attraverso un vettore denso di 256 dimensioni.
La sorgente non è un singolo dataset ma quattro differenti “view” del territorio.
| View | Numero di variabili | Informazione principale |
|---|---|---|
| Housing & Household Characteristics | 1.521 | Housing units, occupancy, tenure, household composition |
| Environment | 113 | Climate, precipitation, land cover e contesto ambientale |
| American Community Survey | 1.617 | Income, employment, education, commuting, household structure |
| Age & Race Census | 2.049 | Population, age, race e struttura demografica |
Complessivamente siamo quindi nell'ordine delle:
1,521
+ 113
+ 1,617
+ 2,049
----------------
≈ 5,300 variables
che vengono compresse in:
256 latent dimensions
È un rapporto di compressione concettualmente molto significativo.
Ma non dobbiamo interpretarlo come una semplice PCA.
Dietro gli embedding si trova il Geodemographic Foundation Model di Esri.
3. Dentro GDFM: un multiview autoencoder geografico
La caratteristica particolarmente interessante del GDFM è l'uso di una architettura multiview autoencoder.
Le quattro sorgenti non vengono semplicemente concatenate in un gigantesco vettore da dare a un singolo encoder.
Concettualmente abbiamo:
Housing & Household
|
v
Encoder H
|
+----------> zH ∈ R^64
Environment
|
v
Encoder E
|
+----------> zE ∈ R^64
American Community Survey
|
v
Encoder A
|
+----------> zA ∈ R^64
Age & Race Census
|
v
Encoder D
|
+----------> zD ∈ R^64
z = [zH | zE | zA | zD]
z ∈ R^256
Questa architettura produce una proprietà estremamente utile ai fini dell'interpretabilità:
dimensions 1 - 64 → Housing / Household
dimensions 65 - 128 → Environment
dimensions 129 - 192 → ACS / Socioeconomic
dimensions 193 - 256 → Age / Race / Demographic
Non conosciamo necessariamente il significato semantico della singola dimensione, ma conosciamo la view dalla quale quella parte dello spazio latente è stata appresa.
È una distinzione fondamentale.
4. Perché embedding_137 non significa “income”
Supponiamo che il modello identifichi:
embedding_137
come feature molto importante.
Sarebbe sbagliato concludere:
embedding_137 = income
Una dimensione latente generalmente rappresenta una combinazione non lineare di molte feature originarie.
Potrebbe catturare qualcosa che emerge dall'interazione tra:
income
education
employment
commuting
household composition
urban structure
...
La rappresentazione è distributed.
L'informazione non deve necessariamente trovarsi in una singola coordinata.
Quello che invece possiamo affermare è che la dimensione 137 appartiene al blocco:
129 - 192
e quindi deriva dalla rappresentazione latente costruita dalla view American Community Survey.
È già un'informazione molto potente.
5. Il downstream model: dall'Embedding Space al Prediction Space
Dopo aver costruito il vettore geografico:
z = [z1, z2, ..., z256]
possiamo utilizzarlo come input di un modello supervisionato:
ŷ = f(z)
Nel caso discusso da Esri:
USA Geodemographic Embedding
|
v
256 predictors
|
v
ArcGIS AutoML
|
v
Food insecurity %
Qui avviene una separazione concettuale molto importante.
Il foundation model non sta prevedendo direttamente la food insecurity.
Sta producendo una rappresentazione generale del territorio.
Un secondo modello utilizza successivamente quella rappresentazione per un task specifico.
Abbiamo quindi:
REAL WORLD
|
v
Geographic data
|
v
GDFM
|
v
EMBEDDING SPACE
|
v
Downstream ML model
|
v
PREDICTION SPACE
6. ArcGIS Pro AutoML
ArcGIS Pro permette di utilizzare queste dimensioni direttamente tramite Train Using AutoML.
AutoML automatizza diverse fasi del processo di modellazione, tra cui, a seconda della modalità utilizzata:
- exploratory data analysis;
- model selection;
- feature selection;
- feature engineering;
- cross validation;
- hyperparameter tuning;
- model training;
- evaluation;
- model packaging.
Il risultato può essere salvato come modello ArcGIS:
.dlpk
e successivamente utilizzato attraverso Predict Using AutoML.
Nel workflow illustrato da Esri viene utilizzato Basic Mode, perché è orientato soprattutto alla comprensione delle variabili e consente di produrre gli output necessari all'analisi dell'importanza.
Tra gli algoritmi utilizzabili troviamo anche modelli tree-based come LightGBM, particolarmente interessanti quando si lavora con embedding tabellari densi.
7. Perché LightGBM è interessante con un embedding
Un embedding a 256 dimensioni produce una matrice:
X ∈ R^(N × 256)
Le relazioni tra coordinate latenti e target possono essere fortemente non lineari.
Una regressione lineare assumerebbe essenzialmente:
ŷ = β0 + β1z1 + β2z2 + ... + β256z256
Un modello gradient boosting può invece apprendere:
- threshold effects;
- nonlinearità;
- interazioni tra dimensioni;
- relazioni condizionali;
- combinazioni di feature latenti.
Per esempio:
IF z137 > thresholdA
AND z151 < thresholdB
AND z42 > thresholdC
THEN ...
può identificare configurazioni dello spazio latente difficili da rappresentare con un modello lineare.
Il prezzo da pagare è naturalmente una minore interpretabilità diretta.
Ed è qui che entra SHAP.
8. SHAP: spiegare il comportamento del modello
SHAP significa SHapley Additive exPlanations.
La teoria deriva dai valori di Shapley della teoria dei giochi cooperativi.
L'idea fondamentale consiste nell'assegnare a ogni feature un contributo alla previsione.
In forma semplificata:
f(x) = E[f(X)] + Σ φi
dove:
E[f(X)]rappresenta il valore di baseline del modello;φirappresenta il contributo attribuito alla featurei.
Per una specifica location potremmo avere qualcosa come:
Model baseline 10.7
embedding_137 +2.1
embedding_041 +0.8
embedding_208 -0.6
embedding_152 +0.4
other dimensions +0.0
-----------------------------------------
Prediction 13.4
Questo è il concetto di local explanation.
9. Il segno del valore SHAP conta
Un valore:
φi > 0
indica che quella feature spinge la previsione rispetto alla baseline in una direzione positiva.
Viceversa:
φi < 0
la spinge nella direzione opposta.
Questa informazione diventa però importante quando passiamo dall'explainability locale alla feature importance globale utilizzata nel workflow Esri.
10. Mean Absolute SHAP: cosa misura davvero ArcGIS
L'importance table prodotta da AutoML contiene sostanzialmente:
VARIABLE
IMPORTANCE
L'IMPORTANCE è una misura globale basata sul mean absolute SHAP.
Concettualmente:
Ii = E(|φi|)
Ovvero:
quanto, mediamente, quella feature modifica le previsioni del modello in termini di magnitudine.
Supponiamo di ottenere:
embedding_137 0.32
embedding_144 0.27
embedding_201 0.18
embedding_041 0.14
Possiamo concludere che embedding_137 riceve una forte attribuzione dal modello.
Ma attenzione:
|+0.32| = |-0.32|
L'importance globale non ci dice se quella dimensione tende ad aumentare o diminuire il target.
La direzione è stata eliminata dal valore assoluto.
11. Il trucco elegante di Esri: aggregare SHAP per segmento
A questo punto entra in gioco la struttura 4 × 64 dell'embedding.
Possiamo calcolare:
Housing importance
= Σ IMPORTANCE dimensions 1..64
Environment importance
= Σ IMPORTANCE dimensions 65..128
ACS importance
= Σ IMPORTANCE dimensions 129..192
Demographic importance
= Σ IMPORTANCE dimensions 193..256
Formalmente:
S1 = Σ Ii i = 1...64
S2 = Σ Ii i = 65...128
S3 = Σ Ii i = 129...192
S4 = Σ Ii i = 193...256
Trasformiamo quindi:
256 opaque latent dimensions
in quattro macro-dimensioni interpretabili:
Housing
Environment
Socioeconomic
Demographic
Nel caso food insecurity discusso da Esri, è il Segment 3, derivato dall'American Community Survey, a mostrare la maggiore aggregate mean absolute SHAP importance.
Il modello sta quindi facendo largo uso delle strutture socioeconomiche apprese dal GDFM.
Ma questa frase deve essere letta con molta precisione.
12. La sottigliezza matematica: non è Group SHAP
Questo è probabilmente uno dei punti tecnicamente più importanti dell'intero workflow.
Esri precisa correttamente che sommare le mean absolute SHAP importance delle singole dimensioni:
Σ E(|φi|)
non equivale a calcolare:
E(|Σ φi|)
Le due quantità sono matematicamente differenti.
Consideriamo due feature appartenenti allo stesso segmento:
φ129 = +0.8
φ130 = -0.7
Sommando le magnitudini otteniamo:
|0.8| + |-0.7| = 1.5
Ma il contributo netto combinato è:
|0.8 - 0.7| = 0.1
Quindi la segment importance utilizzata in questo workflow misura meglio:
la quantità complessiva di attività attributiva presente nelle dimensioni del segmento
che non:
il contributo netto del segmento alla previsione.
Non è una distinzione accademica: cambia radicalmente il significato del risultato.
13. Feature importance non significa predictive value
C'è un secondo errore interpretativo molto comune.
Supponiamo di ottenere:
Housing 20%
Environment 11%
ACS 47%
Demographics 22%
Non possiamo concludere:
senza ACS il modello perderebbe il 47% della propria accuratezza.
SHAP non misura questo.
Misura come il modello già addestrato distribuisce le proprie attribuzioni.
Per misurare il predictive value incrementale di un segmento servirebbe invece una vera ablation study.
14. Ablation study: il test che farei in un progetto reale
Addestriamo inizialmente il modello completo:
Model FULL
Housing
Environment
ACS
Demographic
R² = 0.82
Poi rimuoviamo sistematicamente interi segmenti.
FULL R² = 0.82
without Housing R² = 0.80
without Environment R² = 0.81
without ACS R² = 0.67
without Demographics R² = 0.78
Ora possiamo osservare:
ΔR² ACS = 0.82 - 0.67
= 0.15
Questa misura risponde a una domanda differente:
quanto valore predittivo perde il modello quando elimino l'informazione contenuta in quella rappresentazione?
Esiste poi un'altra possibilità: effettuare una joint permutation di tutte le 64 dimensioni del segmento e misurare la degradazione delle performance.
SHAP, ablation e permutation importance diventano quindi strumenti complementari.
SHAP
→ attribution
Ablation
→ incremental predictive value
Permutation
→ dependence of performance on information
Causal analysis
→ entirely different question
15. Il problema nascosto: le latent feature sono correlate
Gli aspetti che descrivono un territorio non sono indipendenti.
Consideriamo:
income
↕
education
↕
employment
↕
house value
↕
urban form
↕
mobility
↕
accessibility
Queste strutture sono fortemente correlate nel mondo reale.
Il representation learning trasferisce parte di queste dipendenze anche nello spazio latente.
Quindi le dimensioni:
z1 ... z256
non devono essere considerate automaticamente indipendenti.
Questo crea una delle classiche difficoltà dei metodi di feature attribution.
Se due variabili contengono informazione ridondante, il modello può distribuirne il “credito” in modi differenti.
Perciò:
SHAP importance of latent dimension
non deve essere trasformata impropriamente in:
importance of a real-world phenomenon
Il secondo concetto è molto più forte del primo.
16. SHAP non decodifica l'embedding
Questa distinzione merita di essere evidenziata.
SHAP non sta facendo:
embedding_137
|
v
"this dimension means income"
Sta facendo:
embedding_137
|
v
downstream model
|
v
"the fitted predictor relies strongly
on this latent coordinate"
In altre parole:
SHAP non spiega necessariamente ciò che il foundation model ha imparato. Spiega come il downstream model utilizza ciò che il foundation model ha rappresentato.
È probabilmente la distinzione concettuale più importante da portarsi a casa.
17. Tre differenti livelli di interpretabilità
Possiamo formalizzare il problema distinguendo tre livelli.
LEVEL 1
REPRESENTATION INTERPRETATION
What information is encoded in z?
LEVEL 2
MODEL ATTRIBUTION
Which parts of z does f(z) use?
LEVEL 3
CAUSAL INTERPRETATION
Which real-world mechanisms cause Y?
Il workflow AutoML + SHAP opera principalmente al livello 2.
La conoscenza della struttura 4 × 64 consente parzialmente di risalire verso il livello 1.
Ma non arriviamo automaticamente al livello 3.
18. SHAP non implica causalità
Se il segmento ACS ha la maggiore importance nella previsione della food insecurity, possiamo affermare:
il modello utilizza fortemente pattern latenti appresi dal contesto socioeconomico.
Non possiamo automaticamente affermare:
il contesto socioeconomico causa la food insecurity nella misura indicata da SHAP.
Il modello rappresenta una relazione:
P(Y | X)
non necessariamente un intervento causale:
P(Y | do(X))
Questa distinzione tra predictive ML e causal inference diventa ancora più importante con gli embedding, perché la semantica delle feature non è esplicita.
19. Nel GIS compare un problema ancora più serio: spatial autocorrelation
Finora abbiamo ragionato come se le osservazioni fossero indipendenti.
Ma nel mondo geografico questo spesso non è vero.
La prima legge della geografia di Tobler rimane estremamente pertinente:
Everything is related to everything else, but near things are more related than distant things.
Due aree vicine possono condividere:
- struttura demografica;
- mercato immobiliare;
- infrastrutture;
- clima;
- mobilità;
- servizi;
- accessibilità;
- politiche locali;
- storia economica.
Di conseguenza possono avere embedding molto simili.
20. Random train/test split e spatial leakage
Consideriamo un classico split casuale:
TRAIN
County A
County B
County C
TEST
County D
Se D confina con A, B e C e appartiene allo stesso regime geografico, il test potrebbe essere meno indipendente di quanto sembri.
Il modello potrebbe ottenere ottime performance semplicemente interpolando nello stesso contesto spaziale.
Non abbiamo necessariamente dimostrato:
generalization to unseen geography
ma magari soltanto:
interpolation inside a known spatial regime
Per un workflow GeoAI rigoroso affiancherei quindi al normale test una spatial cross-validation.
21. Spatial cross-validation
Una strategia migliore può essere:
Geography
|
v
Spatial blocks
|
+---- Fold A
+---- Fold B
+---- Fold C
+---- Fold D
+---- Fold E
I blocchi possono essere costruiti utilizzando:
- H3;
- grid regolari;
- macroregioni amministrative;
- clustering spaziale;
- buffered holdout;
- spatial blocking.
L'obiettivo è verificare se:
Model trained here
|
| geographic separation
v
Predicts there
mantiene davvero performance elevate.
È una distinzione fondamentale quando vogliamo utilizzare foundation model geospaziali in produzione.
22. Performance globale e performance geografica non sono la stessa cosa
In un problema spaziale non mi fermerei quindi a:
R²
RMSE
MAE
F1
Accuracy
Analizzerei anche:
metric by region
metric by urban/rural context
metric by density
metric by embedding cluster
metric by distance from training data
metric by spatial regime
Per esempio un modello può avere:
Overall R² = 0.84
ma:
Urban areas R² = 0.90
Suburban areas R² = 0.87
Rural areas R² = 0.58
Il singolo valore aggregato nasconde completamente il problema.
23. H3 Resolution 7 e il problema della scala
Gli USA Geodemographic Embeddings vengono distribuiti a livello di Uber H3 resolution 7.
Questa scelta crea una tessellazione geografica regolare e molto utile per la costruzione di rappresentazioni spatially consistent.
Ma spesso il nostro problema lavora a un'altra scala:
H3 cells
|
v
County
oppure
H3 cells
|
v
Municipality
oppure
H3 cells
|
v
Custom catchment area
Serve quindi aggregare gli embedding.
24. Non basta necessariamente fare la media dei 256 numeri
Qui incontriamo un punto matematicamente sottile.
Per un encoder non lineare E, generalmente:
Aggregate(E(x))
≠
E(Aggregate(x))
Il significato è importante.
L'embedding medio di dieci territori non equivale necessariamente all'embedding che avremmo ottenuto addestrando o applicando l'encoder sulla descrizione aggregata di quei territori.
Per questo ArcGIS introduce strumenti embedding-aware come:
Merge Embeddings
anziché ridurre il problema a una semplice operazione arbitraria sulle colonne.
25. MAUP non scompare con gli embedding
Il Modifiable Areal Unit Problem, uno dei problemi classici della spatial analysis, continua quindi ad esistere.
Gli embedding non lo eliminano.
Cambiando:
- scala;
- aggregazione;
- confini;
- unità geografica;
possono cambiare le strutture statistiche osservate.
In futuro dovremo probabilmente parlare molto di più di:
representation stability across geographic scales.
È un problema molto interessante per la ricerca GeoAI.
26. Il workflow concreto in ArcGIS Pro
La pipeline pratica diventa approssimativamente:
USA Geodemographic Embeddings
|
| H3 resolution 7
v
Merge Embeddings
|
v
BLOB field
|
v
Extract Embedding To Fields
|
+--- emb_1
+--- emb_2
+--- ...
+--- emb_256
|
v
Train Using AutoML
|
+--- model selection
+--- training
+--- evaluation
+--- importance
|
v
DLPK
|
v
Predict Using AutoML
ArcGIS può memorizzare gli embedding in un campo BLOB, mantenendoli come singolo oggetto vettoriale per gli strumenti embedding-aware.
Quando occorre utilizzare algoritmi tabellari tradizionali, Extract Embedding To Fields deserializza il vettore nelle singole colonne.
27. Embedding come predictor oppure come augmentation?
Ci sono due strategie differenti.
Prima strategia:
Embeddings
|
v
Model
|
v
Prediction
Gli embedding costituiscono l'intero set di predictor.
Seconda strategia:
Domain variables
+
Geodemographic embeddings
|
v
Model
|
v
Prediction
La seconda è probabilmente quella più interessante per molti problemi reali.
28. Un esempio: flood vulnerability
Immaginiamo di voler prevedere vulnerabilità o impatto potenziale di un evento alluvionale.
Potremmo costruire feature fisiche:
DEM
Slope
Flow accumulation
Distance from river
Terrain roughness
Soil permeability
Building elevation
Rainfall
Hydraulic variables
e aggiungere:
Geodemographic Embedding
Housing context
Environmental context
Socioeconomic context
Demographic context
Otteniamo:
PHYSICAL SYSTEM
+
HUMAN CONTEXT
|
v
GeoAI MODEL
Questa combinazione può essere estremamente potente perché distingue due categorie di informazione.
Explicit domain features
+
Learned contextual representation
Il modello può così utilizzare contemporaneamente conoscenza fisica progettata dall'esperto e rappresentazioni apprese dal foundation model.
29. SHAP può dirci se l'embedding aggiunge contesto realmente usato dal modello
Supponiamo che il modello abbia:
Elevation
Slope
DistanceRiver
FlowAccumulation
+
emb_1 ... emb_256
SHAP può mostrarci che:
physical variables 62%
geodemographic embedding 38%
e all'interno dell'embedding:
Housing 8%
Environment 13%
Socioeconomic 12%
Demographics 5%
Questo crea una sorta di osservabilità del modello che sarebbe impossibile limitandosi alle sole metriche predittive.
30. Global SHAP è solo l'inizio: il GIS vuole Local SHAP
Il vero salto concettuale arriva quando smettiamo di pensare a SHAP soltanto come a un grafico.
Nel GIS ogni osservazione possiede una geometria.
Questo significa che le spiegazioni possono essere riportate nello spazio.
Per ogni feature geografica possiamo immaginare:
ID = 10382
Prediction 0.74
Housing SHAP +0.08
Environment SHAP +0.05
Socioeconomic SHAP +0.21
Demographic SHAP -0.03
Ora questi valori possono diventare attributi geografici.
31. Da Explainable AI a Spatial Explainable AI
Possiamo costruire quattro mappe:
Housing Attribution Map
Environment Attribution Map
Socioeconomic Attribution Map
Demographic Attribution Map
A questo punto non stiamo più chiedendo soltanto:
quali feature sono importanti?
Possiamo chiedere:
dove determinate famiglie di feature sono importanti?
Questo piccolo cambiamento introduce una dimensione analitica completamente nuova.
Feature attribution
+
Geography
=
Spatial attribution
32. Cercare autocorrelazione nelle spiegazioni
Una volta ottenuto uno SHAP value geografico, possiamo addirittura applicare strumenti spatial statistics alle spiegazioni del modello.
Per esempio:
Local Moran's I(SHAP_ACS)
Getis-Ord Gi*(SHAP_ENV)
Spatial clustering(SHAP_HOUSING)
La domanda diventa:
esistono cluster geografici nei quali il modello utilizza sistematicamente lo stesso tipo di informazione?
Questo è molto più interessante della tradizionale feature importance globale.
33. Possiamo costruire un vero Explanation Space
Facciamo un ulteriore passo.
Per ogni location definiamo:
S(x) = [
SHAP_Housing,
SHAP_Environment,
SHAP_Socioeconomic,
SHAP_Demographics
]
Ora ogni luogo non è descritto da ciò che è, ma da come il modello ragiona su quel luogo.
Abbiamo creato un nuovo spazio vettoriale:
Explanation Space.
34. Clusterizzare il modo in cui il modello ragiona
Possiamo applicare clustering agli explanation vector.
EXPLANATION SPACE
|
+---------------+---------------+
| | |
v v v
Cluster A Cluster B Cluster C
socioeconomic environmental housing
driven driven driven
Questi cluster non significano:
questi territori sono geograficamente simili.
Significano qualcosa di diverso:
il modello utilizza pattern simili per formulare una previsione su questi territori.
È una distinzione sottile ma potentissima.
35. Embedding Space, Prediction Space, Explanation Space
Possiamo quindi descrivere l'intero sistema attraverso tre spazi.
REAL WORLD
|
v
Raw geographic data
|
v
Foundation Model
|
v
EMBEDDING SPACE
"What is this place like?"
|
v
Downstream model
|
v
PREDICTION SPACE
"What may happen here?"
|
v
SHAP
|
v
EXPLANATION SPACE
"Why did the model think so?"
Questa, a mio avviso, è una delle chiavi concettuali più interessanti dell'evoluzione futura della GeoAI.
36. E potremmo aggiungere un quarto spazio: Uncertainty Space
Per un sistema realmente maturo manca però ancora qualcosa.
Embedding
|
v
Prediction
|
v
Explanation
|
v
Uncertainty
Non basta sapere:
Prediction = 0.83
Vorremmo sapere anche:
How uncertain is 0.83?
How far is this location
from training distribution?
Is this geography represented
inside the training set?
How stable is the SHAP explanation?
Questo porta verso temi come:
- out-of-distribution detection;
- epistemic uncertainty;
- prediction intervals;
- embedding distance;
- explanation stability;
- model calibration.
37. Embedding distance come possibile segnale di OOD
Consideriamo una nuova location x*.
Otteniamo:
z* = E(x*)
Possiamo misurare la distanza da regioni note del training embedding space.
d(z*, TrainingEmbeddingSpace)
Se la distanza è molto elevata, potremmo trovarci davanti a una geografia che il downstream model non ha mai realmente incontrato.
A quel punto un valore:
Prediction = 0.91
non dovrebbe avere lo stesso significato operativo di un'altra previsione 0.91 effettuata nel cuore della distribuzione di training.
Un GIS realmente AI-native dovrebbe probabilmente mostrare entrambe.
Prediction 0.91
Confidence LOW
OOD distance HIGH
38. Explainability stability: un altro problema poco discusso
Anche la spiegazione dovrebbe essere sottoposta a test di stabilità.
Se piccolissime variazioni dell'input producono:
Location A
ACS importance = 60%
Almost identical Location A'
ACS importance = 12%
Environment = 55%
potremmo avere una spiegazione fragile.
In futuro potrebbe quindi essere utile introdurre metriche del tipo:
Explanation Stability Score
ottenute perturbando ragionevolmente gli input e osservando la varianza delle attribuzioni.
39. Foundation models stanno cambiando il concetto stesso di GIS feature
Storicamente una GIS feature è stata qualcosa come:
Geometry
+
Attributes
Per esempio:
Polygon
POPULATION = 12450
INCOME = 38200
AREA = 18.3
...
Con i foundation model possiamo iniziare a immaginare:
Geometry
+
Explicit Attributes
+
Embedding
+
Prediction
+
Explanation
+
Uncertainty
Questa potrebbe diventare una forma molto più ricca di AI-enabled geographic feature.
40. Dal Semantic GIS al Latent GIS
Tradizionalmente attribuiamo significato al territorio mediante uno schema progettato dall'uomo.
FIELD_NAME
FIELD_TYPE
DOMAIN
VALUE
Gli embedding introducono invece una seconda forma di conoscenza:
human-defined semantic attributes
+
machine-learned latent attributes
Potremmo pensare a questo come a un passaggio da:
Semantic GIS
verso un sistema ibrido:
Semantic + Latent GIS.
Il primo rimane interpretabile dall'uomo.
Il secondo può catturare strutture troppo complesse per essere progettate manualmente.
41. E qui arriva il collegamento con GeoAI e GeoAgents
Questo tipo di rappresentazione diventa ancora più interessante se pensiamo ai futuri agenti geospaziali.
Un GeoAgent potrebbe interrogare contemporaneamente:
Feature attributes
Spatial relationships
Raster data
Vector embeddings
Geodemographic embeddings
Satellite embeddings
Document embeddings
Model predictions
SHAP explanations
La query:
trova aree simili a questa, ma nelle quali il rischio previsto è più elevato e spiegami quale differenza socioeconomica sta guidando il modello
potrebbe essere trasformata in una pipeline:
User question
|
v
GeoAgent
|
+------ Spatial Query
|
+------ Embedding Similarity
|
+------ ML Prediction
|
+------ SHAP Explanation
|
+------ Spatial Statistics
|
v
Natural-language answer
+
Map
+
Evidence
Questa è una prospettiva decisamente più interessante del semplice chatbot sopra una mappa.
42. Non soltanto geodemographic embeddings
Lo stesso paradigma può essere esteso ad altri foundation model geospaziali.
Satellite imagery
|
v
Vision Foundation Model
|
v
Image embedding
Demographic/environmental data
|
v
GDFM
|
v
Geodemographic embedding
Documents / reports
|
v
Language model
|
v
Text embedding
Mobility graph
|
v
Graph model
|
v
Network embedding
Una location potrebbe quindi essere descritta attraverso una rappresentazione multimodale:
Zlocation = [
Zgeo,
Zsatellite,
Ztext,
Znetwork,
Ztemporal
]
A quel punto l'explainability non dovrà più rispondere solamente:
quale feature è importante?
ma anche:
quale modalità informativa sta guidando la decisione?
43. Una possibile architettura GeoAI di nuova generazione
┌─────────────────────┐
│ GEOGRAPHIC WORLD │
└──────────┬──────────┘
│
┌────────────────┼────────────────┐
│ │ │
v v v
Tabular Data Imagery Documents
│ │ │
v v v
GDFM Vision FM LLM
│ │ │
v v v
Geo Embedding Image Embedding Text Embedding
│ │ │
└────────────────┼────────────────┘
│
v
MULTIMODAL SPACE
│
v
Downstream Model
│
┌──────────┴──────────┐
│ │
v v
Prediction Retrieval
│ │
└──────────┬──────────┘
│
v
Explainability
│
v
Spatial Explainability
│
v
GeoAgent
Se questa direzione continuerà, la GeoAI non sarà semplicemente “AI applicata ai dati GIS”.
Diventerà un sistema nel quale il territorio stesso possiede rappresentazioni vettoriali riutilizzabili da molteplici modelli e task.
44. Il punto più importante: prediction non basta più
Per anni abbiamo valutato un modello quasi esclusivamente attraverso metriche come:
Accuracy
Precision
Recall
F1
RMSE
MAE
R²
Nella GeoAI moderna questo non è sufficiente.
Dovremmo iniziare a valutare contemporaneamente:
Predictive performance
Spatial generalization
Representation quality
Explanation quality
Explanation stability
Out-of-distribution behavior
Uncertainty calibration
Geographic fairness
Scale sensitivity
Il modello migliore non è necessariamente quello che guadagna l'ultimo 0,01 di R².
Potrebbe essere quello che mantiene:
- buone performance;
- buona generalizzazione geografica;
- spiegazioni stabili;
- incertezza calibrata;
- comportamento prevedibile fuori distribuzione.
45. La vera rivoluzione: rappresentazioni geografiche riutilizzabili
Il passaggio fondamentale introdotto dai geodemographic embeddings non è quindi semplicemente:
5300 variables
↓
256 variables
È qualcosa di più profondo:
task-specific geographic variables
↓
reusable geographic representation
Una volta costruita la rappresentazione, possiamo riutilizzarla per:
- regression;
- classification;
- clustering;
- segmentation;
- similarity search;
- feature enrichment;
- anomaly detection;
- retrieval;
- spatial reasoning.
Questo è esattamente ciò che i foundation model hanno fatto in altri domini.
Ora stiamo iniziando a vedere lo stesso paradigma entrare seriamente nel GIS.
46. From Embedding Space to Explanation Space
Il workflow mostrato da Esri sembra inizialmente molto semplice:
Embeddings
+
AutoML
+
SHAP
ma dietro questi tre elementi c'è un cambiamento architetturale importante.
RAW GEOGRAPHY
|
v
REPRESENTATION LEARNING
|
v
EMBEDDING SPACE
|
v
MACHINE LEARNING
|
v
PREDICTION SPACE
|
v
EXPLAINABLE AI
|
v
EXPLANATION SPACE
|
v
SPATIAL ANALYSIS
|
v
GEOGRAPHIC UNDERSTANDING
Il passaggio veramente interessante è l'ultimo.
Non vogliamo soltanto modelli capaci di fare previsioni sul territorio.
Vogliamo poter analizzare geograficamente come e perché quei modelli arrivano alle proprie conclusioni.
Conclusioni
L'approccio mostrato da Esri rappresenta un passo importante verso una GeoAI più interpretabile.
La struttura del Geodemographic Foundation Model permette di trasformare 256 dimensioni latenti apparentemente opache in quattro grandi domini semantici:
Housing
Environment
Socioeconomic
Demographic
SHAP permette poi di osservare come un downstream model utilizza quelle rappresentazioni.
Ma bisogna evitare scorciatoie interpretative.
Mean absolute SHAP non rappresenta causalità.
Segment SHAP non equivale a Group SHAP.
Feature attribution non equivale a predictive value.
Una latent dimension non corrisponde automaticamente a una variabile originaria.
Un'ottima cross-validation casuale non garantisce generalizzazione geografica.
Gli embedding non eliminano problemi classici del GIS come autocorrelazione spaziale e MAUP.
Ma, utilizzati correttamente, introducono qualcosa di estremamente potente: la possibilità di lavorare con rappresentazioni geografiche apprese, riutilizzabili e interrogabili.
Il prossimo salto potrebbe essere quello di trasformare SHAP da semplice strumento di interpretazione ML in un vero oggetto geografico:
Prediction Map
+
Explanation Map
+
Uncertainty Map
e quindi passare definitivamente:
from Embedding Space to Explanation Space.
Quando arriveremo a questo punto, explainability e spatial analysis non saranno più due discipline separate.
Potremo utilizzare gli strumenti GIS non soltanto per studiare il fenomeno geografico, ma anche per studiare geograficamente il comportamento dell'intelligenza artificiale che lo sta interpretando.
E questa potrebbe diventare una delle aree più interessanti della prossima generazione di GeoAI.
Nessun commento:
Posta un commento