导读:空间过程广泛存在于社会、生态、环境与公共健康系统之中,但如何同时实现“预测准确”与“机制可解释”,一直是空间建模研究中的核心难题。传统地理加权回归能够提供位置特异性的可解释系数,却难以刻画复杂、高维、非线性的空间关系;机器学习模型虽然预测能力更强,却往往难以直接量化空间变化关系,通常需要借助SHAP等事后(post hoc)可解释性方法辅助揭示变量贡献。该研究提出 GWRBoost 框架,将地理加权回归与梯度提升思想相结合,在提升模型精度的同时保留局部线性系数解释能力,为空间异质性关系的可解释建模提供了新的方法工具。空间数据并非普通表格数据。地理现象通常同时具有两个基本特征:一是空间依赖,即相近位置之间往往具有相似属性;二是空间异质性,即变量之间的关系会随地理位置发生变化。
长期以来,地理加权回归(Geographically Weighted Regression, GWR)是刻画空间异质性关系的重要方法。它能够在每个空间位置估计局部回归系数,从而回答“某个因素在不同地方影响有多大”这一问题。然而,随着地理大数据的发展,研究对象越来越高维、复杂和非线性,传统 GWR 由于以线性回归为基础,容易出现欠拟合,难以充分捕捉复杂空间过程。
与之相对,随机森林、XGBoost、神经网络等机器学习方法具有更强的预测能力,但其内部机制通常较为复杂,难以直接给出类似回归系数的空间变化关系显式量化结果,通常需要借助 SHAP 等事后(post hoc)可解释性方法辅助揭示变量贡献。换言之,机器学习擅长“预测是什么”,也能解释“哪些变量贡献更大”,却不一定擅长直接量化“为什么在这里是这样”。
因此,一个关键问题随之出现:能否构建一种方法,既具备机器学习的优化能力,又保留 GWR 的显示空间解释优势?
为解决这一问题,研究提出了 GWRBoost:一种地理加权梯度提升框架。其核心思想是,将 GWR 作为基础学习器,引入梯度提升中的逐步残差学习机制,使模型在多轮迭代中不断修正上一阶段未能解释的空间残差。
具体而言,GWRBoost 首先在每个空间位置执行一次传统 GWR,得到初始局部系数和预测结果;随后将预测残差作为下一轮学习的目标,再次进行地理加权回归;经过多轮迭代后,模型将各阶段得到的局部参数进行累加,形成最终的 boosted coefficient,即增强后的空间变化系数。
这一设计带来两个关键优势:
第一,模型通过残差传递机制实现更接近全局优化的拟合过程,缓解传统 GWR 局部独立估计所导致的欠拟合问题;
第二,模型最终仍然保留局部线性结构,因此可以输出空间位置特异性的可解释系数,而不是退化为难以解释的“黑箱”模型。

图1|GWRBoost 总体框架。模型以 GWR 为基础过程,通过逐阶段残差传递与参数累加,实现空间关系系数的增强估计。
更重要的是,由于 GWRBoost 仍保留线性模型结构,研究进一步推导了其自由度与 AIC/AICc 计算方式,使该模型能够与 OLS、SEM、SLM、SDM、GWR、MGWR 等传统空间模型进行统一、可比的模型选择与性能评估。这一点是许多非参数机器学习模型难以直接实现的。
为检验 GWRBoost 的有效性,研究设计了模拟实验,并选取三个不同尺度、不同领域的实证案例进行验证,覆盖计算社会科学、生态学与公共健康等典型空间分析场景。
模拟实验:能否准确恢复真实空间关系?
研究首先构建了一个 25 × 25 的规则网格模拟数据集,共 625 个空间样本,并设定四类空间变化系数:平稳系数、低异质性系数、中等异质性系数和高异质性系数。通过 100 组独立模拟数据,评估不同模型对空间变化关系的恢复能力。
结果显示,局部空间模型整体优于全局模型,而 GWRBoost 在拟合精度与参数估计精度方面均表现最好。就空间变化系数估计误差而言,GWRBoost 的平均 RMSE 为 9.79,低于传统 GWR 的 11.60 和 MGWR 的 10.14,说明其能够更准确地恢复真实的空间异质性关系。

图2|模拟实验结果。GWRBoost 在 RSS、AIC、AICc、R²、调整R²以及空间系数估计误差等指标上整体优于基准模型,尤其在高异质性空间关系识别方面表现突出。
区域案例:纽约市收入与教育关系
在区域尺度上,研究以纽约市为案例,分析平均收入与教育水平指标之间的空间变化关系。数据覆盖纽约市 783.8 平方公里范围内的 2216 个统计区块,并选取多个教育相关变量作为解释变量。
结果表明,相比 OLS、SEM、SLM、SDM 等全局模型,GWRBoost 能更有效刻画局部社会经济关系。与 GWR 和 MGWR 相比,GWRBoost 估计出的系数变化范围更广,能够识别更加集中和强烈的空间异质性,尤其适用于城市内部差异显著、邻近区块属性快速变化的场景。

图3|纽约市区域案例结果。GWRBoost 能够在紧凑城市空间中识别更细粒度的收入—教育关系异质性,并减少传统模型中残差空间聚集现象。
国家案例:澳大利亚城市化与哺乳动物多样性关系
在国家尺度上,研究以澳大利亚为案例,探讨城市化强度、自然环境因素与哺乳动物生物多样性之间的关系。案例共包含 703 个统计区块,变量包括人口密度、降水、地表温度、夜间灯光强度以及不同土地利用类型比例等。
这一案例具有明显挑战:统计单元尺度差异较大,生物多样性和城市化变量分布呈现长尾特征,空间异质性显著。结果显示,GWRBoost 在该尺度下仍然优于其他基准模型。其预测值与观测值之间的拟合斜率达到 0.635,高于 GWR 的 0.380 和 MGWR 的 0.493,表明 GWRBoost 对复杂空间变化关系具有更强捕捉能力。

图4|澳大利亚国家尺度案例结果。GWRBoost 在生物多样性—城市化关系建模中表现出更强的拟合能力和更灵活的局部参数估计能力。
全球案例:环境因素与预期寿命关系
在全球尺度上,研究进一步分析 180 个国家的预期寿命与环境因素之间的关系。解释变量涵盖自然气候条件和空气污染指标,包括温度、降水、气压、风速以及 NO₂、O₃、SO₂等污染物。
结果显示,在变量更复杂、尺度更大的全球案例中,GWRBoost 的优势更加明显。其 RSS 为 15.66,接近 GWR(34.10)的一半,也显著低于 MGWR(26.96)。在预测值与真实值对比中,GWRBoost 的回归斜率达到 0.911,截距接近 0,说明模型预测与真实观测高度一致,能够更充分捕捉全球尺度环境—健康关系中的复杂空间模式。

图5|全球预期寿命案例结果。GWRBoost 在全球尺度多变量空间建模中显著降低残差,并提升预测值与真实值的一致性。
该研究的核心贡献,不只是提出了一个性能更高的空间模型,更在于重新平衡了空间建模中的两个目标:预测精度与机制解释。
其方法意义主要体现在以下四个方面:
保留可解释系数:GWRBoost 最终仍输出位置特异性的局部线性系数,使研究者能够直接分析变量影响如何随空间变化,而不仅仅获得一个预测结果;
提升复杂关系拟合能力:通过逐阶段残差学习,模型能够缓解传统 GWR 在复杂、高维和高度异质空间数据中的欠拟合问题;
兼容传统模型评价体系:GWRBoost 可计算 AIC/AICc 等模型选择指标,支持与经典空间回归模型进行严谨比较;
具备跨尺度适用性:从城市区块、国家统计单元到全球国家尺度,GWRBoost 均表现出稳定优势,说明其不仅适用于单一领域,也可推广至多类空间过程建模任务。

图6|GWRBoost 残差传递机制与敏感性分析。模型通过逐阶段学习扩大有效信息范围,同时利用学习率、带宽和 AICc 监控控制过拟合风险。
在地理空间大数据快速发展的背景下,空间科学面临的不只是“模型能否预测得准”,更是“模型能否解释空间过程如何发生”。如果只追求预测精度,模型可能变成难以理解的黑箱;如果只强调可解释性,又可能无法适应复杂空间系统中的非线性和高维特征。
GWRBoost 的提出,为这一矛盾提供了一种新的解决路径:通过梯度提升增强 GWR 的拟合能力,同时保留局部回归系数这一核心解释结构。它在方法上连接了空间统计与机器学习,在应用上可服务于城市社会经济分析、生态保护、环境健康、公共政策评估等多个领域。
该研究表明,未来的空间建模不应在“准确”与“可解释”之间二选一,而应发展能够同时服务预测、解释和科学推断的新型地理智能方法。
该研究成果发表于 Annals of the American Association of Geographers。论文第一作者为北京大学遥感与地理信息系统研究所硕士毕业生王晗,通讯作者为黄舟教授。研究得到了国家自然科学基金项目的支持。论文代码与处理后数据集已在 GitHub 开放 https://github.com/HanwGeek/GWRBoost。
Han Wang, Zhou Huang, Hao Guo, Ganmin Yin, Yi Bao, Xiao Zhou, Yong Gao & Linna Li. GWRBoost: A Geographically Weighted Gradient Boosting Framework for Enhanced Explainable Quantification of Spatially Varying Relationships. Annals of the American Association of Geographers, 2026. DOI: 10.1080/24694452.2026.2648327