控制变量 / 多目标分析
控制变量 / 多目标分析:净效应、协同—权衡与支持域敏感性
本章对应
spatial_structure_analysis/control_target_unit_scale.py的当前实现,分别说明统计单元尺度与邻域作用尺度页面。该模块继承结构/响应尺度轴的公共网格、特征计算、阶段复用、尺度诊断与空间导出能力,并增加多源角色、控制后净效应、多目标协同/权衡、Pareto 和支持域敏感性。
1. 分析问题与变量角色
普通尺度轴分析关注 $Y=f(X\mid s)$;控制变量/多目标分析关注:
$$ \mathbf{Y}_i(s)=f!\left(\mathbf{X}_i(s),\mathbf{C}_i(s)\mid s,\mathcal{G}\right)+\vec{\varepsilon}_i, $$
并进一步比较多个目标的方向一致性:
$$ \text{目标关系}(s)\in{\text{协同},\text{权衡},\text{Pareto 共赢}}. $$
| 角色 | 符号 | 含义 | 示例 |
|---|---|---|---|
| 主结构源 | $\mathbf X$ | 研究重点的空间结构或结构特征 | 土地覆盖、蓝绿格局、道路形态 |
| 控制变量源 | $\mathbf C$ | 可能同时影响结构与响应的背景变量 | DEM、建筑高度、人口、背景气象 |
| 响应目标源 | $\mathbf Y=(Y_1,\ldots,Y_T)$ | 需要同时优化或解释的多个结果 | 降低 LST/PM2.5,同时提高 NDVI/生态服务 |
| 空间尺度 | $s$ | 规则统计单元边长或邻域窗口 | 500–3000 m,或 3×3–17×17 |
“控制”表示在模型中加入协变量或比较控制变量模型与完整模型,不等同于随机实验。即使控制后净效应明显,也应表述为“调整已纳入控制变量后的剩余关联/解释增量”。
[1] 统计单元尺度控制变量 / 多目标分析
1.1 页面总览
统计单元模式在同一规则样方上提取主结构、控制变量和响应特征。每个尺度会形成一套位置完全对应的设计矩阵。
图 1-1 控制变量/多目标统计单元尺度完整配置:多源选择、规则网格、特征、方法、性能和阶段化运行。
图 1-2 统计单元尺度控制变量/多目标主界面与阶段结果。右侧结果页用于查看批处理、曲线、尺度诊断、综合报告和栅格导出。
1.2 样本组织
对尺度 $s$ 的样方 $Q_i(s)$:
$$ \mathbf X_i(s)=\phi_X(S_X\cap Q_i),\quad \mathbf C_i(s)=\phi_C(S_C\cap Q_i),\quad \mathbf Y_i(s)=\phi_Y(S_Y\cap Q_i). $$
多源字段进入表格前自动加角色与来源前缀,避免不同文件产生同名特征。只有 grid_row、grid_col、block_pixels 等位置索引完全一致的记录才进入统一样本表。
[2] 邻域作用尺度控制变量 / 多目标分析
2.1 页面总览
邻域模式固定公共中心支持域,主结构和控制变量在不同滑窗中提取,多个响应目标在中心支持域上按所选聚合方式取值。
图 2-1 控制变量/多目标邻域作用尺度完整配置:多主结构、多控制变量、多响应目标、中心响应聚合和窗口序列。
图 2-2 邻域作用尺度主界面与阶段结果:先确定公共支持域,再比较不同奇数窗口的净效应与协同/权衡。
2.2 中心支持域响应聚合
对中心支持域 $G_i$ 内的有效响应值 $V_i={v_{ij}}_{j=1}^{n_i}$,界面提供:
| 选项 | 公式 | 适用情形 |
|---|---|---|
| 均值(默认) | $y_i=\frac1{n_i}\sum_jv_{ij}$ | 稳定表达中心支持域总体水平 |
| 中位数 | $y_i=Q_{0.5}(V_i)$ | 异常值或偏态明显 |
| 75 分位数 | $y_i=Q_{0.75}(V_i)$ | 关注高暴露/高值状态 |
| 最大值 | $y_i=\max(V_i)$ | 关注极端风险;对噪声敏感 |
| 中心点单像元 | $y_i=v(r_i,c_i)$ | 原始响应像元可靠且无需支持域平滑 |
选择会写入 manifest。不同聚合方式改变响应定义,不能把各自最优窗口当作同一实验结果直接合并。
2.3 公共支持域
若主结构源、控制变量源和响应源的有效范围分别为 $E_k$,公共支持域仍为:
$$ E_{\cap}=\bigcap_kE_k. $$
对齐锚点只决定公共网格的原点/相位与边界裁取,不把分析强制固定到某一个响应源的原始分辨率。窗口 $\mathcal N_w(i)$ 只改变结构和控制变量的邻域范围,中心支持域响应 $G_i$ 保持定义不变。
[3] 数据预处理与设计矩阵
3.1 质量过滤与标准化
对选中字段先数值化,将无穷值转为缺失;有效样本不足或标准差不大于 $10^{-12}$ 的列被剔除。缺失值用该列有效值中位数填补。保留列再标准化:
$$ z_{ij}=\frac{x_{ij}-\bar x_j}{\sigma_j}. $$
因此线性残差、正则化和树模型中的特征位于可比较尺度。最小有效样本通常为 12;单个轻量相关方法另有 4、6 或 8 的下限。
3.2 响应建模组
响应特征会按 schema 中的来源、特征与分量语义组织为建模组。例如 GLCM 的粗糙度分量可组成一组,均值与标准差通常分开。每组形成目标 $y_t$;多维组由公共建模逻辑聚合成一维目标后进入控制/多目标方法。
3.3 目标方向自动转换
不同目标的“好”方向可能相反。代码根据响应组标签推断方向符号 $d_t\in{-1,+1}$:污染、浓度、temperature、heat、LST、risk、noise、error、burden 等默认为最小化;biodiversity、habitat、service、access、benefit、cooling、蓝/绿等默认为最大化;未识别项默认为最大化。
标准化期望度为:
$$ D_{it}=d_t\frac{Y_{it}-\mu_t}{\max(\sigma_t,10^{-9})}. $$
$D_{it}$ 越大表示样本 $i$ 在目标 $t$ 上越符合期望方向。自动推断只是可复现的标签规则,不理解研究语境;运行前应检查响应命名,避免“高值更好/更差”被误判。
[4] 基础关系与控制相关:代码对应公式
4.1 综合信号
为轻量协同/权衡相关构造综合信号。当前代码取完整标准化设计矩阵 $X_{full}=[X,C]$ 中前至多 4 个保留列:
$$ S_i=\frac1K\sum_{k=1}^{K}X^{full}{ik},qquad K=\min(4,p{full}). $$
因此结果中的“主结构综合信号”是界面语义标签;严格按实现,它可能包含排在前部的控制变量列。若需要纯主结构效应,应优先解释 Partial Correlation 或“控制后净效应”结果。
4.2 Pearson、Spearman 与 Kendall
| 方法 | 公式 | 解释 |
|---|---|---|
| Pearson 协同/权衡 | $r=\frac{\sum_i(S_i-\bar S)(y_i-\bar y)}{\sqrt{\sum_i(S_i-\bar S)^2\sum_i(y_i-\bar y)^2}}$ | 正值偏同向协同,负值偏反向权衡;至少 4 个样本 |
| Spearman | $\rho_s=\operatorname{corr}(rank(x),rank(y))$ | 基础阶段逐结构特征计算,报告相关与 P 值 |
| Kendall | $\tau=(N_c-N_d)/\binom n2$(实现使用可处理并列的 SciPy Kendall) | 秩次关系,对异常值更稳健;可设 sample_cap |
相关符号只表示方向。多个响应方向必须先确认是否已按期望方向处理;否则“负相关”不能自动等价为业务权衡。
4.3 偏相关
主结构信号取标准化主结构矩阵前至多 4 列的均值:
$$ S_i^{X}=\frac1K\sum_{k=1}^{K}X_{ik}. $$
以控制矩阵 $Z$ 分别回归 $S^X$ 和 $y$:
$$ \hat\beta_X=\arg\min_\beta|S^X-Z\beta|_2^2, \quad e_X=S^X-Z\hat\beta_X, $$
$$ \hat\beta_Y=\arg\min_\gamma|y-Z\gamma|_2^2, \quad e_Y=y-Z\hat\beta_Y, $$
$$ r_{XY\cdot Z}=\operatorname{corr}(e_X,e_Y). $$
输入已标准化,当前最小二乘未另加显式截距。无控制变量时退化为 Pearson。默认最少样本 8;大数据保护可限制样本和控制变量数量。
4.4 距离相关
距离矩阵双中心化后:
$$ dCor(X,Y)=\frac{\sqrt{\max(\overline{AB},0)}}{\sqrt{\sqrt{\max(\overline{A^2},0)}\sqrt{\max(\overline{B^2},0)}}}. $$
它能识别一般非线性依赖,但时间和内存约为 $O(n^2)$;sample_cap/max_exact_samples 用于大数据保护。
[5] 多目标协同、权衡、协调与 Pareto
设样本 $i$ 有至少两个有效方向标准化目标 $D_{i1},\ldots,D_{iT}$。
5.1 Synergy Index
局部协同分数:
$$ S_i=\frac1{T_i}\sum_{t\in\mathcal V_i}D_{it}. $$
当前代码的尺度级协同得分为:
$$ S_{global}=\frac{\operatorname{mean}_i(S_i)}{\max[\operatorname{std}_i(S_i),1]}. $$
正值表示目标整体向期望方向移动,负值表示整体偏离期望方向。分母下限 1 防止低方差导致分数放大。
5.2 Trade-off Intensity
局部权衡强度:
$$ T_i=\operatorname{std}{t\in\mathcal V_i}(D{it}), $$
尺度级得分:
$$ T_{global}=\operatorname{mean}_i(T_i). $$
值越大说明同一样本的不同目标期望度越分化;它不提供“哪两个目标冲突”的符号,需要结合成对相关、目标组曲线或局部栅格解释。
5.3 Coupling Coordination Degree
代码以协同水平和权衡强度构造局部协调度。设参数 $\alpha$ 默认 0.5:
$$ U_i=\operatorname{clip}!\left[\alpha\frac{S_i+3}{6},0,1\right], $$
$$ CCD_i=\sqrt{\operatorname{clip}!\left[\frac{1}{1+T_i}U_i,0,1\right]}, \qquad CCD=\operatorname{mean}_i(CCD_i). $$
高 $S_i$、低 $T_i$ 才得到高协调度。$+3$ 与 /6 将常见标准分数范围近似映射到 $[0,1]$,极端值会被截断。
5.4 Pareto Frontier
所有目标已统一为“越大越好”。样本 $a$ 支配样本 $b$ 当且仅当:
$$ D_{at}\ge D_{bt}\ \forall t, \qquad \exists t:D_{at}>D_{bt}. $$
不被任何其他样本支配的样本属于第一前沿,Pareto rank=1。尺度得分为共赢样本占比:
$$ P_{win}(s)=\frac{#{i:rank_i=1}}{N_{complete}}. $$
二维目标使用快速非支配排序;高维样本数超过默认 max_exact_samples=20000 时,从最多 approx_sample_cap=10000 个样本构建近似前沿,再批量判断其他样本,报告中会注明近似保护。
[6] 控制后净效应与多目标效应方向
6.1 Elastic Net
完整模型使用 $[X,C]$,控制模型仅使用 $C$:
$$ \hat\beta=\arg\min_\beta\left{\frac1{2n}|y-Z\beta|_2^2+\lambda\left[\alpha|\beta|_1+\frac{1-\alpha}{2}|\beta|_2^2\right]\right}. $$
当前 ElasticNetCV 默认 5 折、l1_ratio=(0.2,0.5,0.8,0.95,1.0)、最大迭代 20000。控制后主结构净解释增量定义为:
$$ \Delta R_X^2=R^2_{full}(X,C)-R^2_{control}(C). $$
同时报告 main_only、control_only、主导主结构和主控制变量。$\Delta R_X^2<0$ 可能来自正则化、采样、模型不稳定或冗余,不应机械解释为“负贡献”。
6.2 PLS / sPLS 语义
PLS 分解:
$$ X=TP^T+E,\qquad y=Uq^T+f, $$
并选择使 $\operatorname{Cov}(t,u)$ 较大的潜变量。当前实现为 PLSRegression,默认 n_components=2,净效应同样用 $R^2_{full}-R^2_{control}$。界面名称保留“PLS / sPLS”,但当前执行逻辑是标准 PLS,不包含额外稀疏惩罚。
6.3 跨目标效应向量相似度
对同一方法在两个响应目标上的主结构重要度向量 $\mathbf w_a,\mathbf w_b$,代码计算:
$$ \cos\theta=\frac{\mathbf w_a^T\mathbf w_b}{|\mathbf w_a|_2|\mathbf w_b|_2}. $$
当前进入该式的是 Elastic Net 系数绝对值或 PLS 权重绝对值,因此结果主要表示“主导结构是否一致”,通常位于 $[0,1]$;效应正负方向的冲突应从 Pearson/Kendall、目标期望度或原始系数补充判断。
局部净效应可按:
$$ NE_i=\sum_{k\in X}x_{ik}\hat\beta_k $$
回写到 stage_d_spatial_outputs.csv,再导出为栅格。
[7] 机器学习与空间方法
7.1 树模型
| 方法 | 当前默认 | 说明 |
|---|---|---|
| Random Forest | n_estimators=400, max_depth=12, min_samples_leaf=2 |
Bagging 非线性回归,稳健起点 |
| XGBoost | 300 棵、深度 4、学习率 0.05、hist |
复杂非线性和交互;依赖可用时执行 |
| LightGBM | 300 棵、31 叶、学习率 0.05 | 高效梯度提升;依赖可用时执行 |
| CatBoost | 300 轮、深度 6、学习率 0.05 | 稳健提升树;依赖可用时执行 |
拟合得分使用:
$$ R^2=1-\frac{\sum_i(y_i-\hat y_i)^2}{\sum_i(y_i-\bar y)^2}. $$
优先用 SHAP 解释:
$$ f(x)=\mathbb E[f(X)]+\sum_j\phi_j, \qquad I_j=\operatorname{mean}i|\phi{ij}|. $$
SHAP 不可用或失败时使用置换重要度:
$$ I_j^{perm}=Score(X,y)-Score(X_{\pi(j)},y), $$
再失败时退回模型原生 feature_importances_。结果备注会记录抽样/降维保护。
7.2 Spatial Block CV
将空间位置划为互斥块 $B_1,\ldots,B_K$,每轮用 $B_k$ 测试、其余块训练,汇总空间外推 $R^2$。它用于检查模型是否依赖近邻泄漏;得分显著低于普通拟合是常见且有信息的结果。
7.3 MGWR / Spatial Durbin
$$ y_i=\beta_0(u_i,v_i)+\sum_k\beta_k(u_i,v_i)x_{ik}+\epsilon_i, $$
$$ y=\rho Wy+X\beta+WX\theta+\epsilon. $$
可选依赖库可用、位置完整且样本达到阈值时执行。局部系数、局部 $R^2$ 或溢出结果可以写入样方级空间输出;这些模型表达空间非平稳/溢出,不自动建立因果方向。
[8] 固定尺度协同/权衡结果
图 8-1 统计单元固定尺度协同/权衡批处理:逐尺度查看净效应、多目标指数、Pareto 与模型结果。
图 8-2 邻域作用固定窗口批处理:比较每个窗口下的协同、权衡和控制后结果。
阅读固定尺度表时:
R2/得分的含义随方法改变,不能跨方法直接比较数值大小;- 正负只在有方向的方法中解释;Pareto share、CCD、距离相关等为非负量;
- 检查“响应统计值”确认目标组/分量;
- 检查“备注”确认 full/control 模型、近似保护、依赖退化和局部输出;
- 检查样本数,避免粗尺度的小样本偶然高分。
[9] 共赢—冲突尺度曲线
图 9-1 统计单元尺度共赢—冲突曲线:比较净效应、协同、权衡、协调与 Pareto 得分随样方尺度的变化。
图 9-2 邻域作用尺度共赢—冲突曲线:识别从局地窗口到较大邻域的协同/权衡变化。
推荐把曲线按意义分组:
| 曲线 | 较大值通常表示 |
|---|---|
| 控制后净效应 | 主结构在控制背景后的解释增量更高 |
| Synergy Index | 多目标整体更朝期望方向变化 |
| Trade-off Intensity | 目标分化/冲突更强,不是“更优” |
| CCD | 高协同、低分化的协调状态 |
| Pareto share | 第一前沿共赢样本占比更大 |
Trade-off 的峰值表示冲突最明显的尺度,应与 Synergy/CCD/Pareto 共同使用,不应作为“最优尺度”。
[10] 协同/权衡尺度诊断
图 10-1 统计单元协同/权衡尺度诊断:按响应组和方法汇总最佳尺度、平台区、断点、AUC 与一致性。
图 10-2 邻域作用尺度诊断:识别净效应峰值、协同峰值、权衡峰值、共赢峰值和窗口转折。
10.1 专用尺度方法
这些方法复用结构/响应尺度轴中的 95% 平台、[0.25,0.5,0.25] 平滑、Bootstrap、断点和 AUC 计算。
| 方法 | 计算含义 | 结论写法 |
|---|---|---|
| 净效应峰值 | $s_{NE}^*=\arg\max_s\Delta R_X^2(s)$ | 控制后主结构解释增量最大的尺度 |
| 协同峰值 | $s_S^*=\arg\max_sS_{global}(s)$ | 多目标朝期望方向共同改善最强的尺度 |
| 权衡峰值 | $s_T^*=\arg\max_sT_{global}(s)$ | 目标分化最强、需重点治理冲突的尺度 |
| 共赢峰值 | $s_P^*=\arg\max_sP_{win}(s)$ | Pareto 第一前沿占比最大的尺度 |
| 稳定一致性 | 比较各方法峰值尺度,界面“一致性”当前报告 $\sigma(s_1^,\ldots,s_M^)$ | 越小表示方法峰值更集中 |
| 转折尺度 | 斜率突变或分段回归最小 RSS 断点 | 协同—权衡趋势发生明显切换的候选尺度 |
| 支持域敏感性 | 重算不同锚点和窗口方案并比较结论 | 仅邻域模式可用 |
| 综合协同报告 | 汇总净效应、协同、权衡、Pareto、平台、断点与一致性 | 形成最终多目标尺度摘要 |
如果某响应组有多个方法,特征诊断表保留最佳得分与 AUC 更强的候选行;方法诊断对同尺度多条得分先求平均再计算曲线指标。
[11] 支持域敏感性(邻域模式)
支持域敏感性不是读取一次结果做简单排序,而是建立情景并重跑所需前置阶段。
11.1 对齐锚点情景
对候选锚点 $a\in\mathcal A$,重新构建公共网格 $\mathcal G_a$,获得诊断结论 $T_a$。若同一主方法/目标的主尺度在不同锚点下接近,说明对网格相位更稳健。
可用尺度差异表示为:
$$ \Delta_a=|s_a^-s_{baseline}^|. $$
11.2 窗口方案情景
对窗口序列方案 $W_b$ 重建样本和结果,例如局地密集序列、扩展大窗口序列。比较峰值、平台、AUC、主方法和样本数是否保持。
11.3 解释原则
- 锚点变化导致结论剧烈改变:可能存在相位敏感、边界破碎或源分辨率冲突;
- 窗口方案变化使峰值总落在端点:原窗口搜索范围不足;
- 主尺度近似稳定但得分波动:空间范围较稳,强度对支持定义敏感;
- 主方法、主目标和尺度均稳定:结论相对稳健,但仍不等于因果证据。
输出包括锚点比较 CSV、窗口比较 CSV、情景 manifest 与稳健性报告,并会在阶段表中显示 E+ 支持域敏感性。
[12] 综合协同报告
图 12-1 统计单元尺度综合协同报告:按响应组汇总最佳尺度、净效应、协同/权衡、主导因素和方法结论。
图 12-2 邻域作用尺度综合协同报告:在多目标结论之外整合支持域/窗口稳健性。
报告的关键部分包括:
- 每个响应组最强方法、最佳尺度、平台区与最佳得分;
- 方法级 AUC、峰值尺度离散和转折候选;
- 控制后净效应的 full/main/control 模型对比;
- 多目标协同、权衡与 Pareto 的主要尺度;
- 主导主结构、主控制变量和树模型重要度;
- 邻域模式的锚点与窗口敏感性。
AI 解释不参与数值计算。报告中出现“驱动”“影响”时,应结合研究设计人工改写为与证据等级相符的“关联”“解释增量”或“条件依赖”。
[13] 样方级结果与多波段 GeoTIFF
13.1 可导出的局部量
| 方法 | 样方级字段示例 | 值的含义 |
|---|---|---|
| Synergy | stage_d__local_synergy_index |
$S_i$,局部多目标平均期望度 |
| Trade-off | stage_d__local_tradeoff_intensity |
$T_i$,局部目标分化 |
| CCD | stage_d__local_coupling_coordination |
$CCD_i$,局部协调度 |
| Pareto | stage_d__pareto_rank |
非支配等级,1 为第一前沿 |
| Pareto | stage_d__pareto_winwin_mask |
第一前沿掩膜,1 为共赢样本 |
| Elastic Net / PLS | stage_d__net_effect__... |
主结构局部线性净效应 |
| MGWR / 空间模型 | 局部系数、局部 $R^2$ 等 | 空间非平稳结果,视依赖与方法而定 |
位置索引与字段写入 stage_d_spatial_outputs.csv,schema 记录方法、响应组和解释。
13.2 统计单元尺度导出
图 13-1 控制变量/多目标统计单元结果导出:选择目标投影、单元大小、尺度、结果图层和输出路径。
图 13-2 统计单元尺度多波段列表:不同净效应、协同/权衡或空间模型字段作为独立波段。
13.3 邻域作用尺度导出
图 13-3 控制变量/多目标邻域作用结果导出:按目标窗口和公共中心网格回写空间结果。
图 13-4 邻域模式待导出波段:可组合局部协同、权衡、CCD、Pareto 与净效应。
导出为单一多波段 GeoTIFF,NoData 为 -9999。只有同一目标 CRS、目标像元大小和尺度下的候选能组成一致波段组。导出后应保存波段说明和 schema,并在 GIS 中检查边缘空值、空间相位和异常热点。
[14] 阶段文件与复用
| 阶段 | 主要内容 | 典型文件 |
|---|---|---|
| A | 多主结构与控制变量特征 | stage_a_structure_features.csv 及 schema |
| B | 响应特征或中心支持域响应 | stage_b_response_features.csv |
| C | 统一多角色样本 | stage_c_quadrat_dataset.csv |
| D | 基础关系、多变量、控制/多目标与局部空间输出 | stage_d_relations.csv、stage_d_multivariate.csv、stage_d_control_target.csv、stage_d_spatial_outputs.csv |
| E | 响应组/方法尺度诊断与综合协同报告 | stage_e_feature_scale_diagnostics.csv、stage_e_method_scale_diagnostics.csv、stage_e_scale_report.txt |
| E+ | 邻域支持域锚点/窗口情景比较 | support sensitivity 比较表、报告与 scenario manifest |
“复用”只读取参数和数据签名匹配的正式结果;“从临时文件恢复”用于中断任务。改变目标方向、响应聚合、对齐锚点、尺度、源数据或方法参数后,应创建新批次或关闭复用重算。
[15] 方法参数速查
| 方法 | 关键参数 | 当前默认/说明 |
|---|---|---|
| Pearson / Kendall | min_samples |
4;Kendall 可设置 sample_cap |
| Partial Correlation | min_samples, sample_cap, max_control_features |
基础默认最少 8;优化策略可抽样/限列 |
| Synergy | aggregation |
目录默认 mean;实际使用目标标准化均值 |
| Trade-off | aggregation |
目录默认 std;实际使用目标标准差 |
| CCD | alpha |
0.5 |
| Pareto | direction, max_exact_samples, approx_sample_cap |
方向自动;大数据策略可注入后两项 |
| Elastic Net | cv, l1_ratio_grid |
5;默认比例网格 0.2–1.0 |
| PLS | n_components |
2 |
| Random Forest | 树数、深度、叶最小样本 | 400 / 12 / 2 |
| XGBoost | 树数、深度、学习率 | 300 / 4 / 0.05 |
| LightGBM | 树数、叶数、学习率 | 300 / 31 / 0.05 |
| CatBoost | 轮数、深度、学习率 | 300 / 6 / 0.05 |
| 树重要度 | importance_mode, shap_sample_cap, permutation_repeats |
自动 SHAP→置换→原生;置换默认 6 次 |
| Spatial Block CV | blocks / cv | 基础默认 4 / 4 |
“快速默认”“自动优化”和“大数据保护”可能根据样本数、特征数和资源预算修改抽样上限、特征上限、树数量或并发。最终参数以 manifest 和结果备注为准。
[16] 推荐操作流程
- 完成数据与对齐,确保主结构、控制变量和所有响应在公共范围内。
- 明确每个响应的优化方向;必要时通过清晰字段名表达“越高越好/越低越好”。
- 选择统计单元或邻域作用模式。邻域模式明确中心支持域响应聚合。
- 加载多源,给每个源正确分配主结构、控制变量或响应角色。
- 设置对齐锚点和尺度/窗口序列,先估算最粗尺度有效样本。
- 选择结构与响应特征,优先保留可解释且不高度冗余的指标。
- 先运行 Pearson/Spearman/Kendall、Partial、Synergy、Trade-off、CCD 和 Pareto;样本足够再加入 Elastic Net、PLS、树模型和空间方法。
- 检查固定尺度表,再阅读共赢—冲突曲线和尺度诊断。
- 邻域模式正式结论前运行支持域敏感性。
- 导出局部协同、权衡、Pareto 或净效应 GeoTIFF,与原始结构/响应叠加复核。
[17] 解释边界与常见误区
| 误区 | 正确处理 |
|---|---|
| 把控制后净效应当作因果效应 | 说明只控制了已纳入的变量,仍可能有遗漏混杂 |
| 把 Trade-off 峰值当作最佳尺度 | 它表示冲突最强,应与 Synergy、CCD、Pareto 联合判断 |
| 自动方向推断后不复核 | 根据业务语义人工确认每个响应的期望方向 |
| 用树模型训练 $R^2$ 宣称泛化性能 | 同时查看 Spatial Block CV 或独立验证 |
| 把 SHAP 当作因果贡献 | SHAP 分解模型预测,不证明干预效应 |
| 比较不同方法的原始得分大小 | 按各方法语义比较曲线、排序和尺度诊断 |
| 忽略支持域 | 在报告中写明对齐锚点、中心响应聚合和窗口序列 |
| 只看总体值不看空间图 | 导出样方级结果,检查热点是否由边界、NoData 或异常样本造成 |
可靠结论应同时包含:控制变量定义、响应方向、尺度/窗口、方法公式、样本数、得分与不确定性、支持域稳健性以及局部空间证据。