空间结构关系分析总览
空间结构关系分析:总览、数据与对齐
本章对应“空间结构关系分析”一级模块的总体方法框架、“数据与对齐”页面以及“结构/响应特征和方法查看”页面。后续三个专题分别详述结构/响应特征尺度轴、控制变量/多目标分析和贝叶斯网络分析。
1. 模块要解决什么问题?
空间结构关系分析不是把两幅栅格简单地做一次相关分析,而是把“空间支撑、特征提取、关系估计、尺度诊断和空间回图”组织成可复用的研究流程。典型问题包括:
- 土地覆盖组成、斑块破碎化、边界形态或连通性与 LST、NDVI、ETa、PM2.5 等响应之间是否存在关系;
- 关系在 30 m、60 m、120 m 等统计单元尺度下是否改变;
- 以同一公共中心点为基础,3×3、5×5、7×7 等邻域窗口中哪一个更能解释响应;
- 控制地形、建筑高度或其他背景变量后,主结构是否仍有净效应;
- 多个响应目标之间表现为协同、权衡还是 Pareto 共赢;
- 变量的条件依赖网络及其方向在不同尺度上是否稳定。
统一写成尺度条件下的关系问题为:
$$ \mathbf{Y}_i(s)=f!\left(\mathbf{X}_i(s),\mathbf{C}_i(s)\mid s,\mathcal{G}\right)+\vec{\varepsilon}_i, $$
其中:
| 符号 | 含义 |
|---|---|
| $i$ | 统计单元或公共支持域中心样本编号 |
| $s$ | 统计单元边长或邻域窗口尺度 |
| $\mathbf{X}_i(s)$ | 主空间结构特征向量 |
| $\mathbf{C}_i(s)$ | 可选控制变量特征向量 |
| $\mathbf{Y}_i(s)$ | 一个或多个响应目标/响应特征 |
| $\mathcal{G}$ | 统一投影、范围、分辨率与对齐相位定义的公共网格 |
| $f(\cdot)$ | 相关、非线性依赖、空间统计、多变量或贝叶斯网络方法 |
| $\vec{\varepsilon}_i$ | 未解释误差向量 |
分析的核心不是只求一个 $f$,而是比较 $f$ 的强度、方向、稳定性和解释变量如何随 $s$ 改变。
2. 页面与分析链条
模块由四个一级页面组成:
| 页面 | 核心任务 | 主要产物 |
|---|---|---|
| 数据与对齐 | 登记多源数据、选择波段/聚合统计、裁切、重投影、对齐并生成建模数据集 | 预处理栅格、元数据、aligned_modeling_dataset.npz |
| 结构/响应特征尺度轴 | 在统计单元尺度或邻域作用尺度上提取特征、计算关系并做尺度诊断 | 阶段 A–E 表格、尺度曲线、诊断报告、GeoTIFF |
| 控制变量/多目标分析 | 组织主结构、控制变量与多个响应目标,计算净效应、协同/权衡与 Pareto 结果 | 控制后效应、多目标诊断、支持域敏感性、GeoTIFF |
| 贝叶斯网络分析 | 读取各尺度样本表,离散化并进行网络结构学习、CPT、Markov Blanket、稳定性和条件推断 | 网络边、CPT、Blanket、稳定边、交互网络图 |
建议首次使用时按上述顺序完成。贝叶斯网络依赖前置尺度分析生成的 stage_c_quadrat_dataset.csv,不能跳过样本构建直接运行。
3. 特征、关系方法与尺度方法总目录
“结构/响应特征和方法查看”页列出当前版本实际注册的结构特征、响应特征、关系方法和尺度诊断方法。双击任意行可查看方法定位、公式、计算逻辑、参数和适用语义;可用 AI 平台时还能生成更长的解释。
图 3-1 结构特征、响应特征、关系方法与尺度方法总目录;右侧弹窗展示选中方法的公式、实现和解释。
3.1 四类目录的区别
| 目录 | 计算对象 | 典型条目 | 回答的问题 |
|---|---|---|---|
| 空间结构特征 | 分类/结构栅格在样方或窗口内的格局 | 类别占比、Shannon 熵、斑块密度、聚集度、边界密度、核心区指数 | “空间格局是什么样?” |
| 响应特征 | 连续响应栅格在样方内的统计或空间组织 | 均值、标准差、GLCM、半变异函数、梯度、频谱 | “响应在单元内处于什么状态并如何变化?” |
| 关系计算方法 | 结构特征与响应特征/目标的样本列 | Spearman、互信息、距离相关、GeoDetector、Moran、Elastic Net | “结构与响应之间有什么关系?” |
| 尺度分析方法 | 同一关系在多个尺度上的得分序列 | 峰值、平台区、断点、AUC、Bootstrap 区间、一致性 | “关系在哪些尺度最强、最稳或发生转折?” |
3.2 “已注册”不等于“当前一定执行”
方法是否执行由四层条件共同决定:
$$ I_{\mathrm{run}}=I_{\mathrm{implemented}},I_{\mathrm{compatible}},I_{\mathrm{selected}},I_{\mathrm{dependency}}, $$
其中四个指示量依次表示:代码已实现、与当前数据类型/场景兼容、用户已勾选、可选依赖库可用。界面会隐藏未实现方法,依赖库缺失的方法会标为不可用或不进入任务。论文或报告中应只描述最终 manifest 中实际执行的方法。
[1] 数据与对齐
1.1 页面总览
“数据与对齐”统一管理工作空间、结构源、响应源、研究边界、目标投影、预处理输出和建模数据集。该步骤决定后续所有空间样本是否具有可比性。
图 1-1 数据与对齐页面:上部登记结构/响应源及波段与格网聚合统计,中部设置边界和投影,底部生成统一建模数据集。
1.2 输入数据角色
| 角色 | 常见数据 | 推荐数据类型 | 后续用途 |
|---|---|---|---|
| 结构数据源 | 土地覆盖、蓝绿空间、建筑高度分级、道路结构 | 分类栅格优先,也可使用经分类的连续表面 | 计算组成、破碎化、邻接、连通、边界等特征 |
| 响应数据源 | LST、NDVI、ETa、PM2.5、CO2、产量、风险 | 连续栅格 | 计算统计、纹理、半变异、梯度或作为中心支持域响应 |
| 控制变量源 | DEM、坡度、建筑高度、人口、背景气象 | 连续或分类栅格 | 在控制变量/多目标模块中剥离背景影响 |
| 研究边界 | 行政区、研究区、有效观测范围 | GeoJSON 多边形 | 裁切和约束公共分析范围 |
每行数据源可选择参与分析的波段。多波段影像必须核对波段说明、NoData、数据类型、像元大小、CRS 与范围;不能仅凭文件名判断含义。
1.3 格网聚合统计
当预处理或建模数据集启用统一空间网格时,每个目标网格单元 $G_i$ 会对源栅格有效像元集合 $V_i={v_{i1},\ldots,v_{in_i}}$ 计算所选统计量。
| 统计量 | 代码/界面键 | 公式 | 适用说明 |
|---|---|---|---|
| 平均值 | mean |
$\bar v_i=\frac{1}{n_i}\sum_{j=1}^{n_i}v_{ij}$ | 连续变量的中心水平 |
| 中位数 | median |
$\operatorname{median}(V_i)$ | 对异常值更稳健 |
| 标准差 | std |
$\sigma_i=\sqrt{\frac{1}{n_i}\sum_j(v_{ij}-\bar v_i)^2}$ | 单元内部离散程度;实现采用总体标准差 |
| 最小/最大值 | min / max |
$\min(V_i)$ / $\max(V_i)$ | 极端状态 |
| 总和 | sum |
$\sum_j v_{ij}$ | 总量型变量;会混入面积/有效像元数效应 |
| 多数值 | majority |
$\arg\max_c\sum_j\mathbf{1}(v_{ij}=c)$ | 分类栅格;避免对类别编码求平均 |
同一源可以选择多个聚合统计,输出字段会自动附加统计量后缀。分类土地覆盖通常选择多数值;连续 LST、NDVI 等通常选择平均值,并按研究目的补充标准差或极值。
1.4 公共范围、统一投影与目标网格
1.4.1 公共支持域
设已选数据源有效空间范围为 $E_1,E_2,\ldots,E_m$,研究边界为 $B$。所有源必须共同有效时,公共分析范围为:
$$ E_{\cap}=B\cap\bigcap_{k=1}^{m}E_k. $$
若未启用研究边界,则去掉 $B$。$E_{\cap}=\varnothing$ 时不能继续分析;常见原因是 CRS 定义错误、经纬度与投影坐标混用或数据不覆盖同一区域。
1.4.2 目标网格
统一投影为 $\mathrm{CRS}^{*}$、目标分辨率为 $(r_x,r_y)$,公共范围宽高为 $(W,H)$ 时,目标行列数可表示为:
$$ n_{\mathrm{col}}=\left\lceil\frac{W}{r_x}\right\rceil, \qquad n_{\mathrm{row}}=\left\lceil\frac{H}{r_y}\right\rceil. $$
除分辨率外还必须固定左上角原点/相位。两幅栅格即使 CRS 和分辨率相同,只要原点错开半个像元,逐像元或样方比较仍会错位。
1.4.3 重采样选择
| 数据语义 | 推荐重采样 | 原因 |
|---|---|---|
| 分类编码、土地覆盖类别 | 最近邻 | 不产生不存在的中间类别 |
| 连续温度、指数、浓度 | 双线性或连续值适配方法 | 保持连续表面的平滑性 |
| 面积/总量 | 按业务语义选择并验证守恒 | 普通插值可能改变总量 |
1.5 预处理设置
操作顺序如下:
- 设置模块工作空间,建议每个研究批次使用独立目录。
- 在“结构数据源”和“响应数据源”中添加文件,选择参与分析的波段和格网聚合统计。
- 选择研究边界,并按需要勾选“按研究边界进行处理”。
- 设置统一投影。建议使用适合研究区、单位为米的投影坐标系;面积、距离和尺度分析不宜直接使用经纬度。
- 指定结构与响应预处理输出目录。
- 点击“执行预处理”,核对日志中的原始/目标 CRS、分辨率、范围、NoData 与输出路径。
预处理完成后,旧模块会自动切换到新生成的预处理结果;仍应在元数据面板复核路径和像元信息,避免误用上一次批次。
1.6 建模数据集生成
建模数据集把已对齐的结构与响应源转换成同一索引顺序的数组/字段集合。若公共网格含 $N$ 个有效单元,可表示为:
$$ \mathbf{D}=\left[\mathbf{X};\middle|;\mathbf{Y};\middle|;\mathbf{P}\right], $$
其中 $\mathbf{X}\in\mathbb{R}^{N\times p}$ 为结构列,$\mathbf{Y}\in\mathbb{R}^{N\times q}$ 为响应列,$\mathbf{P}$ 保存行列索引或空间坐标。界面可选择:
- 是否统一分辨率;
- 是否统一空间网格;
- 网格边长或目标单元大小;
- 对齐锚点/参考网格;
- 每个数据源采用的聚合统计。
输出通常为 aligned_modeling_dataset.npz,同时保存字段说明、空间元数据和配置状态。NPZ 适合特征筛选/建模;后续尺度轴分析还会按尺度生成 CSV 样本表。
2. 两种尺度轴的空间定义
2.1 统计单元尺度
将公共范围划分为边长为 $s$ 的规则样方 $Q_i(s)$:
$$ \mathbf{X}_i(s)=\phi!\left(S\cap Q_i(s)\right), \qquad \mathbf{Y}_i(s)=\psi!\left(R\cap Q_i(s)\right), $$
$\phi$ 和 $\psi$ 分别为结构与响应特征算子。尺度改变时,样方大小、样本数和单元内部异质性都会改变。这属于可变空间单元问题(MAUP)的一种显式尺度实验。
2.2 邻域作用尺度
先构造固定的公共中心支持域 $G_i$,再以中心 $i$ 配置奇数边长窗口 $\mathcal{N}_w(i)$:
$$ \mathbf{X}_{i,w}=\phi!\left(S\cap\mathcal{N}_w(i)\right), \qquad y_i=\mathcal{A}!\left(R\cap G_i\right), $$
其中 $w\in{3,5,7,\ldots}$,$\mathcal{A}$ 为中心支持域的均值、中位数、P75、最大值或中心像元提取。这里改变的是结构作用邻域,中心响应支持域保持不变,因此更适合解释“周边多大范围的结构影响当前位置响应”。
2.3 不可混用的结论
| 比较项 | 统计单元尺度 | 邻域作用尺度 |
|---|---|---|
| 尺度含义 | 聚合/统计单元大小 | 中心样本周围的作用窗口 |
| 响应支持域 | 随样方尺度变化 | 固定中心支持域或中心像元 |
| 样本位置 | 各尺度网格单元 | 尽量保持公共中心点 |
| 主要风险 | MAUP、粗尺度样本数下降 | 边界窗口损失、支持域锚点敏感 |
| 结论表述 | “在某统计单元尺度关系最强” | “某邻域范围对中心响应解释最强” |
3. 共同的阶段化计算
代码内部使用阶段 A–E 落盘,界面根据模式把它们组合为 3 或 4 个“分步”。
| 内部阶段 | 任务 | 典型文件 | 可复用价值 |
|---|---|---|---|
| A-0 | 构建或读取公共网格、源数据与分类元数据 | common_grid*.json/.npy、manifest |
保证各阶段使用同一空间定义 |
| A | 逐尺度提取结构特征 | stage_a_structure_features.csv、schema、positions |
更换关系方法时无需重算特征 |
| B | 提取响应特征或中心支持域响应值 | stage_b_response_features.csv |
更换关系方法时复用响应 |
| C | 按位置索引合并结构与响应 | stage_c_quadrat_dataset.csv |
贝叶斯网络及其他模型的直接输入 |
| D | 计算两两关系、多变量关系和局部空间结果 | stage_d_relations.csv、stage_d_multivariate.csv、stage_d_spatial_outputs.csv |
更换尺度诊断时无需重算关系 |
| E | 跨尺度诊断并生成报告 | stage_e_*diagnostics.csv、stage_e_scale_report.txt |
形成可审阅的尺度结论 |
“复用”读取已正式落盘且参数匹配的结果;“从临时文件恢复”只用于上次中断但尚未形成正式结果的匹配快照,两者不能混为一谈。
4. 目录、manifest 与可复现性
每次运行生成独立分析目录,目录名通常由结构源、响应源和时间戳组成。建议归档以下内容:
| 内容 | 用途 |
|---|---|
| manifest / 配置 JSON | 记录数据源、尺度、特征、方法、参数、并行和版本 |
| schema JSON | 把机器字段名映射为来源、角色、特征和分量语义 |
| positions / grid metadata | 把表格行还原到空间位置 |
| 阶段 A–E CSV | 审计每一步结果,支持断点复用 |
| 报告与导出 GeoTIFF | 论文制图、规划表达和 GIS 复核 |
任何结论至少应同时记录:源数据版本、边界、CRS、基础分辨率、对齐锚点、尺度序列、响应聚合方式、实际执行方法及其参数。
5. 术语速查
| 术语 | 本系统中的含义 |
|---|---|
| 空间支持域 | 某个数值实际代表的空间范围,不等同于文件像元大小 |
| 对齐锚点 | 决定公共网格原点/相位的参考源或自动策略 |
| 统计单元 | 用于同时汇总结构和响应的规则样方 |
| 中心支持域 | 邻域模式中固定的响应提取单元 |
| 邻域窗口 | 围绕中心支持域提取结构特征的奇数方窗 |
| 特征分量 | 一个特征展开后的子列,例如各类别占比或各 GLCM 指标 |
| 关系得分 | 某方法输出的相关、依赖、解释力或模型拟合量 |
| 主尺度 | 得分峰值、平滑峰值、稳定平台或综合诊断支持的尺度候选 |
| 样方级空间输出 | 在每个样方/中心位置产生、可回写 GeoTIFF 的局部系数或指数 |
6. 质量检查清单
运行任何高级分析前,依次确认:
- 所有栅格 CRS 定义正确,单位与尺度解释一致。
- 公共范围非空,边界裁切后仍有足够有效单元。
- 分类栅格使用最近邻重采样,类别编码与 NoData 未混淆。
- 连续栅格的 NoData 已转换为无效值,不参与均值和方差。
- 对齐后的栅格行列数、分辨率、变换矩阵与原点一致。
- 最粗尺度仍有足够样本;样本过少时不使用复杂多变量或贝叶斯网络。
- 统计单元尺度与邻域作用尺度使用符合各自含义的文字报告。
- 最终结论同时检查得分、样本数、P 值/稳定性、平台区和空间图,而不是只取单个最大值。
7. 后续阅读
- 结构/响应特征尺度轴:公式化说明结构特征、响应特征、关系方法、尺度诊断与两种尺度模式的完整操作。
- 控制变量 / 多目标分析:说明方向标准化、偏相关、净效应、协同/权衡、Pareto、支持域敏感性与空间导出。
- 贝叶斯网络分析:说明离散化、BIC Hill-Climb、CPT、Markov Blanket、跨尺度稳定性和条件概率推理。