结构/响应特征尺度轴
结构/响应特征尺度轴:统计单元尺度与邻域作用尺度
本章与
spatial_structure_analysis/statistical_unit_scale.py的当前实现对应,覆盖两种尺度模式、全部可执行特征类别、关系方法、尺度诊断、阶段结果和 GeoTIFF 导出。公式中的默认值以当前代码与界面为准。
1. 分析目标与基本记号
尺度轴分析研究同一结构—响应关系在多个空间尺度上的变化:
$$ R_{km}(s)=\mathcal{M}_m!\left(X_k(s),Y(s),\mathbf{P}(s)\right), $$
其中 $X_k$ 是第 $k$ 个结构特征或特征分量,$Y$ 是响应特征/中心响应,$\mathcal{M}_m$ 是第 $m$ 种关系方法,$\mathbf{P}$ 是空间位置索引。最终输入尺度诊断的是序列:
$$ \mathcal{S}{km}={(s_1,R{km}(s_1)),\ldots,(s_L,R_{km}(s_L))}. $$
本章统一使用下列记号:
| 符号 | 含义 |
|---|---|
| $A$ | 一个样方/窗口内有效像元总数 |
| $m$ | 有效类别数 |
| $A_i$、$p_i=A_i/A$ | 类别 $i$ 的像元数与占比 |
| $N_p$ | 所有类别的连通斑块总数 |
| $a_{ij},e_{ij}$ | 类别 $i$ 第 $j$ 个斑块的面积(像元数)与周长(像元边数) |
| $g_{ii}$ | 类别 $i$ 的单计数同类邻接数 |
| $G_i$ | 类别 $i$ 的总邻接机会数 |
| $E$ | 异类水平/垂直边数;若明确写 $E_b$ 则包含外边界 |
| $r_0$ | 公共网格基础分辨率 |
| $s$ | 统计单元物理尺度 |
| $w$ | 邻域窗口像元边长,必须为不小于 3 的奇数 |
斑块默认通过 3×3 结构元素识别,即 8 邻接连通;边界与转移统计使用水平/垂直 4 邻接;共现统计使用 0°、45°、90°、135° 四个方向。
[1] 统计单元尺度
1.1 界面总览
统计单元尺度把公共范围划分为规则样方,在每个样方内同时计算结构和响应特征,再比较不同样方边长。
图 1-1 统计单元尺度左侧完整配置:数据源、自动优化、规则网格、结构特征、响应特征、关系方法和尺度方法。
图 1-2 统计单元尺度运行与阶段结果:左侧配置尺度与数据,右侧查看阶段 A–E 的状态和输出文件。
1.2 规则网格与尺度换算
界面提供两种规则网格尺度方式:
基础分辨率整数倍
$$ b(s)=\operatorname{round}!\left(\frac{s}{r_0}\right), $$
$b(s)$ 为样方边长的像元数。该模式要求 $s/r_0$ 是正整数,代码会拒绝会被静默量化的尺度。例如 $r_0=30,\mathrm{m}$ 时,60 m 对应 2×2 像元样方。
任意连续样方
$$ b(s)=\max!\left(1,\left\lceil\frac{s}{r_0}-10^{-9}\right\rceil\right). $$
该模式允许任意正尺度,再按向上取整映射到像元块。论文中应同时报告用户尺度 $s$ 与实际像元块 $b(s)$,因为多个相近物理尺度可能映射到同一像元块。
若公共网格尺寸为 $H\times W$,不重叠规则样方的理论数量近似为:
$$ N_s=\left\lfloor\frac{H}{b(s)}\right\rfloor \left\lfloor\frac{W}{b(s)}\right\rfloor, $$
边界和 NoData 会使有效样本数进一步减少。尺度增大时应持续观察样本数,不能只看得分。
1.3 尺度序列
| 配置方式 | 示例 | 说明 |
|---|---|---|
| 手工输入 | 30, 60, 120, 240 |
完全控制尺度列表 |
| 等距序列 | 起点 30、终点 300、步长 30 | $s_j=s_0+j\Delta s$ |
| 倍数序列 | 起点 30、倍数 2、数量 7 | $s_j=s_0q^j$ |
| 连续样方生成 | 按默认连续尺度生成 | 结合公共范围和基础分辨率产生可计算尺度 |
尺度列表应覆盖“小尺度局地格局—中尺度组织—大尺度整体格局”,但最粗尺度至少保留足以支持关系方法的样本量。
[2] 邻域作用尺度
2.1 界面总览
邻域作用尺度先固定公共支持域中心,再以不同邻域方窗提取结构特征。它回答“中心位置周边多大范围的结构与响应关系最强”。
图 2-1 邻域作用尺度左侧完整配置:公共支持域、支持域锚点、滑窗尺寸、结构特征、关系与尺度方法。
图 2-2 邻域作用尺度运行与阶段文件:窗口按奇数像元边长配置,右侧显示各窗口的 A、B/C、D、E 结果。
2.2 公共支持域与滑窗
对公共中心样本 $i$,窗口为:
$$ \mathcal{N}_{w}(i)={(r,c):|r-r_i|\le (w-1)/2,\ |c-c_i|\le (w-1)/2}. $$
代码接受 3x3,5x5,7x7 或 3,5,7,并强制为正方形、奇数且 $w\ge3$。窗口近似物理边长为 $w r_0$。例如 $r_0=30$ m 时,5×5 窗口覆盖约 150 m×150 m。
结构特征与响应值的支持关系为:
$$ \mathbf{X}_{i,w}=\phi(S\cap\mathcal{N}_w(i)), \qquad y_i=\mathcal{A}(R\cap G_i), $$
其中 $G_i$ 是固定中心支持域。普通结构/响应尺度轴页面以中心响应定义进入流程;控制变量/多目标邻域模式还可显式选择均值、中位数、P75、最大值或中心像元。
窗口越大,边界处完整窗口越少。必须结合界面提示的“边界预留像元”和“可用中心样本数”判断曲线变化是否来自真实尺度效应还是样本集合变化。
2.3 与统计单元尺度的关键差异
| 项目 | 统计单元尺度 | 邻域作用尺度 |
|---|---|---|
| 尺度单位 | 通常为米 | 奇数像元窗口及其近似物理范围 |
| 结构支持域 | 当前样方 | 中心周围滑窗 |
| 响应支持域 | 同一尺度样方 | 固定公共中心支持域 |
| 尺度增大时样本 | 网格变粗,数量明显下降 | 中心位置尽量一致,边缘样本减少 |
| 解释 | 聚合单元尺度效应 | 邻域作用范围效应 |
[3] 空间结构特征:代码对应公式
3.1 组成、破碎化、尺度与形态
下表对应 _compute_block_base_stats_value 与 _compute_structure_feature_value_value。多维结果会展开为 summary、classes、levels、pairs 等字段进入 CSV/schema。
| 特征(键) | 当前实现公式/计算 | 解释 |
|---|---|---|
斑块大小 (clump_size) |
$\bar a=\frac{1}{N_p}\sum a_{ij}$ | 所有 8 连通斑块的平均像元面积 |
斑块大小统计 (clump_size_stats) |
$CV_a=\sigma(a)/(\bar a+10^{-12})$ | 斑块大小相对离散程度 |
| 层级分解/层级熵 | 每一层子块 $H=-\sum_cp_c\ln(p_c+10^{-12})$,输出各层均值和跨层均值 | 描述不同粗分层级的类别异质性 |
| 层级多尺度 | 各层子块标准差均值 $C_l=\operatorname{mean}q[\sigma(Q{lq})]$ | 描述结构对分块尺度的对比度响应 |
图像块类别频数 (patch_histogram) |
$\mathbf{n}=(A_1,\ldots,A_m)$,摘要为 $m$ | 保留各类别数量向量 |
Shannon 熵 (shannon_entropy) |
$H=-\sum_{i=1}^m p_i\ln(p_i+10^{-12})$ | 类别组成多样性 |
Shannon 均匀度 (shannon_evenness_index) |
$SHEI=H/\ln m$,$m>1$ | 类别分布均匀程度 |
类别占比 (class_proportion) |
$p_i=A_i/A$,摘要为 $\max_i p_i$ | 组成结构;各类别分量应联合解释 |
斑块密度 (patch_density) |
$PD=N_p/A$ | 当前代码按“每有效像元”标准化,不是传统每 100 ha 单位 |
最大斑块指数 (largest_patch_index) |
$LPI=100\max(a_{ij})/A$ | 最大斑块控制程度 |
分裂指数 (split_index) |
$SPLIT=1/\sum_{ij}(a_{ij}/A)^2$ | 等效斑块分裂数,越大越破碎 |
景观分割指数 (landscape_division_index) |
$DIVISION=1-\sum_{ij}(a_{ij}/A)^2$ | 两个随机像元位于不同斑块的概率型指标 |
有效网格面积 (effective_mesh_size) |
$MESH=\sum_{ij}a_{ij}^2/A$ | 破碎化后的有效连片面积(像元面积单位) |
分形维数 (fractal_dimension) |
$D=\operatorname{slope}[\ln N(\epsilon),\ln(1/\epsilon)]$ | 对有效占据盒数做 box-counting 回归 |
景观形状指数 (landscape_shape_index) |
$LSI=0.25E_b/\sqrt{A}$ | 使用含外边界的总边长;0.25 对应栅格周长标准化 |
3.2 邻接、边界与连通
| 特征(键) | 当前实现公式/计算 | 解释与参数 |
|---|---|---|
| 共现直方图 | $P_{ab}=n_{ab}/\sum_{uv}n_{uv}$;摘要 $H_c=-\sum_{ab}P_{ab}\ln(P_{ab}+10^{-12})$ | 四方向类别共现及其熵 |
| 共现同类比例 | $P_{same}=N_{same}/N_{valid\ pairs}$ | 相邻像元同类比例 |
| 共现转移比例 | $P_{trans}=E/N_{valid\ pairs}$ | 相邻像元异类比例 |
| 方向连接度 | $q_\theta=\Pr(z_u=z_v\mid\theta)$;$D_{ani}=\operatorname{std}(q_{0},q_{45},q_{90},q_{135})$ | 值越大表示四方向同类邻接差异越明显 |
| 类别边界长度 | $E_i=$ 类别 $i$ 的异类边加外边界;摘要为 $E_b$ | 输出各类别边长和景观总边长 |
邻接比/PLADJ 型 (contiguity_ratio) |
$PLADJ_i=100\cdot2g_{ii}/G_i$;摘要按邻接机会加权 | 类内邻接程度;不是一般几何 contiguity 指数 |
聚集度 (aggregation_index) |
$AI_i=100g_{ii}/g_{ii}^{max}(A_i)$;$AI=\sum_i p_iAI_i$ | $g_{ii}^{max}$ 按最紧凑方形排列估计 |
蔓延度 (contagion_index) |
$CONTAG=100\left[1+\frac{\sum_i\sum_j p_i(g_{ij}/\sum_kg_{ik})\ln[p_i(g_{ij}/\sum_kg_{ik})]}{2\ln m}\right]$ | 景观整体团聚与蔓延;单类景观无效 |
镶嵌与毗邻 (IJI) |
$IJI=-100\frac{\sum_k e_k^\ln(e_k^+10^{-12})}{\ln[m(m-1)/2]}$ | $e_k^*$ 为异类边类型占比;类别少于 3 时无效 |
斑块凝聚度 (patch_cohesion_index) |
$COHESION=100\frac{1-\sum e_{ij}/\sum(e_{ij}\sqrt{a_{ij}})}{1-1/\sqrt A}$ | 输出景观摘要及类别值 |
蔟集度 (clumpiness_index) |
令 $G_i=2g_{ii}/G_i^{total}$;按 $G_i\ge p_i$、$p_i<0.5$ 等分段计算 $(G_i-p_i)/(1-p_i)$ 或 $(G_i-p_i)/p_i$ | 输出范围截断到 $[-1,1]$;按类别解释 |
边界密度 (edge_density) |
$ED=E/A$ | 当前实现以异类水平/垂直边数除有效像元数 |
欧氏最近邻 (nearest_neighbor) |
$ENN_i=\operatorname{mean}j\min{k\ne j}d(P_{ij},P_{ik})$ | $d$ 为同类斑块像元集合间最短欧氏距离 |
邻近度 (proximity_index) |
$PROX_{ij}=\sum_{k\ne j,d_{jk}\le r}a_{ik}/d_{jk}^2$,再对斑块求均值 | 默认搜索半径 search_radius=5 像元 |
连通度 (connectance_index) |
$CONNECT_i=100N_{connected}/[n_i(n_i-1)/2]$ | 当斑块最短距离不大于默认阈值 5 像元时视为连接 |
| 类别界面暴露 | $IE_i=(G_i-2g_{ii})/G_i$ | 异类邻接占总邻接比例 |
| 类别核心区比例 | $CAR_i=A_i^{core}/A_i$ | 距类别边界距离不小于 edge_depth 的像元为核心区;默认 2 |
总核心区面积 (total_core_area) |
$TCA=\sum_iA_i^{core}$ | 单位为像元数 |
核心区指数 (core_area_index) |
$CAI=100TCA/A$ | 核心腹地占整个有效样方的比例 |
3.3 探索型补充特征
| 特征 | 实现式 | 注意 |
|---|---|---|
| 局部自相似度 | $LSS=\operatorname{mean}u[\max_c n{uc}/n_u]$ | 在奇数局部窗内计算主导类别比例后求均值 |
| PCA/特征空间稀疏度 proxy | $S=\sum_i p_i^2$ | 当前是组成集中度 proxy,不是实际 PCA 分解 |
| 图结构指数 proxy | $GSI=\max_j a_j/A_{valid}$ | 对有效掩膜的 8 连通分量计算最大连通占比 |
探索型特征只有在界面显示为可用并被勾选时才进入计算;正式论文应使用 schema 和 manifest 核对实际字段,不能仅依据目录名称推断算法。
[4] 响应特征:代码对应公式
统计单元尺度可在样方内计算完整响应特征;邻域模式以中心支持域响应进入样本,界面会隐藏不适用步骤。
4.1 基础统计
对有效响应值 $v_1,\ldots,v_n$:
$$ \bar v=\frac1n\sum_jv_j,\quad \sigma=\sqrt{\frac1n\sum_j(v_j-\bar v)^2},\quad CV=\frac{\sigma}{\bar v}\quad(|\bar v|>10^{-12}). $$
同时输出 median、min、max、sum、p25、p75 和 $range=max-min$。实现采用总体标准差;sum 会受样方面积与有效像元数影响,需谨慎与其他统计量联合解释。
4.2 GLCM 纹理
有效值先线性量化到 $L$ 个灰度级(默认 levels=32),按距离 $d=1$ 和 0°、45°、90°、135° 构建对称、归一化 GLCM $P(i,j)$,再对方向求均值:
| 指标 | 公式 |
|---|---|
| Contrast | $\sum_{ij}(i-j)^2P(i,j)$ |
| Dissimilarity | $\sum_{ij}\vert{}i-j\vert{}P(i,j)$ |
| Homogeneity | $\sum_{ij}\frac{P(i,j)}{1+(i-j)^2}$ |
| ASM | $\sum_{ij}P(i,j)^2$ |
| Energy | $\sqrt{ASM}$ |
| Correlation | $\sum_{ij}\frac{(i-\mu_i)(j-\mu_j)P(i,j)}{\sigma_i\sigma_j}$ |
代码使用 Contrast 作为该特征的 summary,其余指标保存在 metrics 分量。
4.3 空间变异与半变异函数
空间变异特征输出:
$$ MAD=\frac1n\sum_j|v_j-\bar v|, \qquad IQR=Q_{0.75}-Q_{0.25}, $$
以及指定滞后 $h$ 的行列差半方差:
$$ \hat\gamma(h)=\frac{1}{2N(h)}\sum_{(u,v)\in N(h)}[z(u)-z(v)]^2. $$
半变异函数特征把多个距离箱的经验半方差加权拟合到以下模型(默认球状,max_lag=6、lag_step=1):
$$ \gamma_{sph}(h)= \begin{cases} c_0+c\left[1.5(h/a)-0.5(h/a)^3\right],&h\le a,\ c_0+c,&h>a, \end{cases} $$
$$ \gamma_{exp}(h)=c_0+c[1-e^{-h/a}], \qquad \gamma_{gau}(h)=c_0+c[1-e^{-(h/a)^2}]. $$
$c_0$ 为块金、$c$ 为部分基台、$c_0+c$ 为基台。代码报告球状变程 $a$;指数模型报告有效变程 $3a$;高斯模型报告有效变程 $\sqrt3a$,并输出拟合 RMSE。
4.4 分形、梯度与频率
| 特征 | 当前实现 | 默认参数/解释 |
|---|---|---|
| 分形与尺度 | box-counting $D$;多尺度子块标准差曲线对层号做线性拟合,得 contrast_scale_slope |
box_sizes=1,2,4,8 |
| 梯度与边缘 | Sobel $g=\sqrt{g_x^2+g_y^2}$;输出 $\bar g$、$\sigma_g$、$\Pr(g\ge Q_q(g))$ | edge_quantile=0.75;理论上分位阈值无大量并列时边缘比例约 25% |
| 多尺度频率 | Hann 窗后 $F=FFT2(z-\bar z)$、功率 $P=\vert{}F\vert{}^2$;低/高频功率比为指定径向频带功率除总功率 | low_ratio=0.15、high_ratio=0.35 |
| 频谱熵 | $H_f=-\sum_kq_k\ln(q_k+10^{-12}),\ q_k=P_k/\sum P$ | 衡量频谱分散程度 |
| 主导波长 | $\lambda^=1/f^$ | $f^*$ 为排除零频后的最大径向平均功率频率,单位为像元 |
[5] 关系计算方法:代码对应公式
所有方法先按结构列、响应列和位置索引对齐,过滤非有限值和常数列。方法的最小样本量、可选依赖与资源保护会影响是否实际执行。
5.1 两两关系
| 方法 | 公式 | 输出与解释 |
|---|---|---|
| Spearman | $\rho_s=\operatorname{corr}(rank(x),rank(y))$ | 输出 $\rho_s$、$\vert{}\rho_s\vert{}$ 与 P 值;代码默认最少 4 个样本 |
| 互信息 | $I(X;Y)=\iint p(x,y)\ln\frac{p(x,y)}{p(x)p(y)}dxdy$ | mutual_info_regression 的非负依赖量;0 近似独立 |
| 距离相关 | 对距离矩阵 $a_{ij}=\vert{}x_i-x_j\vert{}$、$b_{ij}=\vert{}y_i-y_j\vert{}$ 双中心化为 $A,B$;$dCor=\frac{\sqrt{\overline{AB}}}{\sqrt{\sqrt{\overline{A^2}}\sqrt{\overline{B^2}}}}$ | 能识别一般非线性依赖;精确实现为 $O(n^2)$,样本过大时按阈值跳过 |
| GeoDetector | $q=1-\frac{\sum_hN_h\sigma_h^2}{N\sigma^2}$ | $x$ 先按默认 6 个分位箱分层;$q\in[0,1]$ 越大表示分层解释力越强 |
| 双变量 Moran | 标准化 $z_x,z_y$,以 Queen 邻域行标准化空间滞后 $Wz_y$;$I_{xy}=\frac{n}{S_0}\frac{z_x^T(Wz_y)}{z_x^Tz_x}$ | 衡量 $x$ 与邻近位置 $y$ 的空间耦合,方向受位置索引和权重定义影响 |
5.2 多变量与稳健性方法
| 方法 | 核心公式/实现 | 作用 |
|---|---|---|
| Elastic Net | $\min_{\beta}\frac{1}{2n}|y-X\beta|_2^2+\lambda[\alpha|\beta|_1+\frac{1-\alpha}{2}|\beta|_2^2]$ | 交叉验证选择惩罚;处理高维与共线,输出 $R^2$ 和主导特征 |
| PLS | $X=TP^T+E,\ y=Uq^T+f$,潜变量使 $\operatorname{Cov}(t,u)$ 尽可能大 | 默认 2 个分量,适合相关结构特征的联合建模 |
| VIF/相关聚类 | $VIF_j=1/(1-R_j^2)$ | 默认阈值 VIF=10、相关阈值 0.9,用于冗余诊断 |
| Boruta | 将真实特征重要度与随机打乱的 shadow 特征重要度比较 | 可选 BorutaPy 依赖可用时执行;默认最大 50 轮 |
| Spatial Block CV | 将空间位置划为块,逐块训练/验证并汇总 $R^2=1-\frac{\sum(y-\hat y)^2}{\sum(y-\bar y)^2}$ | 防止随机划分造成空间泄漏;默认 4 块/4 折 |
| MGWR | $y_i=\beta_0(u_i,v_i)+\sum_k\beta_k(u_i,v_i)x_{ik}+\epsilon_i$ | 可选依赖可用且样本足够时输出局部系数/局部拟合信息 |
| Spatial Durbin | $y=\rho Wy+X\beta+WX\theta+\epsilon$ | 表达响应滞后和解释变量空间溢出;依赖空间回归库 |
界面只展示当前版本实际实现且依赖可用的方法。Group Lasso、HSIC-Lasso 等目录条目如果未通过 implemented 条件,不会进入当前运行。
[6] 尺度诊断:从曲线到结论
对同一特征—方法组合,将重复尺度结果先按尺度求均值 $\bar R(s)$。
6.1 代码实际采用的指标
| 诊断 | 当前实现公式 | 解释 |
|---|---|---|
| 优势尺度峰值 | $s^*=\arg\max_s\bar R(s)$ | 直接峰值候选 |
| 平台区 | 若 $R_{max}>0$,${s:R(s)\ge0.95R_{max}}$;否则 ${s:R(s)\ge R_{max}-0.05}$ | 报告满足条件的最小—最大尺度 |
| 平滑峰值 | $\tilde R_j=0.25R_{j-1}+0.5R_j+0.25R_{j+1}$,端点复制;$s^*_{sm}=\arg\max\tilde R$ | 抑制单点锯齿噪声 |
| Bootstrap 峰值区间 | 每尺度对重复得分有放回抽样,求均值、平滑、取峰;重复 $B$ 次后报告峰值尺度 5% 与 95% 分位数 | 默认 $B=200$,随机种子固定为 0,得到 90% 经验区间 |
| 斜率突变断点 | $d_j=(R_{j+1}-R_j)/(s_{j+1}-s_j)$;$s_b=s_{\arg\max\vert{}d_{j+1}-d_j\vert{}+1}$ | 至少 3 个尺度 |
| 分段回归断点 | $s_b=\arg\min_{s_k}[RSS_{left}(k)+RSS_{right}(k)]$ | 左右各拟合一条直线,至少 4 个尺度 |
| 尺度积分 | $AUC=\int_{s_{min}}^{s_{max}}\vert{}R(s)\vert{}ds$ | 代码用梯形积分;衡量整个尺度轴累计强度 |
| 标准化积分 | $AUC_{norm}=AUC/(s_{max}-s_{min})$ | 便于不同尺度跨度之间比较 |
| 半变异参考尺度 | $s_{vario}=\operatorname{mean}(\hat a)$ | 用响应半变异函数有效变程校验主尺度 |
| 变程偏差 | $\Delta_s=\vert{}s^*-s_{vario}\vert{}$ | 越小表示关系峰值与响应内在空间作用尺度越接近 |
| Kendall 尺度一致性 | $\bar\tau_b=\operatorname{mean}_{a<b}\tau_b(rank_a,rank_b)$ | 比较不同关系方法的尺度排序,处理并列秩 |
峰值不等于唯一正确尺度。较稳健的结论通常同时满足:峰值或平滑峰值明确、平台区不过窄、Bootstrap 区间可接受、多方法尺度排序相近、样本量充足,并能在空间导出中解释。
6.2 尺度分析性能/精度
| 预设 | Bootstrap 重复 | 数值精度 | 适用 |
|---|---|---|---|
| 快速 | 50 | 通常 float32 |
参数试跑与流程检查 |
| 平衡 | 200 | float32 |
默认正式分析起点 |
| 精确 | 500 | 可选 float64 |
最终报告或不确定性敏感研究 |
-1 表示自动并行;界面提示阶段 E 通常使用约 80%–90% 逻辑核心,避免完全占满系统。提高重复次数只提高峰值区间的 Monte Carlo 稳定性,不能弥补尺度数量不足或样本偏差。
[7] 分步运行与结果阅读
7.1 阶段 A–E
| 阶段 | 统计单元尺度 | 邻域作用尺度 | 主要输出 |
|---|---|---|---|
| A-0 | 公共规则网格 | 公共中心支持域 | 网格元数据、源配置 |
| A | 各样方结构特征 | 各窗口结构特征 | stage_a_structure_features.csv |
| B | 各样方响应特征 | 中心支持域响应值 | stage_b_response_features.csv |
| C | 统一样方数据 | 统一滑窗样本数据 | stage_c_quadrat_dataset.csv |
| D | 关系、多变量和空间输出 | 关系、多变量和空间输出 | stage_d_relations.csv、stage_d_multivariate.csv、stage_d_spatial_outputs.csv |
| E | 尺度诊断与报告 | 尺度诊断与报告 | stage_e_feature_scale_diagnostics.csv、stage_e_method_scale_diagnostics.csv、stage_e_scale_report.txt |
统计单元界面通常表现为 4 个分步;邻域界面把中心响应与样本构建/关系流程组合显示为 3 个分步,但落盘仍保留 A–E 语义。
7.2 固定尺度批处理
图 7-1 统计单元尺度固定尺度批处理:按单个尺度检查关系明细、多变量结果、样本数与备注。
图 7-2 邻域作用尺度固定窗口批处理:比较每个窗口下结构—中心响应关系。
固定尺度页适合回答“在某个已知政策/生态尺度上,哪些特征最重要”。阅读时同时关注得分、方向、P 值、样本数和方法备注。
7.3 连续尺度曲线
图 7-3 统计单元连续尺度曲线:横轴为样方物理尺度,纵轴为所选关系方法得分。
图 7-4 邻域作用尺度曲线:横轴为窗口尺度,比较局地到较大邻域的关系变化。
曲线支持选择多个主方法和分析方向。若不同方法的量纲/范围不同,应比较各自曲线形态或标准化结果,不宜把互信息、相关系数和 $R^2$ 的绝对值直接排序。
7.4 尺度诊断
图 7-5 统计单元尺度诊断:分别汇总各结构特征和各关系方法的最佳尺度、平台、断点与积分。
图 7-6 邻域作用尺度诊断:识别窗口峰值、稳定区间和转折候选。
“最佳尺度”必须与“平台区”和“断点候选”一起解释。若峰值位于尺度序列端点,说明搜索范围可能没有覆盖真正峰值,应扩展尺度范围后重跑。
7.5 综合报告
图 7-7 统计单元尺度综合报告:汇总关键特征、关系方法、主尺度候选和可选 AI 解释。
图 7-8 邻域作用尺度综合报告:把窗口曲线、诊断指标和主要关系组织为可审阅文本。
AI 解释用于辅助阅读,不改变任何数值结果。正式结论应以 CSV、manifest 和实现公式为依据,并对 AI 文字中的因果措辞进行人工校正。
[8] 结果导出为多波段 GeoTIFF
8.1 导出逻辑
阶段结果中的位置列 grid_row、grid_col、block_pixels(以及可选 sample_scale)与数值列共同恢复空间图层。对目标格网像元 $g$,导出值可概括为:
$$ Z_k(g)=\mathcal{R}\left({v_{ik}:g\in Q_i}\right), $$
其中 $k$ 为待导出结果列,$\mathcal{R}$ 是按照当前格网和重投影方案执行的栅格化/重采样操作。无有效结果写入 -9999。多个结果列按用户顺序写为同一 GeoTIFF 的多个波段。
8.2 统计单元尺度导出
图 8-1 统计单元结果导出:选择目标 CRS、目标单元大小、导出尺度、可用图层和输出路径。
图 8-2 统计单元多波段 GeoTIFF 波段选择与结果展示。
8.3 邻域作用尺度导出
图 8-3 邻域作用尺度结果回图:按所选窗口与公共中心位置导出关系/局部结果。
图 8-4 邻域作用尺度多波段选择:每个待导出字段成为一个波段。
导出前确认:所有波段来自同一尺度、目标 CRS 与研究尺度单位一致、单元大小不是误选的源像元大小、波段顺序与 schema/图例同步保存。
[9] 参数与默认值速查
| 分区 | 参数 | 当前默认/规则 | 影响 |
|---|---|---|---|
| 数据源 | 结构/响应波段 | 用户选择 | 决定变量语义 |
| 对齐 | grid_alignment_source |
自动或指定源 | 决定公共网格相位和边界 |
| 统计单元 | 尺度模式 | 基础分辨率整数倍或任意连续 | 决定 $s\to b(s)$ 的换算 |
| 邻域 | 窗口 | 3 以上奇数正方形 | 决定作用范围与边缘损失 |
| 结构斑块 | connectivity | 2,即 8 连通 | 决定斑块数量与面积 |
| GLCM | distance / levels / angles | 1 / 32 / 0,45,90,135 | 纹理尺度和量化精度 |
| 半变异 | max_lag / lag_step / model | 6 / 1 / spherical | 经验半方差范围与模型 |
| GeoDetector | bins | 6 | 分层粒度 |
| Elastic Net | cv | 5 | 惩罚参数选择稳定性 |
| PLS | n_components | 2 | 潜变量复杂度 |
| 尺度诊断 | Bootstrap | 200(平衡) | 峰值区间稳定性 |
| 并行 | workers | -1 自动 |
速度、CPU 与内存占用 |
| 复用 | reuse | 默认勾选 | 读取参数匹配的正式阶段文件 |
| 恢复 | resume | 默认不勾选 | 从匹配的中断临时快照继续 |
[10] 推荐操作流程
- 在“数据与对齐”完成结构和响应源预处理,确认公共 CRS、范围、分辨率与 NoData。
- 选择统计单元尺度或邻域作用尺度,核对界面中的模式说明。
- 选择工作空间、结构源/响应源和波段,刷新元数据。
- 设置对齐锚点与尺度列表;先用少量代表尺度试跑。
- 选择场景适配特征,检查每个可调参数的物理单位。
- 统计单元模式选择响应特征;邻域模式确认中心支持域响应定义。
- 选择关系方法。样本量小先用 Spearman/GeoDetector;空间机制研究补充 Moran;多变量模型需更大样本。
- 依次运行结构特征、响应/关系和尺度诊断;保留“复用”以减少重复计算。
- 在固定尺度页检查异常值和样本数,再看连续曲线、尺度诊断与综合报告。
- 将具有明确空间语义的局部结果导出为 GeoTIFF,并在 GIS 中与原始数据叠加复核。
[11] 常见误区与排错
| 现象 | 可能原因 | 处理 |
|---|---|---|
| 公共范围为空 | CRS 错误或数据不相交 | 在“数据与对齐”检查坐标和范围 |
| 分类结构出现小数类别 | 使用了双线性重采样 | 改用最近邻并重新预处理 |
| 粗尺度得分很高但不稳定 | 有效样本太少 | 缩小最大尺度或增加研究范围 |
| 曲线峰值在最小/最大端点 | 尺度搜索范围不足 | 向相应方向扩展尺度序列 |
| 距离相关未执行 | 精确 $O(n^2)$ 样本超过保护阈值 | 调整样本/参数或使用互信息 |
| MGWR/Spatial Durbin 不可用 | 可选依赖缺失或样本条件不足 | 查看方法执行状态与日志 |
| 复用后结果不是当前参数 | 结果目录或 manifest 不匹配 | 关闭复用后重算,并使用独立批次目录 |
| GeoTIFF 波段难以识别 | 未保存 schema/波段顺序 | 同步归档导出说明与 schema |
最终报告必须使用“关联、解释力、依赖、空间耦合”等准确措辞;仅凭相关、MGWR 系数或尺度峰值不能直接声称因果关系。