正在加载中...

展开本页目录
算法教程核岭回归(KRR)-KernelRidge

核岭回归(KRR)-KernelRidge

No.032 · 在线教程

核岭回归(Kernel Ridge Regression, KRR)是在岭回归基础上引入核技巧的一类监督学习方法。它通过核函数将输入映射到高维特征空间,在该空间上进行带 ℓ2 正则的最小二乘拟合,从而获得非线性回归能力。系统中 KRR 同时支持回归任务与二分类回退任务(将连续输…

核岭回归(KRR)- Kernel Ridge Regression

1. 方法概述

核岭回归(Kernel Ridge Regression, KRR)是在岭回归基础上引入核技巧的一类监督学习方法。它通过核函数将输入映射到高维特征空间,在该空间上进行带 \(\ell_2\) 正则的最小二乘拟合,从而获得非线性回归能力。系统中 KRR 同时支持回归任务与二分类回退任务(将连续输出按阈值转为类别)。

设共有 \(n\) 个样本、\(d\) 个特征,数据集表示为

$$ \mathcal{D}=\{(x_i,y_i)\}_{i=1}^{n},\quad x_i\in\mathbb{R}^d \tag{1} $$

其中 \(y_i\) 为连续值(回归)或二元标签(分类回退)。

2. 公共部分(预处理与核函数)

系统在模型训练前支持缺失处理、编码、缩放等步骤(均在训练集拟合,再作用于测试集或交叉验证折内,避免数据泄漏)。

2.1 标准化与归一化

Z-score 标准化: $$ z_{ij}=\frac{x_{ij}-\mu_j}{\sigma_j} \tag{2} $$

Min-Max 归一化: $$ z_{ij}=\frac{x_{ij}-\min x_j}{\max x_j-\min x_j+\varepsilon} \tag{3} $$

2.2 One-Hot 编码(类别型变量)

$$ x^{(k)}_{ij}= \begin{cases} 1,& x_{ij}=\text{cat}_k\ 0,& \text{otherwise} \end{cases} \tag{4} $$

2.3 常用核函数

线性核 $$ K(x,z)=x^\top z \tag{5} $$

多项式核 $$ K(x,z)=(\gamma x^\top z+r)^{d} \tag{6} $$

RBF 核 $$ K(x,z)=\exp\big(-\gamma\|x-z\|^2\big) \tag{7} $$

Sigmoid 核 $$ K(x,z)=\tanh(\gamma x^\top z+r) \tag{8} $$

2.4 符号说明

符号 含义
\(n\) 样本数量
\(d\) 特征维度
\(x_i\) 第 \(i\) 个样本特征向量
\(y_i\) 第 \(i\) 个样本标签/真实值
\(\phi(\cdot)\) 核映射函数
\(K(\cdot,\cdot)\) 核函数
\(\lambda\) 正则化系数(对应实现中的 alpha)
\(\alpha\) 对偶系数向量
\(K\) 核矩阵,\(K_{ij}=K(x_i,x_j)\)
\(\hat{y}_i\) 预测值
\(TP,FP,TN,FN\) 分类混淆矩阵四要素

3. 回归版(KRR)

3.1 原始问题(特征空间)

$$ \min_{w}\ \frac{1}{n}\sum_{i=1}^{n}\big(y_i-w^\top\phi(x_i)\big)^2+\lambda\|w\|^2 \tag{9} $$

3.2 对偶解形式

构造核矩阵 \(K\),则 KRR 的对偶解满足

$$ (\mathbf{K}+\lambda I)\,\alpha=y \tag{10} $$

其中 \(\alpha\) 为对偶系数向量。预测函数为

$$ \hat{y}(x)=\sum_{i=1}^{n}\alpha_i K(x_i,x) \tag{11} $$

3.3 回归评价指标

MAE $$ \text{MAE}=\frac{1}{n}\sum_{i=1}^{n}|y_i-\hat{y}_i| \tag{12} $$

MSE / RMSE $$ \text{MSE}=\frac{1}{n}\sum_{i=1}^{n}(y_i-\hat{y}_i)^2 \tag{13} $$

$$ \text{RMSE}=\sqrt{\text{MSE}} \tag{14} $$

决定系数 $$ R^2=1-\frac{\sum_{i=1}^{n}(y_i-\hat{y}_i)^2}{\sum_{i=1}^{n}(y_i-\bar{y})^2} \tag{15} $$

3.4 回归文字说明(可直接用于论文)

  • 采用 KRR 在核空间拟合非线性回归函数(见式(9)–(11)),通过正则项控制模型复杂度与泛化能力。
  • 评价指标使用 MAE、MSE、RMSE 与 \(R^2\)(见式(12)–(15)),用于量化预测误差与拟合优度。
  • 输出预测–真实散点图、残差直方图、残差–拟合图、Q-Q 图与学习曲线,用于残差结构与过拟合风险分析。
  • 交叉验证结果用于反映模型在不同折上的稳定性与泛化能力。

4. 分类版(回归阈值回退)

说明:KRR 本质为回归模型,本系统的分类采用连续输出阈值化策略。当前默认阈值 \(\tau=0.5\),若需多分类或概率校准,可在此基础上扩展(如 One-vs-Rest、Platt 校准等)。

4.1 连续输出与阈值判别

设回归输出 \(s_i=\hat{y}(x_i)\),则二分类标签为

$$ \hat{y}_i=\mathbb{I}(s_i\ge \tau),\quad \tau=0.5 \tag{16} $$

其中 \(\mathbb{I}(\cdot)\) 为指示函数。

4.2 分类评价指标

准确率 $$ \text{Accuracy}=\frac{TP+TN}{TP+TN+FP+FN} \tag{17} $$

精确率 / 召回率 $$ \text{Precision}=\frac{TP}{TP+FP} \tag{18} $$

$$ \text{Recall}=\frac{TP}{TP+FN} \tag{19} $$

F1 值 $$ F1=\frac{2\cdot \text{Precision}\cdot \text{Recall}}{\text{Precision}+\text{Recall}} \tag{20} $$

ROC / PR 相关量(使用连续得分 \(s_i\) 计算) $$ \text{TPR}=\frac{TP}{TP+FN},\quad \text{FPR}=\frac{FP}{FP+TN} \tag{21} $$

$$ \text{AUC}=\int_0^1 \text{TPR}(\text{FPR})\,d(\text{FPR}) \tag{22} $$

$$ \text{AP}=\int_0^1 \text{Precision}(\text{Recall})\,d(\text{Recall}) \tag{23} $$

4.3 分类文字说明(可直接用于论文)

  • 采用 KRR 的连续输出作为判别分数,并以阈值 \(\tau=0.5\) 生成类别标签(见式(16))。
  • 输出 Accuracy、Precision、Recall、F1 等指标(见式(17)–(20)),并给出混淆矩阵与分类报告。
  • 基于连续得分绘制 ROC/PR 曲线与阈值–F1、阈值–TPR/FPR 等图,用于阈值敏感性分析。
  • 学习曲线用于观察样本规模变化对分类性能的影响。

5. 训练与验证(公共)

5.1 训练/测试划分

若设置测试集比例为 \(t\in(0,1)\),则 $$ n_{\text{test}}=\lceil n\cdot t\rceil,\quad n_{\text{train}}=n-n_{\text{test}} \tag{24} $$

5.2 \(K\)-折交叉验证

对 \(K\) 折指标取均值: $$ \bar{M}=\frac{1}{K}\sum_{k=1}^{K}M_k \tag{25} $$

5.3 学习曲线(训练规模 vs. 性能)

设训练规模序列为 \(\{m_j\}\),则学习曲线可记录 $$ \bar{S}_{\text{train}}(m_j)=\frac{1}{K}\sum_{k=1}^{K}S_{\text{train}}^{(k)}(m_j),\quad \bar{S}_{\text{valid}}(m_j)=\frac{1}{K}\sum_{k=1}^{K}S_{\text{valid}}^{(k)}(m_j) \tag{26} $$

6. 结果输出说明

6.1 Excel 与图表输出

系统输出的 Excel 通常包含:原始数据、处理后数据、训练集、测试集、指标、预测、学习曲线、图表清单、参数、交叉验证汇总、各折预测、验证集、参数与配置(分组)、报告摘要。分类任务额外包含混淆矩阵与分类报告

图表输出(不强制嵌入 Excel):

  • 回归:预测–真实散点、预测趋势对比、残差直方图、残差–拟合图、Q-Q 图、学习曲线;
  • 分类:混淆矩阵、ROC 曲线、PR 曲线、阈值–F1、阈值–TPR/FPR、学习曲线。

6.2 论文写作建议

  1. 模型与核函数说明:给出 KRR 的目标函数与核函数形式(式(9)–(11)、式(5)–(8))。
  2. 参数与预处理说明:说明核类型、正则化系数 \(\lambda\)(alpha)、缩放与缺失处理策略。
  3. 核心指标表:回归报告 MAE/MSE/RMSE/\(R^2\),分类报告 Accuracy/Precision/Recall/F1。
  4. 图表与稳定性:给出残差分析、ROC/PR、学习曲线与交叉验证稳定性说明。

在正文中给出模型公式与核心指标,详细的折内预测与参数清单可放入附录,以兼顾可读性与可复现性。

7. 论文写作模板

7.1 论文写作模板(回归)

模板段落 A(方法与参数)
本文采用核岭回归(KRR)进行非线性回归建模,模型目标函数见式(9),对偶解形式与预测函数见式(10)–(11)。核函数选用 \[线性/多项式/RBF/Sigmoid\],正则化系数 \(\lambda\)(实现中的 alpha)为 \[填写\],并对特征进行 \[标准化/归一化/不处理\]。训练/测试划分比例为 \[填写\],并采用 \(K\)-折交叉验证评估模型稳定性。

模板段落 B(指标与结果)
模型在测试集上输出 MAE、MSE、RMSE 与 \(R^2\)(见式(12)–(15))。结果显示 \[填写主要结论\]。残差直方图与残差–拟合图用于检验误差分布与拟合偏差,Q-Q 图用于检验残差近似正态性,学习曲线用于观察样本规模变化对拟合性能的影响。

7.2 论文写作模板(分类:连续输出阈值化)

模板段落 A(方法与阈值)
KRR 本质为回归模型,本文将其连续输出 \(s_i\) 进行阈值化以完成二分类任务(见式(16)),默认阈值 \(\tau=0.5\)。若需多分类或概率校准,可在此基础上扩展 One-vs-Rest 或 Platt/Isotonic 校准策略。

模板段落 B(指标与图表)
分类性能以 Accuracy、Precision、Recall 与 F1 衡量(见式(17)–(20)),并绘制混淆矩阵、ROC/PR 曲线与阈值–F1、阈值–TPR/FPR 曲线,以评估不同阈值下的性能变化。学习曲线用于验证样本规模对分类稳定性的影响。

7.3 示例表格(可直接复制到论文)

表 1 KRR 回归指标(示例)

指标 MAE MSE RMSE \(R^2\)
训练集 \[填写\] \[填写\] \[填写\] \[填写\]
测试集 \[填写\] \[填写\] \[填写\] \[填写\]

表 2 KRR 分类指标(阈值化,示例)

指标 Accuracy Precision Recall F1
测试集 \[填写\] \[填写\] \[填写\] \[填写\]

表 3 交叉验证汇总(示例)

指标1 指标2 指标3
Fold 1 \[填写\] \[填写\] \[填写\]
Fold 2 \[填写\] \[填写\] \[填写\]
... ... ... ...
平均 \[填写\] \[填写\] \[填写\]

7.4 示例图注(可直接使用)

  • 图 1 KRR 回归:预测值与真实值散点图。
  • 图 2 KRR 回归:残差直方图与残差–拟合图(用于评估误差结构)。
  • 图 3 KRR 回归:Q-Q 图(用于检验残差近似正态性)。
  • 图 4 KRR 回归:学习曲线(训练规模与误差变化)。
  • 图 5 KRR 分类(阈值化):ROC 曲线与 PR 曲线。
  • 图 6 KRR 分类(阈值化):阈值–F1 与阈值–TPR/FPR 曲线。
  • 图 7 KRR 分类(阈值化):混淆矩阵与学习曲线。

8. 与代码实现的对应关系

KRR 程序的关键实现位于 具体的算法/核岭回归(KRR)-KernelRidge/core/critic_calculator.py。从代码可以看出,当前系统并不是一个纯粹的“核岭回归论文公式演示器”,而是一个以回归为主、兼容二分类阈值回退的完整结果导出工具。

需要在 md 中明确的实现细节如下:

  1. 主任务是回归,分类是阈值化回退
    程序对分类任务的处理并非真正的概率分类器,而是先回归到连续输出,再以 0.5 为阈值转为类别。因此论文中若写分类结果,应明确说明这是“基于 KRR 连续输出的阈值化分类回退”。

  2. 分类回退没有 predict_proba,但仍可做 ROC/PR
    代码直接使用连续预测值作为分数构造 ROC/PR 与阈值曲线,这一点在方法说明中应单独交代,避免误写成“输出了分类概率”。

  3. 结果目录含模型与预测模板
    程序会导出 krr_model.pklkrr_model_meta.jsonpredict_template.py,因此结果不仅能用于论文,还能用于后续独立推理。

  4. Excel 工作表是完整的案例复核结构
    原始数据处理后数据训练集测试集指标预测混淆矩阵分类报告学习曲线图表清单参数 外,还支持 CV汇总CV折i_预测验证集参数与配置(分组)报告摘要

  5. 学习曲线会随任务切换标题与评分方式
    回归场景导出 学习曲线(-RMSE,越高越好),阈值化分类场景导出 学习曲线(阈值化准确率),论文写作时应使用与任务一致的解释口径。

9. 论文写作模板补充

方法描述模板:
“本文采用核岭回归模型建立预测框架。建模前先完成缺失值处理、编码、缩放及必要的特征工程,再在训练集上拟合带 \(\ell_2\) 正则的核回归模型。对于连续目标变量,直接输出回归结果;对于二分类场景,则基于连续输出进行阈值化判别,并进一步构造 ROC、PR 及阈值敏感性分析图。”

结果描述模板:
“程序结果目录包含处理后数据、逐样本预测、整体指标、CV 汇总、参数配置、学习曲线和图表清单,并附带独立预测模板脚本。因而论文中既可以报告 RMSE、MAE、\(R^2\) 等回归指标,也可以在阈值化分类场景下进一步讨论混淆矩阵、ROC/PR 曲线及阈值选择问题。”

10. 单篇终审补充

10.1 图题与表题对齐建议

  • 本文档应优先对应真实算法目录 具体的算法/核岭回归(KRR)-KernelRidge
  • 代表性结果目录建议绑定 具体的算法/核岭回归(KRR)-KernelRidge/results/核岭回归(KRR)-KernelRidge分析结果_20260329_163816
  • 表题应直接对应 核岭回归(KRR)-KernelRidge分析结果_20260329_163816.xlsx 的真实工作表:原始数据处理后数据训练集测试集指标预测图表清单参数CV汇总CV折1_预测CV折2_预测验证集参数与配置(分组)报告摘要
  • 图题应优先绑定该目录下真实图:pred_vs_true.pngtrue_vs_pred_line.pngresiduals_hist.pngresiduals_qq.pngresiduals_vs_fitted.png

10.2 终审说明

  • 当前 KRR 文档可以直接按单一结果目录形成“xlsx + 图”闭环。
  • 复现脚本可对应相邻目录 results/核岭回归(KRR)-KernelRidge分析结果_20260329_163813/repro_template_20260329_163813.py,其 SRC_FILE 实际写为 repro_inputs/sample_regression.xlsx,属于“结果目录内 repro_inputs 相对路径复现”口径。
  • 因此正文若写复现链路,应说明“正式结果目录”和“相邻时间戳的 repro 目录”为同轮相邻产物,不宜误写成同一秒完全同名导出。

10.3 全量强化补充

  • 当前 KRR 文档应绑定真实算法目录 具体的算法/核岭回归(KRR)-KernelRidge,代表性主结果目录为 具体的算法/核岭回归(KRR)-KernelRidge/results/核岭回归(KRR)-KernelRidge分析结果_20260329_163816
  • 该目录首层主工作簿为 核岭回归(KRR)-KernelRidge分析结果_20260329_163816.xlsx,真实工作表为 原始数据处理后数据训练集测试集指标预测图表清单参数CV汇总CV折1_预测CV折2_预测验证集参数与配置(分组)报告摘要
  • 首层实体图为 pred_vs_true.pngtrue_vs_pred_line.pngresiduals_hist.pngresiduals_qq.pngresiduals_vs_fitted.png。这些图全部与主工作簿同层放置,没有额外 charts/ 子目录。
  • 当前主目录 20260329_163816 本身未看到 repro 脚本;真实复现入口位于相邻时间戳目录 具体的算法/核岭回归(KRR)-KernelRidge/results/核岭回归(KRR)-KernelRidge分析结果_20260329_163813/repro_template_20260329_163813.py
  • 该脚本关键输入写法为 SRC_FILE = 'repro_inputs/sample_regression.xlsx',说明 KRR 的复现链采用“相邻 repro 目录内 repro_inputs 相对路径输入副本”口径,而不是模块根目录 uploads,也不是 results 根目录平铺 CSV。
  • 因此论文与附录如果要写“完整结果包”,应明确区分两层:20260329_163816 作为正式主结果目录,20260329_163813 作为带 repro 输入副本和脚本的相邻复现实验目录。不能把它们误写成同一目录一次性同时导出。
  • 从正文写作映射看,指标预测CV汇总报告摘要 适合承接主要结论;CV折1_预测CV折2_预测验证集 更适合作为附录过程表。

10.4 软件实现核查补充(2026-07)

  • 当前 KRR 结果目录族把分类和回归分开沉淀:分类目录会导出 混淆矩阵分类报告learning_curveroc/pr/threshold 图,回归目录则导出 pred_vs_truetrue_vs_pred_lineresiduals_* 图和交叉验证明细。
  • 当前最新分类目录 results/核岭回归(KRR)-KernelRidge分析结果_20260411_201608_821008 的图文件都在根目录;当前回归目录 results/核岭回归(KRR)-KernelRidge分析结果_20260411_201344_834069 也把图文件直接放在结果目录根层。
  • 复现脚本分布在相邻时间戳目录中,例如 repro_template_20260411_201330.pyrepro_template_20260411_201351.py;文中不要把它写成单一固定目录或单一输入口径。
  • 如果正文讨论核技巧和岭正则,可以继续保留;但结果解释要严格区分分类与回归两套 sheet/图,不能把分类图直接当回归结果。