核岭回归(KRR)-KernelRidge
核岭回归(Kernel Ridge Regression, KRR)是在岭回归基础上引入核技巧的一类监督学习方法。它通过核函数将输入映射到高维特征空间,在该空间上进行带 ℓ2 正则的最小二乘拟合,从而获得非线性回归能力。系统中 KRR 同时支持回归任务与二分类回退任务(将连续输…
核岭回归(KRR)- Kernel Ridge Regression
1. 方法概述
核岭回归(Kernel Ridge Regression, KRR)是在岭回归基础上引入核技巧的一类监督学习方法。它通过核函数将输入映射到高维特征空间,在该空间上进行带 \(\ell_2\) 正则的最小二乘拟合,从而获得非线性回归能力。系统中 KRR 同时支持回归任务与二分类回退任务(将连续输出按阈值转为类别)。
设共有 \(n\) 个样本、\(d\) 个特征,数据集表示为
$$ \mathcal{D}=\{(x_i,y_i)\}_{i=1}^{n},\quad x_i\in\mathbb{R}^d \tag{1} $$
其中 \(y_i\) 为连续值(回归)或二元标签(分类回退)。
2. 公共部分(预处理与核函数)
系统在模型训练前支持缺失处理、编码、缩放等步骤(均在训练集拟合,再作用于测试集或交叉验证折内,避免数据泄漏)。
2.1 标准化与归一化
Z-score 标准化: $$ z_{ij}=\frac{x_{ij}-\mu_j}{\sigma_j} \tag{2} $$
Min-Max 归一化: $$ z_{ij}=\frac{x_{ij}-\min x_j}{\max x_j-\min x_j+\varepsilon} \tag{3} $$
2.2 One-Hot 编码(类别型变量)
$$ x^{(k)}_{ij}= \begin{cases} 1,& x_{ij}=\text{cat}_k\ 0,& \text{otherwise} \end{cases} \tag{4} $$
2.3 常用核函数
线性核 $$ K(x,z)=x^\top z \tag{5} $$
多项式核 $$ K(x,z)=(\gamma x^\top z+r)^{d} \tag{6} $$
RBF 核 $$ K(x,z)=\exp\big(-\gamma\|x-z\|^2\big) \tag{7} $$
Sigmoid 核 $$ K(x,z)=\tanh(\gamma x^\top z+r) \tag{8} $$
2.4 符号说明
| 符号 | 含义 |
|---|---|
| \(n\) | 样本数量 |
| \(d\) | 特征维度 |
| \(x_i\) | 第 \(i\) 个样本特征向量 |
| \(y_i\) | 第 \(i\) 个样本标签/真实值 |
| \(\phi(\cdot)\) | 核映射函数 |
| \(K(\cdot,\cdot)\) | 核函数 |
| \(\lambda\) | 正则化系数(对应实现中的 alpha) |
| \(\alpha\) | 对偶系数向量 |
| \(K\) | 核矩阵,\(K_{ij}=K(x_i,x_j)\) |
| \(\hat{y}_i\) | 预测值 |
| \(TP,FP,TN,FN\) | 分类混淆矩阵四要素 |
3. 回归版(KRR)
3.1 原始问题(特征空间)
$$ \min_{w}\ \frac{1}{n}\sum_{i=1}^{n}\big(y_i-w^\top\phi(x_i)\big)^2+\lambda\|w\|^2 \tag{9} $$
3.2 对偶解形式
构造核矩阵 \(K\),则 KRR 的对偶解满足
$$ (\mathbf{K}+\lambda I)\,\alpha=y \tag{10} $$
其中 \(\alpha\) 为对偶系数向量。预测函数为
$$ \hat{y}(x)=\sum_{i=1}^{n}\alpha_i K(x_i,x) \tag{11} $$
3.3 回归评价指标
MAE $$ \text{MAE}=\frac{1}{n}\sum_{i=1}^{n}|y_i-\hat{y}_i| \tag{12} $$
MSE / RMSE $$ \text{MSE}=\frac{1}{n}\sum_{i=1}^{n}(y_i-\hat{y}_i)^2 \tag{13} $$
$$ \text{RMSE}=\sqrt{\text{MSE}} \tag{14} $$
决定系数 $$ R^2=1-\frac{\sum_{i=1}^{n}(y_i-\hat{y}_i)^2}{\sum_{i=1}^{n}(y_i-\bar{y})^2} \tag{15} $$
3.4 回归文字说明(可直接用于论文)
- 采用 KRR 在核空间拟合非线性回归函数(见式(9)–(11)),通过正则项控制模型复杂度与泛化能力。
- 评价指标使用 MAE、MSE、RMSE 与 \(R^2\)(见式(12)–(15)),用于量化预测误差与拟合优度。
- 输出预测–真实散点图、残差直方图、残差–拟合图、Q-Q 图与学习曲线,用于残差结构与过拟合风险分析。
- 交叉验证结果用于反映模型在不同折上的稳定性与泛化能力。
4. 分类版(回归阈值回退)
说明:KRR 本质为回归模型,本系统的分类采用连续输出阈值化策略。当前默认阈值 \(\tau=0.5\),若需多分类或概率校准,可在此基础上扩展(如 One-vs-Rest、Platt 校准等)。
4.1 连续输出与阈值判别
设回归输出 \(s_i=\hat{y}(x_i)\),则二分类标签为
$$ \hat{y}_i=\mathbb{I}(s_i\ge \tau),\quad \tau=0.5 \tag{16} $$
其中 \(\mathbb{I}(\cdot)\) 为指示函数。
4.2 分类评价指标
准确率 $$ \text{Accuracy}=\frac{TP+TN}{TP+TN+FP+FN} \tag{17} $$
精确率 / 召回率 $$ \text{Precision}=\frac{TP}{TP+FP} \tag{18} $$
$$ \text{Recall}=\frac{TP}{TP+FN} \tag{19} $$
F1 值 $$ F1=\frac{2\cdot \text{Precision}\cdot \text{Recall}}{\text{Precision}+\text{Recall}} \tag{20} $$
ROC / PR 相关量(使用连续得分 \(s_i\) 计算) $$ \text{TPR}=\frac{TP}{TP+FN},\quad \text{FPR}=\frac{FP}{FP+TN} \tag{21} $$
$$ \text{AUC}=\int_0^1 \text{TPR}(\text{FPR})\,d(\text{FPR}) \tag{22} $$
$$ \text{AP}=\int_0^1 \text{Precision}(\text{Recall})\,d(\text{Recall}) \tag{23} $$
4.3 分类文字说明(可直接用于论文)
- 采用 KRR 的连续输出作为判别分数,并以阈值 \(\tau=0.5\) 生成类别标签(见式(16))。
- 输出 Accuracy、Precision、Recall、F1 等指标(见式(17)–(20)),并给出混淆矩阵与分类报告。
- 基于连续得分绘制 ROC/PR 曲线与阈值–F1、阈值–TPR/FPR 等图,用于阈值敏感性分析。
- 学习曲线用于观察样本规模变化对分类性能的影响。
5. 训练与验证(公共)
5.1 训练/测试划分
若设置测试集比例为 \(t\in(0,1)\),则 $$ n_{\text{test}}=\lceil n\cdot t\rceil,\quad n_{\text{train}}=n-n_{\text{test}} \tag{24} $$
5.2 \(K\)-折交叉验证
对 \(K\) 折指标取均值: $$ \bar{M}=\frac{1}{K}\sum_{k=1}^{K}M_k \tag{25} $$
5.3 学习曲线(训练规模 vs. 性能)
设训练规模序列为 \(\{m_j\}\),则学习曲线可记录 $$ \bar{S}_{\text{train}}(m_j)=\frac{1}{K}\sum_{k=1}^{K}S_{\text{train}}^{(k)}(m_j),\quad \bar{S}_{\text{valid}}(m_j)=\frac{1}{K}\sum_{k=1}^{K}S_{\text{valid}}^{(k)}(m_j) \tag{26} $$
6. 结果输出说明
6.1 Excel 与图表输出
系统输出的 Excel 通常包含:原始数据、处理后数据、训练集、测试集、指标、预测、学习曲线、图表清单、参数、交叉验证汇总、各折预测、验证集、参数与配置(分组)、报告摘要。分类任务额外包含混淆矩阵与分类报告。
图表输出(不强制嵌入 Excel):
- 回归:预测–真实散点、预测趋势对比、残差直方图、残差–拟合图、Q-Q 图、学习曲线;
- 分类:混淆矩阵、ROC 曲线、PR 曲线、阈值–F1、阈值–TPR/FPR、学习曲线。
6.2 论文写作建议
- 模型与核函数说明:给出 KRR 的目标函数与核函数形式(式(9)–(11)、式(5)–(8))。
- 参数与预处理说明:说明核类型、正则化系数 \(\lambda\)(alpha)、缩放与缺失处理策略。
- 核心指标表:回归报告 MAE/MSE/RMSE/\(R^2\),分类报告 Accuracy/Precision/Recall/F1。
- 图表与稳定性:给出残差分析、ROC/PR、学习曲线与交叉验证稳定性说明。
在正文中给出模型公式与核心指标,详细的折内预测与参数清单可放入附录,以兼顾可读性与可复现性。
7. 论文写作模板
7.1 论文写作模板(回归)
模板段落 A(方法与参数)
本文采用核岭回归(KRR)进行非线性回归建模,模型目标函数见式(9),对偶解形式与预测函数见式(10)–(11)。核函数选用 \[线性/多项式/RBF/Sigmoid\],正则化系数 \(\lambda\)(实现中的 alpha)为 \[填写\],并对特征进行 \[标准化/归一化/不处理\]。训练/测试划分比例为 \[填写\],并采用 \(K\)-折交叉验证评估模型稳定性。
模板段落 B(指标与结果)
模型在测试集上输出 MAE、MSE、RMSE 与 \(R^2\)(见式(12)–(15))。结果显示 \[填写主要结论\]。残差直方图与残差–拟合图用于检验误差分布与拟合偏差,Q-Q 图用于检验残差近似正态性,学习曲线用于观察样本规模变化对拟合性能的影响。
7.2 论文写作模板(分类:连续输出阈值化)
模板段落 A(方法与阈值)
KRR 本质为回归模型,本文将其连续输出 \(s_i\) 进行阈值化以完成二分类任务(见式(16)),默认阈值 \(\tau=0.5\)。若需多分类或概率校准,可在此基础上扩展 One-vs-Rest 或 Platt/Isotonic 校准策略。
模板段落 B(指标与图表)
分类性能以 Accuracy、Precision、Recall 与 F1 衡量(见式(17)–(20)),并绘制混淆矩阵、ROC/PR 曲线与阈值–F1、阈值–TPR/FPR 曲线,以评估不同阈值下的性能变化。学习曲线用于验证样本规模对分类稳定性的影响。
7.3 示例表格(可直接复制到论文)
表 1 KRR 回归指标(示例)
| 指标 | MAE | MSE | RMSE | \(R^2\) |
|---|---|---|---|---|
| 训练集 | \[填写\] | \[填写\] | \[填写\] | \[填写\] |
| 测试集 | \[填写\] | \[填写\] | \[填写\] | \[填写\] |
表 2 KRR 分类指标(阈值化,示例)
| 指标 | Accuracy | Precision | Recall | F1 |
|---|---|---|---|---|
| 测试集 | \[填写\] | \[填写\] | \[填写\] | \[填写\] |
表 3 交叉验证汇总(示例)
| 折 | 指标1 | 指标2 | 指标3 |
|---|---|---|---|
| Fold 1 | \[填写\] | \[填写\] | \[填写\] |
| Fold 2 | \[填写\] | \[填写\] | \[填写\] |
| ... | ... | ... | ... |
| 平均 | \[填写\] | \[填写\] | \[填写\] |
7.4 示例图注(可直接使用)
- 图 1 KRR 回归:预测值与真实值散点图。
- 图 2 KRR 回归:残差直方图与残差–拟合图(用于评估误差结构)。
- 图 3 KRR 回归:Q-Q 图(用于检验残差近似正态性)。
- 图 4 KRR 回归:学习曲线(训练规模与误差变化)。
- 图 5 KRR 分类(阈值化):ROC 曲线与 PR 曲线。
- 图 6 KRR 分类(阈值化):阈值–F1 与阈值–TPR/FPR 曲线。
- 图 7 KRR 分类(阈值化):混淆矩阵与学习曲线。
8. 与代码实现的对应关系
KRR 程序的关键实现位于 具体的算法/核岭回归(KRR)-KernelRidge/core/critic_calculator.py。从代码可以看出,当前系统并不是一个纯粹的“核岭回归论文公式演示器”,而是一个以回归为主、兼容二分类阈值回退的完整结果导出工具。
需要在 md 中明确的实现细节如下:
-
主任务是回归,分类是阈值化回退
程序对分类任务的处理并非真正的概率分类器,而是先回归到连续输出,再以0.5为阈值转为类别。因此论文中若写分类结果,应明确说明这是“基于 KRR 连续输出的阈值化分类回退”。 -
分类回退没有
predict_proba,但仍可做 ROC/PR
代码直接使用连续预测值作为分数构造 ROC/PR 与阈值曲线,这一点在方法说明中应单独交代,避免误写成“输出了分类概率”。 -
结果目录含模型与预测模板
程序会导出krr_model.pkl、krr_model_meta.json与predict_template.py,因此结果不仅能用于论文,还能用于后续独立推理。 -
Excel 工作表是完整的案例复核结构
除原始数据、处理后数据、训练集、测试集、指标、预测、混淆矩阵、分类报告、学习曲线、图表清单、参数外,还支持CV汇总、CV折i_预测、验证集、参数与配置(分组)、报告摘要。 -
学习曲线会随任务切换标题与评分方式
回归场景导出学习曲线(-RMSE,越高越好),阈值化分类场景导出学习曲线(阈值化准确率),论文写作时应使用与任务一致的解释口径。
9. 论文写作模板补充
方法描述模板:
“本文采用核岭回归模型建立预测框架。建模前先完成缺失值处理、编码、缩放及必要的特征工程,再在训练集上拟合带 \(\ell_2\) 正则的核回归模型。对于连续目标变量,直接输出回归结果;对于二分类场景,则基于连续输出进行阈值化判别,并进一步构造 ROC、PR 及阈值敏感性分析图。”
结果描述模板:
“程序结果目录包含处理后数据、逐样本预测、整体指标、CV 汇总、参数配置、学习曲线和图表清单,并附带独立预测模板脚本。因而论文中既可以报告 RMSE、MAE、\(R^2\) 等回归指标,也可以在阈值化分类场景下进一步讨论混淆矩阵、ROC/PR 曲线及阈值选择问题。”
10. 单篇终审补充
10.1 图题与表题对齐建议
- 本文档应优先对应真实算法目录
具体的算法/核岭回归(KRR)-KernelRidge。 - 代表性结果目录建议绑定
具体的算法/核岭回归(KRR)-KernelRidge/results/核岭回归(KRR)-KernelRidge分析结果_20260329_163816。 - 表题应直接对应
核岭回归(KRR)-KernelRidge分析结果_20260329_163816.xlsx的真实工作表:原始数据、处理后数据、训练集、测试集、指标、预测、图表清单、参数、CV汇总、CV折1_预测、CV折2_预测、验证集、参数与配置(分组)、报告摘要。 - 图题应优先绑定该目录下真实图:
pred_vs_true.png、true_vs_pred_line.png、residuals_hist.png、residuals_qq.png、residuals_vs_fitted.png。
10.2 终审说明
- 当前 KRR 文档可以直接按单一结果目录形成“xlsx + 图”闭环。
- 复现脚本可对应相邻目录
results/核岭回归(KRR)-KernelRidge分析结果_20260329_163813/repro_template_20260329_163813.py,其SRC_FILE实际写为repro_inputs/sample_regression.xlsx,属于“结果目录内repro_inputs相对路径复现”口径。 - 因此正文若写复现链路,应说明“正式结果目录”和“相邻时间戳的 repro 目录”为同轮相邻产物,不宜误写成同一秒完全同名导出。
10.3 全量强化补充
- 当前 KRR 文档应绑定真实算法目录
具体的算法/核岭回归(KRR)-KernelRidge,代表性主结果目录为具体的算法/核岭回归(KRR)-KernelRidge/results/核岭回归(KRR)-KernelRidge分析结果_20260329_163816。 - 该目录首层主工作簿为
核岭回归(KRR)-KernelRidge分析结果_20260329_163816.xlsx,真实工作表为原始数据、处理后数据、训练集、测试集、指标、预测、图表清单、参数、CV汇总、CV折1_预测、CV折2_预测、验证集、参数与配置(分组)、报告摘要。 - 首层实体图为
pred_vs_true.png、true_vs_pred_line.png、residuals_hist.png、residuals_qq.png、residuals_vs_fitted.png。这些图全部与主工作簿同层放置,没有额外charts/子目录。 - 当前主目录
20260329_163816本身未看到 repro 脚本;真实复现入口位于相邻时间戳目录具体的算法/核岭回归(KRR)-KernelRidge/results/核岭回归(KRR)-KernelRidge分析结果_20260329_163813/repro_template_20260329_163813.py。 - 该脚本关键输入写法为
SRC_FILE = 'repro_inputs/sample_regression.xlsx',说明 KRR 的复现链采用“相邻 repro 目录内repro_inputs相对路径输入副本”口径,而不是模块根目录uploads,也不是results根目录平铺 CSV。 - 因此论文与附录如果要写“完整结果包”,应明确区分两层:
20260329_163816作为正式主结果目录,20260329_163813作为带 repro 输入副本和脚本的相邻复现实验目录。不能把它们误写成同一目录一次性同时导出。 - 从正文写作映射看,
指标、预测、CV汇总、报告摘要适合承接主要结论;CV折1_预测、CV折2_预测、验证集更适合作为附录过程表。
10.4 软件实现核查补充(2026-07)
- 当前 KRR 结果目录族把分类和回归分开沉淀:分类目录会导出
混淆矩阵、分类报告、learning_curve、roc/pr/threshold图,回归目录则导出pred_vs_true、true_vs_pred_line、residuals_*图和交叉验证明细。 - 当前最新分类目录
results/核岭回归(KRR)-KernelRidge分析结果_20260411_201608_821008的图文件都在根目录;当前回归目录results/核岭回归(KRR)-KernelRidge分析结果_20260411_201344_834069也把图文件直接放在结果目录根层。 - 复现脚本分布在相邻时间戳目录中,例如
repro_template_20260411_201330.py与repro_template_20260411_201351.py;文中不要把它写成单一固定目录或单一输入口径。 - 如果正文讨论核技巧和岭正则,可以继续保留;但结果解释要严格区分分类与回归两套 sheet/图,不能把分类图直接当回归结果。