BayesianRidge-贝叶斯岭回归
贝叶斯岭回归(Bayesian Ridge Regression)是在线性回归框架下引入参数先验与噪声精度的贝叶斯模型。它通过最大化边际似然(证据)估计超参数,并能输出预测均值与不确定性(标准差/区间)。本系统支持:
BayesianRidge-贝叶斯岭回归
1. 方法概述
贝叶斯岭回归(Bayesian Ridge Regression)是在线性回归框架下引入参数先验与噪声精度的贝叶斯模型。它通过最大化边际似然(证据)估计超参数,并能输出预测均值与不确定性(标准差/区间)。本系统支持:
- 回归建模与置信区间;
- 可选特征工程(缺失处理、One-Hot、缩放、多项式、特征选择、降维等);
- 训练/测试拆分,评估 MAE、RMSE、MAPE、\(R^2\);
- 残差诊断图、QQ 图、预测区间图与 LogML 曲线。
设共有 \(n\) 个样本、\(p\) 个特征,数据集为
$$ \mathcal{D}=\{(x_i,y_i)\}_{i=1}^{n},\quad x_i\in\mathbb{R}^p \tag{1} $$
2. 符号说明表
| 符号 | 含义 |
|---|---|
| \(X\in\mathbb{R}^{n\times p}\) | 特征矩阵 |
| \(y\in\mathbb{R}^{n}\) | 目标向量 |
| \(w\in\mathbb{R}^{p}\) | 回归系数 |
| \(\alpha\) | 噪声精度(noise precision) |
| \(\lambda\) | 权重先验精度(weight precision) |
| \(\Sigma\) | 权重后验协方差 |
| \(m\) | 权重后验均值 |
| \(\hat{y}\) | 预测均值 |
| \(\sigma_{\hat{y}}\) | 预测标准差 |
| \(\text{AIC},\text{BIC}\) | 信息准则(可选参考) |
3. 公共部分(数据预处理与特征工程)
系统支持缺失处理、类别编码、数值缩放、多项式特征、特征选择与降维(均可选),且仅在训练集拟合,再作用于测试集,避免数据泄漏。
3.1 标准化与归一化
Z-Score 标准化: $$ z_{ij}=\frac{x_{ij}-\mu_j}{\sigma_j} \tag{2} $$
Min-Max 归一化: $$ z_{ij}=\frac{x_{ij}-\min x_j}{\max x_j-\min x_j+\varepsilon} \tag{3} $$
3.2 One-Hot 编码(类别型变量)
$$ x^{(k)}_{ij}=\begin{cases} 1,& x_{ij}=\text{cat}_k\\ 0,& \text{otherwise} \end{cases} \tag{4} $$
3.3 多项式特征(可选)
$$ \phi(x)=\{x_1^{a_1}x_2^{a_2}\cdots x_p^{a_p}\mid a_1+\cdots+a_p\le d_p\} \tag{5} $$
3.4 特征选择(方差阈值 / 互信息)
方差阈值: $$ \operatorname{Var}(x_j)=\frac{1}{n-1}\sum_{i=1}^{n}(x_{ij}-\mu_j)^2 \tag{6} $$
互信息: $$ I(X;Y)=\sum_{x\in X}\sum_{y\in Y}p(x,y)\log\frac{p(x,y)}{p(x)p(y)} \tag{7} $$
3.5 降维(PCA / KPCA)
协方差矩阵: $$ \Sigma_X=\frac{1}{n-1}\sum_{i=1}^{n}(x_i-\bar{x})(x_i-\bar{x})^\top \tag{8} $$
主成分解释率: $$ \eta_k=\frac{\lambda_k}{\sum_{j=1}^{p}\lambda_j} \tag{9} $$
4. BayesianRidge 模型
4.1 线性回归与似然
$$ y = Xw + \varepsilon,\quad \varepsilon\sim\mathcal{N}(0,\alpha^{-1}I) \tag{10} $$
对应的似然: $$ p(y|X,w,\alpha)=\mathcal{N}(Xw,\alpha^{-1}I) \tag{11} $$
4.2 权重先验(岭回归先验)
$$ p(w|\lambda)=\mathcal{N}(0,\lambda^{-1}I) \tag{12} $$
4.3 后验分布
后验分布仍为高斯:
$$ p(w|X,y,\alpha,\lambda)=\mathcal{N}(m,\Sigma) \tag{13} $$
其中 $$ \Sigma=(\lambda I+\alpha X^\top X)^{-1},\quad m=\alpha\Sigma X^\top y \tag{14} $$
4.4 预测分布与区间
对新样本 \(x_*\),预测分布为 $$ p(y_*|x_*,\mathcal{D})=\mathcal{N}\big(x_*^\top m,\ \alpha^{-1}+x_*^\top\Sigma x_*\big) \tag{15} $$
预测区间(显著性水平 \(\alpha\)): $$ \hat{y}_* \pm z_{1-\alpha/2}\,\sigma_{\hat{y}_*} \tag{16} $$
4.5 边际似然(证据)
贝叶斯岭回归通过最大化边际似然估计 \(\alpha,\lambda\): $$ \log p(y|X,\alpha,\lambda) \tag{17} $$
系统输出 Log Marginal Likelihood 曲线,用于观察优化过程收敛情况。
5. 回归评价指标
MAE: $$ \text{MAE}=\frac{1}{n}\sum_{i=1}^{n}|y_i-\hat{y}_i| \tag{18} $$
RMSE: $$ \text{RMSE}=\sqrt{\frac{1}{n}\sum_{i=1}^{n}(y_i-\hat{y}_i)^2} \tag{19} $$
MAPE: $$ \text{MAPE}=\frac{1}{n}\sum_{i=1}^{n}\left|\frac{y_i-\hat{y}_i}{y_i}\right| \tag{20} $$
决定系数: $$ R^2=1-\frac{\sum_{i=1}^{n}(y_i-\hat{y}_i)^2}{\sum_{i=1}^{n}(y_i-\bar{y})^2} \tag{21} $$
6. 输出结果与图表(Excel/图片)
Excel Sheet(示例):
- Parameters / Raw_Preview / Preprocess_Info / Summary
- Coefficients / Pred_Train / Pred_Test / Pred_All
- Charts_Index / LogML_Curve
图表清单(示例):
- 预测 vs 真实散点图(fitted_vs_actual)
- 残差直方图(residual_hist)
- 残差-拟合散点图(residual_vs_fitted)
- QQ 图(qqplot)
- 测试集预测区间图(test_pred_interval)
- LogML 曲线(logml_curve)
7. 与代码实现的对应关系
本算法在程序中由 具体的算法2/BayesianRidge-贝叶斯岭回归/core/calculator.py 实现,程序会把预处理、系数、三套预测表、不确定性区间和 Log marginal likelihood 曲线一并导出,因此论文写作建议以这些真实产物为主线。
7.1 程序实际导出的工作表
Parameters:模型超参数、训练比例、随机种子、特征工程设置;Raw_Preview:原始数据预览;Preprocess_Info:缺失处理、编码、缩放、特征选择、降维等流程摘要;Summary:模型信息与误差指标;Coefficients:回归系数及后验相关统计;Pred_Train、Pred_Test、Pred_All:训练集、测试集、全样本预测明细;Charts_Index:图表路径索引;LogML_Curve:启用compute_score时的边际似然迭代曲线。
7.2 程序实现中的关键事实
- 预测阶段调用
predict(..., return_std=True),因此区间不是后处理拼接,而是直接来自模型预测标准差; - 训练集、测试集和全样本三套预测结果会同时保存,便于论文分别讨论拟合效果与泛化效果;
Preprocess_Info会记录特征工程链路,方法部分应与其保持一致;compute_score=True时才会生成LogML_Curve,若该表缺失,通常表示运行参数未启用。
7.3 论文中的直接映射
- 数据与预处理:对应
Raw_Preview、Preprocess_Info; - 参数估计与变量解释:对应
Parameters、Coefficients; - 预测与泛化能力:对应
Pred_Test、Summary; - 不确定性分析:对应
Pred_Test中的标准差/区间与test_pred_interval图; - 模型证据或收敛过程:对应
LogML_Curve。
8. 论文写作模板
8.1 模型描述模板段落
“本文采用 Bayesian Ridge 回归对连续变量 \(y\) 建模。模型在高斯噪声假设下,将回归系数置为零均值高斯先验,并通过最大化边际似然估计噪声精度 \(\alpha\) 与权重精度 \(\lambda\)(见式(10)–(17))。在训练集上拟合后,于测试集评估 MAE、RMSE、MAPE 与 \(R^2\)(式(18)–(21)),并输出预测均值与置信区间,用于刻画模型不确定性。”
8.2 图表题注模板(示例)
- 图 1 预测值与真实值散点图(BayesianRidge)。
- 图 2 残差分布与 QQ 图。
- 图 3 测试集预测区间示意图。
8.3 表格模板(示例)
表 1 BayesianRidge 模型参数与指标
| 参数 | \(\alpha\) | \(\lambda\) | \(R^2\) | RMSE |
|---|---|---|---|---|
| 估计值 |
表 2 预测误差指标
| 指标 | MAE | RMSE | MAPE |
|---|---|---|---|
| 测试集 |
表注示例:注:\(\alpha\) 与 \(\lambda\) 为噪声与权重先验精度的估计值。
8.4 含显著性标注的表格示例(中文)
表 3 系数估计与显著性(示例)
| 变量 | 系数均值 | 标准差 | z 值 | p 值 | 显著性 |
|---|---|---|---|---|---|
| x1 | 0.823 | 0.112 | 7.35 | <0.001 | *** |
| x2 | -0.415 | 0.137 | -3.03 | 0.003 | ** |
| x3 | 0.091 | 0.055 | 1.65 | 0.099 | * |
| (截距) | 1.204 | — | — | — | — |
表注:显著性标注规则:*** \(p<0.01\),** \(p<0.05\),* \(p<0.10\)。
(注:BayesianRidge 输出为近似 z 值/近似 p 值,可作为系数显著性参考)
表 4 模型表现对比(示例)
| 模型 | MAE | RMSE | MAPE | \(R^2\) | 显著性 |
|---|---|---|---|---|---|
| BayesianRidge | 1.65 | 1.77 | 3.19% | 0.842 | *** |
| 基准线性回归 | 2.01 | 2.12 | 3.98% | 0.781 | — |
表注:显著性基于配对 t 检验或 Wilcoxon 检验对误差差值进行检验(可选),规则同上。
8.5 英文图表题注模板(可直接使用)
英文图题模板
- Fig. 1. Scatter plot of predicted vs. observed values for Bayesian Ridge regression.
- Fig. 2. Residual histogram and Q–Q plot for diagnostic assessment.
- Fig. 3. Prediction interval on the test set (mean ± confidence band).
- Fig. 4. Log marginal likelihood curve across iterations (if compute_score is enabled).
英文表格标题与表注模板
- Table 1. Bayesian Ridge hyper-parameters and performance metrics on the test set.
Note: \(\alpha\) and \(\lambda\) denote noise and weight precision, respectively. - Table 2. Prediction error metrics (MAE, RMSE, MAPE, \(R^2\)).
Note: Metrics are computed on the hold-out set.
9. UI 参数一一对应说明表(与界面一致)
| UI 参数 | 含义 | 对应模型/流程 | 备注 |
|---|---|---|---|
| dependent / 目标列 | 因变量 \(y\) | 回归目标 | 必选 |
| independents / 自变量 | 特征列 \(X\) | 解释变量 | 必选 |
| fit_intercept | 是否拟合截距 | 线性项 | 一般建议开启 |
| cred_alpha | 区间显著性水平 | 预测区间 | 0.05 ≈ 95% |
| max_iter / tol | 迭代上限/收敛阈值 | 优化过程 | 影响收敛 |
| alpha_1, alpha_2 | 噪声精度 \(\alpha\) 的 Gamma 先验 | 超参数 | shape / rate |
| lambda_1, lambda_2 | 权重精度 \(\lambda\) 的 Gamma 先验 | 超参数 | shape / rate |
10. 单篇终审补充
10.1 图题与表题对齐建议
Parameters表可写为:表X Bayesian Ridge 参数设置表。Raw_Preview表可写为:表X Bayesian Ridge 原始数据预览表。Preprocess_Info表可写为:表X Bayesian Ridge 预处理信息表。Summary表可写为:表X Bayesian Ridge 结果摘要表。Coefficients表可写为:表X Bayesian Ridge 系数表。Pred_Train表可写为:表X Bayesian Ridge 训练集预测结果表。Pred_Test表可写为:表X Bayesian Ridge 测试集预测结果表。Pred_All表可写为:表X Bayesian Ridge 全样本预测结果表。Charts_Index表可写为:表X Bayesian Ridge 图表索引表。LogML_Curve表可写为:表X Bayesian Ridge 对数边际似然曲线数据表。fitted_vs_actual_*.png建议写为:图X Bayesian Ridge 拟合值与实际值对比图。test_pred_interval_*.png建议写为:图X Bayesian Ridge 测试集预测区间图。residual_hist_*.png建议写为:图X Bayesian Ridge 残差直方图。residual_vs_fitted_*.png建议写为:图X Bayesian Ridge 残差与拟合值关系图。qqplot_*.png建议写为:图X Bayesian Ridge 残差 Q-Q 图。logml_curve_*.png建议写为:图X Bayesian Ridge 对数边际似然曲线图。
10.2 终审说明
- 当前最适合作为终审证据的代表性目录可采用
具体的算法2/BayesianRidge-贝叶斯岭回归/results/pytest_ui_bayesian_ridge_test_window2_regression_robust8_20260329_165354。该目录同时具备结果簿、完整图集和 repro 脚本。 - 真实工作表为
Parameters/Raw_Preview/Preprocess_Info/Summary/Coefficients/Pred_Train/Pred_Test/Pred_All/Charts_Index/LogML_Curve。论文若解释不确定性和贝叶斯证据,应优先引用Pred_Test、LogML_Curve与Summary。 - 当前真实图文件稳定为
fitted_vs_actual_20260329_165354.png、test_pred_interval_20260329_165354.png、residual_hist_20260329_165354.png、residual_vs_fitted_20260329_165354.png、qqplot_20260329_165354.png、logml_curve_20260329_165354.png。这一组图已经覆盖拟合效果、区间估计、残差诊断和边际似然四类核心证据。 - 当前复现脚本为
repro_bayesian_ridge_20260329_165354.py,采用SRC_FILE = 'repro_inputs/sample_data.csv'。因此 Bayesian Ridge 这篇可以把repro_inputs/...作为标准复现输入路径。 - 这篇的终审重点不应只写“系数和 RMSE”,还应明确其贝叶斯回归特征:预测区间与 Log marginal likelihood 曲线都是程序真实输出。 | alpha_init, lambda_init | \(\alpha,\lambda\) 初值 | 收敛 | 可选 | | compute_score | 记录 LogML 曲线 | 可视化 | 便于比较 | | train_ratio | 训练比例 | 切分 | 默认 0.80 | | shuffle | 是否打乱 | 切分 | 非时间序列建议 | | random_state | 随机种子 | 复现 | 建议固定 | | missing / one_hot / scaling | 缺失处理/编码/缩放 | 特征工程 | 可选 | | poly_features | 多项式/交互 | 特征工程 | 注意维度爆炸 | | feature_select | 特征选择(KBest/方差) | 特征工程 | 可选 | | dim_reduce | 降维(PCA/KPCA) | 特征工程 | 可选 |
10. 示例数据说明模板(可直接用于论文)
“本文使用 \(n\) 个样本与 \(p\) 个特征,包含数值特征与必要的类别特征(采用 One-Hot 编码)。训练/测试比例为 \(r\)/(1-\(r\))。模型输出预测均值、预测标准差及置信区间,以反映参数不确定性与预测区间宽度。”
11. 单篇终审补充
11.1 全量强化补充
本篇终审补充绑定的真实算法目录为 具体的算法2/BayesianRidge-贝叶斯岭回归,而不是 具体的算法/ 下的同名目录。本次采用的代表性结果目录为 具体的算法2/BayesianRidge-贝叶斯岭回归/results/pytest_ui_bayesian_ridge_test_window2_regression_robust8_20260329_165354。
该目录当前主结果工作簿为:
pytest_ui_bayesian_ridge_test_window2_regression_robust8_20260329_165354.xlsx
实测工作表为:
ParametersRaw_PreviewPreprocess_InfoSummaryCoefficientsPred_TrainPred_TestPred_AllCharts_IndexLogML_Curve
因此这篇应按英文 sheet 体系写表题,不能套用 OLS 的中文诊断页名。Coefficients 适合解释系数均值与不确定性,Pred_Test 和 Pred_All 适合写预测结果,LogML_Curve 对应边际似然过程。
当前目录中的真实图文件为:
fitted_vs_actual_20260329_165354.pngtest_pred_interval_20260329_165354.pngresidual_hist_20260329_165354.pngqqplot_20260329_165354.pngresidual_vs_fitted_20260329_165354.pnglogml_curve_20260329_165354.png
这说明当前结果同时支持拟合诊断、预测区间和 LogML 曲线解释;论文中如果写贝叶斯岭的不确定性,优先引用 test_pred_interval_*.png 与 Pred_Test。
复现实物方面,该目录实际包含:
具体的算法2/BayesianRidge-贝叶斯岭回归/results/pytest_ui_bayesian_ridge_test_window2_regression_robust8_20260329_165354/repro_bayesian_ridge_20260329_165354.py具体的算法2/BayesianRidge-贝叶斯岭回归/results/pytest_ui_bayesian_ridge_test_window2_regression_robust8_20260329_165354/repro_inputs/sample_data.csv
脚本中明确写成 SRC_FILE = 'repro_inputs/sample_data.csv'。因此这一篇的代表性结果目录已经是目录内相对路径输入副本复现口径。
11.2 软件实现核查补充(2026-07)
- 当前最新结果目录
results/BayesianRidge分析结果_20260411_212736的工作表包括Parameters、Raw_Preview、Preprocess_Info、Summary、Coefficients、Pred_Train、Pred_Test、Pred_All、Charts_Index、LogML_Curve,说明它是带不确定性输出的回归模型。 - 当前目录的图文件包括
fitted_vs_actual_20260411_212736.png、residual_hist_20260411_212736.png、residual_vs_fitted_20260411_212736.png、qqplot_20260411_212736.png、logml_curve_20260411_212736.png、test_pred_interval_20260411_212736.png。 - 复现脚本
repro_bayesian_ridge_20260411_212736.py和repro_inputs/sample_data.csv同目录存在,当前目录已经是闭环复现口径。 - 文档里若讨论 Bayesian Ridge 的不确定性,应该直接对应预测区间图和 LogML 曲线,不要把它写成单纯点预测模型。