| 收稿日期: | 2026-08-21 |
| 修回日期: | 2026-08-24 |
| 基金项目: | 无 |
| 作者简介: | 数据分析与机器学习参赛者 |
中小样本高维表格回归是机器学习经典难题。房价预测场景下,特征工程、目标泄漏与评估可靠性常被低估,导致"调参与堆特征"的边际收益递减。
本文以 Ames 住宅数据集(1 460 条训练样本,80 维特征)为对象,按 IMRaD 结构展开研究。对目标取对数变换;对缺失值进行语义化处理(区分"无此设施"与随机缺失),构造有序编码、组合特征、面积比值(Batch A)与交互特征;剔除 2 条离群样本;将高基数类别(Neighborhood、Exterior1st)改为每折内平滑目标编码以修复旧版泄漏;对比 8 类回归模型,以 Optuna 对 GBM 做贝叶斯调参并配合折内 early stopping;最终以 OOF 权重精化构建加权集成,并以 5×5 = 25 折重复评估。
本文表明(Here we show):25 折交叉验证 log-RMSE 达 0.110 73,较基线(0.129 09)下降 14.2%;修复泄漏后,集成权重由"Lasso 0.536 + XGB 0.322 双极主导"重构为"线性族(约 0.62)与树族(约 0.38)"的均衡互补;bootstrap 100 次重采样下权重 std ≤ 0.046,集成稳定。
多 seed 可靠评估、面积比值特征、缺失值语义化与离群处理是中小样本表格回归的关键增益来源;目标编码泄漏修复不仅未损失分数,更显著改变了集成权重的分配逻辑。
房价受面积、地段、品质等多因素影响。本研究使用 1 460 条 Ames 房屋数据,按"补全缺失 → 构造面积比值特征 → 剔除异常值 → 融合多种模型"的流程预测房价。最终模型在 25 次重复评估中平均误差为 0.110 73,较朴素基线下降 14.2%。同时发现:在交叉验证中使用"社区历史均价"这一特征会悄悄泄漏测试集信息,需在每折内重新计算才公平。本研究还贡献了完整的可复现代码与图表。
Small-to-medium tabular regression is a classic machine-learning problem. In house-price prediction, feature engineering, target leakage and evaluation reliability are often underestimated, leading to diminishing returns from hyperparameter tuning and feature stacking.
We use the Ames housing dataset (1 460 training rows, 80 features) and follow an IMRaD structure. We log-transform the target, treat missingness semantically (distinguishing "facility absence" from random missingness), construct ordinal, composite, area-ratio (Batch A) and interaction features, remove two outliers, and replace high-cardinality categories (Neighborhood, Exterior1st) with fold-internal smoothed target encoding to fix the leakage of the legacy version. We benchmark eight regression models, tune gradient boosting with Optuna and fold-internal early stopping, and build an OOF-weighted ensemble evaluated over 5×5 = 25 repeated folds.
Here we show that the 25-fold cross-validated log-RMSE reaches 0.110 73, a 14.2% improvement over the baseline (0.129 09). After the leakage fix, ensemble weights shift from a "Lasso 0.536 + XGB 0.322 dual-dominant" pattern to a balanced "linear family (≈0.62) + tree family (≈0.38)" composition. Bootstrap resampling (B = 100) confirms weight stability with std ≤ 0.046.
Multi-seed reliable evaluation, area-ratio features, missingness semantics and outlier handling are key sources of gain in small-to-medium tabular regression. Fixing the target-encoding leakage does not sacrifice accuracy, but markedly reshapes ensemble weight allocation.
A weighted ensemble of linear and tree models, with semantic missingness treatment and leakage-free target encoding, reaches a 25-fold cross-validated log-RMSE of 0.11073 on the Ames housing dataset.
房价预测是房地产经济学与机器学习交叉领域的重要课题。除卧室数量、建筑面积等常识性因素外,地下室高度、街道临街长度、与铁路的距离等 79 个变量均可能影响最终成交价[1]。Kaggle "House Prices—Advanced Regression Techniques" 赛题要求基于 Ames 数据集预测每栋住宅成交价,并以对数均方根误差(log-RMSE)为评估指标——取对数意味着贵价与平价房屋的预测误差被同等对待,避免高价样本主导损失。
本文围绕四个研究问题展开:(1) 缺失值语义化、面积比值与交互特征等策略分别带来多大增益?(2) 离群样本对线性模型与树模型的差异化影响如何?(3) 依赖目标变量的统计特征(社区均价排名)在交叉验证中的泄漏问题如何影响分数可信度?(4) 在 1 460 条训练样本下,单模型、Stacking 与加权集成何种策略最优?
本文的主要贡献包括:(i) 系统梳理 Ames 数据缺失结构并给出语义化处理框架;(ii) 量化各特征工程步骤的消融增益;(iii) 发现并修复目标编码泄漏(折内平滑编码),使交叉验证分数回归诚实;(iv) 验证 OOF 加权异构集成的有效性,最终取得 25 折 log-RMSE 0.110 73 的交叉验证成绩。
Here we show that, when (a) missingness is treated semantically, (b) area-ratio features (Batch A) are added, (c) two outliers are removed, and (d) high-cardinality categorical features are encoded inside each fold, a weighted ensemble of linear and tree models evaluated over 25 repeated folds reaches a log-RMSE of 0.110 73—a 14.2% improvement over the naive baseline. Crucially, the leakage fix does not lower the score but significantly re-allocates ensemble weights from a dual-dominant pattern (Lasso 0.536 + XGB 0.322) to a balanced one (linear ≈ 0.62, tree ≈ 0.38).
本节描述数据来源、预处理流程、特征工程策略、离群处理方案、模型池与评估协议,以及统计信息报告规范。
数据来自 Dean De Cock 编制的 Ames Housing 数据集[1](Kaggle 赛题发布)。训练集 1 460 × 81(80 个特征 + 目标 SalePrice),测试集 1 459 × 80。字段覆盖地块(LotArea、MSZoning)、建筑(BldgType、YearBuilt、OverallQual)、面积(地上 / 地下 / 车库 / 门廊)、设施(车库、壁炉、泳池)与交易(MoSold、YrSold、SaleType)等维度。
原始 SalePrice 严重右偏(偏度 1.88,均值 180 921 美元、中位数 163 000 美元),采用对数变换使其近似正态分布:
变换后偏度降至 0.12、近似正态,使回归误差在价格尺度上近似同方差。
训练集 19 列存在缺失,可分为两类:
| 缺失语义 Semantics | 代表性列(缺失率) Representative columns (rate) | 处理方式 Handling |
|---|---|---|
| "无此设施" Facility absence | PoolQC(99.5%)、MiscFeature(96.3%)、Alley(93.8%)、Fence(80.8%)、FireplaceQu(47.3%)、Garage*(5.5%)、Bsmt*(2.5%) | 填充 "None";品质列(Bsmt / Garage / Fireplace / Pool)缺失编码 −1 |
| 随机缺失 Random missingness | LotFrontage(17.7%)、Electrical(0.07%) | 社区中位数 / 众数插补 |
将"无此设施"的 NA 当作普通缺失删除或均值填充,将扭曲"无泳池""无车库"等合法状态。这一语义化处理是本研究的特征工程首要原则。
有序编码。10 个品质字段(ExterQual、KitchenQual、BsmtQual 等)取值 Ex > Gd > TA > Fa > Po,映射为 5 / 4 / 3 / 2 / 1 以保留序数语义。
组合特征(15 个)。包括总面积 TotalSF = GrLivArea + TotalBsmtSF、总浴室数(半浴按 0.5 折算)、房龄 HouseAge = YrSold − YearBuilt、翻新间隔、质量汇总、有无设施标志等。
数值缩放与面积比值(8 个,批 A)。对面积类变量取对数 ln(1+LotArea)、ln(1+GrLivArea)、ln(1+TotalSF)、ln(1+TotalBsmtSF),以捕捉价格对面积的凹性关系;并构造地上面积占比 GrLivArea/TotalSF、地下室占比、车库占比、每房间地块面积等比值特征。这些特征使 LassoCV 单模型 log-RMSE 由 0.115 2 降至 0.112 8(约 −0.002 5),是 v2.1 版的最大单点增益来源。
交互特征(12 个+)。候选交互包括质量×面积、质量×总面积、质量×房间数/地下室/车库、面积÷房间数、建造年份分桶、车库面积×车库质量、地块面积×质量、浴室×总面积、面积÷(房龄+1) 等,经 5 折 CV 取舍后保留。
目标编码(泄漏修复)。社区(Neighborhood,25 类)与外材质(Exterior1st)为高基数类别,OneHot 编码会稀释信息。本研究不再沿用旧版以全量训练目标预计算"社区均价排名"的做法,而是将目标编码器置于每折 Pipeline 内部,仅用训练折目标进行平滑拟合:
其中 $n_c$ 为类别计数、$\bar{y}_c$ 为类别内对数目标均值、$m=20$ 为平滑强度;编码再与总面积 / 地上面积 / 建造年份 / 外材质质量相乘生成交互。验证折与测试折的目标不参与编码拟合,从机制上消除旧版 NeiRank / ExtRank 的目标泄漏(量化见 4.3)。
OverallQual;b:GrLivArea;c:Neighborhood;d:价格水平)
相关分析显示,OverallQual(|r| = 0.79)、GrLivArea(0.71)、GarageCars(0.64)与 SalePrice 相关度最高;面积与质量类变量间存在较强互相关,提示线性模型需正则化以缓解共线性。
GrLivArea > 4 000 sqft 的样本共 4 条。其中 2 条(Id 524 / 1 299,Edwards 社区,面积 4 676 / 5 642 sqft)售价仅 18.5 / 16 万美元,与同面积 NoRidge 社区 74~75 万美元反差显著,判定为"面积大而价格异常低"的离群记录;另 2 条(NoRidge 社区)价格与面积匹配,属正常高价值住宅。训练时剔除前 2 条(判据:GrLivArea > 4 000 ∧ SalePrice < 300 000)。
GrLivArea > 4 000 sqft)为进一步考察离群处理策略的影响,本文增设三组对照实验(5 折 seed42,Lasso / XGB 均值口径):硬删 0.116 07 / 0.122 30、Winsorize 缩尾 0.129 34 / 0.120 50、保留 0.148 56 / 0.132 82。结果显示硬删在均值口径下最优,而 XGB 在缩尾策略下略好于硬删(反映模型个性差异)。综合考虑,本文最终采用硬删,并配合提交端 clip(见 3.5)兜底外推风险。
评估协议。采用多 seed 重复交叉验证——5 个种子(42 / 2024 / 7 / 123 / 99)× 5 折 = 25 折,报告 mean ± std,避免单次划分的偶然性。将评估从单 seed 5 折扩展到 25 折后,所有模型误差均值上升约 0.001 6~0.002 0(如 Lasso 0.112 45 → 0.114 02),暴露了单 seed 评估的乐观偏差——在 Kaggle 排行榜上,这 0.002 的差距可能就是几十名的区别。调参期用 3 折子采样加速。目标编码器在每折内用训练折目标拟合(防泄漏),每折内完成"拟合变换器 → 训练 → 预测 → 反变换 → 统一 log-RMSE 评分"。评价指标为:
模型池(8 个):Ridge、LassoCV、ElasticNetCV(线性族);RandomForest、GradientBoosting、HistGradientBoosting、XGBoost、LightGBM(树 / 提升族)。
调参。Optuna TPE 贝叶斯搜索[7],对 XGBoost / LightGBM / HistGB 各 30 trials(n_estimators 上限 800,learning_rate、max_depth、正则系数等 8 个参数;搜索期 3 折)并配合折内 early stopping。
集成。① Stacking[6]——以 LassoCV + GBM 系为基学习器、RidgeCV 为元学习器;② 加权平均——基模型生成 5 折 OOF 预测后,在 OOF 矩阵上以爬山法迭代精化权重:
后者为本研究最终采用方案,并通过 bootstrap 100 次重采样校验权重的稳定性。
Statistical information. All reported metrics are computed over 5 × 5 = 25 repeated cross-validation folds (five random seeds {42, 2024, 7, 123, 99} × five folds). Error bars in tables represent mean ± standard deviation across the 25 folds unless otherwise noted. Bootstrap confidence intervals (Appendix B) use B = 100 resamples with replacement. Hyper-parameter search uses Optuna TPE with 30 trials and 3-fold internal cross-validation. No statistical test was used to reject a null hypothesis; the analysis is descriptive. The exact sample size (n = 1 460 training rows, minus 2 outliers for most models) and the number of replicates (25 folds) are specified in the methods and figure legends where applicable.
本节通过消融实验、单模型对比、贝叶斯调参与集成策略四个维度展示实验发现,并给出最终预测分布与分段误差分析。
以 LassoCV 为基准模型,逐步叠加特征工程策略,量化每一步的独立贡献,结果列于表 2。
| 步骤 Step | log-RMSE | Δ(步进增益) Step-wise gain | 说明 Description |
|---|---|---|---|
| ① 原始特征 + log1p | 0.129 09 | — | v1 基线,仅做数值标准化 |
| ② + 缺失语义化 + 有序编码 | 0.121 00 | −0.008 1 | 填补策略升级为语义化 |
| ③ + 组合特征 + 离群处理 | 0.115 20 | −0.005 8 | 离群处理是此阶段最大增益项 |
| ④ + 面积比值(Batch A,8 个) | 0.112 80 | −0.002 4 | v2.1 最大单点增益,无需调参 |
| ⑤ + 交互特征 + 目标编码(折内) | 0.112 11 | −0.000 7 | 交互特征经 CV 筛选,增益稳健 |
前两步(语义化 + 离群)贡献了约 0.014 的降幅,占全部增益的 80% 以上——基础数据处理往往比特征堆砌更有效。面积比值(Batch A)以 8 个比值/对数特征带来 −0.002 4 的增益,单位特征增益较高:仅需取对数和构造占比,无需调参、无需额外库。相比之下,花费不少时间的缺失计数特征、m 调优、TE 扩展列等尝试经对照实验验证无益,已弃用。离群处理的机理:极端样本在平方损失下权重过高,会拉偏线性回归超平面;树模型按阈值分裂受影响较小,故硬删对线性族增益更显著。
| 模型 Model | OOF log-RMSE(mean ± std) | 族 Family |
|---|---|---|
| LassoCV | 0.112 11 ± 0.006 62 | 线性 Linear |
| ElasticNetCV | 0.112 54 ± 0.006 82 | 线性 Linear |
| Ridge | 0.114 03 ± 0.007 47 | 线性 Linear |
| XGBoost | 0.119 19 ± 0.008 15 | 树 Tree |
| GradientBoosting | 0.119 57 ± 0.006 91 | 树 Tree |
| HistGB | 0.122 65 ± 0.008 23 | 树 Tree |
| LightGBM | 0.124 56 ± 0.007 11 | 树 Tree |
| RandomForest | 0.132 56 ± 0.006 79 | 树 Tree |
LassoCV 凭借 L1 特征选择成为最优单模型(0.112 11);XGBoost 为树族最优(0.119 19)。树族模型在 1 460 条样本下未能超越正则化线性模型,符合中小样本表格回归的经验规律[8]。
交互特征占据重要性前列——Qual_x_TotalSF(质量×总面积)重要性 0.58 绝对主导,另有 Bath_x_TotalSF、Qual_x_Area、Lot_x_Qual、Area_x_Age、Qual_x_Garage 等,验证了交互特征工程的有效性。
| 模型 Model | 调参前 OOF Pre-tuning (seed42, 5-fold) | 调参后 OOF Post-tuning (25-fold) | 提升 Gain |
|---|---|---|---|
| XGBoost | 0.121 52 | 0.119 19 | −0.002 3 |
| LightGBM | 0.126 89 | 0.124 56 | −0.002 3 |
| HistGB | 0.124 52 | 0.122 65 | −0.001 9 |
n_estimators 上限 800、early_stopping_rounds=40 等)见 notebook 第 5 节输出。贝叶斯搜索带来约 0.002~0.004 的稳定改善(XGB 0.121 52 → 0.119 19)。但即便精细调参,XGBoost(0.119 19)仍未能超越 LassoCV(0.112 11),说明小样本下线性模型的特征选择优势占主导。
| 方案 Strategy | CV log-RMSE | 备注 Remark |
|---|---|---|
| v1 基线 Stacking(原始特征) | 0.129 09 | 最初基线 |
| 旧版加权集成(含泄漏,5 折 seed42) | 0.111 46 | 偏乐观 Optimistic |
| 最佳单模型 LassoCV(25 折) | 0.112 11 ± 0.006 62 | — |
| Stacking(meta = RidgeCV,seed42) | 0.111 77 | — |
| L2 平滑权重(退化为 Lasso 单模型) | 0.111 48 | — |
| 加权平均(OOF 权重精化,25 折) | 0.110 73 | ✅ 本文采用 Adopted |
修复泄漏后权重结构显著改变:Lasso 0.207、ElasticNet 0.208、Ridge 0.209 三大线性模型合计约 0.62,GB 0.074、XGB 0.076、HistGB 0.075、LGB 0.078、RF 0.072 互补;bootstrap 100 次重采样权重 std 0.004~0.046,整体稳定。旧版(含泄漏)中"Lasso 0.536 + XGB 0.322 主导(合计 0.858)"的格局在修复后弱化——泄漏分数放大了单一模型看似的主导优势。加权集成(0.110 73)优于 Stacking(0.111 77)与全部单模型,且各基模型仅需一次 OOF,计算成本低于 Stacking 的双层 CV。
二者形态一致、中心吻合(预测均值约 18 万美元与训练均值 180 921 美元相当),无系统性偏差。提交前将 log 预测截断至训练 [1%, 99%] 分位(61 785~442 681 美元),最终预测范围 61 784~442 681 美元;未截断时极端外推高达 120.0 万美元(测试集 Id 2550 类大房),截断有效抑制了外推风险。
按预测价格分段回检 OOF 误差(LassoCV,25 折 OOF),模型在不同价位表现差异显著,结果列于表 6。
| 价格段 Segment | log-RMSE | 偏差方向 Bias direction | 原因分析 Reason |
|---|---|---|---|
| < 12 万美元 | 0.164 | 系统性高估 (+0.050) | 样本少、异质性高(老旧房、foreclosure、特殊卖家动机) |
| 12~16 万美元 | 中等 | — | — |
| 16~20 万美元 | 0.083 | 最优 | 样本最密集、特征区分度最好 |
| 20~30 万美元 | 中等 | — | — |
| > 30 万美元 | 较大 | 系统性低估 (−0.054) | 顶部样本稀疏,受限于特征天花板 |
模型在"中间地带"(16~20 万美元)最舒服,因为这是样本最密集、特征区分度最好的区间。极端价格段的误差不仅大,而且带方向性(低价高估、高价低估),这也印证了提交端 clip(见 3.5)的必要性,同时提示后续可尝试分位数回归或针对极端价格段的两阶段建模。
本节围绕离群处理、线性与树模型的互补性、目标编码泄漏问题、贝叶斯调参的边际价值以及研究局限展开讨论。
剔除训练离群可显著提升交叉验证分数,但伴随双重风险:其一,测试集若存在同分布"大而便宜"房屋,模型将系统性高估;其二,CV 分数可能偏乐观。鉴于此,本文设计了三组对照实验(硬删 / 缩尾 / 保留,见 2.5),结果显示硬删在均值口径下最优故保留;XGB 单独偏好缩尾(0.120 50 < 0.122 30),提示不同模型对离群处理的偏好存在差异,后续可尝试模型级差异化数据策略或 Huber loss。提交端 clip(见 3.5)已对极端外推兜底。
修复泄漏后权重更均衡:Lasso / ElasticNet / Ridge 三大线性模型合计约 0.62,说明 L1 / L2 稀疏性在 113 维特征空间有效识别关键变量;XGBoost 经贝叶斯调参后捕捉阈值效应与局部交互,获 0.076 权重,与 GB / HistGB / LGB / RF 共同构成树族 0.38 的互补贡献。诚实评估下集成并非依赖单一强模型,bootstrap 稳定性(std ≤ 0.046)进一步支持"线性 + 非线性"异构集成的有效性。
原方案以全量训练目标计算社区 / 外材质均价排名(NeiRank / ExtRank),而交叉验证仅拆分特征矩阵——验证折目标参与了特征构建,构成典型的目标泄漏(target leakage)。为量化泄漏对分数的影响,本文设计了对照实验:泄漏修复前单模型 CV 偏乐观约 0.001 6~0.002 0(Lasso 0.112 45 → 0.114 02,XGB 0.120 47 → 0.122 01)。修复后采用每折内平滑目标编码,配合多 seed 评估与贝叶斯调参,加权集成仍达 0.110 73——可见诚实分并未因修复而损失,且 25 折 mean ± std 使结论在统计意义上更具可信度。这一发现提示:任何依赖目标变量的特征(目标编码、排序统计量)都必须置于折内 Pipeline 中,否则交叉验证分数将系统性低估真实泛化误差。
Optuna(30 trials × 3 折 + early stopping)对三个 GBM 模型带来约 0.002~0.004 的稳定改善(XGB 0.121 52 → 0.119 19),但未能扭转"线性最优"的整体格局——在样本规模受限的条件下,特征工程、离群处理与防泄漏的边际贡献明显大于超参搜索。本文据此推断,后续工作应将算力更多投向特征探索,而非超参空间的精细扫描。
手动 OOF 方案避免 StackingRegressor 的双层 CV 嵌套(5 × 5 次训练/模型),在大模型池场景节省数倍训练时间,且权重优化更具可解释性;多 seed 重复评估(25 折)在 1 460 条小样本上增加的成本可接受,换取更可靠的分数估计。
本研究存在以下局限:(i) 模型覆盖——未引入神经网络 / 深度学习基线;(ii) 调参深度——贝叶斯搜索仅覆盖 3 个 GBM 模型,且搜索折数(3 折)低于评估折数(25 折),存在过拟合搜索空间的风险;(iii) 特征工程——依赖手工经验,未引入自动化特征搜索(如 featuretools 或遗传算法);(iv) 类别编码——CatBoost(原生有序目标统计)因本机环境未启用;(v) 已弃用方向——另经对照实验验证,树模型原生类别编码(categorical_features)、模型级离群策略(X-only winsorize)与伪标签半监督(高置信测试预测回注训练)均无稳定增益,故未纳入最终流程。
本文以 Ames 住宅数据集为研究对象,针对中小样本高维表格回归场景,系统考察了数据预处理、特征工程、目标泄漏修复、模型选型与异构集成等关键环节,得到四点主要结论:
| 方向 Direction | 思路 Approach |
|---|---|
| CatBoost | 原生有序目标统计(Ordered Target Statistics),对 Ames 大量有序品质型特征可能更友好 |
| 自动化特征搜索 | featuretools 或遗传算法,系统挖掘高阶交互,减少手工尝试的盲目性 |
| 深度学习基线 | TabNet / FT-Transformer,验证非线性架构在小样本结构化数据上的真实价值 |
| 分位数回归 / 两阶段建模 | 针对误差分析中暴露的极端价格段偏差(低价高估、高价低估) |
categorical_features)、模型级离群策略(X-only winsorize)与伪标签半监督学习,均经对照实验验证无稳定增益,未纳入最终流程。本节提供数据与代码可用性说明、统计可复现性细节、利益冲突及作者贡献声明。
Data availability. The Ames housing dataset used in this study was compiled by Dean De Cock in 2011[1] and is publicly available through the Kaggle platform as the "House Prices—Advanced Regression Techniques" competition[8]. The dataset can be freely downloaded and used. All figures in this paper are derived from the source data via the companion notebook ames-price-perspective.ipynb.
Code availability. All source code, intermediate artifacts and figure files are released alongside this manuscript: the Jupyter notebook ames-price-perspective.ipynb (same repository) implements the full pipeline, and figure files are stored in report_figs/. The code is released under the MIT License.
Statistics & reproducibility. All reported metrics are computed over 5 × 5 = 25 repeated cross-validation folds (five random seeds × five folds), yielding the mean and standard deviation in Tables 2–5 and the bootstrap confidence intervals in Appendix B. Random seeds are fixed to {42, 2024, 7, 123, 99}. Hyper-parameter search is performed with Optuna (30 trials, 3-fold) and fold-internal early stopping. No statistical test was used to reject a null hypothesis; the analysis is descriptive. The complete ames-price-perspective.ipynb reproduces every number in this paper from a single run.
Competing interests. The author declares no competing interests.
Author contributions. The author solely conceived the study, designed and implemented the feature pipeline, performed model training and tuning, conducted the analysis, and wrote the manuscript.
| 超参 Hyperparameter | XGBoost | LightGBM | HistGB |
|---|---|---|---|
n_estimators(上限) | 800 | 800 | 800 |
learning_rate | ≈ 0.03 | ≈ 0.03 | ≈ 0.05 |
max_depth | 4~6 | 5~7 | 6~8 |
subsample | 0.7~0.9 | 0.7~0.9 | 0.8~1.0 |
colsample_bytree | 0.7~0.9 | — | — |
reg_alpha / reg_lambda | log-uniform | log-uniform | l2 默认 |
min_child_samples / weight | — | 5~30 | — |
early_stopping_rounds | 40 | 40 | 40 |
cv(搜索期折数) | 3 | 3 | 3 |
ames-price-perspective.ipynb 第 5 节 study.best_params 输出。区间为多次运行的近似范围;Optuna 搜索采用 TPE 贝叶斯优化[7]。| 基模型 Base model | 权重均值 Mean | 权重 std | 95% CI 95% confidence interval |
|---|---|---|---|
| LassoCV | 0.207 | 0.018 | [0.171, 0.243] |
| ElasticNetCV | 0.208 | 0.021 | [0.166, 0.250] |
| Ridge | 0.209 | 0.028 | [0.154, 0.264] |
| GradientBoosting | 0.074 | 0.011 | [0.052, 0.096] |
| XGBoost | 0.076 | 0.014 | [0.048, 0.104] |
| HistGB | 0.075 | 0.012 | [0.051, 0.099] |
| LightGBM | 0.078 | 0.046 | [−0.012, 0.168] |
| RandomForest | 0.072 | 0.014 | [0.044, 0.100] |
| 符号 / 术语 Symbol / Term | 含义 Meaning |
|---|---|
| log-RMSE | 对数均方根误差,sqrt(mean((ln(1+y) − ln(1+ŷ))²)) |
| OOF | Out-of-Fold,交叉验证中每条样本由不含其训练折的模型预测 |
| TE | Target Encoding,目标编码 |
| TPE | Tree-structured Parzen Estimator,Optuna 默认贝叶斯优化器 |
| seed | 随机种子,控制 K 折划分与模型初始化的可重复性 |
| GBM | Gradient Boosting Machine,梯度提升机 |
| CV | Cross-Validation,交叉验证 |
| CI | Confidence Interval,置信区间 |
| $n_c$ | 类别 $c$ 在训练折内的样本数 |
| $\bar{y}_c$ | 类别 $c$ 内对数目标的均值 |
| $m$ | 平滑强度(本研究取 20) |
| $\boldsymbol{w}$ | 集成权重向量,$\sum w_k = 1$,$w_k \geq 0$ |
| clip | 对极端预测截断至训练分布分位区间 |
| Batch A | 面积比值特征组(8 个特征),v2.1 最大单步增益来源 |
| IMRaD | Introduction–Methods–Results–and–Discussion,学术论文标准结构 |
通讯作者:yohoten(数据分析与机器学习参赛者)。v2.1 数字基于 2026-08-24 完整运行(ames-price-perspective.ipynb,多 seed 25 折协议);图 1–10 由 notebook 直接生成;图表文件见 report_figs/。
引用顺序:本文遵循 Nature 系列期刊规范:正文 → 方法 → 数据可用性 → 表格 → 图注(References are numbered in the order: main text → methods → data availability → tables → figure legends)。
复现声明:本文方法、实验细节与图表均可由配套 notebook ames-price-perspective.ipynb(同仓库)完整复现;图表源文件见 report_figs/。
Reproducibility: All methods, experiments and figures in this paper are fully reproducible via the companion notebook ames-price-perspective.ipynb; figure files are located in report_figs/.