本文介绍一种手动分层策略,确保训练集和测试集中均包含每位配送员(delivery guy)的样本,且每个目标类别(0/1)在每位配送员下均有代表性分布,避免模型因数据泄露或缺失而失效。
本文介绍一种手动分层策略,确保训练集和测试集中均包含每位配送员(delivery guy)的样本,且每个目标类别(0/1)在每位配送员下均有代表性分布,避免模型因数据泄露或缺失而失效。
在构建预测“订单是否会被成功交付”(Target: 0/1)的机器学习模型时,仅对标签(stratify=y)做简单分层是不够的——尤其当关键特征(如 Delivery Guy)具有强个体效应,且数据高度不平衡(例如多数人仅有少量正例 Target=1)时。若标准 train_test_split 随机切分,极易导致某位配送员(如 James)的所有正样本(Target=1)全部落入训练集,而测试集中完全缺失其正例,造成评估失真、泛化能力误判。
为此,需采用
双重分层(Double-Stratified Split)
:即同时按 Delivery Guy 和 Target 进行分组,在每个子组内独立分配训练/测试样本,从而强制保证:
✅ 每位配送员的数据在训练集和测试集中均有出现;
✅ 每位配送员的每个目标类别(0 和 1)在两个集合中均至少保留一个样本(若该类存在多个实例);
✅ 整体训练/测试比例仍接近预设值(如 70%/30%)。
以下是推荐的稳健实现方案(基于 pandas + sklearn.model_selection.train_test_split):
⚠️
关键注意事项
:
小样本处理
:当某配送员在某类别下仅有一个样本(如 Tom 的 Target=1 只有 1 条),无法物理拆分。此时应将其保留在训练集,并在测试集中通过其他配送员的同类样本弥补评估可靠性;也可考虑使用 StratifiedGroupKFold 进行交叉验证替代单次划分。
比例灵活性
:上述代码中 test_size=0.3 是全局目标,实际最终比例可能略有浮动(因按子组独立切分)。如需精确控制整体比例,可先计算各子组权重后动态调整 test_size。
扩展性建议
:对于更大规模数据,推荐封装为函数并支持 min_train_per_class=1、min_test_per_class=1 等参数;亦可结合 imblearn 库在划分后对训练集进行过采样(如 SMOTE),但
切勿在划分前或跨训练/测试集采样
,以防数据泄露。
该策略从根本上解决了“模型只见过 John 的失败案例,却从未在测试中验证 James 失败场景”的业务风险,使模型真正具备面向全配送员群体的鲁棒预测能力。
import pandas as pd
from sklearn.model_selection import train_test_split
# 假设 df 是您的原始 DataFrame
train_list, test_list = [], []
# 第一层:按配送员分组
for name, guy_group in df.groupby('Delivery Guy'):
# 第二层:按目标类别再分组
for target_val, target_group in guy_group.groupby('Target'):
n_samples = len(target_group)
if n_samples == 1:
# 单一样本:优先放入训练集(保障模型能学到该模式),测试集暂不分配
train_list.append(target_group)
else:
# 多样本:严格按比例拆分(如 test_size=0.3),确保两类均有代表
t_train, t_test = train_test_split(
target_group,
test_size=0.3,
random_state=42,
shuffle=True
)
train_list.append(t_train)
test_list.append(t_test)
# 合并结果
X_train = pd.concat(train_list, ignore_index=True).drop(columns=['Target'])
y_train = pd.concat(train_list, ignore_index=True)['Target']
X_test = pd.concat(test_list, ignore_index=True).drop(columns=['Target'])
y_test = pd.concat(test_list, ignore_index=True)['Target']
# 验证:检查每位配送员是否在 train/test 中均存在
print("Train delivery guys:", X_train['Delivery Guy'].unique())
print("Test delivery guys: ", X_test['Delivery Guy'].unique())
print("\nPer-guy target distribution in train:")
print(X_train.join(y_train).groupby(['Delivery Guy', 'Target']).size())
print("\nPer-guy target distribution in test:")
print(X_test.join(y_test).groupby(['Delivery Guy', 'Target']).size())