跳转到主内容
websoft网络软件专家 - 深耕网络技术,打造实用软件!

如何在高度不平衡数据中实现兼顾人员与目标类别分布的分层训练集划分

本文介绍一种手动分层策略,确保训练集和测试集中均包含每位配送员(delivery guy)的样本,且每个目标类别(0/1)在每位配送员下均有代表性分布,避免模型因数据泄露或缺失而失效。 本文介绍一种手动分层策略,确保训练集和测试集中均包含每位配送员(delivery guy)的样本,且每个目标类别(0/1)在每位配送员下均有代表性分布,避免模型因数据泄露或缺失而失效。 在构建预测“订单是否会被成功交付”(Target: 0/1)的机器学习模型时,仅对标签(stratify=y)做简单分层是不够的——尤其当关键特征(如 Delivery Guy)具有强个体效应,且数据高度不平衡(例如多数人仅有少量正例 Target=1)时。若标准 train_test_split 随机切分,极易导致某位配送员(如 James)的所有正样本(Target=1)全部落入训练集,而测试集中完全缺失其正例,造成评估失真、泛化能力误判。 为此,需采用 双重分层(Double-Stratified Split) :即同时按 Delivery Guy 和 Target 进行分组,在每个子组内独立分配训练/测试样本,从而强制保证: ✅ 每位配送员的数据在训练集和测试集中均有出现; ✅ 每位配送员的每个目标类别(0 和 1)在两个集合中均至少保留一个样本(若该类存在多个实例); ✅ 整体训练/测试比例仍接近预设值(如 70%/30%)。 以下是推荐的稳健实现方案(基于 pandas + sklearn.model_selection.train_test_split):
import pandas as pd from sklearn.model_selection import train_test_split # 假设 df 是您的原始 DataFrame train_list, test_list = [], [] # 第一层:按配送员分组 for name, guy_group in df.groupby('Delivery Guy'): # 第二层:按目标类别再分组 for target_val, target_group in guy_group.groupby('Target'): n_samples = len(target_group) if n_samples == 1: # 单一样本:优先放入训练集(保障模型能学到该模式),测试集暂不分配 train_list.append(target_group) else: # 多样本:严格按比例拆分(如 test_size=0.3),确保两类均有代表 t_train, t_test = train_test_split( target_group, test_size=0.3, random_state=42, shuffle=True ) train_list.append(t_train) test_list.append(t_test) # 合并结果 X_train = pd.concat(train_list, ignore_index=True).drop(columns=['Target']) y_train = pd.concat(train_list, ignore_index=True)['Target'] X_test = pd.concat(test_list, ignore_index=True).drop(columns=['Target']) y_test = pd.concat(test_list, ignore_index=True)['Target'] # 验证:检查每位配送员是否在 train/test 中均存在 print("Train delivery guys:", X_train['Delivery Guy'].unique()) print("Test delivery guys: ", X_test['Delivery Guy'].unique()) print("\nPer-guy target distribution in train:") print(X_train.join(y_train).groupby(['Delivery Guy', 'Target']).size()) print("\nPer-guy target distribution in test:") print(X_test.join(y_test).groupby(['Delivery Guy', 'Target']).size())
⚠️ 关键注意事项 : 小样本处理 :当某配送员在某类别下仅有一个样本(如 Tom 的 Target=1 只有 1 条),无法物理拆分。此时应将其保留在训练集,并在测试集中通过其他配送员的同类样本弥补评估可靠性;也可考虑使用 StratifiedGroupKFold 进行交叉验证替代单次划分。 比例灵活性 :上述代码中 test_size=0.3 是全局目标,实际最终比例可能略有浮动(因按子组独立切分)。如需精确控制整体比例,可先计算各子组权重后动态调整 test_size。 扩展性建议 :对于更大规模数据,推荐封装为函数并支持 min_train_per_class=1、min_test_per_class=1 等参数;亦可结合 imblearn 库在划分后对训练集进行过采样(如 SMOTE),但 切勿在划分前或跨训练/测试集采样 ,以防数据泄露。 该策略从根本上解决了“模型只见过 John 的失败案例,却从未在测试中验证 James 失败场景”的业务风险,使模型真正具备面向全配送员群体的鲁棒预测能力。

相关文章