示例成品 · 平台演示,按左边这组点选真跑出来的
【去重合并方案 · 商品SKU库】
一、SKU归一(先清洗再判重,避免漏掉近似重复)
- 去首尾空格、统一大写、去掉连字符差异
- 归一后 SKU 作为判重主键
二、合并规则(保留最全)
- 主图URL:取非空第一条
- 价格:取有效价(>0)中的最新一条
- 库存:同款多仓求和
- 标题/卖点:取字数最多的版本
三、可运行代码(pandas,节选)
df['sku'] = df['sku'].str.strip().str.upper()
agg = {'stock': 'sum', 'price': 'last', 'title': lambda s: s.loc[s.str.len().idxmax()]}
df = df.groupby('sku', as_index=False).agg(agg)
四、结果核对
- 归一前 12,660 行 → 去重后 8,942 个SKU
- 因大小写、空格差异被识别为同款 1,204 组
- 缺主图的 356 个SKU标红待补,缺价的 88 个单列
五、注意事项
- 同名不同款商品(如同名不同颜色)不合并,避免误并
- 合并前先导出一份原始明细存档,任何一步都可回溯还原
- 价格取值优先取最新有效价,历史价单独留一列备查
点左边「开工 · 直接出成品」,出一份你自己的版本(文字免费)