日期:2026-07-29
某电商商城运营团队三十多人,每月上新数百个 SKU,选品决策的真实过程是:运营翻一翻行业榜单、看一看竞对店铺、凭手感报选品会,会上谁嗓门大谁的品上得多。结果摆在数据里:上新 SKU 的九十天滞销率超过四成,仓库里压着一批批"当初觉得能爆"的货;反过来,真正的趋势品又常常错过窗口——等运营看到别家卖爆再跟进,红利期已过。销量预测同样粗放,备货量拍脑袋,爆款断货和滞销压仓轮流上演。
商城此前已接入我们的 AI 私有化底座跑智能客服,这次运营副总的诉求是把选品和备货也"武装"起来:不要黑盒决策系统,要一个能讲清理由的辅助决策工具,最终拍板权留给人。项目周期约四个月。
落地为三个工作台。选品评分台:候选商品(运营提报或系统从供应商商品池发现)自动汇聚历史同类销售、站内搜索热词、商品评价情感分析、公开行业趋势信息,大模型综合这些特征输出选品评分与评分理由,运营在选品会前就能看到每个候选品的结构化档案。销量预测台:确定上新的商品按同类商品冷启动曲线加价格带、季节、流量计划因子生成首批备货建议与滚动预测,附置信说明。活动选品台:大促前按活动定位(引流、利润、清仓)从在售池里推荐活动商品组合,测算各组合的预期 GMV 与毛利影响。
流程上我们动了选品会的规矩:所有上会商品必须附系统评分档案,运营可以不同意评分,但必须在系统里写明不同意的理由——这些理由数据后来成了模型迭代最重要的输入。
第一个挑战是多源特征的汇聚与清洗。评价数据有大量水军噪声,我们先用规则加模型过滤异常评价(集中时段、模板化文本、账号行为异常);搜索热词要区分"搜了没买"和"搜了就买",转化率低的热词只能作弱信号;竞对信息只使用公开合规渠道的数据并做趋势化处理,不碰具体商家的敏感数据。特征进库前全部走质量校验,这一层脏活占了项目工作量的四成。
第二个挑战是评分的可解释性。运营不接受一个光秃秃的"78 分"。我们把评分拆成五个可解释维度:需求热度、竞争拥挤度、价格带机会、供应链友好度(起订量、交期、退换灵活性)、与现有品类的协同度,每个维度有分值有证据,大模型再输出一段综合判断的自然语言摘要。上线初期我们做过一个对照:只给总分时运营采纳率不足三成,五维加摘要上线后采纳率翻了一倍以上——同样的模型能力,解释方式决定了它的实际价值。
第三个挑战是新品冷启动预测。新品没有自己的历史,我们的做法是相似品映射:按类目、价格带、卖点标签找出历史相似品集合,用它们的首销曲线分布作为先验,再按本次流量计划修正,输出的是区间而非单点;同时明确置信等级——相似品样本足够的给中高置信,全新类目直接标注"低置信,建议小批试销"。诚实标注不确定性反而赢得了运营的信任:低置信品走小单快返,两周实销数据回流后预测自动修正,第二批备货就有据可依了。
案例片段(已脱敏):选品评分档案的输出片段——
json {"candidate": "便携电解质冲饮", "score": 81, "dims": {"demand_heat": 88, "competition": 62, "price_gap": 79, "supply_chain": 85, "category_synergy": 76}, "evidence": ["站内'电解质'搜索量环比+140%", "同类目TOP价格带15-25元存在空档", "供应商起订500件、7天交期、支持退换"], "summary": "运动补水场景需求上行,站内供给集中在高价带,中价带存在机会窗口; 供应链条件友好,建议首批小批上新并配流量测试。", "confidence": "mid-high"}该品实际上新后六十天进入类目销量前十,首批备货售罄率约 92%。案例片段(已脱敏):一段选品会复盘纪要——"本月上会 62 品,系统评分与运营决策一致 47 品;运营否决高分品 6 个,理由集中在'品牌调性不符'(系统暂无此特征);运营坚持上低分品 9 个,九十天后其中 7 个确认滞销。"调性特征已加入特征工程排期,而低分品的滞销验证让评分的话语权自然上升。
上线六个月后的数据(脱敏示意值):新品九十天滞销率从约 42% 降至约 24%;爆款捕获率(进入类目前二十的新品占比)提升约一倍;首批备货准确率(售罄率落在目标区间)从约 50% 提升到约 78%;大促活动选品的组合测算与实际 GMV 偏差收敛到 15% 以内;选品会平均时长缩短一半,争论从"我觉得"变成了"数据和证据怎么说"。运营团队的原话是:系统没有抢走决策权,但抬高了拍脑袋的成本。
第一,选品先有评分再上新,评分必须多维可解释、证据可查,总分没有灵魂。第二,特征清洗是地基,水军评价、弱转化热词这些噪声不滤掉,评分就是垃圾进垃圾出。第三,新品预测要诚实面对不确定性,区间加置信等级加小单快返,比伪装精确的单点数字有用得多。第四,人在回路要双向留痕,运营否决的理由是模型缺失特征的探测器,模型正确的验证是评分公信力的积累器。第五,辅助决策系统的成功标志不是替代了谁,而是让整个团队的讨论质量上了一个台阶。