多模态大模型图文对齐训练与表征质量评估落地

日期:2026-09-12

一、项目背景

某电商想用多模态模型做以图搜货和商品理解,直接拿开源模型一测,图文匹配经常牛头不对马嘴,尤其类目相近的商品,比如同款不同颜色的包、相似款式的鞋,几乎分不清。搜索结果一乱,运营就不敢用,模型躺在测试环境吃灰。我们进场时,这个多模态能力被判定为"还差得远"。业务方的真实诉求其实很朴素,就是拍一张货架照片能找回对应商品,可开源模型连同款不同色都分不清,运营宁可用关键词搜也不信它,模型价值完全没发挥出来。

二、落地场景

我们在底座上做了图文对齐训练,用商品图文对喂模型,让它学会图片特征和文本标签对应。针对相近类目,专门挖难负样本,把容易混淆的品对放在一起训练,逼模型拉开区分度。上线后以图搜货,用户拍一张商品图能召回同款和近似款,运营也能用模型给无图商品补描述。检索质量靠一套评估集持续盯。我们还在后台做了人工抽检入口,运营对结果打分,分数回流进评估集,模型迭代时劣化一眼可见,形成数据飞轮。

我们把以图搜货的结果做成了可编辑的候选列表,运营能勾选同款、近似款并一键补全商品属性,模型给的是粗排,人做精修,效率和质量都顾上。无图商品补描述也接进了发布流程,模型生成的文案运营改两笔就能用,上新速度比纯人工写快了好几倍。模型还顺带支持了以图搜相似款做比价,运营定价时多了一个客观参照,不再完全凭经验拍。

图文对齐这套打磨下来,我们最大的结论是,多模态模型在电商域必须做领域适配,不能指望开源权重直接上岗。相近类目分不清不是模型笨,是训练数据里这类难样本太少,模型没见过就学不会。我们花最多时间的不是调结构,是挖难负样本和洗数据,这两件事做好了,效果比换大模型还明显。后来我们把它做成固定的迭代闭环,新类目上线先补难负样本再放量,踩坑次数少了一大半。数据工程才是多模态落地真正的护城河。

三、关键技术挑战与解决思路

第一个难点是图文对齐弱,开源模型对商品域不适应,我们在自有商品图文对上继续训练,对齐质量明显上来。第二个难点是难负样本,通用训练里相近商品出现少,模型分不清,我们自动挖同款不同色、相似款的样本构成难负对,区分度拉起。第三个难点是细粒度,类目内差异小,我们做了类目分层评估,不只看整体准确率,还盯每个细类,避免平均掩盖问题。第四个难点是质量评估,光看首位不够,我们建了人工抽检加自动指标双轨,模型迭代时劣化一眼可见。第五个难点是数据清洗,早期堆了几百万脏图文,噪声反而带偏模型,我们做了去重和过滤,干净数据胜数量。

案例片段(已脱敏): 图文对齐训练:pretrain_ckpt=base-mmfine_tune_data=商品图文对 120万hard_neg_mining=autotemp=0.07。 检索评估:同款不同色召回首位从 71.2% 升至 93.5%,类目内细粒度区分度提升 22 个百分点,人工抽检满意度 4.6 分。数据清洗后训练集从 310 万降至 120 万干净样本,召回率反升 3 个百分点。

四、效果数据

图文对齐加难负样本之后,相近商品的区分度大幅提升,同款不同色的首位召回从七成出头拉到九成三,运营终于敢把以图搜货放上前台。类目内细粒度评估让我们看清哪些子类还弱,针对性补数据比盲目堆量管用。人工抽检满意度到了 4.6 分,模型从测试环境走到了生产。数据清洗这一刀意外地重要,砍掉近两百万脏数据后召回率不降反升,说明之前噪声真在带偏模型。

我们偷懒过一阵子只堆通用数据不做难负样本,结果相近款还是分不清,返工重做才醒悟,细粒度这事绕不过去。还有一个教训,评估只看整体准确率时一片祥和,拆到细类才发现某几个子类惨不忍睹,分层评估这步省不得,否则平均掩盖的问题迟早爆在生产。

五、可复用经验总结

多模态不是训完就灵,尤其电商这种相近类目多的场景,通用模型分不清是常态,我们靠难负样本把细粒度啃下来,省略这步后面全返工。评估要分层,只看整体准确率会掩盖类目内的坑,我们按细类拆开看才找着薄弱点。人工抽检不能省,自动指标漂亮也可能有偏,双轨并行才放心。数据质量胜过数据数量,一百二十万干净图文对比几百万脏数据有用,我们在清洗上花的时间最后都体现在召回率上。数据飞轮要让运营打分回流,模型才能越用越准,闭门训练迟早脱节。 多模态的坑大多不在模型结构,而在数据和评估,这条我们交过学费,写出来是给后来人避坑,别再在通用数据上空转。