多语言大模型与出海业务本地化落地

日期:2026-07-21

随着业务出海,我们面对的不再是一套中文语料和一套客服话术,而是十几个语种、截然不同的合规边界和表达习惯。这个项目里,我们基于自研 AI 私有化部署底座,把通用大模型改造成了一个能听懂本地俚语、守得住合规底线的多语服务中枢,直接支撑海外客服与商品文案两条核心链路。

一、项目背景

某出海企业客服与商品文案需覆盖多语种,机器翻译生硬、本地合规与俚语错漏,海外体验差、合规风险高。我们当时接到的第一个诉求来自其东南亚运营团队:他们用通用翻译接口把中文商品标题甩到当地站点,结果印尼语版本把"清真友好"写成了字面直译,触犯了本地宗教表述规范,差点引发下架。更麻烦的是客服侧,海外用户用泰语、越南语提问,旧系统只能回一段机器翻译的"标准答案",意图识别准确率不到六成,转人工比例居高不下。

这家客户属于某头部美妆品牌商出海板块,站点分布在东南亚、中东与拉美,涉及语种约 14 种,其中真正有足量标注数据的只有英、泰、越、印尼四种,其余全是低资源语种。我们评估后决定:不自建从零训练的多语大模型,而是以我们采用的 AI 私有化部署底座为基础,在 vLLM 推理框架之上做 LoRA 多语适配,再叠一层合规与文化过滤网关,把"能说"升级为"说得对、说得得体"。

二、落地场景

这个项目落地了三条核心链路。

第一,多语大模型客服。海外用户用本地语言提问,经由我们采用的 AI 网关做语种识别与路由,先小模型打意图标签,再路由到多语大模型精答,最后过一遍合规与文化过滤器才返回。

第二,本地化商品文案生成。运营在后台填中文卖点,系统按目标站点语种生成标题、详情与营销文案,并自动标注可能触碰本地禁忌的措辞。

第三,文化适配与合规过滤。这是贯穿前两条链路的横切能力,既做硬性的合规拦截(宗教、政治、广告法红线),也做软性的文化润色(俚语、称呼、语气)。

三、关键技术挑战与解决思路

挑战一:多语微调与语种平衡。 我们手上的语料极度不均衡,英语有几十万条,而斯瓦希里语只有不到两万条。直接混合微调会让模型被高频语种带偏,低频语种越训越差。解决思路是按语种做采样权重归一化,并对低资源语种启用更高的 LoRA 学习率与重复采样。训练配置里我们显式声明了 per_language_sample_rate,把英语采样上限压到 1.0,斯瓦希里语放宽到 4.0,再用 temperature 控制整体分布。

# multilingual_lora.yaml
model: base-7b
method: qlora
languages: [en, th, vi, id, ms, sw, ar]
per_language_sample_rate:
  en: 1.0
  th: 1.5
  vi: 1.5
  id: 1.5
  ms: 3.0
  sw: 4.0
  ar: 2.0
learning_rate: 3e-4
lora_rank: 64
max_seq_len: 4096

挑战二:本地合规与禁忌过滤。 不同国家有不同的硬性红线,不能用一套关键词糊弄。我们当时的做法是把合规规则做成可热更新的路由策略,挂在 AI 网关的编排层前面。每条规则带 region 标签和 severity,命中高危项直接截断返回,命中中危项进入人工复核队列。比如中东站点对酒精类描述的拦截、欧盟站点对绝对化用语的限制,全部以声明式规则下发。

{
  "region": "ME",
  "rules": [
    {"id": "alc-01", "severity": "high", "pattern": "alcohol| liquor| wine", "action": "block", "note": "酒精类描述需本地资质"},
    {"id": "claim-01", "severity": "mid", "pattern": "best| #1| guaranteed", "action": "review", "note": "绝对化用语"}
  ]
}

挑战三:文化俚语适配。 机器直译最大的问题不是语法,而是"不像本地人说话"。我们在 RAG 知识库层补了一层本地化语料:每个站点维护一个俚语—标准语映射表,检索重排时优先召回本地表达。比如泰语里促销常用口语化缩略,我们就把这些缩略作为高权重片段塞进向量库。微调时再拿这部分数据做小规模 SFT,让模型学会"入乡随俗"。

挑战四:小语种低资源。 斯瓦希里语、老挝语这类几乎没标注。我们没有硬训,而是采用蒸馏思路:用英语和多语大模型当教师,把高资源语种的语义对齐能力蒸馏到小语种 LoRA 上,再用少量本地志愿者标注做校准。实测下来,小语种意图识别从不足五成拉到了七成以上,性价比远高于从头采集语料。

案例片段(已脱敏): 中东站点上线首日,合规网关拦截了一条商品文案:"Best halal wine gift set"。其中 "best" 命中 claim-01(中危,进复核),"wine" 命中 alc-01(高危,直接 block)。网关返回:

json {"blocked": true, "hits": ["alc-01","claim-01"], "action": "block"}

运营在管控台看到拦截原因后,改为"清真认证礼盒(无酒精)",复核通过。当天该站点因合规问题导致的下架工单从约 11 单降至 0。

四、效果数据

下表为该项目改造前后脱敏示意数据(均经客户授权脱敏,非审计级精确值):

指标改造前改造后说明
多语意图识别准确率约 62%约 88%高频语种均值,小语种提升更明显
本地合规拦截几乎为零约 96%高危项自动 block,中危进复核
人工改稿率约 45%约 12%文案生成后需人工修改比例
海外满意度(CSAT)约 3.1/5约 4.3/5客服与文案双链路抽样调查

五、可复用经验总结

第一,本地化要先合规后润色。我们踩过的坑是先把文案"写漂亮"再查合规,结果返工成本极高;后来改成合规网关前置,先保证不出事,再谈文化适配,返工率直接下降。

第二,小语种别硬刚,靠蒸馏补。低资源语种从头采标注既不经济也不现实,用高资源教师模型蒸馏 + 少量校准是更稳的路径。

第三,合规规则要可热更新、带区域标签。出海业务合规边界会变,把规则做成声明式、可灰度下发,比改代码快得多,也方便不同区域独立运营。

第四,网关与底座要联动。我们让网关的限流与拦截信号反向驱动底座弹性扩缩容,大促期间多语大模型实例按需拉起,闲时回收,算力和流量形成闭环。