日期:2026-07-22
我们当时服务的客户是一家处于快速扩张期的某头部互联网企业,社招月均在招岗位上千个。他们的痛点很典型:简历初筛靠人肉,面试记录散落在文档、IM 和脑子里的印象里,面试官凭感觉打分,评价尺度彼此对不齐;更麻烦的是决策难以复核——一个候选人为什么被拒、为什么被录,事后翻不出客观依据,既影响招聘质量,也埋下合规与偏见风险。
这个项目里,我们想用大模型把「人的主观判断」沉淀成「结构化的、可解释、可复核」的过程资产。我们采用的是自研 AI 私有化部署底座,面试语音转写与画像建模全部跑在私有化环境里,数据不出域;推理统一经由我们采用的 AI 网关接入,网关的计量层按部门和应用做配额与账单,确保大模型调用成本可控、调用链可观测。目标不是替面试官做决定,而是让每次面试都留下可追溯、可比对的证据链。
落地场景分四步闭环。第一,面试录音/纪要经 ASR 转写后,大模型抽取结构化面试记录:问答对、行为事件、关键能力陈述、矛盾点。第二,基于岗位画像(JD 拆出的能力维度与权重)生成候选人能力画像,每个维度给分并附依据片段。第三,大模型把候选人与岗位要求进行对齐评分,输出人岗匹配度与短板清单,面试官在此基础上校正。第四,多人面试结果汇入协同视图,模型给出一致性度量,并对明显分歧提示复核;最终录用决策由人拍板,全过程留痕可审计。
我们还服务了一家某股份制银行的合规敏感岗位,他们对「评分偏见与合规约束」要求极严,因此模型输出必须可解释、可追溯,任何维度评分都要能定位到原始问答证据,且不能引入性别、年龄等敏感属性的直接推断。
面试语音/记录结构化。真实面试记录噪声极大:多人抢话、口语化、专业术语缩写、跨话题跳跃。我们先用说话人分离 + 领域热词增强的 ASR,再让模型按「能力维度模板」做抽取而非自由总结,模板强制产出结构化字段,避免幻觉式概括。对长面试采用分段切片,每段独立抽取后用一致性对齐合并,冲突处标红交回人工。为保证可追溯,每条抽取都带时间戳与原文偏移,支撑后续复核。
候选人能力画像建模。画像不是一张散分表,而是带权重的 schema。我们把 JD 拆成能力维度(如系统设计、协作、抗压)与权重,模型对每个维度输出 1–5 分 + 证据片段 + 置信度。难点在维度间耦合:某维度证据不足时不能给中间分掩盖不确定性,我们强制低证据维度标「证据不足」而非强行打分,避免画像失真。画像向量化后入 Milvus,支撑同岗位候选人横向比对与历史人才库检索。
评分偏见与合规约束。我们用规则层硬性屏蔽敏感属性推断,并在提示词中声明「禁止基于年龄/性别/地域做评价」;同时做偏差自检:同一批面试记录由模型多次重评分,若维度波动超阈值则告警。RAG 知识库层检索岗位标准与历史合规案例做对齐,确保评分口径稳定。所有输出进入审计日志,配合网关可观测层记录调用链与延迟,满足合规复核。
人在回路复核。模型给出建议分但默认不自动录用。我们对高 stakes 岗位设置「双盲复核」:两位面试官独立确认模型的证据抽取无误后再采纳;一致性低于阈值的维度强制线下讨论。一次真实案例是模型对某候选人「系统设计」打出 2 分并附证据,面试官复核发现证据来自口误,遂纠正为 4 分——这正是人机协同的价值:模型铺证据,人做终审。
以下为脱敏示意数据,取自客户两个事业部的灰度对照(约一个招聘季度):
| 指标 | 改造前 | 改造后 | 说明 |
|---|---|---|---|
| 面试记录完整率 | 约 61% | 约 92% | 结构化抽取替代手写纪要,关键问答全覆盖 |
| 人岗匹配采纳率 | 约 54% | 约 80% | 画像与 JD 对齐评分,面试官采纳度提升 |
| 面试官评分一致性 | 约 0.52 | 提升至约 0.78 | 统一维度与权重,分歧可量化提示 |
| 录用后绩效吻合度 | 约 63% | 提升至约 81% | 以结构化证据替代印象,预测更稳 |
| 单岗位面试周期 | 约 9.5 天 | 降至约 6 天 | 初筛与记录整理自动化,流程提速 |
这些都是脱敏示意值,仅用于说明方向。让我们更在意的信号是:面试官更愿意在系统里「写清楚为什么」,复核争议明显下降。
第一,画像先结构化。不要一上来就追求「智能评分」,先定义清晰的能力维度 schema 与权重,让模型只做抽取与对齐,工程可控性远高于端到端黑盒。第二,评分要可解释可复核:每个分数都必须能回跳到原始问答证据,这是合规与信任的底线,也是人机协同能跑通的前提。第三,偏见不是靠口号防,要靠规则屏蔽 + 偏差自检 + 审计留痕三件套,把合规约束落到工程层。第四,基础设施分层收益明显:我们采用的 AI 私有化部署底座保证数据不出域、算力弹性,采用的 AI 网关统一接入、计量配额与可观测,限流信号反向驱动底座扩缩容,让招聘高峰期的突发调用被平滑吸收。最终记住——大模型是辅助面试官把判断讲清楚、留扎实,而不是替企业做录用决定。
案例片段(已脱敏): 候选人画像 schema(节选,已脱敏): { "candidate_id": "C-****", "role": "后端工程师", "dimensions": [ {"name": "系统设计", "score": 4, "weight": 0.30, "evidence": "23:10 候选人描述了分库分表与熔断方案", "confidence": 0.86}, {"name": "协作沟通", "score": 3, "weight": 0.20, "evidence": "31:02 复盘跨团队排障经历", "confidence": 0.71}, {"name": "抗压能力", "score": "证据不足", "weight": 0.15, "evidence": null, "confidence": 0.20} ], "match_score": 0.78, "bias_check": "passed" } 复核规则(脱敏):当 |面试官分 - 模型分| ≥ 2 或 bias_check≠passed, 强制进入人工复核队列,网关记录审计事件并告警。