2026-07-22 · AI 应用
信贷风控中AI落地的正确姿势
信贷风控中 AI 落地的正确姿势:从规则引擎到智能评分卡
标签:AI应用开发 · 信贷风控 · 机器学习 · 评分卡
一、为什么规则引擎不够用了?
传统信贷风控靠规则引擎 + 专家经验。比如:
- "年收入 < 5 万 → 拒"
- "近 6 个月逾期次数 > 3 → 拒"
- "多头借贷平台数 > 5 → 拒"
这套逻辑过去十年确实够用。但问题越来越明显:
- 规则膨胀:几百条 if-else 堆在一起,互相冲突,维护成本高到离谱
- 硬切 vs 软分:规则只能输出过/不过,无法给出"60% 概率会还但风险偏高"这种梯度判断
- 迭代滞后:新欺诈模式出现后至少要等策略分析师几周才能上线新规则
说白了就是:规则引擎像一个安检员,要么放行要么拦下。智能评分卡像一个老中医,望闻问切之后给个综合评分。
二、评分卡:AI 在风控里最成熟的一招
核心思路
把用户的多个维度(收入、负债、征信、行为)映射成一个分数:
score = w1×收入 + w2×负债比 + w3×征信分 + w4×多头数 + ... + bias
分数越高 → 违约概率越低 → 更容易通过审批。
技术栈
特征工程(SQL/Flink) → 模型训练(XGBoost/LightGBM) → 分数转换(sigmoid → 0~1000) → API 服务(Python/Java)
关键点:
1. 特征分箱(Binning)
别直接用原始值。把"年龄 28 岁"映射成"25-35 岁区间"才有统计意义:
# WOE 编码示例
bins = [18, 25, 35, 45, 55, 100]
labels = ['18-25', '25-35', '35-45', '45-55', '55+']
df['age_bin'] = pd.cut(df['age'], bins=bins, labels=labels)
2. WOE + IV 筛选特征
- WOE(Weight of Evidence):每个分箱对"好坏"的区分能力
- IV(Information Value):整个特征对目标的预测力
# IV < 0.02 → 几乎没用,可以丢掉
# IV 0.02~0.1 → 弱预测力
# IV 0.1~0.3 → 中等预测力
# IV > 0.3 → 强预测力
3. 单调性约束
部分特征在业务上必须是单调的(收入越高→风险越低),模型不能学出反直觉的模式。
三、大模型(LLM)在风控里的真实价值
这是最近一年最热的话题。但说清楚:LLM 不是替代评分卡,是补充评分卡做不了的事。
| 能力 | 传统评分卡/ML | LLM |
|---|---|---|
| 数值型特征打分 | ✅ 强 | ❌ 弱(幻觉风险高) |
| 非结构化文本理解 | ❌ 没法做 | ✅ 强 |
| 可解释性 | ✅ 分数=加权求和 | ⚠️ 需额外设计 |
| 实时性能 | ✅ 毫秒级 | ⚠️ 需优化 |
LLM 真正能落地的三个场景
场景 1:贷前材料审核
营业执照、银行流水、合同发票——这些非结构化文档传统靠人工审。
用户上传材料 → OCR 提取文本 → LLM 提取关键字段 → 规则引擎/评分卡打分
关键设计:LLM 只负责"提取结构化字段",不负责"判断过不过"。决策权留在评分卡/规则引擎——避免幻觉风险。
场景 2:反欺诈关联分析
用户填写的"工作单位"和"联系人单位"完全不搭边?联系人都是同一个手机号段?这些模式 LLM 可以辅助判断,但最终交给图算法+规则引擎做关联挖掘。
场景 3:贷后催收策略生成
根据用户逾期天数、还款意愿评分、历史沟通记录,LLM 生成个性化催收话术。这不是评分,是内容生成,LLM 正好擅长。
四、工程落地:AI 应用开发工程师要关注的
1. 模型部署与版本管理
# 评分卡模型上线流程
训练环境 → 模型注册(MLflow/自建) → A/B 测试(灰度 10%流量)→ 全量上线
每个模型版本要有:
- 训练时间 + 训练数据范围
- 特征列表(哪些特征、分箱边界)
- KS/AUC 指标
- 上线时间 + 回滚记录
2. 线上推理链路
请求进入 → 特征实时计算(Flink/Redis)→ 模型调用(gRPC/HTTP)→ 分数返回 → 决策 → 落日志
关键设计:
- 特征计算和模型调用分离,特征做缓存
- 模型服务超时兜底策略(降级到规则引擎)
- 所有决策留 trace:谁、什么特征值、模型版本、分数、判定结果
3. 监控和反馈闭环
线上分数分布监控 → 实际逾期率 vs 预期逾期率 → KS 漂移检测 → 触发重训
没有监控的模型像没有仪表盘的车——出问题了你不知道。
五、总结:三条实用建议
- 先上评分卡,再想 LLM。评分卡成熟、可控、可解释,是信贷风控 AI 化的第一步。LLM 用来解决评分卡解决不了的非结构化问题。
- LLM 做提取,不做决策。让 LLM 从文档里提取字段,决策权交给规则引擎 + 评分卡。这是目前最稳妥的分工。
- 工程化比算法更重要。模型部署、版本管理、监控告警、兜底策略——这些工程能力的缺失是 AI 落地失败的真正瓶颈,不是模型精度不够。
下一篇预告:用 Python 从零手写一个信贷评分卡——数据预处理 → WOE 编码 → 逻辑回归 → 转分数 → API 服务,全部可运行代码。