一家中型拉丁美洲金融机构在两年前引入了一套由国际技术供应商提供的人工智能辅助信用评分系统。在未与原系统进行有记录的比较的情况下,该模型进入了个人贷款审批流程。在最初六个月中,该机构依赖供应商解释具体决策,且未获得足够的细节来独立核查这些决策。本文从审核实践出发,梳理这一匿名案例所揭示的金融业算法治理问题。


运行背景

拉丁美洲金融业正将人工智能引入信贷、欺诈、反洗钱、生物识别、客户服务等关键决策,其速度超出了治理框架的跟进能力。这种不对称呈现出熟悉的形态:大中型机构以商业速度采用模型;监管框架和机构风险管理体系则以行政速度推进。

开篇案例并非罕见。这正是审核实践在现场越来越频繁地遇到的滞后现象的具体表现 · 算法模型在关键业务中作出决策,却没有与机构刚刚承担的风险水平相匹配的治理框架。

案例的五项技术发现

发现案例中的证据受损的原则
01 · 无并行运行模型直接取代了原有统计模型;投产前的方法流程省略了这一阶段原则 01 · 并行运行
02 · 可解释性不足合规部门要求解释第一季度的六项决策;供应商四周后才作出回复,且细节不足以支持独立核查原则 02 · 采用方自身的解释能力
03 · 名义上的人工监督仅对有限样本进行复核,既无统计代表性,也无抽样准则;决策直接按模型输出执行原则 03 · 有效监督
04 · 无漂移监测面对行为相较训练群体发生变化的群体,没有任何针对模型漂移的技术控制原则 04 · 漂移检测
05 · 可追溯性断裂年度外部审核完成了对成文程序的审核;模型在运行中的行为被排除在范围之外四项原则同时受损。体系未经审视便获得了确认

第五项发现值得单独说明,因为它触及审核这一职业。年度外部审核在形式上符合要求,却什么也没看到 · 其范围排除了对运行中模型的技术核查。成文程序合乎规范;实际运行却无人见证。准则 10 以准确的类别确立了这一理念 ·

一个既无可解释性、又无有效人工监督、也无漂移监测的人工智能系统,是一个不受机构约束的系统。

四项操作原则

结合其他实地案例来看,本案例揭示了严肃的算法治理不能委托他人承担的四项原则。

01

转型需要受控比较

当变更的关键程度与性质足以构成理由时,新模型在全面承担决策之前,必须与原模型或等效对照进行比较。持续时间和样本应依据风险、业务量及发现差异的能力确定;不存在通用期限。在本案例中,方法流程省略了这项比较。

02

组织保留解释责任

采用算法模型的机构必须能够解释和复核其所使用的决策,即使它将技术能力外包。本案例揭示了完全依赖供应商的风险 · 合规部门要求解释六项决策,四周后才收到回复,且没有可供核查的细节。这种能力必须在机构所治理的条件、时限和证据要求下可供使用。

03

人工监督必须有效

人工监督有三种状态—— 有效, 名义上存在, 缺失 ——只有第一种才算数(准则 10)。有效监督要求三点 · 成文的抽样准则、阻止模型决策的权限,以及最近一次被阻止决策的记录,注明日期。本案例中的复核只覆盖了极小部分业务流,没有抽样准则,也从未阻止过任何决策 · 这就是名义上的监督。准则 15 点出了其本质 · 每个样本都是以书面形式表达的风险理论。本案例中的人工复核样本没有理论;只有图方便。

04

漂移需要检测与响应规则

当群体、数据或运行环境相较训练时发生变化,漂移就是可预见的风险。控制措施必须明确如何检测漂移、评估漂移,以及决定是否应重新训练、重新校准或停用模型。本案例中不存在用于执行这些操作的成文机制。

案例的局限 · 哪些结论可以推广

局限不是法律免责声明 · 而是论证的一部分。未声明局限的文章,其断言超出了自身能够支持的范围。该案例经过匿名处理,且仅有一例。它允许得出三点结论。这些 问题 ——这五项发现可作为适用于任何在关键决策中运行模型的实体的核查清单——、 模式 ——结合其他实地案例来看,它代表了一种反复出现的配置,但并未对其进行量化——以及 原则 ——这些原则具有独立于本案例的规范依据。不在讨论范围内的内容也已明确说明 · 行业占比、归因于某个可识别的实体,以及有关模型本身统计性能的任何结论。

适用的国际框架

ISO/IEC 42001:2023 提供了管理体系框架,用于治理人工智能的风险、影响、责任和监测。它并未明确规定本案例中的四项机制:受控比较、可用的可解释性、有效监督和漂移检测都是操作层面的准则,其具体形式必须根据风险加以论证。该标准认证所需的认可链自 2024 年起已存在(ANAB;UKAS)。对于金融行业,拉丁美洲的不同监管机构也发布了关于在信贷决策中使用人工智能的指导方针。

技术采用速度与治理框架发展速度之间的差距,是未来十年金融行业审核实践最迫切的工作领域。

下一季度的实践任务

如果您的实体在关键决策中运行算法模型,请在下个季度开展一次诊断。清查所有在生产环境中运行的模型。对每个模型核查四项要素 · 有记录的并行运行期、内部可解释性技术能力、有效的人类监督——具备抽样准则、阻止权限和记录——以及持续的漂移监测。每缺失一项要素,就意味着模型运行所承受的治理风险高于机构声明的风险水平。而且,没有人作出过这样的决定 · 它就这样发生了。

人工智能进入金融行业时,能够治理它的机构文化尚未形成。这一差距不会自行缩小。缩小它需要技术判断。