生产级治理,正在重塑金融AI安全

互联网
2026
09/04
15:06
分享
评论

金融AI正在同时出现两种速度。

一种是应用扩张的速度。

英格兰银行与英国金融行为监管局对118家金融机构的调查显示,75%的受访机构已经使用AI,另有10%计划在未来三年内使用;金融机构预计,AI应用场景的中位数将从9个增加至21个。

image.png

来自英格兰银行与英国金融行为监管局

另一种是治理体系建设的速度。

同一份调查中,46%的金融机构表示,对正在使用的AI技术只有部分了解,完整了解的机构仅占34%。日本银行对153家金融机构的调查也显示,约半数机构认为,在使用监测、第三方风险、网络攻击防护和内部操作规则方面仍有改进空间。它们共同反映了一种行业现象:

大模型进入金融业务的速度,正在超过治理体系成熟的速度。

8月28日,在哈尔滨举办的“2026金融业新一代数据中心发展研讨会”上,50多家来自银行、证券、保险及农信体系的科技、安全和数据中心负责人,围绕金融AI应用与安全治理体系建设展开交流。

image.png

网易智企易盾内容安全负责人饶晓艳以《金融行业大模型安全治理体系》为主题,结合监管要求和金融机构落地实践,系统梳理了大模型进入生产环境后需要建立的安全能力。

大模型正在离开低风险试验区

金融机构的大模型应用,因为其行业的特殊性,对安全及稳定性的高要求,大多沿着一条由浅入深的路径发展。

第一阶段是知识助手、材料摘要、会议纪要和代码辅助。应用主要服务内部员工,模型输出能够经过人工复核,发生错误后的影响相对有限。

第二阶段是智能客服、客户经理辅助、营销内容生成、投研问答和财富管理。模型开始进入真实业务,并通过生成内容直接影响客户。

第三阶段是Agent。模型开始连接知识库、数据库和业务工具,参与任务拆解、系统调用与流程执行。

image.png

应用每深入一层,风险就会发生一次变化。

内部助手答错一条制度,员工可以重新检索;面向客户的财富问答产生错误解读,可能引发投诉与合规风险;Agent调用错误的数据或工具,则可能进一步影响业务结果。

基于这一演进趋势,金融AI的风险正在从“答错”向“做错”延伸

饶晓艳在现场强调:我们需要明确哪些工作可以交给模型,哪些环节必须由人工复核,哪些关键决定需要回到人的手中。

大模型可以参与分析、生成和辅助判断,但涉及客户权益、高风险决策和资金操作时,人机协同、人工干预和紧急退出机制仍然不可缺少。

因此,金融机构需要管理的对象已经不限于一个模型。

训练及业务数据、基础模型、知识库、RAG上下文、用户输入、模型输出、Agent权限、工具调用和人工复核流程,共同构成了一套AI业务系统。

任何一个环节出现问题,都可能沿着业务链路继续传导。

8号文将安全推进至全周期治理

2026年6月,国家金融监督管理总局发布金发〔2026〕8号《银行业保险业人工智能安全开发应用的指导意见》。

image.png

文件要求银行保险机构建立覆盖需求分析、训练开发、部署运行、维护迭代、评估退出的全生命周期管理体系,同时加强分类分级、人工干预、自动化测评、运行监测和日志留存。国家金融监督管理总局

饶晓艳在现场重点解读了8号文对金融AI建设方式的影响。

首先,安全责任开始从单一技术部门走向机构级治理。

大模型应用涉及业务规则、客户权益、数据使用、内容合规、模型风险和系统安全。业务、科技、安全、合规、风控等部门需要共同参与,管理层则需要明确高风险场景的责任边界和资源投入。

其次,安全控制需要贯穿应用的完整生命周期。

模型版本会更新,知识库内容会变化,Prompt和业务流程会调整,新的攻击方式也在持续出现。一次上线前测评,只能说明某个版本在某组测试题下的表现,无法证明系统能够长期安全运行。

因此,安全围栏不能成为项目上线前的一次性检查。运行过程中仍需开展持续测评、策略调整和效果验证。

最后,安全结果需要可验证、可追溯。

金融机构不仅要建立安全制度,还需要说明安全如何测量、风险如何处置、模型变更后是否重新测试,以及历史判断能否被完整追溯。

测试题库、评测指标、策略版本、处置记录和运行日志,将逐渐成为金融AI治理的重要证据。

image.png

结合8号文和GB/T 45654—2025《网络安全技术 生成式人工智能服务安全基本要求》,可以进一步判断:

金融AI治理正在从原则性要求,进入用技术结果和运行证据证明安全的阶段。

网安守住系统边界,围栏守住业务边界

金融机构已经形成了较成熟的网络安全体系。身份认证、权限管理、数据防泄漏、应用安全和网络防护,可以降低非法访问、系统入侵和数据外泄风险。

但大模型带来了一类新的问题:系统没有被入侵,业务仍然可能产生风险。

模型可能受到提示词注入、角色扮演、指令劫持、反向诱导和多轮攻击;也可能在正常运行状态下,生成违规承诺、不当营销、确定性荐股或不真实陈述。

这些风险存在于自然语言、上下文和业务语义中。

image.png

饶晓艳在现场展示了多类金融风险样例。

在客户招揽场景中,需要识别保证收益、暗示内幕、诱导交易和不正当竞争;在产品营销场景中,需要关注片面宣传历史业绩和暗示未来收益;在投顾服务中,需要判断投资建议是否缺乏依据、是否作出确定性结论;在客户投诉中,则要识别推诿责任、消极服务及可能激化矛盾的表达。

同一句话出现在内部研究、员工培训、投资者教育和客户营销中,风险等级可能完全不同。个人信息也不能只按单字段判断。姓名、手机号单独出现,与姓名、身份证号、银行卡号和交易信息组合出现,风险程度并不相同。敏感信息一旦形成关联,泄露后果会明显放大。

这类风险很难依靠关键词表或传统防火墙处理。

安全系统需要理解内容、上下文、服务对象和业务场景,再结合机构制度与风险偏好进行判断。

网络安全重点保护系统和访问边界,大模型安全围栏则进一步管理模型可以接收什么、生成什么,以及发现风险后如何处置

安全围栏正在成为金融AI的实时控制层

过去,安全围栏常被理解为模型前后的过滤接口。输入检测一次,输出再检测一次,发现敏感内容便进行拦截。

但进入生产环境后,这种简单模式已经不够。

模型负责生成内容,业务系统负责承接和执行,安全围栏则需要将监管要求、机构制度和风险偏好转化为运行时决策。

image.png

基于饶晓艳分享的安全体系,可以将生产级围栏的职责概括为三个方面。

第一,判断一次输入、生成或调用是否允许。

围栏需要覆盖用户输入、文件与多模态附件、知识库上下文和模型输出,识别通用内容风险、提示词攻击、个人敏感信息、科技伦理和金融专项风险。

第二,决定风险应该如何处置。

直接拦截只是其中一种方式。根据业务场景和风险等级,系统还需要支持内容替换、隐私脱敏、安全代答和转人工复核。

第三,留下完整的决策证据。

每一次检测使用了什么模型和策略、触发了什么风险、执行了何种处置,都需要被记录下来,为后续运营、复盘和审计提供依据。

据此,我们进一步判断:

安全围栏正在成为模型与业务系统之间的策略执行层,也是外部监管要求与内部业务规则进入AI生产链路的控制入口。

更难的是:长期平衡风险与体验

在真实金融项目中,业务部门和安全部门经常面对同一个矛盾。

拦截过严,模型频繁拒答,应用体验下降;策略过松,又可能遗漏高风险内容。

饶晓艳在分享中明确指出,围栏最重要、也最难的价值,是在业务体验和风险控制之间建立长期平衡,并跟随业务变化持续调整。

这要求安全系统具备精细化处置能力。

明确违规或具有攻击意图的内容可以直接阻断;包含个人信息的内容可以局部脱敏;高敏感但具有合理咨询需求的问题,可以通过可信知识库、RAG和安全大模型提供合规回答;涉及高风险判断或操作时,再转交人工处理。

处置能力越精细,安全措施对正常业务的影响越小。

为了支撑这类判断,网易智企采用安全大模型与专项模型协同的技术架构。

通用安全模型负责语义和上下文理解,专项模型分别处理金融违规、提示词攻击、科技伦理和敏感信息等问题,再由场景策略决定最终处置方式。

image.png

模型决定系统能否看懂风险,金融规则决定判断是否贴合业务,长期运营则决定安全能力能否持续有效。

两类金融实践,验证两种建设路线

饶晓艳在现场分享了两个具有代表性的实践案例。

第一个案例来自某国有银行。

image.png

该机构需要管理内部大模型、业务系统、公众号、客服、直播、邮件和协同工具等多个入口,内容覆盖文本、图片、音频、视频、文档和AIGC。

各系统分别建设审核能力,会形成接口重复、标准不一、运营分散和审计困难的问题。

网易智企协助该机构建设全模态内容安全中台,通过统一接口承接不同系统的内容,集中完成安全检测、策略配置、风险处置和运营管理,再根据业务场景执行不同标准。

这是一条机构级集中治理路径。当AI应用数量持续增加,安全能力也需要从单项目采购走向基础设施建设,避免每增加一个应用,就重新建设一套策略和运营体系。

第二个案例来自某头部证券机构。

image.png

其AI原生投资应用覆盖AI选股、智能盯盘、行情解读、复盘分析和语音下单等场景,直接面向投资者。

这类应用既需要控制金融违规表述和敏感信息,又不能明显影响系统响应。

网易智企将安全围栏嵌入模型输入和输出链路,通过流式检测、金融专项策略和分级处置完成实时防护,并结合运行数据持续优化策略。

演讲材料显示,在项目既定测试口径下,数据识别准确率达到99.5%以上,风险数据召回率达到99%以上,风险识别精度达到95%以上。

这是一条高敏感业务实时控制路径。两种路径最终指向同一目标:让金融AI的每一次输入、生成和处置,都处于可控制、可验证、可追溯的体系中。

从内容安全走向Agent行为治理

在分享的后半部分,饶晓艳简要提到了Agent和Skill带来的安全变化。

相较于内容生成,Agent会进一步连接外部工具和业务系统。其风险范围可能从输入输出内容扩展到权限、工具调用、参数传递和执行结果。

基于这一变化,结合金融行业研究和网易智企的技术实践,我们判断下一阶段将出现三个方向。

首先,金融场景规则将成为新的安全资产。

基础模型能力会继续趋同,通用风险识别也会逐步标准化。真正决定金融安全效果的,是机构能否把法规、行业规范、内部制度和产品规则转化为可配置策略和测试题库。

其次,安全测评将逐渐进入AI应用的变更与发布流程。

模型升级、知识库更新、Prompt调整和工具权限变化,都可能需要重新测评。未达到安全指标的版本,不应直接进入生产环境。

最后,Agent将推动安全从内容治理走向行为治理。

安全系统不仅要判断一句话能否输出,还需要判断一项工具能否调用、某类数据能否访问、一次操作是否需要人工授权。

写在最后

在金融机构加快大模型应用的背景下,安全能力已不再只是业务上线后的补充措施,而是人工智能进入核心业务的重要基础设施。

随着大模型进一步向Agent和复杂业务流程延伸,金融AI治理也将从“内容是否安全”扩展到“行为是否可控”。网易智企希望,通过制度、技术与运营的协同建设,帮助金融机构在安全边界内释放人工智能的应用价值,推动金融服务向更加智能、高效和稳健的方向发展。

THE END
广告、内容合作请点击这里 寻求合作
免责声明:本文系转载,版权归原作者所有;旨在传递信息,不代表砍柴网的观点和立场。

相关热点

相关推荐

1
3