银行智能研发白皮书:研发工程师80%的工作具备AI介入空间,提出四维度量模型


2026-9-7 15:56来源:移动支付网    作者:木子剑

随着AI大模型的快速发展,不少金融机构已在智能研发领域进行了探索。就在近日,中信百信银行和百度联合发布《迈向AI原生时代——大模型驱动的智能研发白皮书》(以下简称“《白皮书》”),或能为金融同业提供一些参考。

《白皮书》分为9章,分别从时代背景、战略原点、演进之路、全景赋能、方法论体系、效能度量体系、安全与治理、组织与人才等方面进行了分析。

其中指出,传统研发模式存在响应速度滞后、代码质量难以保证、知识传承体系薄弱、协作效率低下等瓶颈,行业需要一种能够自动化生成逻辑、自适应调整架构、且具备行业知识推理能力的新生产力工具。大模型技术的爆发,正好提供了这把钥匙。

不过,技术爆发并非偶然,而是算力、算法与场景需求在此刻达成“共振”,使得金融智能研发从“概念验证”走向“规模化落地”成为必然。

智能研发是AI原生银行的第一引擎

目前,已有多家银行提出“AI原生”战略。《白皮书》指出,“AI原生”意味着以AI的推理、生成与自主决策能力为第一性原理来重构银行的一切。

对于AI原生银行来说,AI不是外挂工具,而是像水电煤一样的基础设施,深度嵌入银行运营的每一个毛细血管。在AI原生架构下,若去掉AI,银行的大部分流程将无法正常运转。这与传统银行引入AI的方式——“AI+”模式截然不同。

《白皮书》显示,智能研发是AI原生银行的“第一引擎”。因为,在AI原生银行的四大智能闭环(运营、风控、研发、服务)中,智能研发具有独特的“元能力”属性——它是其他三个闭环得以实现的前提条件:智能运营闭环需要研发来构建千人千面的推荐引擎、实时策略平台和效果度量系统;智能风控闭环需要研发来实现毫秒级决策引擎、特征工程平台和模型监控体系;智能服务闭环需要研发来打造多轮对话引擎、知识检索系统和意图识别模型。

更重要的是,智能研发还具有“自我强化”的独特属性。当研发团队用AI来构建AI系统时,研发能力本身也在被加速——形成“用AI做AI”的复合增长飞轮。

提出智能研发的成熟度模型

《白皮书》第三章讲述智能研发的演进之路。

首先,百信银行基于247项具体研发工作的全量梳理,将核心研发交付链路收敛为七大阶段、42个关键节点,形成端到端的“AI化作战全景图”。

图片

表中每个节点标注的M级别即为当前AI化成熟度现状。其中,研发编码阶段走在最前面(代码编写已达M3),测试集成紧随其后(案例编写、流程自动化达M3),而投产部署和生产运行多数节点仍停留在M1~M2——这是下一阶段的攻坚重点。

而对于如何科学定义从“人工为主”到“AI闭环”的演进阶段,百信银行建立了一套节点级成熟度评估框架。

节点成熟度模型将每个研发活动的AI化程度划分为四个递进阶段,为42个关键节点逐一标定当前位置和演进目标——M1设计阶段、M2试用阶段、M3推广阶段、M4成熟阶段。

其中,M1设计阶段:节点已识别,具备AI介入的设计思路。团队已完成该节点AI化的可行性分析,制定了初步的技术方案,但尚未进入实际开发或试用。此阶段的核心产出是设计文档与概念验证(PoC)。

M4成熟阶段:节点形成AI闭环,彻底释放人力。AI在该节点实现了端到端的自动化闭环——从输入理解、任务执行到结果验证,全部由AI自主完成,人类仅在异常情况下介入审核。该节点的人力投入大幅下降甚至归零,AI成为该节点的主要执行者。

百信银行提出的战略目标为,推动42个研发交付活动逐步从M1迈向M4,并在跨阶段之间建立AI驱动的自动化连接,最终实现研发交付的AI原生重塑。

不过,节点成熟度(M1-M4)只能衡量单个活动的AI化程度,而系统级别模型(L1-L4)可衡量整个研发体系的智能化水平。两者相辅相成:节点成熟度的聚合决定了系统级别的跃迁。

《白皮书》显示,智能研发演进四级模型(L1-L4)分为AI辅助研发(Co-pilot)、AI协同研发(Agent)、AI代理研发(Agentic)、AI自治研发(Principal)。

其中,L4级AI自治研发是智能研发的终极形态,其核心特征是,AI作为领域级负责人,具备业务规则理解、资源调度与风险预判能力,人类退居战略制定与合规监督。

图片

此外,《白皮书》还对247项研发工作逐一进行了AI化潜力评估,按AI介入深度划分为三个层级:

其中,AI可主导层级,涵盖86项工作。这类工作具有“规则明确、模式固定、重复度高”的特征,大模型和Agent可端到端自主完成。

AI可协同层级,涵盖111项工作。这类工作需要一定的业务判断力和上下文理解,AI提供初步方案或分析,人类负责审核、调整和最终决策。

人必须主导层级,涵盖50项工作。这类工作具有“高度不确定性、需要人际沟通、涉及组织决策”的特征,AI仅能提供信息支持。

因此,总结下来,研发工程师约80%的日常工作具备AI介入空间,其中35%可AI主导、45%可AI协同。“非编码”工作占比远超想象,传统AI编码工具仅覆盖了研发工作的“冰山一角”。

AI原生研发的度量模型涉及4个维度

《白皮书》第五章则构建了百信银行AI原生研发的完整方法论体系,包含四个逐层递进的维度:

范式层:定义规则——SPEC-Harness双轮驱动。 SPEC定义“系统应该做什么”(正向目标),Harness定义“系统不应该做什么”(反向约束),两者构成AI生成代码的“行为空间定义”。这是整个方法论的核心骨架。

交互层:人机界面——Vibe Coding。人如何与AI协作?Vibe Coding提供了一种轻量化的探索性交互模式,适用于从0到1的创意验证。经验证的成果通过SPEC-Harness固化为生产级资产。

执行层:谁来干活——多智能体协作。当范式和交互模式确定后,谁来执行?多智能体系统是SPEC-Harness范式的“执行引擎”——多个专业化Agent各司其职,在SPEC指引和Harness约束下协同完成全链路研发交付。

知识层:记忆与认知——RAG检索增强。支撑以上三层运转的底层基础是什么?是组织级的知识体系。RAG将散落在代码库、文档库、规范库中的知识实时注入AI的决策过程,确保SPEC的定义有据可依、Harness的约束不会遗漏、Agent的生成不会“幻觉”。

这四层逻辑环环相扣:SPEC-Harness定义“做什么、不做什么”,Vibe Coding提供快速探索入口,多智能体团队在范式框架内协同执行,RAG知识体系为全流程提供事实根基。

《白皮书》对上述四层展开进行了讲述。

在《白皮书》第六章,则提出适用于AI原生研发的四维度量模型,包括价值维度、效率维度、质量维度、智能维度,并对核心指标进行了详解。

图片

其中,价值维度衡量研发交付对业务的实际贡献——需求响应速度是否满足市场窗口、功能上线后的业务效果是否达预期、技术投入的ROI是否合理。

效率维度衡量人机协作下的全流程吞吐率——从意图输入到功能上线的端到端耗时、单位需求的人力成本、各环节的等待与浪费。

质量维度衡量交付物的稳定性、安全性与合规性——生产缺陷率、安全漏洞密度、合规通过率、系统可用性。

智能维度衡量AI工具的使用深度与实际贡献——AI采纳率、AI代码存活率、AI生成占比、AI建议精准度。

这四个维度可相互制衡:追求效率不能牺牲质量,追求智能化不能忽视价值交付,形成平衡机制。

值得一提的是,为避免增加研发人员负担,百信银行结合百度Comate能力构建了“无感采集”的度量基础设施。

此外,由于金融业对稳定性和安全性的要求远高于一般互联网行业,因此在度量体系上需做特殊的平衡设计,包括“核心系统与外围系统差异化度量”“避免‘指标博弈’”“伦理与责任度量”等。

本文为作者授权发布,不代表移动支付网立场,转载请注明作者及来源,未按照规范转载者,移动支付网保留追究相应责任的权利。
评论加载中
相关文章

月点击排行
关于本站    联系我们    版权声明    手机版
Copyright © 2011-2026 移动支付网    粤ICP备11061396号    粤公网安备 44030602000994号
深圳市宇通互联信息技术有限公司    地址:深圳市宝安区新安街道28区宝安新一代信息技术产业园C座606