金融可信AI趋势下,智算存储架构的核心挑战与演进方向是什么?

本文不仅是技术分析,更是战略思考。在金融AI从概念验证走向生产级部署的关键时刻,指出当前金融行业在“三域协同”中的核心痛点,提出的“统一智能数据平面”、“存储与智算深度协同”、“AI原生存储自治”、“三域一体安全体系”等演进方向,为行业破解“可信AI”难题提供了重要的思路。

某人寿IT基础架构经理,参与负责了公司两地三中心建设、信创项目、信息安全等工作,擅长操作系统和存储相关技术,对各类存储架构、原理有深入理解。个人紧跟技术前沿,对大模型应用也有一些研究,积极探索创新应用落地。

一、 前言

国务院常务会议近日审议通过《关于深入实施 “ 人工智能 +” 行动的意见》,标志着我国 AI 发展进入了体系化推进、深层次融合的新阶段,正式开启 “ 人工智能 +” 战略升级。在此背景下,金融 AI 大模型正迅速成为驱动行业新质生产力的核心引擎,其应用已从早期的概念验证和局部试点,迅速扩展到全业务链条的生产级部署。风控模型的精准画像、投研报告的智能生成、客户服务的沉浸式交互以及交易策略的实时优化,无不依赖于大模型对海量数据的深度挖掘与瞬时推理。

然而,金融行业也面临核心挑战:如何实现可信 AI ?前沿实践表明,消除模型幻觉的关键在于高质量的核心敏感数据,这对金融 AI 基础架构提出了前所未有的要求:

一是更高的算力密度与弹性,以支撑不同应用场景下大模型的海量参数训练与高频实时推理;

二是具备同时处理结构化与非结构化数据的强大能力,高效对接 TB 甚至 PB 级多元数据;

三是安全可靠与敏捷运营,在满足金融级容灾、数据安全与合规的刚性基础上,实现 AI 应用全生命周期的高效运维。

数据存储作为 AI 基础架构的核心组成部分,直接决定了 AI 算力的效能天花板。为避免存储瓶颈,必须前瞻性地规划存储架构演进路径。本文旨在深入剖析智能计算与传统通用计算在存储需求上的异同,解读存储技术现状,并展望其与智算深度协同的未来图景,打通 “从敏感数据到可信 AI” 的关键路径。

二、 求同存异:通用计算与智能计算的存储需求辨析

通用计算以 “ 记录业务 ” 为核心,智能计算则以 “ 生成知识 ” 为目标。尽管通用计算与智能计算在任务目标上迥异,但其对底层存储的核心诉求在本质上存在深刻的“同”,并因数据规模与处理模式的差异而催生出特殊的“异”。

1. 共性需求:性能、扩展性与安全性

无论是处理传统联机交易( OLTP )的通用服务器,还是运行千卡集群的 AI 训练推理平台,其对存储的基础需求是一致的:

极致性能需求:二者都需要更高的 I/O 带宽和更低的延迟,以缩短 CPU/GPU 等待时间,从而提升整体效率。在通用计算中,这体现为数据库查询的快速响应;在智算中,则直接关乎 GPU 集群的利用率和训练推理任务的完成时间。

弹性扩展需求:业务量的增长和数据的膨胀都要求存储能够支持快速、灵活的容量与性能扩展。 Scale-out 横向扩展架构成为满足这一需求的共同选择,以实现资源的平滑增长。

存储安全需求:可用性(容灾)、完整性(数据持久化)、机密性(加密)是金融级存储不可妥协的基石。模型参数、训练数据、知识库与客户交易数据同样都是必须严加保护的核心资产。

2. 差异特性:智算对存储的颠覆性挑战

智算,特别是 AI 大模型,在大数据基础上,进一步将数据处理的对象和复杂度推向了极致,从而产生了独特的存储需求:

数据范式的转变:从生产域结构化数据,到消费域非结构化数据主导。传统生产域通用计算以处理结构化数据(如交易表、客户信息表)为主,数据模型规整, I/O 模式相对可预测。而消费域的 AI 大模型的核心在于发掘海量非结构化数据(文本、图像、音频、视频)的价值。这些数据需从生产域经汇聚域预处理(清洗、标注、向量化)后,才能进入消费域大模型训练和推理流程。此过程需超长数据管道,对存储的持续吞吐能力要求极高,同时要采用脱敏、匿名化等技术手段,保证敏感数据“可用不可见”的用数模式。

数据管理的复杂性:从三域数据孤岛到统一视图。金融机构的数据通常散落在三域异构系统中,采用文件、对象、数据库等多种协议存储。传统生产域架构下,这种异构性尚可管理。但在智算场景中,频繁的数据搬运和格式转换会成为巨大瓶颈。因此,智算迫切需要一个统一的非结构化数据网关,能够简化数据管理,提供全局命名空间,让“数据不动算动”,极大提升数据供给效率。

I/O 模式的演进:从“随机访问”到“流式吞吐”与“突发检查点”:大模型训练呈现出独特的 I/O 模式。在大部分时间里,训练任务是顺序、流式地读取海量小文件,要求存储提供高且稳定的顺序读带宽。然而,在保存检查点( Checkpoint )时,任务则转变为高并发、突发性的巨量数据写入(短时间内将整个 GPU 显存中的模型状态写入存储),这对存储的突发写带宽和元数据处理能力构成了极端挑战。

三、 现状与适配:当前存储技术对智算的支撑与三域协同差距

当前,存储技术正处于快速迭代期,以应对智算的挑战。当前金融行业的存储架构实践,正沿着 “ 从复用现有架构,到适配智算需求,到专用三域协同架构 ” 的路径演进,但在支撑三域协同、保障可信 AI 方面仍有显著差距。

1. 智算场景不同阶段的存储需求与选型

大模型试点应用初期:此阶段通常复用现有 NAS 或服务器本地存储,成本低、部署快,可以满足模型加载和简单推理的需求,但性能和扩展性有限。

知识工程构建阶段:以 RAG 为例,数据源位于 NAS 或对象存储,而向量数据库则部署在集中式 SAN 上,两者物理分离。传统存储异构、多协议的特性开始显现其对效率的影响,数据迁移和转换过程繁琐。

大规模推理与训练阶段:此时,存储成为关键瓶颈。容器化推理需要支持动态扩展的 NAS 或文件存储。而大规模训练则强烈依赖于高性能并行文件系统(如 Lustre, GPFS ),其 Scale-out 架构能够将带宽和容量分散到多个节点上,满足高并发访问需求,但复杂度和管理成本较高。

2. 当前存储架构的三域协同局限

尽管存储技术( NVMe 、软件定义存储 SDS 、 NVMe-oF )在快速迭代,但适配三域协同仍存在四大核心问题:

“伪存算分离”普遍存在:多数金融机构仍采用“多副本 + 本地盘”架构,生产域数据需先落地本地盘,再同步至消费域,并非真正的“数据不动算动”——既增加延迟,又可能因副本不一致导致模型训练推理数据不可信;

三域协议融合不足:虽“多协议支持” 成为高端存储标配,但生产域的数据库协议( iSCSI )、汇聚域的对象协议( S3 )、消费域的文件协议( NFS )仍需数据拷贝,而非原生统一访问,无法实现“一次写入,三域共用”;

生产域价值未被激活:存储架构设计多聚焦消费域的性能需求,忽视生产域的“数据一致性保障”(如 RPO=0 )对可信 AI 的价值 —— 生产域专家未参与 AI 存储设计,导致消费域无法获取“零丢失”的敏感数据,增加模型幻觉风险;

三域安全体系割裂:生产域有成熟的容灾备份机制,但消费域的模型训练数据、汇聚域的整合数据常缺乏统一的加密与访问控制,存在敏感数据泄漏、模型投毒风险。

四、展望与期望:智算存储架构的三域协同进化之路

未来,存储架构的演进必将超越单纯的设备性能提升 , 以“打通敏感数据到可信 AI” 为核心,构建 “ 三域协同、内生智能、安全可信 ” 的新型架构。

1. 构建统一的智能数据平面

核心目标是打破三域数据孤岛,实现 “ 数据不动算 ” 未来的趋势。通过智能数据编排引擎和非结构化数据统一网关,将生产域的核心数据库、汇聚域的对象存储、消费域的并行文件系统纳入同一全局命名空间。生产域的数据一次写入,附以完备的数据血缘( Data Lineage )和元数据标签,经汇聚域完成清洗、脱敏后,直接供给消费域训练框架、推理服务或分析工具直接访问,从而彻底消除孤岛与迁移开销。这将为数据预处理和模型训练提供“零等待”的数据供给,极大提升从数据到价值的转化效率。

2.实现存储与智算的深度协同( Deep Co-Design )

存储不应再是孤立的外设,而应成为智算流水线的有机组成部分。

通过持久化数据降低智算压力:智能分层存储可将热数据(正在训练的数据集)、温数据(历史检查点、常用知识库)、冷数据(归档数据)自动分布在性能不同的存储介质上,将大量数据自动下沉到成本更低的介质,以减轻高性能存储的容量压力,降低总体拥有成本( TCO )。

通过更便捷、性能更高的存储 I/O 加速智算性能:计算存储分离架构(通过高速 RDMA 网络如 InfiniBand 连接)已成为主流,下一步是更细粒度的协同。例如,存储系统可主动感知训练任务进度,预取下一个批次的数据到缓存;或与训练框架结合,实现增量式检查点(只保存变化部分),大幅降低 I/O 压力。 NVMe-oF 技术的普及将使得远程访问存储的性能接近本地访问,为存算分离提供性能保障。

3.发展 AI 原生的三域存储自治

利用 AI 技术管理存储架构,实现三域协同的“自优化、自修复、自运维”:

精准预测与调度:通过机器学习分析三域数据访问模式(如生产域交易高峰、消费域训练时段),动态调整数据布局(如将高频访问的生产数据迁移至高性能存储);

主动故障自愈:实时监控三域存储硬件状态,在故障发生前自动迁移数据(如生产域磁盘预警时,将数据同步至备用节点),保障数据不丢失;

三域运维协同:构建统一运维平台,生产域、汇聚域、消费域专家可共享存储运行数据,快速定位问题(如消费域训练卡顿,可追溯至生产域数据供给延迟)—— 降低跨域协作成本,提升运维效率。

4.强化三域一体的安全可信体系

以 “ 内生安全 ” 保障敏感数据三域一体全链路安全,支撑可信 AI 。采用端到端加密、零信任架构确保模型参数和敏感数据全生命周期安全。同时,在金融等关键行业,构建基于国产硬件和软件的自主可控的“算力 - 存储”技术栈,将从战略选择变为必然要求,保障金融 AI 业务的持续稳定和国家金融数据安全。

结语

金融 AI 大模型正驱动存储架构的深刻变革。随着 AI 大模型与智算存储技术的持续演进与深度融合,智算存储系统将实现“敏感数据安全流通、 AI 模型可信输出”的目标,为金融 AI 构筑坚实的信任基石。

最终,三域协同、智能自治、安全可信的存储架构,将更好地赋能精准定价、欺诈识别、智能客服等核心业务场景,提升金融企业的风险管理能力和客户服务水平,真正释放人工智能在金融领域的巨大潜能。

请使用浏览器的分享功能分享到微信等