金融行业数据处理平台建设及技术应用情况如何?

金融行业数据处理平台建设及技术应用情况如何?

最佳答案 匿名用户编辑于2024/03/19 09:29

金融业目前主流的数据存储技术中,HDFS、对象存储是常见 的存储选型。

一、 平台建设应用情况

1.技术平台上云情况

金融业海量数据处理平台上云已经成为一个不可逆转的趋 势。这一趋势的出现主要是由于云计算技术的不断发展和进步, 提供了更高的计算能力、更大的存储能力和更好的灵活性。因此, 金融机构正在逐渐将他们的数据、应用和计算资源迁移到云计算 平台上,以实现更高效、灵活和低成本的数据管理和处理。金融 业海量数据处理平台因其涵盖交易、客户信息等高敏感数据,一 般采用私有云部署,部署模式的发展历程可以分为以下几个阶段: 第一阶段是物理机部署,使用传统的硬件和软件资源构建管 理数据处理平台。 第二阶段是虚拟化部署,通过虚拟化技术将服务器、存储和 网络等资源进行虚拟化,以提高资源利用率和管理效率。 第三阶段是云化部署,将数据、应用和计算资源迁移到私有 云平台上,以实现更高效、灵活和低成本的数据管理和处理。 第四阶段是多云部署,将数据、应用和计算资源分散部署在 多个不同的云平台上,以实现更好的容灾、备份和安全性。 据不完全统计,目前部分中等规模以上的金融机构已进入第 三阶段云化部署。对于云化部署的范围,金融行业内也有多种不 同观点。

2.技术平台规模情况

在金融业中,海量数据涵盖了交易、用户行为、市场、客户 信息、风险评估、反欺诈检测等多个方面,具有极高的复杂性、 多样性和处理速度要求。在金融行业,海量数据通常通过以下指 标来定义。

为了有效管理和分析这些海量数据,需要采用新的数据处理 和分析技术,以提高数据处理和分析效率,为金融业务提供更准 确、更快速的数据支持,从而提高金融业务的竞争力和效率。因 此,金融业海量数据处理平台一般采用多样化的技术栈构建。 近年来,随着互联网金融及第三方支付业务的快速发展,金 融行业各机构的业务量也出现了大幅度的增长,产生的数据量也 越来越大,底层平台规模也随之越来越庞大。如何评价一个组织 的海量数据规模有很多维度,但基本上以数据总量和机器节点数 量两个主要维度来判断一个组织的海量数据规模。 在平台整体节点规模方面,体量较大的金融机构,典型如国 有大行(工商银行、中国银行、建设银行等)已超过 8000 台, 并计划在 2023 年扩容超过 10000 台;体量较小的也已超过 2000 台。在单集群节点规模方面,Hadoop 集群已有超过 2000 台, MPPDB 集群最大已超过 500 台。在数据总量规模方面,体量较大 的海量数据平台已超过单副本 80PB。这些数据反映了金融行业海量数据处理平台的规模和实力, 以及金融行业在数据处理方面的挑战和发展趋势。

3.研发运营一体化应用情况

DataOps 的概念最早在 2014 年由国外学者提出,随后业界 逐步对其内涵进行补充。在 2018 年 DataOps 正式被纳入 Gartner 的数据管理技术成熟度曲线当中,由此进入了国际的视野当中。 2022 年中国信通院正式牵头成立了 DataOps 能力标准工作组, 以此为基础推动我国大数据产业的多元化发展,助力企业完成数 智化升级。

研发运营一体化是国内对 DataOps 理念的一种理解,是一种 新兴的数据处理方法论和管理能力。这种技术旨在提高数据分析、 数据工程和数据科学团队的生产效率和质量。它借鉴了数据研发、 数据运营等方面在实践中的优劣点,强调数据工程中的自动化、 协作、持续集成和持续交付,以便更快地从数据中获取价值,与 DataOps 的理念具有很多相似处。研发运营一体化的核心理念是 将数据处理过程视为数据产品的生产线,通过改进数据流程、工 具和团队协作,实现数据产品的快速、可靠和高质量交付。 在金融行业,研发运营一体化的作用具有许多意义,比如通 过研发运营一体化,可以提高数据质量。金融行业对数据的准确 性和完整性要求很高,因为数据质量直接影响到风险管理、投资 决策和客户服务。研发运营一体化通过自动化数据清洗、验证和 转换过程,确保数据质量得到有效控制。此外,还可以加速数据 分析和决策,因为金融行业需要快速响应市场变化,做出及时的 决策,通过自动化数据处理和分析过程,缩短了数据准备时间, 使数据科学家和分析师能够更快地获得洞察力和建议。最后,研 发运营一体化可以促进跨部门协作,由于金融行业的数据分析涉 及多个部门,如风险管理、营销和客户服务。研发运营一体化实现之后,可鼓励跨部门协作,共享数据和知识,实现业务目标的 一致性。

总结来看,研发运营一体化在金融行业的作用和发展主要体 现在提高数据质量、加速数据分析和决策、降低数据安全风险、 促进跨部门协作和支持创新和实验等方面,金融机构可以更好地 利用数据,实现业务价值的最大化。

二、 技术应用情况

1.存储技术应用情况

金融业目前主流的数据存储技术中,HDFS、对象存储是常见 的存储选型,它们各自有不同的应用情况: HDFS 用于存储大规模数据的分布式文件系统。它将数据划 分为较小的块并分布在多台机器上,提供高可用性、容错性和可 扩展性。HDFS 适用于批处理工作负载,如 MapReduce 任务,但对 于随机读写性能较差。 对象存储: 对象存储是一种数据存储模型,将数据存储为 对象,每个对象包含数据本身以及元数据(例如文件名、时间戳 等)。对象存储不使用传统的文件系统层次结构,而是通过统一 的 API 进行访问。这种存储方式不仅适合存储传统结构化数据, 也适用存储大规模的半结构化、非结构化数据,如图像、音频、 视频等。因此,随着大数据上云成为新的技术趋势,业界普遍将 云上对象存储作为新一代的数据湖存储。流行的对象存储解决方 案包括 Amazon S3、Azure Blob Storage 等。

据统计,金融行业中,当前以 HDFS 存储为核心的 Hadoop 技 术广泛应用于构建企业的统一数据湖。随着大数据上云成为新的 技术趋势,业界普遍趋向于将云上文件存储、对象存储等作为新 一代的数据湖存储。

2.计算技术应用情况

金融业对计算技术的要求越来越高,而且由于金融的计算处 理非常复杂,所使用的计算技术也较为繁杂,目前使用的主要计 算技术包括:批计算引擎 Hive/Spark、流处理引擎 Flink、交互 式分析引擎 Presto。 Apache Spark 是一个通用的大数据处理框架,支持多种计 算模式,其中批处理模式是其最常见的用法之一。在 Spark 批处 理中,数据被划分为小块,称为 RDD(Resilient Distributed Datasets,RDD),并且可以通过一系列的转换和操作进行处理。 Spark批处理适用于对离线数据进行分析和处理,例如数据清洗、 ETL(Extract-Transform-Load,ETL)、批量计算等。它的优点 包括快速数据处理、容错性和丰富的 API。 Apache Flink 是一个开源的流式处理框架,专注于支持实 时流数据的处理和计算。与 Spark 的批处理模式不同,Flink 专 注于实时数据的流式处理。Flink支持事件时间处理、窗口操作、 状态管理等功能,使得用户可以实时处理和分析数据流。Flink 适用于需要实时响应的应用,如实时监控、实时分析、事件驱动 型应用等。

Presto 是一款开源的分布式 SQL 查询引擎,专注于实时分 析和大规模数据查询。其独特之处在于高速的查询能力和弹性的 分布式架构,适用于需要快速响应和复杂分析的场景。其出色的 查询性能、灵活的数据源连接方式以及高度可扩展的架构,使其 成为处理各种数据分析挑战的首选工具。Presto 适用于数据探 索、BI 报表等领域,能够处理大量数据并支持复杂查询操作,是 处理实时数据分析的强大工具。 不同的计算技术适用不同的业务场景。在金融机构中,选择 适当的计算模式取决于业务需求、数据特点和性能要求。金融行 业普遍使用 Hive/Spark 引擎用于海量数据的批量加工,比如标 签加工、指标加工,Flink引擎广泛应用于金融行业的实时营销、 实时风控等场景中,Presto 应用于面向数据分析师的数据探索 业务,以及 BI 报表对应。

为了发挥计算技术的最大优势,在构建数据处理平台时还会 采用计算与存储一体的数据库技术,在专项领域达到更优的性价 比,如:HBase、时序数据库、图数据库、ClickHouse、MPPDB 等。 HBase是一个适合存储海量非结构化数据或半结构化数据的、 具备高可靠性、高性能、可灵活扩展伸缩的、支持实时数据读写 的分布式数据库。HBase 适合需要高吞吐量、低延迟、大规模数 据存储和实时查询的业务场景。其分布式、可伸缩的架构适用于 大数据应用,如实时分析、日志处理、社交网络、物联网数据管理等。同时,HBase 的数据模型类似于分布式哈希表,适合需要 快速存取、随机读写的场景。

时序数据库具备高效的时序数据存储和查询能力,适用于需 要处理大规模、高频率时间序列数据的场景。支持复杂查询、聚 合分析以及数据压缩,能够满足设备监控、智能城市、工业生产 等领域的需求。时序数据库的优势在于可扩展性、低延迟读写以 及对大量设备生成的实时数据的强大支持,在金融场景中可以用 于处理大量的实时数据,如股票价格、汇率、交易信息等。时序 数据库还非常适合金融的风险管理,实时交易监控等领域,在金 融行业越来越受到重视。 图数据库是用于图谱数据的存储和分析的数据库。客观世界 的事物可以抽象成事物实体和事物之间的联系,将实体抽象成点, 将实体之间的关系抽象成边,则客观的世界可以抽象成由点和边 组成的图谱。用图谱的表示方式很多时候能更客观直接地描述事 物的规律,针对图谱数据的分析也能更高效地发现事物直接的规 律。图数据库就是专门针对这类抽象为点和边的图谱数据的分析 组件。

日志存储和搜索引擎以 Elasticsearch 为例,它是一个基于 Apache Lucene 的分布式搜索和分析引擎,它主要用于搜索和数 据分析场景。它允许用户构建实时搜索引擎、日志分析、指标监 控和推荐系统等各种应用。日志存储和搜索引擎工具在金融业使 用非常广泛,比如在金融的实时搜索和分析场景中因为涉及大量文本数据,如交易记录、报告、研究论文等,Elasticsearch 的 实时搜索和分析功能可以帮助金融企业快速查找相关信息,提高 工作效率。另外金融的风险控制、合规、反洗钱(AML)和客户 识别,甚至金融数据挖掘和分析等各个场景下,都需要日志存储 和搜索引擎这一类的工具,对金融业具有重要意义。 ClickHouse 是面向联机分析(OLAP)处理的列式数据库,适 合大规模并行分析、交互式分析应用场景。支持通过分布负载到 多个数据库服务器主机,实现存储和处理大规模数据,具有完全 的伸缩性、高可用、高性能、资源共享等特征。支持基于 SQL 的 查询、统计、分析,且性能好,特别是基于大宽表的聚合分析查 询、分析性能非常优异。ClickHouse 完全使用 SQL 作为查询语 言,提供了标准协议的 SQL 查询接口,具备基于 SQL 的数据查 询、统计、分析等能力。使得现有的第三方分析可视化系统可以 轻松与它集成对接。

MPPDB 是一种面向数据分析的分布式并行运算数据库,通过 将查询和计算分布在多个计算节点上来实现高性能分析。MPPDB 数据库针对复杂数据查询和大规模数据分析进行了优化,具有并 行性、高性能和高吞吐量等优势,适合实时和交互式分析。 各类计算与存储一体的数据库技术都在金融业不同的场景 中发挥着重要作用,如:HBase 广泛应用于金融机构的明细高并 发查询场景中(如交易流水查询、账单查询),MPP 则应用于构 建数据仓库支持大规模数据集的存储和查询场景;部分金融机构已将时序数据库应用于量化交易、智能化运维等场景中,将图数 据库应用于知识图谱、反欺诈等业务场景中,将 ClickHouse 应 用于贷款、营销等场景的实时 SQL 统计分析,以及构建标签管理 系统。而日志存储和搜索引擎则长期都是金融业处理海量日志以 及实时搜索的必要工具。

3.数据湖仓技术应用情况

数据湖仓技术是指将数据湖(Data Lake)和数据仓库(Data Warehouse)两种数据存储和管理模式结合起来的方法,旨在实 现更灵活、高效和综合的数据处理和分析。这种方法可以让企业 在一个统一的平台上同时享受数据湖和数据仓库的优势。目前主 流的数据湖仓技术为湖仓一体技术,该技术在数据湖构建和管理 方面有着不同方法和策略,近几年深受金融行业的青睐。 Iceberg 和 Hudi ( Hadoop Upserts Deletes and Incrementals)是两种流行的数据湖仓 Lakehouse 组件,常被用 来构建湖仓一体技术架构,它们提供了类似事务性操作、数据版 本控制、分区管理等功能。通过在数据湖中引入 Hudi 或 Iceberg 等技术来实现增量数据存储、数据更新和删除操作的支持,实现 了数据湖和数据仓库的融合。数据湖不仅承载原始数据,还负责 承担数据仓库的职责,包括数据的清洗、转换、加工和分析。这 种集成的方法不仅简化了数据架构,还提高了数据的可访问性和 灵活性,使得金融机构能够更好地应对实时分析和复杂业务需求, 从而实现更智能的决策制定和业务创新。

随着湖仓一体技术的兴起,金融机构也逐步将传统的数据湖 和数据仓库升级到湖仓一体。目前头部的金融机构已经开始探索 湖仓一体技术,并在生产业务中落地部分业务。随着未来时间的 推移,湖仓一体将逐步成为金融行业的主流形态。

4.数据架构应用情况

当前金融行业已经从传统的数据仓库体系、大数据体系升级 演进到数据中台体系。这一演进是为了更好地整合企业内部的数 据资源,提高数据的使用效率,以及满足金融行业日益增长的数 据需求。 在这种背景下,金融行业的数据中台体系下的数据架构往往 做了数据分层。典型的数据分层如下: (1) 贴源层:直接对接各个数据源,如交易系统、核心业 务系统、外部数据接口等。通常保持数据的原始状态不做过多处 理。 (2) 明细层:存储经过初步清洗和转换的详细事务数据, 为后续的数据分析和报表提供了基础数据。保留了数据的细节, 允许对数据进行深入的分析。 (3) 汇总层:基于明细层的数据,进行进一步的加工和汇 总,生成对应的汇总数据、聚合数据或预计算的度量数据,以支 撑快速查询和报告。(4) 应用层:为终端用户或者应用系统提供数据访问服 务。这一层通常包括为特定业务或功能定制的数据集,例如数据 看板、报表、数据产品或 API 接口。

数据架构的技术落地上,数据贴源层普遍基于数据湖技术构 建,如 Hadoop、Delta Lake 或 AWS S3 等。数据湖为后续的数据 分析、机器学习和报表提供了一个灵活的、原始的数据基础。明 细层和汇总层部分金融机构会基于 MPPDB 构建,对于领先的金融 机构而言,则通常使用大数据技术构建。最上层的应用层一般基 于高并发的 OLAP 数据库和各类大数据技术组件比如 HBase、 ElasticSearh、Redis 等构建。 领先的金融机构已经实现完全基于开放大数据技术栈来构 建整个数据架构,从而确保数据处理的高效、灵活和可扩展性。

参考报告REPORT

海量数据处理技术金融应用研究报告.pdf

海量数据处理技术金融应用研究报告。海量数据处理是金融业大数据技术领域的关键难点,对金融业海量数据进行高效的存储、计算、分析和运营,将有效帮助金融机构深度挖掘数据的潜在业务价值,实现降本增效。现阶段,金融业在海量数据处理方面呈现出“五化”的技术趋势,即云数一体化、存算分离化、湖仓一体化、计算融合化与研发运营一体化。其中一些新的关键技术已在部分金融机构进行了较深入的实践应用,取得了可观的成果。但是,作为一项复杂的课题,海量数据处理还面临着技术、产品、应用等多方面的挑战和痛点,且这些难题当前尚未进行全面的研究和分析。因此,本报告对海量数据处理的技术、应用、建设等方面进行系统的...

我来回答

快速提问

海量报告支持,行业专家解读

海量文库支持,行业专家解答

用户解答榜
分享至