拓尔思主要产品介绍

拓尔思主要产品介绍

最佳答案 匿名用户编辑于2023/03/27 17:12

我来介绍一些拓尔思主要产品有哪些。

1.网络大数据采集

网络大数据采集是指根据互联网不同的数据类型与网站结构,采 用分布式抓取技术,对指定网站定向数据采集、存储,然后进行分类、分词、查重、打标等数据加工,在专业知识库建立、企业竞争情报分 析、报社媒体资讯获取、舆情监测等领域应用广泛。

拓尔思大数据中心的数据基于自研的互联网数据采集系统实现 全网数据采集的。早在 2002 年,拓尔思就推出了第一代网络信息采 集系统——TRS 网络信息雷达(以下简称“雷达”),已成功应用于 数千家媒体、企业、金融和政府部门的数据中心或信息中心。随着互 联网的发展,以及 web2.0 技术的兴起,各种风格迥异的网站、新闻 APP 等风云涌现,各种页面展现技术层出不穷,比如:异步加载、延 时加载、下拉刷新、手机 APP、登录验证、参数时效性、访问屏蔽等 等,“雷达”产品面临新技术的挑战。

2020 年,拓尔思推出了 TRS 海 蜘大数据采集平台(以下简称“海蜘”),这是基于“雷达”开发出 来的新一代分布式大数据采集系统。“海蜘”从采集点的维护到采集 终端的部署、源码下载、内容解析,再到采集结果的存储都是集群式 +分布式的,平台内嵌了雷达的内容和链接智能过滤模块、脚本引擎 模块、内容模板和链接模板等等。把雷达采集流程按照模块进行拆分, 细分为采集点管理、采集配置管理、采集属性管理、链接更新检查、 源码下载(雷达下载、基于浏览器下载、手机模拟下载、插件下载、 API 下载)、链接过滤和内容抽取、采集日志管理、解析结果分发几 个独立的模块,任意模块均可集群式部署。

主流社交媒体和小视频相对传统网站,是舆论新阵地,信息密度 高。由于官方网站提供的 API 存在限制数据采集速度和身份验证等问 题,常规的网络爬虫存在一定的局限性,采集门槛更高。

针对这一新形势,拓尔思开发出了全新的海汇主流社交媒体和 小视频采集平台(以下简称“海汇”),集成了拓尔思丰富的协议 分析和分布式采集经验,实现了海量数据的稳定高效采集,覆盖了 国内外常见的多种社交媒体和小视频站点。针对小视频,“海汇” 还拥有文本快速检测和视频动态 OCR 等关键技术,可以实现视频内 容的深入挖掘。“海汇”管理着数千个采集节点,通过对大规模采 集过程中的任务调度、智能纠错、反爬对抗和验证码识别等技术的 工程化应用,让海量公开数据的实时监控成为可能。“海汇”模拟 自然人的行为特征、内容特征,进行拟人化帐号养殖。设计社交网 络智能体时考虑包括访问、发布内容、评论内容、对话等行为的时 间,基于智能写作和智能对话生成的内容特征,进行反检测以维持社交网络智能体不被屏蔽,同时模仿社交网络智能体的行为特征进 性采集任务配置与调度监控,以实现基于社会计算的数据采集技 术。“海汇”的采集点全球各大洲都有覆盖,在阿里云、华为云、 AWS、微软云、VPS 等供应商云主机验证通过,且对多语种都能够适 配。

2.数据资源汇聚

数据资源汇聚就是从源端经过抽取(extract)、转换 (transform)、加载(load)至目的端的过程,它能够对各种分布 的、异构的源数据(如关系数据)进行抽取,按照预先设计的规则将 不完整数据、重复数据以及错误数据等“脏"数据内容进行清洗,得 到符合要求的“干净”数据,并加载到数据仓库中进行存储,这些 “干净”数据并加载到大数据管理平台中进行存储,这些“干净” 数据就成为了数据分析、数据挖掘的基石。

海聚数据融合平台(以下简称“海聚”)是一款由拓尔思自主 设计研发,具有强大数据集成能力的流批一体数据融合平台。“海 聚”采用分布式架构,以 flink 作为数据处理引擎,可拖拽式数据 流程开发,提供几百种常用功能组件,支持对任务的进度实时监控 和多维度统计分析,并提供了全功能 RESTful API。“海聚”能帮 助企业打破数据孤岛、修正数据质量、汇集多数据源、转换数据形 态,提升数据的利用价值。

“海聚”支持多种任务类型,包括批任务、流任务、SQL 任 务、JAR 任务。通过调度计划用于配置任务的定时运行策略,合理 的给任务分配调度计划,可以使得多个任务协同运行并且合理使用 服务器资源,避免出现过多任务争抢线程和数据库等资源以及大量 任务排队等待等现象,为服务器稳定运行提供保障。“海聚”支持 集中管理任务中使用的所有外部连接的资源,并生成相应的血缘图 谱。

3.大数据管理

海贝搜索数据库(以下简称“海贝”)是一款从内核到系统完全 国产自研的搜索引擎数据库,其定位为大数据应用支撑软件,为大数 据应用提供高效的数据存储、信息检索、统计分析等数据管理服务,支持几乎所有类型的数据,包括文本、数字、地理空间、图片等各种 结构化、半结构化和非结构化数据。“海贝”不仅集成了众多开源检 索系统不具备的企业级功能,还能够有效降低用户的系统建设成本、 开发成本和运维成本。

全语种分词器

“海贝”自带的 TRS 分词器,不仅可以支持中日韩等方块文字, 也能处理英法德等拉丁语系,还可以处理藏文、蒙文、维文等少数民 族语言,真正可以做到单一分词器处理全部语种,大大简化了系统的 开发和运维工作。

用户隔离

“海贝”还具有其他同类产品不具备的用户隔离安全特性,系统 支持用户数据的物理隔离和逻辑隔离。

冷热分区

海贝自带的分时归档视图,不仅可以实现冷热数据自动分区,同 时还支持多种存储混合使用以提供高效的检索服务。

镜像数据库

用户可以通过简单的配置实现读写分离、大小库以及访问隔离等, 大大降低了数据加工和查询之间的 CPU、内存、IO 等冲突,避免了数 据入库导致的检索卡顿问题。

深度检索

随着互联网审查的愈发严格,有人经常将一些敏感词转成同音词 或者同义词进行发布,或将非法文章通过图片的形式对外发布,企图 躲避监管。针对这种情况,海贝集成了深度学习引擎,支持以文搜图、 以图搜图、图文融合搜索,可以对图像中的文字进行 OCR 识别,也可 以提取图像或者文本的特征数据,通过基因编码存储到海贝数据库里, 成功实现图像相似性检索功能,并配合拼音检索、同音词检索等功能, 让网络上的不法分子无处遁形。

4.数据中台

随着互联网的高速发展,业务场景的不断增加,数据应用的需求 越来越多,为快速响应业务的需求,很多企业都不同程度的存在烟囱 式的开发模式,这种烟囱式的开发导致企业不同业务线的数据是割裂 的,这就造成了数据的重复加工,导致研发效率、数据存储和计算资 源的浪费,使大数据的应用成本越来越高,也带来指标口径不一致的问题。产生这些问题的根源在于数据无法共享,为解决这一问题,2016 年,阿里率先提出“数据中台”的口号。数据中台的核心是:避免数 据的重复加工,通过数据服务化,提高数据的共享能力,赋能数据应 用。

总的来说,数据中台具备异构数据统一计算、存储的能力,同时 让分散杂乱的数据通过规范化的方式管理起来。数据中台借鉴了传统 数仓面向主题域的数据组织方式,基于维度建模理论,构建统一的数 据公共层和应用层。数据中台依赖于大数据平台完成数据研发全流程, 同时增加了数据治理和数据服务化以及数据资产内容。数据中台是大 数据时代的大背景下,为实现数据快(快速)、准(准确)、省(低 成本)赋能业务发展的目标,将企业的数据统一整合起来,基于 Onedata 方法论借助大数据平台完成数据的统一加工处理,对外提供 数据服务的一套机制。

拓尔思天骄数据中台(以下简称“天骄”)帮助大数据应用客户处理 各种多源异构数据,完成数据治理,沉淀数据知识,控制数据质量,实现数 据采集、数据接入、数据处理、数据存储、数据应用和数据智能,成为数据 资产管理中枢,让客户从数据泥潭中解放出来,专注于业务应用和创新。

参考报告REPORT

拓尔思数据要素白皮书.pdf

本白皮书由拓尔思发布,聚焦于数据要素这一核心主题,深入探讨了在数字经济背景下数据作为关键生产要素的价值释放路径与治理体系。文档系统梳理了数据要素的市场规模、产业链结构及政策环境,分析了数据确权、流通交易、安全防护等关键环节的技术实现与商业模式创新。通过解读数据要素化过程中的痛点与机遇,为相关企业参与数据资产运营、构建数据生态提供战略参考与实践指导,旨在推动数据资源向数据资产的高效转化。

我来回答

快速提问

海量报告支持,行业专家解读

海量文库支持,行业专家解答

用户解答榜
分享至