2026年BondClaw固收投研系列二:人机协同的REITs公告批量搜集实践

  • 来源:国投证券
  • 发布时间:2026/04/28
  • 浏览次数:103
  • 举报
相关深度报告REPORTS

BondClaw固收投研系列二:人机协同的REITs公告批量搜集实践.pdf

BondClaw固收投研系列二:人机协同的REITs公告批量搜集实践。AI自主完成复杂数据采集,已达实用水平:固收投研中有大量重复性的数据采集工作——批量下载公告、定期拉齐报告、跨平台比对数据。这些工作单次不难,但数量一上来,分析师的时间就被大量消耗在机械操作上。我们用一个实战案例验证了一条新路径:以巨潮资讯网全部27只REITs的一季报和评估报告为对象,AI在约23分钟内自主完成了50份PDF的下载,覆盖26只产品,人工介入总时长不超过两分钟。对于固收分析人员日常面临的高频数据采集需求,这条路径已经具备实用价值。AI能突破人工操作的视觉边界,获取人眼看不到的完整数据:...

背景与思路

1.1.投研中的数据采集痛点

做过固收投研的人都知道,日常工作中有大量时间花在"找数据"上。写一篇信用资质跟 踪报告,可能需要从巨潮资讯下载几十份公告;跟踪城投债的发行情况,要反复登录多个平 台检索、比对;做 REITs 研究,需要把所有产品的季报和评估报告拉齐。这些工作有一个共 同特点——单次操作不难,但数量一上来,重复劳动的负担就很重。 面对这种需求,传统方案陷入了两个极端。一端是专业爬虫工具:Python + Selenium、 Scrapy,功能强大,但开发门槛高、维护成本大,目标网站一改版脚本就可能失效。对大多 数没有技术背景的分析师而言,这条路走不通。另一端是纯手动操作:打开网页、选条件、 翻页、下载、整理。人人都能做,但效率低下,容易遗漏,而且每次重复任务都要从头来过。 两难之间,需要一条中间路径:不要求分析师会写代码,同时能像程序一样高效、可重 复地完成数据采集。这条路径的打开,得益于近期 AI 能力的一个重要突破——让 AI 自主操 作浏览器。

1.2.AI 驱动的浏览器操作:一个新范式

浏览器自动化正在经历一次范式切换。过去做数据采集,本质上是程序员预先写好每一 步精确指令——"点击第 3 个按钮、在第 5 个输入框填入关键词、等待 2 秒后提取表格数据 "。这些指令依赖网页元素的代码地址(CSS 选择器或 XPath),网页一旦改版,地址变了,脚 本就废了。 借助 Anthropic 推出的 Model Context Protocol(MCP),AI 助手可以直接调用浏览器自 动化框架(如 Playwright),用户只需要用自然语言描述意图——"打开巨潮资讯网,搜索某 公司最近三年的年报并下载"——AI 自主理解网页内容、拆解操作步骤、执行并获取结果。 定位方式从"代码地址"转向"语义理解",系统通过理解"找到标题中包含年度报告的链接"来 完成任务。即使网页改版,AI 也能重新理解页面并适应。 对投研的实际帮助,体现在两个维度: 数据采集环节:公告批量下载、行业数据定期采集、多平台信息比对等重复性工作, 可交由 AI 按指令自动完成。分析人员从机械操作中释放出来,将更多时间投入数据 解读与判断。 信息检索环节:撰写报告时需要从多个来源快速获取背景数据,AI 可以按需访问指 定网站、提取关键信息、汇总为结构化结果,缩短信息收集周期。 当然,这个范式目前仍处于早期阶段。AI 对复杂网页的理解准确率、多步骤操作的完成 率和错误恢复能力、大规模调用下的成本——这些都还在持续改善中。单任务成功率尚未稳 定达到人工操作水平,但收敛的速度很快,值得提前布局。

1.3.web-data-scraper:我们的解决方案

web-data-scraper 是我们基于上述思路开发的一个数据采集工具。核心理念用一句话概 括:分析师的思路,加程序员的技巧。 所谓"分析师的思路",是指它完全模拟真实用户的使用路径——先打开网页看看长什么 样,找到搜索入口,输入筛选条件,查看结果。先像人一样"看",再像程序一样"做"。

所谓"程序员的技巧",是指在浏览过程中,它会监听网页背后的网络请求,发现并解析 隐藏的 API 接口。一旦找到数据接口,就把单次的人工操作转化为可批量执行的自动化流程。 这个能力至关重要——举个实际例子,在巨潮资讯网搜索 REITs 产品时,人工操作只能看到 下拉框中弹出的部分列表(受浏览器显示区域限制),但通过捕获背后的 API 请求,可以直接 拉取到完整的 REITs 产品清单,突破了手动操作的视觉限制。

在技术策略上,它采用"API 优先 + 浏览器兜底"的混合方案。面对任意网站,首先尝试 发现 JSON API 接口——如果有,直接调用 API 批量获取,这是最高效的路径;如果没有发现 API,就用浏览器自动化模拟操作,通用性最强;如果页面本身是静态的,直接读取内容 即可。优先走快通道,同时保留备用方案。 在合规层面,设计原则包括:模拟真人操作节奏,请求频率控制在合理范围内;优先使 用网站自身的 API 接口,而非暴力抓取;遇到验证码等反爬机制时主动降级而非强行突破; 支持断点续传,任务中断后可从上次位置继续。 综合来看,web-data-scraper 具备几个关键特征:无需预先配置,面对新网站时 AI 自主 分析页面结构并制定策略;智能策略选择,自动判断最优获取方式;自主异常处理,遇到问 题主动分析原因并调整方案;人人可用,用自然语言描述需求即可,无需编写代码。它利用 AI 的编码能力为信息收集场景赋能,本质上是一种新型工作方式——以合规、合理且高效的 方式,将重复性的信息采集工作交给机器完成。

1.4.本文要解决的问题

为验证上述方案的可行性,我们选择了一个具有代表性的实战任务:在巨潮资讯网上检 索并下载全部 REITs 产品的 2026 年一季度报告和 2025 年资产评估报告。 之所以选这个案例,是因为它同时考验了数据采集的几个核心难点:目标抽象("所有 REITs"——需要先搞清楚市场上到底有多少只 REITs 产品)、来源分散(各产品独立披露公 告)、文档类型多样(一季报 + 评估报告两类)、异常情况多(部分产品未发布报告、新产品 尚无任何披露)。这个任务远非"打开页面、下载文件"那么简单,需要理解、判断、搜索、筛 选、核验等多步综合操作。 最终,web-data-scraper 在约 20 分钟内完成了全部任务:下载 50 个 PDF 文件,覆盖 26 只 REITs 的一季报和 24 份评估报告,并准确识别出 2 只未发布报告的产品和 1 只尚无任何 报告的新产品。整个过程中,用户只需在开头描述任务需求、在中间偶尔提供反馈,其余全 部由 AI 自主完成。

实战过程:23 分钟下载 50 份 REITs 报告

2.1.任务背景与目标

我们的目标很明确:从巨潮资讯网(cninfo.com.cn)批量下载全部 27 只公募 REITs 的 两类报告——2026 年一季报和 2025 年房地产评估报告。 巨潮资讯网是证监会指定的法定信息披露平台,所有公募基金(包括 REITs)的定期报告、 临时公告均在此发布。问题在于,27 只 REITs 分散在不同的产品页面中,每只产品的报告需 要单独搜索、逐一下载。如果纯靠人工操作,即使熟悉网站结构,也需要反复搜索、点击、 确认,耗费大量时间。 更棘手的是报告命名的"不统一"问题。以评估报告为例,有的产品叫"房地产评估报告", 有的只写"评估报告",还有的带着更长的前缀。对人工来说,扫一眼标题就能判断;但对程 序来说,用哪个关键词搜索、如何精确匹配,都需要策略。这个任务看似简单,实际上涵盖 了多产品、多报告类型、标题命名不规范等多个典型难点,极具代表性。 我们把整个任务交给 AI,看它能否独立完成。接下来,我们按时间线完整复盘这 23 分钟 的全过程。

2.2.第一阶段:像人一样探索网页(约 3 分钟)

AI 的第一步,和任何一个不熟悉巨潮资讯网的人完全一样——先打开网站,看看页面长 什么样。它导航到巨潮资讯网的信息披露搜索页面,识别出搜索输入框,然后在里面输入了 "REIT"这个关键词。

AI 助手以人类浏览者的方式进入巨潮资讯网,在搜索框中输入"REIT"进行初步探索 不过,AI 的操作并不一帆风顺。在输入过程中,由于工具本身的交互机制问题,搜索框 里出现了"REITREIT"这样的重复文字。AI 尝试了好几种办法来修正——清空后重新输入、逐 字母输入、甚至直接用 JavaScript 代码强制设置输入值。这个小插曲说明,AI 同样会遇到 网页交互中的各种技术细节,需要反复尝试。 一个更重要的发现是:搜索结果的默认分类落在"上市公司"板块下,而 REITs 产品实际 上属于"基金"分类。AI 意识到了这个问题,决定切换到"基金"标签页。在这个过程中,我们进行了第一次人工干预——帮助 AI 点击进入"基金"分类页面,让它快速跳到正确的位置。 (当然不干预的话 AI 已经在操作切换,我们帮助它更快的直接解决部分问题)

小结: 这 3 分钟的核心产出是 AI 对网站结构建立了基本认知——搜索入口在哪里、搜 索结果怎么分类、REITs 应该去哪里找。这些认知是后续所有操作的基础。AI 的探索策略有 层次性:先尝试人类式的点击和输入,遇到障碍时再切换到更高效的编码手段。

2.3.第二阶段:发现背后的 API(约 5 分钟)

进入"基金"分类后,AI 在搜索框输入"REIT",下拉列表果然出现了多只 REITs 产品的代 码和名称——博时蛇口产园 REIT 180101、华安张江光大 REIT 180102……但下拉列表有长 度限制,只能显示部分产品。对人类来说,到这里可能就接受了"看不全"的现实;但 AI 有另 一条路。 AI 做出了一次关键的策略转换——从"看"网页转向监听网页与服务器之间的网络通信。 通过分析网页发送的后台请求,AI 发现巨潮资讯网有一个隐藏的数据接口(API),可以一次 性返回全部基金产品的列表。

AI 调用这个接口,用"不动产基金"作为筛选条件,成功拿到了完整的 27 只 REITs 产品 清单,每只产品包含代码、名称和机构 ID 三个核心标识。这意味着,原来需要手动翻页、逐 个查找的工作,现在一条数据请求就全部解决了。

AI 成功解析出 API 关键参数(stock 格式、plate 参数、PDF 下载 URL 模式),创建执行 计划并等待权限确认。拿到产品清单只是第一步。接下来,AI 需要搞清楚两件事:第一,如何根据产品代码查 询它的公告列表?第二,如何从公告列表中提取 PDF 文件的下载地址? AI 选取了一只代表性产品——博时蛇口产园 REIT,以它为样本进行深入探索。它先打开 这只产品的信息披露页面,像人类一样浏览页面内容,同时监听页面的网络请求。通过反复 比对请求参数和返回数据,AI 逐步拼凑出了完整的"搜索语法":公告查询需要特定的参数组 合,产品标识的格式是"代码,机构 ID"(如"180101,jjjl0000035"),必须指定板块类型为" 基金",PDF 文件的下载地址也有固定的 URL 拼接规则。

编辑:火腿肠
  • 相关标签
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至