GSMA如何运用机器学习模型预测未调查国家的移动性别差距?

在《2026年移动性别差距报告》中,GSMA消费者调查并未覆盖所有低收入和中等收入国家(LMICs)。对于未被直接调查的国家,研究团队是如何利用现有的观察数据,结合宏观经济与社会指标,构建机器学习模型来外推和预测移动设备拥有率、移动互联网普及率以及智能手机拥有率的性别差距的?具体使用了哪些算法和变量?

最佳答案 匿名用户编辑于2026/09/19 09:29

为估算未被直接调查的低收入和中等收入国家(LMIC)的移动性别差距,GSMA依赖机器学习(ML)分类器。这些分类器使用来自已有移动技术性别差距观察数据的国家进行训练。研究团队将这些观察数据与其他潜在预测移动性别差距的变量结合起来形成数据集,教导分类器识别哪些技术采用和社会经济条件与更高或更低的移动性别差距相关。训练好的分类器随后利用这些识别出的模式,对未直接调查国家的移动性别差距进行预测,并使用不同的分类器分别估计移动设备拥有率、移动互联网使用率和智能手机拥有率的性别差距。

在数据处理方面,由于部分国家和年份存在数据缺失,研究采用了MICE森林(链式方程多重插补森林)技术。该算法通过为每个存在缺失数据的变量创建决策树,并利用其他变量中观察到的模式来预测缺失值,生成多个插补数据集。为管理计算时间,研究依赖五个插补数据集,并将预测的性别差距值计算为这五个插补数据集的平均值。

用于预测的变量体系十分广泛,主要包括:联合国人类发展报告中关于女性和男性的平均受教育年限、预期年限、人类发展指数、性别不平等指数、性别发展指数及人均国民总收入;国际货币基金组织的人均GDP和购买力平价;盖洛普世界民意调查中关于互联网接入比例、移动设备拥有差距的数据;GSMA Intelligence的脸书性别差距和每用户平均收入(ARPU);以及世界银行的法律层面性别平等衡量指标和区域分组虚拟变量等。

在具体的预测算法选择上,报告依赖梯度提升回归森林来预测所有移动性别差距及相应的城乡差距。根据2023年的一项评估,该方法能够为移动设备拥有率、移动互联网普及率和智能手机拥有率性别差距提供最可靠的预测结果。此外,在认为数据可靠的情况下,模型还参考了After Access、皮尤全球态度与趋势、中国互联网络信息中心等第三方和公开可用的调查数据作为补充验证。

参考报告REPORT

全球移动通信系统协会-互联网行业:2026年移动性别差距报告.pdf

中低收入国家在数字化进程中普遍面临接入不平等问题,女性在移动设备拥有与互联网使用上的滞后已成为制约社会经济发展的关键瓶颈。全球移动通信系统协会(GSMA)发布的《2026年移动性别差距报告》方法论文件,系统性地披露了量化这一差距的底层研究框架与技术路径。调查网络与抽样标准本年度研究的核心数据源自2025年GSMA消费者调查,实地调研覆盖14个低收入和中等收入国家(LMICs),获取了超过16200名18岁及以上成年人的样本。从历史维度看,该系列调查已累计涵盖34个国家,代表了所有LMICs高达75%的成年人口。抽样过程采用目的抽样与随机抽样相结合的方法,严格按照性别、年龄、城乡分布、地区及社会...

我来回答

快速提问

海量报告支持,行业专家解读

海量文库支持,行业专家解答

  • 相关问题
  • 最新问题
用户解答榜
分享至