小样本学习定义、历史演进及方法研究介绍

小样本学习定义、历史演进及方法研究介绍

最佳答案 匿名用户编辑于2024/01/11 16:47

什么是小样本学习?

首先来看机器学习的定义,根据香港科技大学和第四范式的研究人员在 2020 年 发布的一篇论文,机器学习的定义是:一个计算机程序可以从经验 E 中学习一些类 别的任务 T 以及由 P 来度量性能,通过度量 P 的任务 T 上来提高 E。进一步,小样 本学习的定义:是指一种机器学习方法(由 E、T 和 P 规定),其中 E 只包含带有监 督信息的有限样例,而 T 是新的目标生成任务。简单来说就是,一个任务(T)是在 仅有少量样本的情况下生成一个新特征样本,计算机程序使用 E 进行学习,E 包含 带有监督信息和预训练概念,比如部分先验经验。这个新生成的特征样本以视觉图 灵测试(P)的通过率进行评估辨别图像是由人类还是机器生成的,以此判断小样 本学习的拟人化特征的准确性。简单来说,小样本学习其实就是研究如何用较少的 样本数据训练出一个性能较好的模型的方法论集合,是一种研究方向,广义上包括 多种学习方法。

人类可以将其他领域所积累的知识应用到对新领域理解的过程中,在很少的样 本中获得某个新领域的知识,这个过程比起机器学习需要依赖成千上万的数据作为 训练数据来说快捷很多(当然如果完全从零开始学习一个新知识,学习速度也是缓 慢的)。小样本学习与人类学习新领域的方式相当接近。它细分了很多种方法,但 都是通过对其他各个领域知识的积累,在新的领域中寻找与所积累的知识的共性, 从而快速的对新领域知识进行学习。

机器学习就是从数据中学习,从而使完成任务的表现越来越好。小样本学习是 具有有限监督数据的机器学习。类似的,其他的机器学习定义也都是在机器学习定 义的基础上加上不同的限制条件衍生出来。例如,弱监督学习是强调在不完整、不 准确、有噪声、数量少的数据上学习;又比如半监督学习是强调在少量标注数据和 大量非标注数据上学习,迁移学习是把充足数据上学习的知识迁移到数据匮乏的任 务上。

总结来说,小样本学习本质上其实也是在追求未来的通用 AGI。目前,机器学 习是建立在统计相关性之上,需要大量数据才能学习到较为可靠的模型。人类的小 样本辨别属性来源于认知,小样本学习也许可以从根本入手,包括数据的结构性& 非结构性、逻辑的因果性、视觉的不变性等。理想的学习,是希望能够降低模型的 期望风险。也就是在未来不管有什么样的样本,都能够很好的预测出来。但模型的 联合分布,一般是未知的,所以需要预测估算。在机器学习里面一般是优化经验风 险,但公式里面的经验风险是通过训练集里面有多少样本来获得的,如果训练样本 只有很少的标注数据,经验值 E 将很小,最终得出的结论可能相当不可靠。最小化 的风险经验估值是小样本学习的难点,需要探索各种小样本学习算法加以解决,真 正的类人小样本学习能力,还需依靠整个 AI 领域的根本性突破。

根据一篇名为“Learning from Very Few Samples: A Survey”的论文(作者:Jiang Lu, Pinghua Gong, Jieping Ye, Fellow, IEEE, Jianwei Zhang, Member, IEEE 和 Changshui Zhang, Fellow, IEEE),我们对小样本学习的演进过程进行总结。 机器学习的一般机制是使用在先前准备的训练样本上学习的统计模型对未来数 据进行预测。在大多数情况下,模型的泛化能力由足够数量的训练样本保证。然 而,在许多现实应用中,由于只允许访问很少的可训练数据,比如识别几种不常见 的动物,而由于它们的稀有性,可能只有几张带注释的图片。这些需要从很少的例 子中学习的问题首先引起了 E.G.Miller 等人的注意。2000 年,他假设了数字变换的 共享密度,并提出了一种聚类算法,使测试数字图像与特定类别的聚类数字图像相 一致。此后,越来越多的人开始致力于 FSL 的研究。

FSL 研究的发展过程大致可分为两个阶段,非深度阶段(2000 年至 2015 年)和 深度阶段(2015 年至现在)。分水岭是 G.Koch 等人在 2015 年引入深度学习和 FSL 问题的首次结合。在此之前,针对 FSL 问题提出的所有解决方案都是基于非深度学 习方法。大多数著名的早期非深层 FSL 方法都基于生成模型,寻求在给定监督(比 如一个类)的情况下估计联合分布 P(X;Y)或条件分布 P(XjY),在相当少的观 察训练样本上,从贝叶斯决策的角度对测试样本进行预测。基于生成模型的 FSL 方 法中的几个里程碑,包括 E.G.Miller 等人的聚类算法,L.Fei Fei 等人的变分贝叶斯框 架(VBF)以及 B.M.Lake 等人的贝叶斯程序学习(BPL)。聚类算法是研究如何从很 少的样本中学习的最早创始人;VBF 是阐明“one-shot learning”这一术语的第一个论 文;而 BPL 则是利用人类的合成能力,概念认知中的因果关系和想象。在非深度阶 段,FSL 研究进展缓慢。

随着深度学习的蓬勃发展,特别是 CNN(卷积神经网络)在视觉任务上取得的 巨大成功,许多 FSL 研究者开始将目光从非深度模型转向深度模型。2015 年, G.Koch 等人率先将深度学习纳入 FSL 问题的解决方案中,提出了基于孪生卷积网络 CNN(Siamese CNN),对成对的样例进行无相关类别的相似性度量学习(Metric learning),这标志着 FSL 新时代的开始,即深度阶段。之后,FSL 方法充分利用了 深度神经网络在特征表示和端到端模型优化方面的优势,从各个不同角度解决 FSL 问题,包括数据增强、度量学习和元学习等,将 FSL 研究推向快速发展的新时期。 在深度阶段尽管也提出过一些基于生成模型的方法,比如神经统计学和顺序生成模 型,但基于分类模型的 FSL 方法主导了 FSL 研究的发展。

近年来,涌现了大量基于元 学习的 FSL 方法,如 O.Vinyals 等人的匹配网络、C.Finn 等人的 MAML、S.Ravi 和 H.Larochelle 的元学习 LSTM、a.Santoro 等人的 MANN、T.Munkhdalai 和 H.Yu 的 MetaNet、J.Snell 等人的原型网、F.Song 和 H.Li 等人的 LGM Nets 等等,元学习策略 已成为 FSL 的主流。在这个时期,各种先进的 FSL 方法已被直接应用或改进,以解决 计算机视觉、自然语言处理、音频和语音、数据分析、机器人等领域的各种应用, 而广义 FSL 和多模态 FSL 也已经出现。

根据一篇 2022 年 5 月发表的名为“A Comprehensive Survey of Few-shot Learning: Evolution, Applications, Challenges, and Opportunities” 的论文 (以下简称 “A Comprehensive Survey”)(作者:Yisheng Song, Ting Wang, Subrota K Mondal, Jyoti Prakash Sahoo),FSL 学习方法可大致分为单模态学习和多模态学习学习,单模态学 习可以进一步分为数据增强、迁移学习和元学习,主要侧重于将有限的信息转换为 更高级别的功能向量或元知识。多模式学习更接近人类智能的真实世界,依靠有限 的样本,实现跨域智能识别。

FSL 的关键在于样本有限不能反映实际的数据分布,需要生成基于特定概率模 型的附加数据或者使用来自扩展数据的大量未标记数据来扩展辅助数据集。现有的 工作重点是探索特征差异和特征提取,并通过人工制定的规则或自动学习的数据处 理方式来实现 FSL 学习过程。整体分类法以金字塔的形式呈现,底层代表了“云-边缘 -终端”的边缘计算场景,在此基础上,根据所需知识的整合程度,将 FSL 分为四个层 次。

数据增强:在实际的 FSL 任务中,支持和查询数据集通常由于隐私、收集成本和标签成本 而受到限制。为了解决这个问题,数据增强被认为是最直接的方法,以增加 FSL 中 的样本丰富度。然而,FSL 数据增强的核心问题是增强的数据集如何评估真实数据 的分布。基于数据增强技术是否可以重复用于其他任务中。FSL 数据增强可分为人 工制定规则和自动学习数据处理。

迁移学习:是为特定的问题构建了数据到标签的映射,同样是为了解决 FSL 中只 有少数甚至没有标记样本的问题。通过特征重用来解决 FSL 数据缺失问题是迁移学 习的核心思想。基本原理是在广泛的数据集上进行预训练,然后在有限的支持集上 进行微调。当源域和目标域存在较大差距时,知识转移的效率比较低,这种跨域设 置为 FSL 带来了新的挑战。在 FSL 中,迁移学习可以大致分为预训练阶段和微调阶 段,被称为基线阶段(base-line)。

元学习:是推导出独立于特定问题的任务到目标的模型映射。元学习从数据和任 务的双重采样中学习历史先验知识,然后提取元知识以应用于未来的任务。元学习 独立于特定的问题,在任务空间中探索最优的初始化参数,抛弃了传统监督学习下 与任务无关的特征表达。到目前为止,大多数元学习模型都采用传统梯度下降的参 数进行更新。当然,也有基于强化学习和度量方法的非梯度下降方法。在 FSL 中, 元学习可以用于自动化模型参数学习、度量函数和信息传递。

信息传递学习:研究证明,图神经网络(GNNs)近年来在基于关系的任务上表现良好,其基于 类的信息传输可以很好地帮助 FSL 学习识别新的类,同时避免这些类被专有特性所 主导。早期的图神经网络通过在支持集和查询集之间创建完整的连接来模拟不同节 点之间的权值的传播。节点可以用编码或嵌入向量来表示,节点之间可以通过边界 来连接。考虑到图神经网络算法的复杂性,目前大多数图神经网络的层数都较浅。 为了更好地适应 FSL,图神经网络用节点和边界被单独设计。

多模态学习:多模态是指不同类型的数据资源,比如文字、影像、音讯、影片等。在过去, AI 模型几乎只能处理单一模态任务,比如只限于文字或视觉。但 2021 年出现不少多 模态 AI 成果,比如 OpenAI 发表的 CLIP 和 DALL·E 模型,能同时处理文字和影像,靠 输入文字就能产生图片;还有 DeepMind 的 Perceiver IO。虽然这些新的多模态系统 大多处于实验阶段,但也已经在实际应用中取得突破。例如开源社区将 CLIP 与生成 对抗网络(GAN)相结合,开发数字艺术作品。艺术家 Martin O’Leary 使用 Samuel Coleridge 的史诗作品《忽必烈大汗》为输入,生成了充满迷幻色彩的“Sinuous Rills”。谷歌也表示,将为其搜索引擎添加多模态功能,它的多任务统一模型可以处 理文本、音频、图像和视频内容,用户可以通过 75 种语言中的任何一种语言使用。

到目前为止,FSL 在单模领域已取得重大进展。在单模态学习中,模型主要负 责将信息表示为特征向量,可以由计算机处理或进一步抽象为更高层次的语义向 量。FSL 中的多模态学习是指通过利用多种模态之间的互补性和消除模态之间的冗 余来学习更好的特征表达。通过融合多模态信息,可以提高模型对小样本数据的感 知能力。

FSL与AutoML的结合:AutoML 是一套主动学习算法框架,通过主动学习(Active Learning)技术,改 变了监督学习的被动接受人工标注样本的模式。在传统 AI 算法开发流程中,从业务 和问题定义,到数据采集和标注、存储管理、数据分析和可视化,再到模型结构设 计、优化、最后到应用开发,流程复杂,且成本较高。涵盖算法研发全流程的 AutoML 可以从特征工程、模型构建、超参选择,优化方法四方面实现自动化,其优 势在于:可减少算法生产成本,提高效率,并降低了算法生产门槛。在业界,已经 有许多较为成熟的 AutoML 平台,国外如 FeatureLab(自动特征工程)、Google Cloud Vertex AI NAS;国内则有第四范式的 AI Prophet AutoML 等,包括创新奇智的 Orion 平台也涵盖了 AutoML 功能。

小样本学习是为了解决碎片化场景无法获取大量数据训练模型的问题,而 AutoML 是在传统算法模式下,通过主动学习来提高算法生产效率,解放人力成本。 换句话说,小样本学习解决小数据智能分析问题,AutoML 则是提高算法生产效率的 方法,两者互相结合,通过“特征提取+自动标注”的 FSL+AutoML 可有效实现小样 本、低成本和算法精度之间的平衡,改变了以往的算法生产模式,将算法生产带入 平民化和低成本时代。

我来回答
分享至