ChatGPT在哪些方面存在劣势?

ChatGPT在哪些方面存在劣势?

最佳答案 匿名用户编辑于2023/03/10 13:29

固然 ChatGPT 在实际使用中表现惊艳,然而囿于大规模语言模型自身、 数据原因、标注策略等局限,仍主要存在以下劣势。

一、大规模语言模型自身的局限

身为大规模语言模型,ChatGPT 难免有 着 LLM 的通用局限,具体表现在以下几个方面:

1. 可信性无法保证:ChatGPT 的回复可能是在一本正经地胡说八道,语 句通畅貌似合理,但其实完全大相径庭,目前模型还不能提供合理的 证据进行可信性的验证;

2. 时效性差:ChatGPT 无法实时地融入新知识,其知识范围局限于基础 大规模语言模型使用的预训练数据时间之前,可回答的知识范围有明 显的边界;

3. 成本高昂:ChatGPT 基础大模型训练成本高、部署困难、每次调用花 费不菲、还可能有延迟问题,对工程能力有很高的要求;

4. 在特定的专业领域上表现欠佳:大规模语言模型的训练数据是通用数 据,没有领域专业数据,比如针对特定领域的专业术语翻译做的并不 好;

5. 语言模型每次的生成结果是 beam search 或者采样的产物,每次都会 有细微的不同。同样地,ChatGPT 对输入敏感,对于某个指令可能回 答不正确,但稍微替换几个词表达同样的意思重新提问,又可以回答 正确,目前还不够稳定。

二、数据原因导致的局限

 如上文所述,ChatGPT 的基础大规模语言模型 是基于现实世界的语言数据预训练而成,因为数据的偏见性,很可能生成有 害内容。虽然 ChatGPT 已采用 RLHF 的方式大大缓解了这一问题,然而 通过一些诱导,有害内容仍有可能出现。

此外,ChatGPT 为 OpenAI 部署,用户数据都为 OpenAI 所掌握,长 期大规模使用可能存在一定的数据泄漏风险。 

三、 标注策略导致的局限

 ChatGPT 通过基于人类反馈的强化学习使模型 的生成结果更符合人类预期,然而这也导致了模型的行为和偏好一定程度上反映的是标注人员的偏好,在标注人员分布不均的情况下,可能会引入新的 偏见问题。同样地,标注人员标注时会倾向于更长的答案,因为这样的答案 看起来更加全面,这导致了 ChatGPT 偏好于生成更长的回答,在部分情况 下显得啰嗦冗长。

此外,作为突围型产品,ChatGPT 确实表现优秀。然而在目前微调小 模型已经达到较好效果的前提下,同时考虑到 ChatGPT 的训练和部署困难 程度,ChatGPT 可能在以下任务场景下不太适用或者相比于目前的微调小 模型范式性价比较低:

1. ChatGPT 的通用性很强,对多种自然语言处理任务都有处理能力。然 而针对特定的序列标注等传统自然语言理解任务,考虑到部署成本和 特定任务的准确性,在 NLU 任务不需要大规模语言模型的生成能力, 也不需要更多额外知识的前提下,如果拥有足够数据进行微调,微调 小模型可能仍是更佳的方案;

2. 在一些不需要大规模语言模型中额外知识的任务上,例如机器阅读理 解,回答问题所需的知识已经都存在于上下文中;

3. 由于除英语之外的其它语言在预训练语料库中占比很少,因此翻译目 标非英文的机器翻译任务和多语言任务在追求准确的前提下可能并不 适用;

4. 大规模语言模型的现实世界先验知识太强,很难被提示覆盖,这导致 我们很难纠正 ChatGPT 的事实性错误,使其使用场景受限;

5. 对于常识、符号和逻辑推理问题,ChatGPT 更倾向于生成“不确定” 的回复,避免直接面对问题正面回答。在追求唯一性答案的情况下可 能并不适用;

6. ChatGPT 目前还只能处理文本数据,在多模态任务上还无法处理。 表 1.2 列举了一些 ChatGPT 存在的以上不足的示例(2023 年 2 月 24 日测试)。

参考报告REPORT

哈尔滨工业大学-ChatGPT调研报告.pdf

哈尔滨工业大学-ChatGPT调研报告。2022年11月30日,OpenAI推出全新的对话式通用人工智能工具——ChatGPT。ChatGPT表现出了非常惊艳的语言理解、生成、知识推理能力,它可以很好地理解用户意图,做到有效的多轮沟通,并且回答内容完整、重点清晰、有概括、有逻辑、有条理。ChatGPT上线后,5天活跃用户数高达100万,2个月活跃用户数已达1个亿,成为历史上增长最快的消费者应用程序。除了被广大用户追捧外,ChatGPT还受到了各国政府、企业界、学术界的广泛关注,使人们看到了解决自然语言处理这一认知智能核心问题的一条可能的路径,并被认为向通用人工智能迈出了...

我来回答

快速提问

海量报告支持,行业专家解读

海量文库支持,行业专家解答

用户解答榜
分享至