GPT-4的流畅性能如何?人类写作能被超越吗?
摘要生成是自然语言生成(NLG)的一项任务,其主要目的是将长篇文本压缩成简短的摘要。它可以应用于各种内容,如新闻文章、源代码和跨语言文本等
随着大模型(LLM)的出现,传统的在特定数据集上进行微调的方法已经不在适用。
我们不禁会问,LLM 在生成摘要方面效果到底如何?
为了回答这个问题,来自北京大学的研究人员在论文《Summarization is (Almost) Dead》中进行了详细的探讨。他们利用人类生成的评估数据集评估了LLM在各种摘要任务(单条新闻、多条新闻、对话、源代码和跨语言摘要)上的表现
在对LLM生成的摘要、人工撰写的摘要和微调模型生成的摘要进行定量和定性的比较后,发现LLM生成的摘要明显受到人类评估者的喜爱
在对过去3年发表在ACL、EMNLP、NAACL和COLING上的100篇与摘要方法相关的论文进行抽样和检查后,研究人员发现大约70%的论文的主要贡献是提出了一种总结摘要方法并在标准数据集上验证了其有效性。因此,该研究表示「摘要(几乎)已死(Summarization is (Almost) Dead)」
尽管如此,研究者表示该领域仍然面临一些挑战,比如需要更高质量的参考数据集和改进评估方法等问题仍需解决
论文链接:https://arxiv.org/pdf/2309.09558.pdf
方法及结果
该研究使用最新的数据来构建数据集,每个数据集由 50 个样本组成。
在执行单条新闻、多条新闻和对话摘要任务时,我们使用了与 CNN/DailyMail、Multi-News 数据集构建方法相似的方法进行模拟。对于跨语言摘要任务,我们采用了与 Zhu 等人提出的方法相同的策略。至于代码摘要任务,则采用了 Bahrami 等人提出的方法
数据集构建完成之后,接下来就是方法了。具体来说,针对单条新闻任务本文采用 BART 和 T5 ;多条新闻任务采用 Pegasus 和 BART;T5 和 BART 用于对话任务;跨语言任务使用 MT5 和 MBART ;源代码任务使用 Codet5 。
在这项实验中,研究采用了人类评估员来比较不同摘要的整体质量。根据图1的结果显示,LLM生成的摘要在所有任务中都表现出优于人工生成的摘要和微调模型生成的摘要的特点
这引发了一个问题:为什么 LLM 能够超越人类撰写的摘要,而传统上人们认为这些摘要是完美无缺的。此外,初步观察表明,LLM 生成的摘要非常流畅和连贯
本文进一步招募注释者来识别人类和 LLM 生成摘要句子中的幻觉问题,结果如表 1 所示,与 GPT-4 生成的摘要相比,人工书写的摘要表现出相同或更高数量的幻觉。在多条新闻和代码摘要等特定任务中,人工编写的摘要表现出明显较差的事实一致性。
表2显示了人工撰写的摘要和GPT-4生成摘要中出现幻觉的比例
本文还发现人工编写的参考摘要存在这样一个问题,即缺乏流畅性。如图 2 (a) 所示,人工编写的参考摘要有时存在信息不完整的缺陷。并且在图 2 (b) 中,一些由人工编写的参考摘要会出现幻觉。
本研究还发现微调模型生成的摘要通常具有固定且严格的长度,而LLM能够根据输入信息调整输出长度。此外,当输入包含多个主题时,微调模型生成的摘要对主题的覆盖率较低,如图3所示,而LLM在生成摘要时能够捕获所有主题
根据图4的结果可知,人类对大型模型的偏好分数超过50%,这表明人们对其摘要有很强的偏好,并且凸显了LLM在文本摘要方面的能力
以上是GPT-4的流畅性能如何?人类写作能被超越吗?的详细内容。更多信息请关注PHP中文网其他相关文章!

热AI工具

Undresser.AI Undress
人工智能驱动的应用程序,用于创建逼真的裸体照片

AI Clothes Remover
用于从照片中去除衣服的在线人工智能工具。

Undress AI Tool
免费脱衣服图片

Clothoff.io
AI脱衣机

AI Hentai Generator
免费生成ai无尽的。

热门文章

热工具

记事本++7.3.1
好用且免费的代码编辑器

SublimeText3汉化版
中文版,非常好用

禅工作室 13.0.1
功能强大的PHP集成开发环境

Dreamweaver CS6
视觉化网页开发工具

SublimeText3 Mac版
神级代码编辑软件(SublimeText3)

热门话题

配置Debian邮件服务器的防火墙是确保服务器安全性的重要步骤。以下是几种常用的防火墙配置方法,包括iptables和firewalld的使用。使用iptables配置防火墙安装iptables(如果尚未安装):sudoapt-getupdatesudoapt-getinstalliptables查看当前iptables规则:sudoiptables-L配置

Debian系统中的readdir函数是用于读取目录内容的系统调用,常用于C语言编程。本文将介绍如何将readdir与其他工具集成,以增强其功能。方法一:C语言程序与管道结合首先,编写一个C程序调用readdir函数并输出结果:#include#include#includeintmain(intargc,char*argv[]){DIR*dir;structdirent*entry;if(argc!=2){

在Debian系统中,readdir函数用于读取目录内容,但其返回的顺序并非预先定义的。要对目录中的文件进行排序,需要先读取所有文件,再利用qsort函数进行排序。以下代码演示了如何在Debian系统中使用readdir和qsort对目录文件进行排序:#include#include#include#include//自定义比较函数,用于qsortintcompare(constvoid*a,constvoid*b){returnstrcmp(*(

在Debian邮件服务器上安装SSL证书的步骤如下:1.安装OpenSSL工具包首先,确保你的系统上已经安装了OpenSSL工具包。如果没有安装,可以使用以下命令进行安装:sudoapt-getupdatesudoapt-getinstallopenssl2.生成私钥和证书请求接下来,使用OpenSSL生成一个2048位的RSA私钥和一个证书请求(CSR):openss

在Debian系统上使用OpenSSL进行数字签名验证,可以按照以下步骤操作:准备工作安装OpenSSL:确保你的Debian系统已经安装了OpenSSL。如果没有安装,可以使用以下命令进行安装:sudoaptupdatesudoaptinstallopenssl获取公钥:数字签名验证需要使用签名者的公钥。通常,公钥会以文件的形式提供,例如public_key.pe

在Debian系统中,OpenSSL是一个重要的库,用于加密、解密和证书管理。为了防止中间人攻击(MITM),可以采取以下措施:使用HTTPS:确保所有网络请求使用HTTPS协议,而不是HTTP。HTTPS使用TLS(传输层安全协议)加密通信数据,确保数据在传输过程中不会被窃取或篡改。验证服务器证书:在客户端手动验证服务器证书,确保其可信。可以通过URLSession的委托方法来手动验证服务器

在Debian上管理Hadoop日志,可以遵循以下步骤和最佳实践:日志聚合启用日志聚合:在yarn-site.xml文件中设置yarn.log-aggregation-enable为true,以启用日志聚合功能。配置日志保留策略:设置yarn.log-aggregation.retain-seconds来定义日志的保留时间,例如保留172800秒(2天)。指定日志存储路径:通过yarn.n

CentOS 关机命令为 shutdown,语法为 shutdown [选项] 时间 [信息]。选项包括:-h 立即停止系统;-P 关机后关电源;-r 重新启动;-t 等待时间。时间可指定为立即 (now)、分钟数 ( minutes) 或特定时间 (hh:mm)。可添加信息在系统消息中显示。
