GPT-4王者加冕！读图做题性能炸天，凭自己就能考上斯坦福-人工智能-PHP中文网

考试几乎满分，性能跃迁炸天

读图做题小case，甚至比网友还懂梗

梗图识别" >梗图识别

图表分析" >图表分析

做物理题" >做物理题

训练过程

首页

科技周边

人工智能

GPT-4王者加冕！读图做题性能炸天，凭自己就能考上斯坦福

WBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWB

Apr 11, 2023 pm 07:58 PM

ai gpt

果然，能打败昨天的OpenAI的，只有今天的OpenAI。

刚刚，OpenAI震撼发布了大型多模态模型GPT-4，支持图像和文本的输入，并生成文本结果。

号称史上最先进的AI系统！

GPT-4不仅有了眼睛可以看懂图片，而且在各大考试包括GRE几乎取得了满分成绩，横扫各种benchmark，性能指标爆棚。

OpenAI 花了 6 个月的时间使用对抗性测试程序和 ChatGPT 的经验教训对 GPT-4 进行迭代调整，从而在真实性、可控性等方面取得了有史以来最好的结果。

大家都还记得，2月初时微软和谷歌鏖战三天，2月8日微软发布ChatGPT必应时，说法是必应「基于类ChatGPT技术」。

今天，谜底终于解开了——它背后的大模型，就是GPT-4！

图灵奖三巨头之一Geoffrey Hinton对此赞叹不已，「毛虫吸取了营养之后，就会化茧为蝶。而人类提取了数十亿个理解的金块，GPT-4，就是人类的蝴蝶。」

顺便提一句，ChatGPT Plus用户现在可以先上手了。

考试几乎满分，性能跃迁炸天

在随意谈话中，GPT-3.5和GPT-4之间的区别是很微妙的。只有当任务的复杂性达到足够的阈值时，差异就出现了，GPT-4比GPT-3.5 更可靠、更有创意，并且能够处理更细微的指令。

为了了解这两种模型之间的差异，OpenAI在各种基准测试和一些为人类设计的模拟考试上进行了测试。

GPT-4在各种考试中，有几个测试几乎接近了满分：

USABO Semifinal 2020（美国生物奥林匹克竞赛）
GRE Writing

以美国 BAR律师执照统考为例，GPT3.5可以达到 10%水平，GPT4可以达到90%水平。生物奥林匹克竞赛从GPT3.5的31%水平，直接飙升到 99%水平。

此外，OpenAI 还在为机器学习模型设计的传统基准上评估了 GPT-4。从实验结果来看，GPT-4 大大优于现有的大型语言模型，以及大多数 SOTA 模型：

另外，GPT-4在不同语种上的能力表现：中文的准确度大概在 80% 左右，已经要优于GPT-3.5的英文表现了。

许多现有的 ML 基准测试都是用英语编写的。为了初步了解GPT-4其他语言的能力，研究人员使用 Azure翻译将 MMLU 基准（一套涵盖57个主题的14000个多项选择题）翻译成多种语言。

在测试的 26 种语言的 24 种中，GPT-4 优于 GPT-3.5 和其他大语言模型（Chinchilla、PaLM）的英语语言性能：

OpenAI表示在内部使用 GPT-4，因此也关注大型语言模型在内容生成、销售和编程等方面的应用效果。另外，内部人员还使用它来帮助人类评估人工智能输出。

对此，李飞飞高徒、英伟达AI科学家Jim Fan点评道：「GPT-4最强的其实就是推理能力。它在GRE、SAT、法学院考试上的得分，几乎和人类考生没有区别。也就是说，GPT-4可以全靠自己考进斯坦福了。」

（Jim Fan自己就是斯坦福毕业的！）

网友：完了，GPT-4一发布，就不需要我们人类了……

读图做题小case，甚至比网友还懂梗

GPT-4此次升级的亮点，当然就是多模态。

GPT-4不仅能分析汇总图文图标，甚至还能读懂梗图，解释梗在哪里，为什么好笑。从这个意义上说，它甚至能秒杀许多人类。

OpenAI称，GPT-4比以往模型都更具创造力和协作性。它可以生成、编辑和迭代用户进行创意和技术写作任务，例如创作歌曲、编写剧本或学习用户的写作风格。

GPT-4可以将图像作为输入，并生成标题、分类和分析。比如给它一张食材图，问它用这些食材能做什么。

另外，GPT-4能够处理超过25,000字的文本，允许用长形式的内容创建、扩展会话、文档搜索和分析。

GPT-4在其先进的推理能力方面超过了ChatGPT。如下：

梗图识别

比如，给它看一张奇怪的梗图，然后问图中搞笑在哪里。

GPT-4拿到之后，会先分析一波图片的内容，然后给出答案。

比如，逐图分析下面这个。

GPT-4立马反应过来：图里的这个「Lighting充电线」，看起来就是个又大又过气的VGA接口，插在这个又小又现代的智能手机上，反差强烈。

再给出这么一个梗图，问问GPT-4梗在哪里？

它流利地回答说：这个梗搞笑的地方在于「图文不符」。

文字明明说是从太空拍摄的地球照片，然而，图里实际上只是一堆排列起来像地图的鸡块。

GPT-4还能看懂漫画：为什么要给神经网络加层数？

它一针见血地点出，这副漫画讽刺了统计学习和神经网络在提高模型性能方法上的差异。

图表分析

格鲁吉亚和西亚的平均每日肉类消费量总和是多少？在给出答案前，请提供循序渐进的推理。

果然，GPT-4清楚地列出了自己的解题步骤——

1. 确定格鲁吉亚的平均每日肉类消费量。

2. 确定西亚的平均每日肉类消费量。

3. 添加步骤1和2中的值。

做物理题

要求GPT-4解出巴黎综合理工的一道物理题，测辐射热计的辐射检测原理。值得注意的是，这还是一道法语题。

GPT-4开始解题：要回答问题 I.1.a，我们需要每个点的温度 T(x)，用导电棒的横坐标x表示。

随后解题过程全程高能。

你以为这就是GPT-4能力的全部？

老板Greg Brockman直接上线进行了演示，通过这个视频你可以很直观的感受到 GPT-4的能力。

最惊艳的是，GPT-4对代码的超强的理解能力，帮你生成代码。

Greg直接在纸上画了一个潦草的示意图，拍个照，发给 GPT说，给我按照这个布局写网页代码，就写出来了。

另外，如果运行出错了把错误信息，甚至错误信息截图，扔给GPT-4都能帮你给出相应的提示。

网友直呼：GPT-4发布会，手把手教你怎么取代程序员。

顺便提一句，用GPT-4还可以进行报税。要知道，每年美国人要花好多时间金钱在报税上面。

训练过程

和以前的GPT模型一样，GPT-4基础模型的训练使用的是公开的互联网数据以及OpenAI授权的数据，目的是为了预测文档中的下一个词。

这些数据是一个基于互联网的语料库，其中包括对数学问题的正确/错误的解决方案，薄弱/强大的推理，自相矛盾/一致的声明，足以代表了大量的意识形态和想法。

当用户给出提示进行提问时，基础模型可以做出各种各样的反应，然而答案可能与用户的意图相差甚远。

因此，为了使其与用户的意图保持一致，OpenAI使用基于人类反馈的强化学习（RLHF）对模型的行为进行了微调。

不过，模型的能力似乎主要来自于预训练过程，RLHF并不能提高考试成绩（如果不主动进行强化，它实际上会降低考试成绩）。

基础模型需要提示工程，才能知道它应该回答问题，所以说，对模型的引导主要来自于训练后的过程。

GPT-4模型的一大重点是建立了一个可预测扩展的深度学习栈。因为对于像GPT-4这样的大型训练，进行广泛的特定模型调整是不可行的。

因此，OpenAI团队开发了基础设施和优化，在多种规模下都有可预测的行为。

为了验证这种可扩展性，研究人员提前准确地预测了GPT-4在内部代码库（不属于训练集）上的最终损失，方法是通过使用相同的方法训练的模型进行推断，但使用的计算量为1/10000。

现在，OpenAI 可以准确地预测在训练过程中优化的指标损失。例如从计算量为1/1000的模型中推断并成功地预测了HumanEval数据集的一个子集的通过率：

还有些能力仍然难以预测。比如，Inverse Scaling竞赛旨在找到一个随着模型计算量的增加而变得更糟的指标，而 hindsight neglect任务是获胜者之一。但是GPT-4 扭转了这一趋势：

OpenAI认为能够准确预测未来的机器学习能力对于技术安全来说至关重要，但它并没有得到足够的重视。

而现在，OpenAI正在投入更多精力开发相关方法，并呼吁业界共同努力。

贡献名单

就在GPT-4发布的同时，Open AI还公开了GPT-4这份组织架构及人员清单。

上下滑动查看全部

北大陈宝权教授称，

再好看的电影，最后的演职员名单也不会有人从头看到尾。Open AI的这台戏连这个也不走寻常路。毫无疑问这将是一份不仅最被人阅读，也被人仔细研究的「演职员」(贡献者) 名单，而最大的看头，是详细的贡献分类，几乎就是一个粗略的部门设置架构了。

这个很「大胆」的公开其实意义挺深远的，体现了Open AI背后的核心理念，也一定程度预示了未来进步的走向。

以上是GPT-4王者加冕！读图做题性能炸天，凭自己就能考上斯坦福的详细内容。更多信息请关注PHP中文网其他相关文章！

本站声明

本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn

热AI工具

热工具

热门话题

gmail邮箱登陆入口在哪里

7696

Java教程

1640

CakePHP 教程

1393

Laravel 教程

1287

PHP教程

1229

显示更多

Related knowledge

跨链交易什么意思？跨链交易所有哪些？ Apr 21, 2025 pm 11:39 PM

支持跨链交易的交易所有：1. Binance，2. Uniswap，3. SushiSwap，4. Curve Finance，5. Thorchain，6. 1inch Exchange，7. DLN Trade，这些平台通过各种技术支持多链资产交易。

web3交易平台排行榜_web3全球交易所前十名汇总 Apr 21, 2025 am 10:45 AM

币安是全球数字资产交易生态的霸主，其特点包括：1. 日均交易量突破$1500亿，支持500 交易对，覆盖98%主流币种；2. 创新矩阵涵盖衍生品市场、Web3布局和教育体系；3. 技术优势为毫秒级撮合引擎，峰值处理量达140万笔/秒；4. 合规进展持有15国牌照，并在欧美设立合规实体。

WorldCoin（WLD）价格预测2025-2031：到2031年WLD会达到4美元吗？ Apr 21, 2025 pm 02:42 PM

WorldCoin(WLD)凭借其独特的生物识别验证和隐私保护机制，在加密货币市场中脱颖而出，吸引了众多投资者的目光。 WLD凭借其创新技术，特别是结合OpenAI人工智能技术，在众多山寨币中表现突出。但未来几年，数字资产的走势如何呢？让我们一起预测WLD的未来价格。 2025年WLD价格预测预计2025年WLD将实现显着增长。市场分析显示，WLD平均价格可能达到1.31美元，最高可能触及1.36美元。然而，在熊市情况下，价格可能跌至0.55美元左右。这一增长预期主要源于WorldCoin2.

对于加密货币行业来说，'黑色星期一抛售”是艰难的一天 Apr 21, 2025 pm 02:48 PM

加密货币市场暴跌引发投资者恐慌，Dogecoin(Doge)成为重灾区之一。其价格大幅下挫，去中心化金融(DeFi)总价值锁定(TVL)也出现显着下降。 “黑色星期一”的抛售潮席卷加密货币市场，Dogecoin首当其冲。其DeFiTVL跌至2023年水平，币价在过去一个月内下跌23.78%。 Dogecoin的DeFiTVL降至272万美元的低点，主要原因是SOSO价值指数下跌26.37%。其他主要DeFi平台，如无聊的Dao和Thorchain，TVL也分别下降了24.04%和20.

币圈杠杆交易所排名币圈十大杠杆交易所APP最新推荐 Apr 21, 2025 pm 11:24 PM

2025年在杠杆交易、安全性和用户体验方面表现突出的平台有：1. OKX，适合高频交易者，提供最高100倍杠杆；2. Binance，适用于全球多币种交易者，提供125倍高杠杆；3. Gate.io，适合衍生品专业玩家，提供100倍杠杆；4. Bitget，适用于新手及社交化交易者，提供最高100倍杠杆；5. Kraken，适合稳健型投资者，提供5倍杠杆；6. Bybit，适用于山寨币探索者，提供20倍杠杆；7. KuCoin，适合低成本交易者，提供10倍杠杆；8. Bitfinex，适合资深玩

虚拟币价格上涨或者下降是为什么虚拟币价格上涨或者下降的原因 Apr 21, 2025 am 08:57 AM

虚拟币价格上涨因素包括：1.市场需求增加，2.供应量减少，3.利好消息刺激，4.市场情绪乐观，5.宏观经济环境；下降因素包括：1.市场需求减少，2.供应量增加，3.利空消息打击，4.市场情绪悲观，5.宏观经济环境。

如何在币安拿下 KERNEL 空投奖励全流程攻略 Apr 21, 2025 pm 01:03 PM

在加密货币的繁华世界里，新机遇总是不断涌现。当下，KernelDAO (KERNEL) 空投活动正备受瞩目，吸引着众多投资者的目光。那么，这个项目究竟是什么来头？BNB Holder 又能从中获得怎样的好处？别急，下面将为你一一揭晓。

Aavenomics是修改AAVE协议令牌并介绍令牌回购的建议，已达到法定人数 Apr 21, 2025 pm 06:24 PM

Aavenomics是修改AAVE协议令牌并引入令牌回购的提议，已为AAVEDAO实现了一个法定人数。AAVE连锁计划（ACI）创始人马克·泽勒（MarcZeller）在X上宣布了这一点，并指出它标志着该协议的新时代。AAVE连锁倡议（ACI）创始人MarcZeller在X上宣布，Aavenomics提案包括修改AAVE协议令牌和引入令牌回购，已为AAVEDAO实现了法定人数。根据Zeller的说法，这标志着该协议的新时代。AaveDao成员以压倒性的投票支持该提议，即在周三以每周100

See all articles

GPT-4王者加冕！读图做题性能炸天，凭自己就能考上斯坦福

考试几乎满分，性能跃迁炸天

读图做题小case，甚至比网友还懂梗

梗图识别

图表分析

做物理题

训练过程

热AI工具

Undresser.AI Undress

AI Clothes Remover

Undress AI Tool

Clothoff.io

Video Face Swap

热门文章

热工具

记事本++7.3.1

SublimeText3汉化版

禅工作室 13.0.1

Dreamweaver CS6

SublimeText3 Mac版

热门话题