Karpathy新教程爆火，网友抢着送他H100：从头复现GPT-2训练-人工智能-PHP中文网

90分钟复现GPT-2

大神也不是那么卷

首页

科技周边

人工智能

Karpathy新教程爆火，网友抢着送他H100：从头复现GPT-2训练

WBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWB

Jun 07, 2024 am 10:29 AM

人工智能 karpathy GPT-2

大神Karpathy已经不满足于用C语言造Llama了！

他给自己的最新挑战：复现OpenAI经典成果，从基础版GPT-2开始。

挑战成功本身并不意外，但是只花费20美元、90分钟完成训练，Loss和评测还超越原版，就！有！点！过！分！了！。

Karpathy新教程爆火，网友抢着送他H100：从头复现GPT-2训练

不仅如此，他把复现过程写成了完整教程，果不其然再次火爆。

Karpathy新教程爆火，网友抢着送他H100：从头复现GPT-2训练

由于Karpathy自己租用的是A100云服务，训练124M版本花费20了美元。

不过有人按照教程用H100跑了一把，不仅训练时间更短，还更省钱了：43分钟完成，只花14美元。

Karpathy新教程爆火，网友抢着送他H100：从头复现GPT-2训练

另外Karpathy还自掏腰包200美元，为大家复现了350M版本的GPT-2。

但1.5B大杯版，照计算要花1周时间和2500美元，有点玩不起了，主要他手里也没有H100。

Karpathy新教程爆火，网友抢着送他H100：从头复现GPT-2训练

还好各路卡壕非常仗义，该出手时就出手：

有需要随时给你用！

Karpathy新教程爆火，网友抢着送他H100：从头复现GPT-2训练

只收你2美元一小时！

Karpathy新教程爆火，网友抢着送他H100：从头复现GPT-2训练

90分钟复现GPT-2

这次Karpathy复现GPT-2，还是基于他的llama.c代码库，端到端完成训练。

代码库这些日子被他不断完善，现在启动训练非常简单：

Karpathy新教程爆火，网友抢着送他H100：从头复现GPT-2训练

具体来说，网络结构是GPT-2，但许多超参数设置遵循了GPT-3的那一套。

Karpathy分析，按照Chinchilla定律的标准，GPT-2在100B tokens上训练应该属于过度训练了，后面收益递减，124M模型按计算2.5Btokens就够。

不过他自己训练了10B tokens，训练数据也用刚刚发布不久FineWeb，比起OpenAI原版WebText数据集token质量更高。

原版WebText从未公开，无法在控制变量在相同条件下实验，另外今天的互联网数据分布，也可能与5年前大不相同了。

据推测，评测分数比原版更高的原因可能就在这些差别了。

Karpathy新教程爆火，网友抢着送他H100：从头复现GPT-2训练

另外有网友注意到，训练时的GPU利用效率也比OpenAI的工作高，不过Karpathy表示主要是由于用了单个云服务节点，不需要考虑服务器间通信问题。

Karpathy新教程爆火，网友抢着送他H100：从头复现GPT-2训练

最后，对于已训练完的350M版本GPT-2，同样取得了超越原版的成绩。

Karpathy新教程爆火，网友抢着送他H100：从头复现GPT-2训练

掌声响起来～

大神也不是那么卷

自今年二月份再次从OpenAI辞职之后，Karpathy已经用C语言搞出不少大模型成果，从Llama到GPT玩了一遍。

观察他的GitHub热力图，只有刚开始休息了一段时间，进入4月以后就越来越卷了。

Karpathy新教程爆火，网友抢着送他H100：从头复现GPT-2训练

这是辞职在家还要997的节奏？

其实Karpathy这段时间也旅游过，也分享过在打的游戏，并没那么卷。

Karpathy新教程爆火，网友抢着送他H100：从头复现GPT-2训练

根据他晒出的一周时间表：在职时975，离职后工作4-20小时不等，看心情。

周一工作4小时，
周二工作14小时到晚上11点
周三失眠了，4点爬起来写代码，到中午崩溃
周四干了20小时
周五休息
周六12小时
周日4小时
然后出去旅游两周。

Karpathy新教程爆火，网友抢着送他H100：从头复现GPT-2训练

大家看到这里也比较好奇，是规律的安排感觉更好，还是随心所欲能有奇效呢？

Karpathy自己也不确定，不过混乱的日程安排肯定更有趣。

Karpathy新教程爆火，网友抢着送他H100：从头复现GPT-2训练

最后他还分享了一条自由职业心得：

起床后直接开始工作，不看任何消息，吃完午饭再上网，避免外界信息分散注意力。

Karpathy新教程爆火，网友抢着送他H100：从头复现GPT-2训练

有条件的朋友可以试试了。

教程：https://github.com/karpathy/llm.c/discussions/481。

参考链接：
[1]https://x.com/karpathy/status/1795484547267834137。
[2]https://www.threads.net/@karpathy。

以上是Karpathy新教程爆火，网友抢着送他H100：从头复现GPT-2训练的详细内容。更多信息请关注PHP中文网其他相关文章！

本站声明

本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn

热AI工具

热工具

热门话题

Java教程

1675

CakePHP 教程

1429

Laravel 教程

1333

PHP教程

1278

C# 教程

1257

显示更多

Related knowledge

字节跳动剪映推出 SVIP 超级会员：连续包年 499 元，提供多种 AI 功能 Jun 28, 2024 am 03:51 AM

本站6月27日消息，剪映是由字节跳动旗下脸萌科技开发的一款视频剪辑软件，依托于抖音平台且基本面向该平台用户制作短视频内容，并兼容iOS、安卓、Windows、MacOS等操作系统。剪映官方宣布会员体系升级，推出全新SVIP，包含多种AI黑科技，例如智能翻译、智能划重点、智能包装、数字人合成等。价格方面，剪映SVIP月费79元，年费599元（本站注：折合每月49.9元），连续包月则为59元每月，连续包年为499元每年（折合每月41.6元）。此外，剪映官方还表示，为提升用户体验，向已订阅了原版VIP

使用Rag和Sem-Rag提供上下文增强AI编码助手 Jun 10, 2024 am 11:08 AM

通过将检索增强生成和语义记忆纳入AI编码助手，提升开发人员的生产力、效率和准确性。译自EnhancingAICodingAssistantswithContextUsingRAGandSEM-RAG，作者JanakiramMSV。虽然基本AI编程助手自然有帮助，但由于依赖对软件语言和编写软件最常见模式的总体理解，因此常常无法提供最相关和正确的代码建议。这些编码助手生成的代码适合解决他们负责解决的问题，但通常不符合各个团队的编码标准、惯例和风格。这通常会导致需要修改或完善其建议，以便将代码接受到应

微调真的能让LLM学到新东西吗:引入新知识可能让模型产生更多的幻觉 Jun 11, 2024 pm 03:57 PM

大型语言模型（LLM）是在巨大的文本数据库上训练的，在那里它们获得了大量的实际知识。这些知识嵌入到它们的参数中，然后可以在需要时使用。这些模型的知识在训练结束时被“具体化”。在预训练结束时，模型实际上停止学习。对模型进行对齐或进行指令调优，让模型学习如何充分利用这些知识，以及如何更自然地响应用户的问题。但是有时模型知识是不够的，尽管模型可以通过RAG访问外部内容，但通过微调使用模型适应新的领域被认为是有益的。这种微调是使用人工标注者或其他llm创建的输入进行的，模型会遇到额外的实际知识并将其整合

七个很酷的GenAI & LLM技术性面试问题 Jun 07, 2024 am 10:06 AM

想了解更多AIGC的内容，请访问：51CTOAI.x社区https://www.51cto.com/aigc/译者|晶颜审校|重楼不同于互联网上随处可见的传统问题库，这些问题需要跳出常规思维。大语言模型（LLM）在数据科学、生成式人工智能（GenAI）和人工智能领域越来越重要。这些复杂的算法提升了人类的技能，并在诸多行业中推动了效率和创新性的提升，成为企业保持竞争力的关键。LLM的应用范围非常广泛，它可以用于自然语言处理、文本生成、语音识别和推荐系统等领域。通过学习大量的数据，LLM能够生成文本

你所不知道的机器学习五大学派 Jun 05, 2024 pm 08:51 PM

机器学习是人工智能的重要分支，它赋予计算机从数据中学习的能力，并能够在无需明确编程的情况下改进自身能力。机器学习在各个领域都有着广泛的应用，从图像识别和自然语言处理到推荐系统和欺诈检测，它正在改变我们的生活方式。机器学习领域存在着多种不同的方法和理论，其中最具影响力的五种方法被称为“机器学习五大派”。这五大派分别为符号派、联结派、进化派、贝叶斯派和类推学派。1.符号学派符号学（Symbolism），又称为符号主义，强调利用符号进行逻辑推理和表达知识。该学派认为学习是一种逆向演绎的过程，通过已有的

为大模型提供全新科学复杂问答基准与测评体系，UNSW、阿贡、芝加哥大学等多家机构联合推出SciQAG框架 Jul 25, 2024 am 06:42 AM

编辑|ScienceAI问答（QA）数据集在推动自然语言处理（NLP）研究发挥着至关重要的作用。高质量QA数据集不仅可以用于微调模型，也可以有效评估大语言模型（LLM）的能力，尤其是针对科学知识的理解和推理能力。尽管当前已有许多科学QA数据集，涵盖了医学、化学、生物等领域，但这些数据集仍存在一些不足。其一，数据形式较为单一，大多数为多项选择题（multiple-choicequestions），它们易于进行评估，但限制了模型的答案选择范围，无法充分测试模型的科学问题解答能力。相比之下，开放式问答

SOTA性能，厦大多模态蛋白质-配体亲和力预测AI方法，首次结合分子表面信息 Jul 17, 2024 pm 06:37 PM

编辑|KX在药物研发领域，准确有效地预测蛋白质与配体的结合亲和力对于药物筛选和优化至关重要。然而，目前的研究没有考虑到分子表面信息在蛋白质-配体相互作用中的重要作用。基于此，来自厦门大学的研究人员提出了一种新颖的多模态特征提取（MFE）框架，该框架首次结合了蛋白质表面、3D结构和序列的信息，并使用交叉注意机制进行不同模态之间的特征对齐。实验结果表明，该方法在预测蛋白质-配体结合亲和力方面取得了最先进的性能。此外，消融研究证明了该框架内蛋白质表面信息和多模态特征对齐的有效性和必要性。相关研究以「S

SK 海力士 8 月 6 日将展示 AI 相关新品：12 层 HBM3E、321-high NAND 等 Aug 01, 2024 pm 09:40 PM

本站8月1日消息，SK海力士今天（8月1日）发布博文，宣布将出席8月6日至8日，在美国加利福尼亚州圣克拉拉举行的全球半导体存储器峰会FMS2024，展示诸多新一代产品。未来存储器和存储峰会（FutureMemoryandStorage）简介前身是主要面向NAND供应商的闪存峰会（FlashMemorySummit），在人工智能技术日益受到关注的背景下，今年重新命名为未来存储器和存储峰会（FutureMemoryandStorage），以邀请DRAM和存储供应商等更多参与者。新产品SK海力士去年在

See all articles

Karpathy新教程爆火，网友抢着送他H100：从头复现GPT-2训练

90分钟复现GPT-2

大神也不是那么卷

热AI工具

Undresser.AI Undress

AI Clothes Remover

Undress AI Tool

Clothoff.io

Video Face Swap

热门文章

热工具

记事本++7.3.1

SublimeText3汉化版

禅工作室 13.0.1

Dreamweaver CS6

SublimeText3 Mac版

热门话题