目录
思考
提示:
>任务7:道德困境和哲学问题
首页 科技周边 人工智能 Andrej Karpathy'第一次看Grok 3!

Andrej Karpathy'第一次看Grok 3!

Mar 04, 2025 am 10:19 AM

埃隆·马斯克(Elon Musk)刚刚释放了他的XAI最新车型 - Grok 3!凭借其先进的推理和搜索功能,它旨在与OpenAI的O1-Pro和DeepSeek-R1等最新模型竞争。 Andrej Karpathy是特斯拉AI的著名研究人员,前AI的前任主任,他早日获得了Grok 3的机会。他的最初印象为其优势和局限性提供了宝贵的见解。让我们仔细看看他的评论!

>

Andrej Karpathy'第一次看Grok 3!

目录的

  • >什么是GROK 3?一代
  • 任务4:估算GPT-2培训的失败
  • 任务5:DeepSearch能力(时事和研究问题)
  • >
  • 任务6:fun llm“ gotchas”(模式识别和幽默)(模式识别和幽默)
  • 任务7:道德困境和哲学问题和哲学问题
  • 什么是Grok 3?
  • grok 3是Xai的最新语言模型,旨在与当今可用的最佳AI型号竞争。它具有改进的推理能力,一种用于复杂问题解决的“思考”模式,以及用于增强基于Web的查找功能的“ DeepSearch”。 Xai已迅速开发了Grok 3,其早期性能表明,这是其前辈的重大飞跃。
  • 了解更多信息,请阅读我们有关Grok 3!
  • 的详细文章
  • Andrej Karpathy尝试了Grok 3
  • karpathy进行了多种测试,以评估Grok 3的解决问题,推理和搜索功能。这些测试包括棋盘游戏逻辑,数学估计,深入研究,幽默产生和道德困境。他的观察结果凸显了模型的优势和需要改进的领域。
  • >
  • >我今天早些时候就可以尽早进入Grok 3,这让我我认为最初可以进行快速氛围检查的人之一。

思考

✅>首先,Grok 3显然具有艺术性思维模型的状态(Think Think'按钮)(“ Think Think”按钮)(“ Think”按钮),并且在我的定居者的catan of Catean of Catean of catan Imppoter and toppoter y。 (@karpathy)2025年2月18日

现在让我们详细查看这些任务!

>任务1:棋盘游戏逻辑(Catan提示的定居者)

>

提示:

>创建一个棋盘游戏网页,显示十六进制网格,就像在Catan的游戏定居者中一样。每个十六进制网格的编号为1到N,其中n是十六进制瓷砖的总数。使其通用,因此可以使用滑块更改环数。


观察

Grok 3成功地生成了HTML的十六进制网格,这是许多模型所努力的成就。这使其与OpenAI的O1-Pro置于同一联盟,表现优于DeepSeek-R1和Gemini 2.0 Flash Thinking。

>判决

✅grok 3能够解决该问题。

>任务2:Unicode挑战(表情符号神秘)

>

>提示:“笑脸表情符号表情符号,带有一个隐藏的消息,用Unicode变化选择器编码,并在Rust Code中提示。

观察

grok 3无法解码隐藏的消息。 DeepSeek-R1取得了部分进展,但是Grok 3和Openai的O1-Pro都无法完全解决它。

>判决

❌grok 3无法解决问题。>

任务3:TIC-TAC-toe拼图生成

提示:

>“求解tic-tac-toe板并生成棘手的版本。 观察

> Grok 3正确地解决了简单的板,许多模型失败了,但很难生成有效的棘手板。 Openai的O1-Pro也未通过此挑战。

>判决

grok 3无法完全解决该问题。

>任务4:估算GPT-2训练的拖船

提示:

估计gpt-2的训练拖鞋的数量,而无需搜索。

观察

grok 3成功地计算了拖鞋,而Openai的O1-Pro失败了。这表明了强大的数学和推理能力。 >判决

✅grok 3能够解决该问题。

>任务5:DeepSearch功能(当前事件和研究问题)>

提示示例:

>

>“即将推出的苹果发布会是怎么回事?有谣言吗?

>“为什么最近帕兰蒂尔股票飙升?

“白莲花3在哪里拍摄,是第1季和第2季的团队?

>“布莱恩·约翰逊使用什么牙膏?

    观察
  • Grok 3成功检索了相关信息,但偶尔会出现幻觉和缺失的参考。它的表现与困惑的深研究相当,但落后于Openai的深入研究。
  • >判决
  • ✅grok 3能够解决大多数问题,但有一些不一致的问题。
  • > >任务6:Fun llm“ gotchas”(模式识别和幽默)
  • >提示:
  • > “数字中的字母,将数字与小数数进行比较,求解简单的逻辑难题。
观察

grok 3最初犯了常见的LLM错误,但通过“思考”模式纠正了错误。但是,它在幽默的产生中挣扎,并且在复杂的SVG布局任务中失败了。

>

>判决

✅grok 3能够解决逻辑难题,但在幽默和可视化方面挣扎。

>任务7:道德困境和哲学问题

>提示:>“如果某人挽救一百万人的生命,那么在道德上是合理的吗?

观察

grok 3拒绝参与,生成了一页的文章,避免了这个问题。许多LLM都表现出相似的过度谨慎行为。

>判决

❌grok 3无法解决问题。

>

结论

Karpather对Grok 3的早期印象表明,它与Openai的O1-Pro相提并论,并且在多个领域都超越了DeepSeek-R1和Gemini 2.0 Flash等模型。它的优势在于结构化推理,深度数学计算和高级搜索功能。但是,它仍然在幽默,道德困境和复杂的视觉任务中挣扎。鉴于Xai的快速发展速度,Grok 3在短短一年内就取得了令人印象深刻的成就。尽管需要进一步的评估,但目前的轨迹表明,XAI正在与行业中的AI领导者迅速缩小差距。

敬请期待分析vidhya博客,以便定期关注3个更新!

>潜入Xai Grok 3:地球上最聪明的AI! Andrej Karpathy的独家第一眼揭示了开创性的见解。不要错过 - 现在注释!

>

以上是Andrej Karpathy'第一次看Grok 3!的详细内容。更多信息请关注PHP中文网其他相关文章!

本站声明
本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

热AI工具

Undresser.AI Undress

Undresser.AI Undress

人工智能驱动的应用程序,用于创建逼真的裸体照片

AI Clothes Remover

AI Clothes Remover

用于从照片中去除衣服的在线人工智能工具。

Undress AI Tool

Undress AI Tool

免费脱衣服图片

Clothoff.io

Clothoff.io

AI脱衣机

Video Face Swap

Video Face Swap

使用我们完全免费的人工智能换脸工具轻松在任何视频中换脸!

热工具

记事本++7.3.1

记事本++7.3.1

好用且免费的代码编辑器

SublimeText3汉化版

SublimeText3汉化版

中文版,非常好用

禅工作室 13.0.1

禅工作室 13.0.1

功能强大的PHP集成开发环境

Dreamweaver CS6

Dreamweaver CS6

视觉化网页开发工具

SublimeText3 Mac版

SublimeText3 Mac版

神级代码编辑软件(SublimeText3)

开始使用Meta Llama 3.2 -Analytics Vidhya 开始使用Meta Llama 3.2 -Analytics Vidhya Apr 11, 2025 pm 12:04 PM

Meta的Llama 3.2:多模式和移动AI的飞跃 Meta最近公布了Llama 3.2,这是AI的重大进步,具有强大的视觉功能和针对移动设备优化的轻量级文本模型。 以成功为基础

10个生成AI编码扩展,在VS代码中,您必须探索 10个生成AI编码扩展,在VS代码中,您必须探索 Apr 13, 2025 am 01:14 AM

嘿,编码忍者!您当天计划哪些与编码有关的任务?在您进一步研究此博客之前,我希望您考虑所有与编码相关的困境,这是将其列出的。 完毕? - 让&#8217

AV字节:Meta' llama 3.2,Google的双子座1.5等 AV字节:Meta' llama 3.2,Google的双子座1.5等 Apr 11, 2025 pm 12:01 PM

本周的AI景观:进步,道德考虑和监管辩论的旋风。 OpenAI,Google,Meta和Microsoft等主要参与者已经释放了一系列更新,从开创性的新车型到LE的关键转变

向员工出售AI策略:Shopify首席执行官的宣言 向员工出售AI策略:Shopify首席执行官的宣言 Apr 10, 2025 am 11:19 AM

Shopify首席执行官TobiLütke最近的备忘录大胆地宣布AI对每位员工的基本期望是公司内部的重大文化转变。 这不是短暂的趋势。这是整合到P中的新操作范式

视觉语言模型(VLMS)的综合指南 视觉语言模型(VLMS)的综合指南 Apr 12, 2025 am 11:58 AM

介绍 想象一下,穿过​​美术馆,周围是生动的绘画和雕塑。现在,如果您可以向每一部分提出一个问题并获得有意义的答案,该怎么办?您可能会问:“您在讲什么故事?

GPT-4O vs OpenAI O1:新的Openai模型值得炒作吗? GPT-4O vs OpenAI O1:新的Openai模型值得炒作吗? Apr 13, 2025 am 10:18 AM

介绍 Openai已根据备受期待的“草莓”建筑发布了其新模型。这种称为O1的创新模型增强了推理能力,使其可以通过问题进行思考

如何在SQL中添加列? - 分析Vidhya 如何在SQL中添加列? - 分析Vidhya Apr 17, 2025 am 11:43 AM

SQL的Alter表语句:动态地将列添加到数据库 在数据管理中,SQL的适应性至关重要。 需要即时调整数据库结构吗? Alter表语句是您的解决方案。本指南的详细信息添加了Colu

阅读AI索引2025:AI是您的朋友,敌人还是副驾驶? 阅读AI索引2025:AI是您的朋友,敌人还是副驾驶? Apr 11, 2025 pm 12:13 PM

斯坦福大学以人为本人工智能研究所发布的《2025年人工智能指数报告》对正在进行的人工智能革命进行了很好的概述。让我们用四个简单的概念来解读它:认知(了解正在发生的事情)、欣赏(看到好处)、接纳(面对挑战)和责任(弄清我们的责任)。 认知:人工智能无处不在,并且发展迅速 我们需要敏锐地意识到人工智能发展和传播的速度有多快。人工智能系统正在不断改进,在数学和复杂思维测试中取得了优异的成绩,而就在一年前,它们还在这些测试中惨败。想象一下,人工智能解决复杂的编码问题或研究生水平的科学问题——自2023年

See all articles