Andrej Karpathy'第一次看Grok 3!
埃隆·马斯克(Elon Musk)刚刚释放了他的XAI最新车型 - Grok 3!凭借其先进的推理和搜索功能,它旨在与OpenAI的O1-Pro和DeepSeek-R1等最新模型竞争。 Andrej Karpathy是特斯拉AI的著名研究人员,前AI的前任主任,他早日获得了Grok 3的机会。他的最初印象为其优势和局限性提供了宝贵的见解。让我们仔细看看他的评论!
>
- >什么是GROK 3?一代
- 任务4:估算GPT-2培训的失败
- 任务5:DeepSearch能力(时事和研究问题) >
- 任务6:fun llm“ gotchas”(模式识别和幽默)(模式识别和幽默)
- 任务7:道德困境和哲学问题和哲学问题 什么是Grok 3?
- grok 3是Xai的最新语言模型,旨在与当今可用的最佳AI型号竞争。它具有改进的推理能力,一种用于复杂问题解决的“思考”模式,以及用于增强基于Web的查找功能的“ DeepSearch”。 Xai已迅速开发了Grok 3,其早期性能表明,这是其前辈的重大飞跃。
- 了解更多信息,请阅读我们有关Grok 3! 的详细文章
- Andrej Karpathy尝试了Grok 3
- > >我今天早些时候就可以尽早进入Grok 3,这让我我认为最初可以进行快速氛围检查的人之一。
思考
✅>首先,Grok 3显然具有艺术性思维模型的状态(Think Think'按钮)(“ Think Think”按钮)(“ Think”按钮),并且在我的定居者的catan of Catean of Catean of catan Imppoter and toppoter y。 (@karpathy)2025年2月18日现在让我们详细查看这些任务!
>任务1:棋盘游戏逻辑(Catan提示的定居者)
>
提示:
“>创建一个棋盘游戏网页,显示十六进制网格,就像在Catan的游戏定居者中一样。每个十六进制网格的编号为1到N,其中n是十六进制瓷砖的总数。使其通用,因此可以使用滑块更改环数。
观察
Grok 3成功地生成了HTML的十六进制网格,这是许多模型所努力的成就。这使其与OpenAI的O1-Pro置于同一联盟,表现优于DeepSeek-R1和Gemini 2.0 Flash Thinking。
>判决
✅grok 3能够解决该问题。>任务2:Unicode挑战(表情符号神秘)
>
>提示:“笑脸表情符号表情符号,带有一个隐藏的消息,用Unicode变化选择器编码,并在Rust Code中提示。
观察grok 3无法解码隐藏的消息。 DeepSeek-R1取得了部分进展,但是Grok 3和Openai的O1-Pro都无法完全解决它。
>判决
❌grok 3无法解决问题。>
任务3:TIC-TAC-toe拼图生成
提示:
>“求解tic-tac-toe板并生成棘手的版本。 观察
> Grok 3正确地解决了简单的板,许多模型失败了,但很难生成有效的棘手板。 Openai的O1-Pro也未通过此挑战。>判决
grok 3无法完全解决该问题。
>任务4:估算GPT-2训练的拖船提示:
“估计gpt-2的训练拖鞋的数量,而无需搜索。
观察
grok 3成功地计算了拖鞋,而Openai的O1-Pro失败了。这表明了强大的数学和推理能力。 >判决
✅grok 3能够解决该问题。
>任务5:DeepSearch功能(当前事件和研究问题)> 提示示例: >
>“即将推出的苹果发布会是怎么回事?有谣言吗? >“为什么最近帕兰蒂尔股票飙升? “白莲花3在哪里拍摄,是第1季和第2季的团队?>“布莱恩·约翰逊使用什么牙膏?
观察
观察- Grok 3成功检索了相关信息,但偶尔会出现幻觉和缺失的参考。它的表现与困惑的深研究相当,但落后于Openai的深入研究。
- >判决
✅grok 3能够解决大多数问题,但有一些不一致的问题。- > >任务6:Fun llm“ gotchas”(模式识别和幽默)
>提示:- > “数字中的字母,将数字与小数数进行比较,求解简单的逻辑难题。
grok 3最初犯了常见的LLM错误,但通过“思考”模式纠正了错误。但是,它在幽默的产生中挣扎,并且在复杂的SVG布局任务中失败了。
>>判决
✅grok 3能够解决逻辑难题,但在幽默和可视化方面挣扎。
>任务7:道德困境和哲学问题
>提示:>“如果某人挽救一百万人的生命,那么在道德上是合理的吗?
观察grok 3拒绝参与,生成了一页的文章,避免了这个问题。许多LLM都表现出相似的过度谨慎行为。
>判决❌grok 3无法解决问题。
>结论
Karpather对Grok 3的早期印象表明,它与Openai的O1-Pro相提并论,并且在多个领域都超越了DeepSeek-R1和Gemini 2.0 Flash等模型。它的优势在于结构化推理,深度数学计算和高级搜索功能。但是,它仍然在幽默,道德困境和复杂的视觉任务中挣扎。鉴于Xai的快速发展速度,Grok 3在短短一年内就取得了令人印象深刻的成就。尽管需要进一步的评估,但目前的轨迹表明,XAI正在与行业中的AI领导者迅速缩小差距。
敬请期待分析vidhya博客,以便定期关注3个更新!>潜入Xai Grok 3:地球上最聪明的AI! Andrej Karpathy的独家第一眼揭示了开创性的见解。不要错过 - 现在注释!
>
以上是Andrej Karpathy'第一次看Grok 3!的详细内容。更多信息请关注PHP中文网其他相关文章!

热AI工具

Undresser.AI Undress
人工智能驱动的应用程序,用于创建逼真的裸体照片

AI Clothes Remover
用于从照片中去除衣服的在线人工智能工具。

Undress AI Tool
免费脱衣服图片

Clothoff.io
AI脱衣机

Video Face Swap
使用我们完全免费的人工智能换脸工具轻松在任何视频中换脸!

热门文章

热工具

记事本++7.3.1
好用且免费的代码编辑器

SublimeText3汉化版
中文版,非常好用

禅工作室 13.0.1
功能强大的PHP集成开发环境

Dreamweaver CS6
视觉化网页开发工具

SublimeText3 Mac版
神级代码编辑软件(SublimeText3)

Meta的Llama 3.2:多模式和移动AI的飞跃 Meta最近公布了Llama 3.2,这是AI的重大进步,具有强大的视觉功能和针对移动设备优化的轻量级文本模型。 以成功为基础

嘿,编码忍者!您当天计划哪些与编码有关的任务?在您进一步研究此博客之前,我希望您考虑所有与编码相关的困境,这是将其列出的。 完毕? - 让&#8217

本周的AI景观:进步,道德考虑和监管辩论的旋风。 OpenAI,Google,Meta和Microsoft等主要参与者已经释放了一系列更新,从开创性的新车型到LE的关键转变

Shopify首席执行官TobiLütke最近的备忘录大胆地宣布AI对每位员工的基本期望是公司内部的重大文化转变。 这不是短暂的趋势。这是整合到P中的新操作范式

介绍 想象一下,穿过美术馆,周围是生动的绘画和雕塑。现在,如果您可以向每一部分提出一个问题并获得有意义的答案,该怎么办?您可能会问:“您在讲什么故事?

介绍 Openai已根据备受期待的“草莓”建筑发布了其新模型。这种称为O1的创新模型增强了推理能力,使其可以通过问题进行思考

SQL的Alter表语句:动态地将列添加到数据库 在数据管理中,SQL的适应性至关重要。 需要即时调整数据库结构吗? Alter表语句是您的解决方案。本指南的详细信息添加了Colu

斯坦福大学以人为本人工智能研究所发布的《2025年人工智能指数报告》对正在进行的人工智能革命进行了很好的概述。让我们用四个简单的概念来解读它:认知(了解正在发生的事情)、欣赏(看到好处)、接纳(面对挑战)和责任(弄清我们的责任)。 认知:人工智能无处不在,并且发展迅速 我们需要敏锐地意识到人工智能发展和传播的速度有多快。人工智能系统正在不断改进,在数学和复杂思维测试中取得了优异的成绩,而就在一年前,它们还在这些测试中惨败。想象一下,人工智能解决复杂的编码问题或研究生水平的科学问题——自2023年
