LLaMA-2-7B數學能力上限已達97.7%？ Xwin-Math利用合成資料解鎖潛力-人工智慧-PHP中文網

首頁

科技週邊

人工智慧

LLaMA-2-7B數學能力上限已達97.7%？ Xwin-Math利用合成資料解鎖潛力

PHPz

Mar 15, 2024 pm 12:07 PM

工程

合成資料持續解鎖大模型的數學推理潛力！

數學問題解決能力一直被視為衡量語言模型智慧程度的重要指標。通常只有規模極大的模型或經過大量數學相關預訓練的模型才能有機會在數學問題上表現出色。

近日，由Swin-Transformer 團隊打造，來自西安交通大學、中國科學技術大學、清華大學和微軟亞洲研究院的學者共同完成的研究工作Xwin 顛覆了這個認知，揭示了通用預訓練下7B（即70 億參數）規模的語言模型（LLaMA-2-7B）在數學問題解決方面已經展現出較強的潛力，並可使用基於合成數據的監督微調方法促使模型愈發穩定地將數學能力激發出來。

這項研究發佈在 arXiv 上，題為《Common 7B Language Models Already Possess Strong Math Capabilities》。

LLaMA-2-7B數學能力上限已達97.7%？ Xwin-Math利用合成資料解鎖潛力

論文連結：https://arxiv.org/pdf/2403.04706.pdf
程式碼連結：https://github.com/Xwin-LM/Xwin-LM

#研究團隊首先只使用7.5K 數據，對LLaMA- 2-7B 模型指令微調，進而評估模型在GSM8K 和MATH 的表現。實驗結果表明，當每個測試集中的問題從256 個產生的答案中選擇最佳答案時，測試準確率可分別高達97.7% 和72.0%，這一結果說明即使是通用預訓練下7B 量級的小模型，也具備產生優質答案的巨大潛力，這項發現挑戰了以往的觀點，即強大的數學推理潛力並非僅限於大規模和數學相關預訓練模型。

LLaMA-2-7B數學能力上限已達97.7%？ Xwin-Math利用合成資料解鎖潛力

然而研究也指出，尽管已具备强大的数学推理潜力，但当前语言模型的主要问题是难以一致地激发其内在的数学能力。例如，在前面的实验中如果只考虑每个问题的一次生成的答案，那么在 GSM8K 和 MATH 基准测试上的准确率会分别降至 49.5% 和 7.9%。这体现出模型数学能力的不稳定性问题。为了解决这一问题，研究团队采用了扩大有监督微调（SFT）数据集的方法，并发现随着 SFT 数据的增多，模型生成正确答案的可靠性被显著提升。

研究中还提到，通过使用合成数据，可以有效地扩大 SFT 数据集，而且这种方法几乎与真实数据一样有效。研究团队利用 GPT-4 Turbo API 生成了合成的数学问题与解题过程，并通过简单的验证提示词来确保问题的质量。通过这种方法，团队成功地将 SFT 数据集从 7.5K 扩展到约一百万样本，实现了近乎完美的缩放定律（Scaling Law）。最终获得的 Xwin-Math-7B 模型在 GSM8K 和 MATH 上分别达到了 82.6% 和 40.6% 的准确率，大幅超越此前的 SOTA 模型，甚至可超越一些 70B 量级模型，实现越级提升。而 Xwin-Math-70B 模型在 MATH 评测集上的结果可达 52.8%，显著超越了 GPT-4 的早期版本。这是基于 LLaMA 系列基础模型的研究第一次在 MATH 上超越 GPT-4。

LLaMA-2-7B數學能力上限已達97.7%？ Xwin-Math利用合成資料解鎖潛力

研究人员还定义了 Pass@N 和 PassRatio@N 评测指标，意图分别测评模型的 N 次输出中，是否能够输出正确答案（表示模型潜在的数学能力），以及正确答案的所占比例（表示模型数学能力的稳定性）。当 SFT 数据量较小时，模型的 Pass@256 已经很高，进一步扩大 SFT 数据规模后，模型的 Pass@256 提升极小，而 PassRatio@256 则获得显著增长。这表明基于合成数据的有监督微调是提升模型数学能力稳定性的有效方式。

LLaMA-2-7B數學能力上限已達97.7%？ Xwin-Math利用合成資料解鎖潛力

此外，研究还提供了对不同推理复杂性和错误类型下扩展行为的洞察。例如，随着 SFT 数据集规模的增加，模型在解决数学问题时的准确率遵循与推理步骤数量相关的幂律关系。通过增加训练样本中长推理步骤的比例，可以显著提高模型解决难题的准确率。同时，研究还发现，计算错误比推理错误更容易被缓解。

LLaMA-2-7B數學能力上限已達97.7%？ Xwin-Math利用合成資料解鎖潛力

在表现模型数学推理泛化能力的匈牙利高中数学考试中，Xwin-Math 也拿到了 65% 的分数，仅次于 GPT-4。这表明研究中合成数据的方式并没有显著地过拟合到评测集中，展现出良好的泛化能力。

LLaMA-2-7B數學能力上限已達97.7%？ Xwin-Math利用合成資料解鎖潛力

这项研究不仅展示了合成数据在扩展 SFT 数据方面的有效性，而且为大型语言模型在数学推理能力方面的研究提供了新的视角。研究团队表示，他们的工作为未来在这一领域的探索和进步奠定了基础，并期待能够推动人工智能在数学问题解决方面取得更大的突破。随着人工智能技术的不断进步，我们有理由期待 AI 在数学领域的表现将更加出色，为人类解决复杂数学问题提供更多帮助。

文章还涉及数据合成方法的消融实验和其他评测指标的结果，详细内容请参阅全文。

以上是LLaMA-2-7B數學能力上限已達97.7%？ Xwin-Math利用合成資料解鎖潛力的詳細內容。更多資訊請關注PHP中文網其他相關文章！

本網站聲明

本文內容由網友自願投稿，版權歸原作者所有。本站不承擔相應的法律責任。如發現涉嫌抄襲或侵權的內容，請聯絡admin@php.cn

熱AI工具

Undresser.AI Undress

人工智慧驅動的應用程序，用於創建逼真的裸體照片

AI Clothes Remover

用於從照片中去除衣服的線上人工智慧工具。

Undress AI Tool

免費脫衣圖片

Clothoff.io

AI脫衣器

Video Face Swap

使用我們完全免費的人工智慧換臉工具，輕鬆在任何影片中換臉！

熱工具

記事本++7.3.1

好用且免費的程式碼編輯器

SublimeText3漢化版

中文版，非常好用

禪工作室 13.0.1

強大的PHP整合開發環境

Dreamweaver CS6

視覺化網頁開發工具

SublimeText3 Mac版

神級程式碼編輯軟體(SublimeText3)

熱門話題

Java教學

1665

CakePHP 教程

1424

Laravel 教程

1321

PHP教程

1269

C# 教程

1249

Related knowledge

ControlNet作者又出爆款！一張圖生成繪畫全過程，兩天狂攬1.4k Star Jul 17, 2024 am 01:56 AM

同樣是圖生視頻，PaintsUndo走出了不一樣的路線。 ControlNet作者LvminZhang又開始整活了！這次瞄準繪畫領域。新項目PaintsUndo剛上線不久，就收穫1.4kstar（還在瘋狂漲）。項目地址：https://github.com/lllyasviel/Paints-UNDO透過這個項目，用戶輸入一張靜態圖像，PaintsUndo就能自動幫你生成整個繪畫的全過程視頻，從線稿到成品都有跡可循。繪製過程，線條變化多端甚是神奇，最終視頻結果和原始圖像非常相似：我們再來看一個完整的繪

登頂開源AI軟體工程師榜首，UIUC無Agent方案輕鬆解決SWE-bench真實程式設計問題 Jul 17, 2024 pm 10:02 PM

AIxiv專欄是本站發布學術、技術內容的欄位。過去數年，本站AIxiv專欄接收通報了2,000多篇內容，涵蓋全球各大專院校與企業的頂尖實驗室，有效促進了學術交流與傳播。如果您有優秀的工作想要分享，歡迎投稿或聯絡報道。投稿信箱：liyazhou@jiqizhixin.com；zhaoyunfeng@jiqizhixin.com這篇論文的作者皆來自伊利諾大學香檳分校（UIUC）張令明老師團隊，包括：StevenXia，四年級博士生，研究方向是基於AI大模型的自動代碼修復；鄧茵琳，四年級博士生，研究方

從RLHF到DPO再到TDPO，大模型對齊演算法已經是「token-level」 Jun 24, 2024 pm 03:04 PM

AIxiv專欄是本站發布學術、技術內容的欄位。過去數年，本站AIxiv專欄接收通報了2,000多篇內容，涵蓋全球各大專院校與企業的頂尖實驗室，有效促進了學術交流與傳播。如果您有優秀的工作想要分享，歡迎投稿或聯絡報道。投稿信箱：liyazhou@jiqizhixin.com；zhaoyunfeng@jiqizhixin.com在人工智慧領域的發展過程中，對大語言模型（LLM）的控制與指導始終是核心挑戰之一，旨在確保這些模型既強大又安全地服務人類社會。早期的努力集中在透過人類回饋的強化學習方法（RL

arXiv論文可以發「彈幕」了，史丹佛alphaXiv討論平台上線，LeCun按讚 Aug 01, 2024 pm 05:18 PM

乾杯！當論文討論細緻到詞句，是什麼體驗？最近，史丹佛大學的學生針對arXiv論文創建了一個開放討論論壇——alphaXiv，可以直接在任何arXiv論文之上發布問題和評論。網站連結：https://alphaxiv.org/其實不需要專門訪問這個網站，只需將任何URL中的arXiv更改為alphaXiv就可以直接在alphaXiv論壇上打開相應論文：可以精準定位到論文中的段落、句子：右側討論區，使用者可以發表問題詢問作者論文想法、細節，例如：也可以針對論文內容發表評論，例如：「給出至

OpenAI超級對齊團隊遺作：兩個大模型博弈一番，輸出更好懂了 Jul 19, 2024 am 01:29 AM

如果AI模型給的答案一點也看不懂，你敢用嗎？隨著機器學習系統在更重要的領域中得到應用，證明為什麼我們可以信任它們的輸出，並明確何時不應信任它們，變得越來越重要。獲得對複雜系統輸出結果信任的一個可行方法是，要求系統對其輸出產生一種解釋，這種解釋對人類或另一個受信任的系統來說是可讀的，即可以完全理解以至於任何可能的錯誤都可以被發現。例如，為了建立對司法系統的信任，我們要求法院提供清晰易讀的書面意見，解釋並支持其決策。對於大型語言模型來說，我們也可以採用類似的方法。不過，在採用這種方法時，確保語言模型生

黎曼猜想显著突破！陶哲轩强推MIT、牛津新论文，37岁菲尔兹奖得主参与 Aug 05, 2024 pm 03:32 PM

最近，被稱為千禧年七大難題之一的黎曼猜想迎來了新突破。黎曼猜想是數學中一個非常重要的未解決問題，與素數分佈的精確性質有關（素數是那些只能被1和自身整除的數字，它們在數論中扮演著基礎性的角色）。在當今的數學文獻中，已有超過一千個數學命題以黎曼猜想（或其推廣形式）的成立為前提。也就是說，黎曼猜想及其推廣形式一旦被證明，這一千多個命題將被確立為定理，對數學領域產生深遠的影響；而如果黎曼猜想被證明是錯誤的，那麼這些命題中的一部分也將隨之失去其有效性。新的突破來自MIT數學教授LarryGuth和牛津大學

LLM用於時序預測真的不行，連推理能力都沒用到 Jul 15, 2024 pm 03:59 PM

語言模型真的能用於時序預測嗎？根據貝特里奇頭條定律（任何以問號結尾的新聞標題，都能夠用「不」來回答），答案應該是否定的。事實似乎也果然如此：強大如斯的LLM並不能很好地處理時序資料。時序，即時間序列，顧名思義，是指一組依照時間發生先後順序排列的資料點序列。在許多領域，時序分析都很關鍵，包括疾病傳播預測、零售分析、醫療和金融。在時序分析領域，近期不少研究者都在研究如何使用大型語言模型（LLM）來分類、預測和偵測時間序列中的異常。這些論文假設擅長處理文本中順序依賴關係的語言模型也能泛化用於時間序

首個基於Mamba的MLLM來了！模型權重、訓練程式碼等已全部開源 Jul 17, 2024 am 02:46 AM

AIxiv专栏是本站发布学术、技术内容的栏目。过去数年，本站AIxiv专栏接收报道了2000多篇内容，覆盖全球各大高校与企业的顶级实验室，有效促进了学术交流与传播。如果您有优秀的工作想要分享，欢迎投稿或者联系报道。投稿邮箱：liyazhou@jiqizhixin.com；zhaoyunfeng@jiqizhixin.com。引言近年来，多模态大型语言模型（MLLM）在各个领域的应用取得了显著的成功。然而，作为许多下游任务的基础模型，当前的MLLM由众所周知的Transformer网络构成，这种网

See all articles

LLaMA-2-7B數學能力上限已達97.7%？ Xwin-Math利用合成資料解鎖潛力

熱AI工具

Undresser.AI Undress

AI Clothes Remover

Undress AI Tool

Clothoff.io

Video Face Swap

熱門文章

熱工具

記事本++7.3.1

SublimeText3漢化版

禪工作室 13.0.1

Dreamweaver CS6

SublimeText3 Mac版

熱門話題