大模型微調非得依賴人類資料嗎？ DeepMind：用有回饋的自我訓練比較好-人工智慧-PHP中文網

首頁

科技週邊

人工智慧

大模型微調非得依賴人類資料嗎？ DeepMind：用有回饋的自我訓練比較好

WBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWB

Aug 05, 2024 pm 08:48 PM

deepmind 工程

面對目前微調大模型主要依賴人類生成數據的普遍做法，Google DeepMind 探索出了一種減少這種依賴的更有效率方法。

如你我所見，大語言模型（LLM）正在改變深度學習的格局，在產生人類質量的文本和解決各種語言任務方面展現了卓越的能力。雖然業界透過對人類收集的數據進行監督微調進一步提升了在具體任務上的效能，但獲取高品質人類數據卻面臨著重大瓶頸。這對於要解決複雜問題的任務來說尤其明顯，需要大量資源和專業知識。

怎麼解決呢？模型產生得合成資料是一種有潛力的替代方案，只要能確保資料的質量，就能實現可擴展性和成本效益。

雖然LLM 能夠自我評估生成的數據，但在本文中，GoogleDeepMind 探索了一種更簡單的設置，將外部標量回饋訊號用作每個生成樣本的品質指標。

大模型微調非得依賴人類資料嗎？ DeepMind：用有回饋的自我訓練比較好

論文網址：https://arxiv.org/pdf/2312.06585.pdf

為了研究在模型生成資料上的訓練，研究者考慮了一種簡單但強大的語言模型自訓練方法，僅需要兩項功能，一是基於模型生成樣本，二是利用評分機制對這些樣本進行評估。

為了確保清晰度和一致性，研究者採用了一種強化自訓練方法ReST^??，並證明該方法可以將期望最大化（expectation- maximization,EM）用於強化學習。具體來講，ReST^??在期望和最大化步驟之間交替進行。

產生（E-step）：語言模型為每個輸入上下文產生多個輸出樣本，然後使用二元獎勵過濾這些樣本以收集訓練資料集。
改進（M-step）：原始語言模型在前一個 E-step 的訓練資料集上進行監督微調，然後在下一個 E-step 中使用。

研究者證實，ReST^??及變體在增強各個領域的語言模型方面取得了成功，包括機器翻譯、語義分析、偏好對齊和基礎推理。

此外，以往工作主要將 ReST^??用於相對較小的模型（最高 70 億參數），對於較大模型的可擴展性受限。因此，本文旨在探討模型產生的合成數據與人類產生的數據在以下兩個具有挑戰性但研究較少領域的有效性和可擴展性，這兩個領域分別是競爭水平數學解題（MATH）和代碼生成（APPS）。

實證結果表明，當將 ReST^??用於不同規模的 PaLM 2 模型時，在數學推理和代碼生成任務中實現了顯著的能力改進。與在人類編寫資料上訓練的模型相比，在模型產生的合成資料上微調的模型取得了更大的效能增益。有趣的是，超過了一定數量的 ReST^?? 迭代後，表現會降低，這表明了在少量訓練問題上可能會出現過度擬合。

此外，使用 ReST^??微調的模型提升了 pass@k 指標和多數投票表現。這些微調後的模型在相關但 held-out 的基準上也表現出了效能增強，包括數學題（GSM8K 和 Hungarian HS finals）、編碼（HumanEval）和 Big-Bench Hard 任務。

總之，本文研究結果表明，具有回饋的自訓練是減少對人類資料依賴的一種有潛力的方法。

用於強化自訓練的期望最大值（EM）

首先，該研究基於Dayan 和Hinton 先前的研究，用語言模型描述了基於EM 的強化學習框架。具體而言，他們先是定義了一個二進制最優變數O，使得?(?= 1|?，?)∝?(?(?，?))；然後對非遞減函數? : ℝ → ℝ+ ，實現最大化觀察?= 1（獲得高獎勵），得到以下公式：

大模型微調非得依賴人類資料嗎？ DeepMind：用有回饋的自我訓練比較好

然而，求解上式中的序列 ? 的和很棘手。因而本文考慮相對於參數 ? 和變分分佈 ?( ?|?) 最大化其 ELBO ?( ??, ?)，而不是最大化 log ?(? = 1; ?)。具體來說：

大模型微調非得依賴人類資料嗎？ DeepMind：用有回饋的自我訓練比較好

公式（2）中的 EM 演算法在 E-step（Expectation）和 M-step（Maximization）之間交替進行。

ReST^??：受 EM 框架的啟發，接下來論文討論了 Gulcehre 等人提出的 ReST 方法的簡化版本。為了清楚起見，本文將這種方法稱為 ReST^??，它將 RL pipeline 中的資料收集 (E-step) 和策略優化 (M-step) 進行解耦。如演算法1 所示：

大模型微調非得依賴人類資料嗎？ DeepMind：用有回饋的自我訓練比較好

產生（E-step）：在此步驟中，研究透過從目前策略?? 大模型微調非得依賴人類資料嗎？ DeepMind：用有回饋的自我訓練比較好

中取樣輸出序列來產生資料集大模型微調非得依賴人類資料嗎？ DeepMind：用有回饋的自我訓練比較好

。在這裡，輸入是從原始資料集大模型微調非得依賴人類資料嗎？ DeepMind：用有回饋的自我訓練比較好

重新取樣的。然後使用二元獎勵函數 ?(?, ?) 對大模型微調非得依賴人類資料嗎？ DeepMind：用有回饋的自我訓練比較好

中的輸出序列進行評分。

改進（M-step）：在第?步迭代中，研究使用E-step 中的新資料集大模型微調非得依賴人類資料嗎？ DeepMind：用有回饋的自我訓練比較好

來微調策略??。不同於 Gulcehre 的研究，他們微調基本預訓練語言模型，以最大限度地減少特定於任務的過度擬合並最大限度地減少與基本模型的偏差。為了進行微調，研究最小化獎勵加權負對數似然損失大模型微調非得依賴人類資料嗎？ DeepMind：用有回饋的自我訓練比較好

。一旦策略改進，就可以再次建立品質更好樣本的新資料集。

實驗與分析

本文進行實驗的主要目標是以下問題：

與人類產生的數據進行微調相比，ReST^??的效果如何？
需要多少次迭代才能獲得最佳效能？ ReST^??多久會導致訓練集過度擬合？
ReST^??如何影響 pass@k 與多數投票表現？
如果使用者在特定任務上使用模型產生的資料進行微調，是否會移轉到其他任務？在廣泛的任務中評估本文的微調模型時，與基本模型相比，表現是否會下降？
大約需要多少輸入資料才能從 ReST^?? 獲得大部分效能提升？ ReST^??的一次迭代是否足夠？

研究使用PaLM 2 模型和Google Cloud 上的公共API 進行實驗，包括PaLM 2-S (Bison)、PaLM 2-S * (Codey) 和PaLM 2-L (Unicorn)。訓練資料集採用 MATH 資料集和 APPS 資料集。

圖 2 和圖 3 分別顯示了 ReST^??在 MATH 和 APPS 資料集上訓練的效能。可以得出 MATH 受益於 ReST^?? 的多次迭代，無論是在 MATH 測試集上的效能還是遷移到 GSM8K 方面。另一方面可以看到 APPS 的大部分收益來自第一次迭代，而執行更多次迭代會導致 APPS 和 HumanEval 的效能下降。

大模型微調非得依賴人類資料嗎？ DeepMind：用有回饋的自我訓練比較好

訓練和測試表現的差距。圖 4 顯示，雖然訓練集表現隨著 ReST^??迭代次數線性增加，但測試集表現卻沒有。對於 MATH，第一次迭代後測試效能改進很小，而對於 APPS，在第二次迭代中觀察到效能迴歸。該研究猜測表現的回歸可能是由於過度擬合造成的。由於 APPS 資料集的大小約為 MATH 資料集的三分之一，因此它更容易受到此問題的影響。

大模型微調非得依賴人類資料嗎？ DeepMind：用有回饋的自我訓練比較好

圖 5 顯示了 Palm-2-L 模型在 pass@K 指標上的表現。結果顯示，微調後獲得的 ReST^?? 模型對於所有 K 值都更強，其中性能差距通常在 K=1 時最大。大模型微調非得依賴人類資料嗎？ DeepMind：用有回饋的自我訓練比較好

以上是大模型微調非得依賴人類資料嗎？ DeepMind：用有回饋的自我訓練比較好的詳細內容。更多資訊請關注PHP中文網其他相關文章！

本網站聲明

本文內容由網友自願投稿，版權歸原作者所有。本站不承擔相應的法律責任。如發現涉嫌抄襲或侵權的內容，請聯絡admin@php.cn

熱AI工具

熱工具

熱門話題

Java教學

1664

CakePHP 教程

1423

Laravel 教程

1318

PHP教程

1269

C# 教程

1248

Related knowledge

DeepMind機器人打乒乓球，正手、反手溜到飛起，全勝人類初學者 Aug 09, 2024 pm 04:01 PM

但可能打不過公園裡的老大爺？巴黎奧運正在如火如荼地進行中，乒乓球項目備受關注。同時，機器人打乒乓球也取得了新突破。剛剛，DeepMind提出了第一個在競技乒乓球比賽中達到人類業餘選手等級的學習型機器人智能體。論文地址：https://arxiv.org/pdf/2408.03906DeepMind這個機器人打乒乓球什麼程度呢？大概和人類業餘選手不相上下：正手反手都會：對手採用多種打法，機器人也能招架得住：接不同旋轉的發球：不過，比賽激烈程度似乎不如公園老大爺對戰。對機器人來說，乒乓球運動

ControlNet作者又出爆款！一張圖生成繪畫全過程，兩天狂攬1.4k Star Jul 17, 2024 am 01:56 AM

同樣是圖生視頻，PaintsUndo走出了不一樣的路線。 ControlNet作者LvminZhang又開始整活了！這次瞄準繪畫領域。新項目PaintsUndo剛上線不久，就收穫1.4kstar（還在瘋狂漲）。項目地址：https://github.com/lllyasviel/Paints-UNDO透過這個項目，用戶輸入一張靜態圖像，PaintsUndo就能自動幫你生成整個繪畫的全過程視頻，從線稿到成品都有跡可循。繪製過程，線條變化多端甚是神奇，最終視頻結果和原始圖像非常相似：我們再來看一個完整的繪

登頂開源AI軟體工程師榜首，UIUC無Agent方案輕鬆解決SWE-bench真實程式設計問題 Jul 17, 2024 pm 10:02 PM

AIxiv專欄是本站發布學術、技術內容的欄位。過去數年，本站AIxiv專欄接收通報了2,000多篇內容，涵蓋全球各大專院校與企業的頂尖實驗室，有效促進了學術交流與傳播。如果您有優秀的工作想要分享，歡迎投稿或聯絡報道。投稿信箱：liyazhou@jiqizhixin.com；zhaoyunfeng@jiqizhixin.com這篇論文的作者皆來自伊利諾大學香檳分校（UIUC）張令明老師團隊，包括：StevenXia，四年級博士生，研究方向是基於AI大模型的自動代碼修復；鄧茵琳，四年級博士生，研究方

從RLHF到DPO再到TDPO，大模型對齊演算法已經是「token-level」 Jun 24, 2024 pm 03:04 PM

AIxiv專欄是本站發布學術、技術內容的欄位。過去數年，本站AIxiv專欄接收通報了2,000多篇內容，涵蓋全球各大專院校與企業的頂尖實驗室，有效促進了學術交流與傳播。如果您有優秀的工作想要分享，歡迎投稿或聯絡報道。投稿信箱：liyazhou@jiqizhixin.com；zhaoyunfeng@jiqizhixin.com在人工智慧領域的發展過程中，對大語言模型（LLM）的控制與指導始終是核心挑戰之一，旨在確保這些模型既強大又安全地服務人類社會。早期的努力集中在透過人類回饋的強化學習方法（RL

arXiv論文可以發「彈幕」了，史丹佛alphaXiv討論平台上線，LeCun按讚 Aug 01, 2024 pm 05:18 PM

乾杯！當論文討論細緻到詞句，是什麼體驗？最近，史丹佛大學的學生針對arXiv論文創建了一個開放討論論壇——alphaXiv，可以直接在任何arXiv論文之上發布問題和評論。網站連結：https://alphaxiv.org/其實不需要專門訪問這個網站，只需將任何URL中的arXiv更改為alphaXiv就可以直接在alphaXiv論壇上打開相應論文：可以精準定位到論文中的段落、句子：右側討論區，使用者可以發表問題詢問作者論文想法、細節，例如：也可以針對論文內容發表評論，例如：「給出至

OpenAI超級對齊團隊遺作：兩個大模型博弈一番，輸出更好懂了 Jul 19, 2024 am 01:29 AM

如果AI模型給的答案一點也看不懂，你敢用嗎？隨著機器學習系統在更重要的領域中得到應用，證明為什麼我們可以信任它們的輸出，並明確何時不應信任它們，變得越來越重要。獲得對複雜系統輸出結果信任的一個可行方法是，要求系統對其輸出產生一種解釋，這種解釋對人類或另一個受信任的系統來說是可讀的，即可以完全理解以至於任何可能的錯誤都可以被發現。例如，為了建立對司法系統的信任，我們要求法院提供清晰易讀的書面意見，解釋並支持其決策。對於大型語言模型來說，我們也可以採用類似的方法。不過，在採用這種方法時，確保語言模型生

黎曼猜想显著突破！陶哲轩强推MIT、牛津新论文，37岁菲尔兹奖得主参与 Aug 05, 2024 pm 03:32 PM

最近，被稱為千禧年七大難題之一的黎曼猜想迎來了新突破。黎曼猜想是數學中一個非常重要的未解決問題，與素數分佈的精確性質有關（素數是那些只能被1和自身整除的數字，它們在數論中扮演著基礎性的角色）。在當今的數學文獻中，已有超過一千個數學命題以黎曼猜想（或其推廣形式）的成立為前提。也就是說，黎曼猜想及其推廣形式一旦被證明，這一千多個命題將被確立為定理，對數學領域產生深遠的影響；而如果黎曼猜想被證明是錯誤的，那麼這些命題中的一部分也將隨之失去其有效性。新的突破來自MIT數學教授LarryGuth和牛津大學

LLM用於時序預測真的不行，連推理能力都沒用到 Jul 15, 2024 pm 03:59 PM

語言模型真的能用於時序預測嗎？根據貝特里奇頭條定律（任何以問號結尾的新聞標題，都能夠用「不」來回答），答案應該是否定的。事實似乎也果然如此：強大如斯的LLM並不能很好地處理時序資料。時序，即時間序列，顧名思義，是指一組依照時間發生先後順序排列的資料點序列。在許多領域，時序分析都很關鍵，包括疾病傳播預測、零售分析、醫療和金融。在時序分析領域，近期不少研究者都在研究如何使用大型語言模型（LLM）來分類、預測和偵測時間序列中的異常。這些論文假設擅長處理文本中順序依賴關係的語言模型也能泛化用於時間序

See all articles

大模型微調非得依賴人類資料嗎？ DeepMind：用有回饋的自我訓練比較好

熱AI工具

Undresser.AI Undress

AI Clothes Remover

Undress AI Tool

Clothoff.io

Video Face Swap

熱門文章

熱工具

記事本++7.3.1

SublimeText3漢化版

禪工作室 13.0.1

Dreamweaver CS6

SublimeText3 Mac版

熱門話題