AI學會隱藏思考暗中推理!不依賴人類經驗解決複雜任務,更黑箱了
AI做數學題,真正的思考居然是暗中「心算」的?
紐約大學團隊新研究發現,即使不讓AI寫步驟,全用無意義的「…」代替,在一些複雜任務上的表現也能大幅提升!
一作Jacab Pfau表示:只要花費算力產生額外token就能帶來優勢,具體選擇了什麼token無關緊要。
圖片
舉例來說,讓Llama 34M回答一個簡單問題:自然常數e的前6位數中,有幾個大於5的?
AI直接回答約等於瞎搗亂,只統計前6位數字居然統計出7個來。
讓AI把驗證每一數字的步驟寫出來,便可以得到正確答案。
讓AI把步驟隱藏,替換成大量的“…”,依然能得到正確答案!
圖片
這篇論文一經發布便掀起大量討論,被評價為「我見過的最玄學的AI論文」。
圖片
那麼,年輕人喜歡說更多的「嗯…」、「like…」等無意義口癖,難道也可以加強推理能力?
圖片
從「一步一步」想,到「一點一點」想
實際上,紐約大學團隊的研究正是從思維鏈(Chain-of-Thought,CoT)出發的。
也就是那句著名提示詞「讓我們一步一步地想」(Let‘s think step by step)。
圖片
過去人們發現,使用CoT推理可以顯著提升大模型在各種基準測試中的表現。
目前尚不清楚的是,這種效能提升到底源自於模仿人類把任務分解成更容易解決的步驟,還是額外的計算量帶來的副產物。
為了驗證這個問題,團隊設計了兩個特殊任務和對應的合成資料集:3SUM和2SUM-Transform。
3SUM要求從一組給定的數字序列中找出三個數,使得這三個數的和滿足特定條件,例如除以10餘0。
圖片
這個任務的計算複雜度是O(n3),而標準的Transformer在上一層的輸入和下一層的激活之間只能產生二次依賴關係。
也就是說,當n夠大序列夠長時,3SUM任務超出了Transformer的表達能力。
在訓練資料集中,把與人類推理步驟相同長度的「...」填入問題和答案之間,也就是AI在訓練中沒有見過人類是怎麼拆解問題的。
圖片
在實驗中,不輸出填充token「…...」的Llama 34M表現隨著序列長度增加而下降,而輸出填充token時一直到長度14還能保證100%準確率。
圖片
2SUM-Transform只需判斷兩個數字總和是否符合要求,這在 Transformer 的表達能力範圍內。
但問題的最後增加了一步“對輸入序列的每個數字進行隨機置換”,以防止模型在輸入token上直接計算。
結果表明,使用填充token可以將準確率從 78.7%提高到93.6%。
圖片
除了最終準確率,作者還研究了填充token的隱藏層表示。實驗表明,凍結前面層的參數,只微調最後一個Attention層,隨著可用的填充token數量增多,預測的準確率增加。
這證實了填充token的隱藏層表示確實包含了與下游任務相關的隱性計算。
圖片
AI學會隱藏想法了?
有網友懷疑,這篇論文難道在說「思維鏈」方法其實是假的嗎?研究這麼久的提示詞工程,都白玩了。
圖片
團隊表示,從理論上填入token的作用僅限於TC0複雜度的問題範圍內。
TC0也就是可以透過一個固定深度的電路來解決的計算問題,其中電路的每一層都可以並行處理,可以透過少數幾層邏輯閘(如AND、OR和NOT閘)快速解決,也是Transformer在單一先前向傳播中能處理的計算複雜度上限。
而足夠長的思維鏈,能將Transformer的表達能力擴展到TC0之外。
而且讓大模型學習利用填充token並不容易,需要提供特定的密集監督才能收斂。
也就是說,現有的大模型不太可能直接從填充token方法中獲益。
但這並不是目前架構的內在局限性,如果在訓練資料中提供足夠的示範,它們應該也能從填充符號中獲得類似的好處。
這項研究也引發了一個令人擔憂的問題:大模型有能力進行無法監控的暗中計算,對AI的可解釋性和可控性提出了新的挑戰。
換句話說,AI可以不依賴人類經驗,以人們看不見的形式自行推理。
這既刺激又可怕。
圖片
最後有網友開玩笑提議,讓Llama 3先生成1千萬億點點點,就能得到AGI的權重了(狗頭) 。
圖片
論文:https://www.php.cn/link/36157dc9be261fec78aeee1a94158c26
參考連結:
[1]https://www.php.cn/link/e350113047e82ceecb455c33c21ef32a[2]https://www.php.cn/link/872de53a900f3250aee#3811956490
以上是AI學會隱藏思考暗中推理!不依賴人類經驗解決複雜任務,更黑箱了的詳細內容。更多資訊請關注PHP中文網其他相關文章!

熱AI工具

Undresser.AI Undress
人工智慧驅動的應用程序,用於創建逼真的裸體照片

AI Clothes Remover
用於從照片中去除衣服的線上人工智慧工具。

Undress AI Tool
免費脫衣圖片

Clothoff.io
AI脫衣器

Video Face Swap
使用我們完全免費的人工智慧換臉工具,輕鬆在任何影片中換臉!

熱門文章

熱工具

記事本++7.3.1
好用且免費的程式碼編輯器

SublimeText3漢化版
中文版,非常好用

禪工作室 13.0.1
強大的PHP整合開發環境

Dreamweaver CS6
視覺化網頁開發工具

SublimeText3 Mac版
神級程式碼編輯軟體(SublimeText3)

使用C 中的chrono庫可以讓你更加精確地控制時間和時間間隔,讓我們來探討一下這個庫的魅力所在吧。 C 的chrono庫是標準庫的一部分,它提供了一種現代化的方式來處理時間和時間間隔。對於那些曾經飽受time.h和ctime折磨的程序員來說,chrono無疑是一個福音。它不僅提高了代碼的可讀性和可維護性,還提供了更高的精度和靈活性。讓我們從基礎開始,chrono庫主要包括以下幾個關鍵組件:std::chrono::system_clock:表示系統時鐘,用於獲取當前時間。 std::chron

DMA在C 中是指DirectMemoryAccess,直接內存訪問技術,允許硬件設備直接與內存進行數據傳輸,不需要CPU干預。 1)DMA操作高度依賴於硬件設備和驅動程序,實現方式因係統而異。 2)直接訪問內存可能帶來安全風險,需確保代碼的正確性和安全性。 3)DMA可提高性能,但使用不當可能導致系統性能下降。通過實踐和學習,可以掌握DMA的使用技巧,在高速數據傳輸和實時信號處理等場景中發揮其最大效能。

在C 中處理高DPI顯示可以通過以下步驟實現:1)理解DPI和縮放,使用操作系統API獲取DPI信息並調整圖形輸出;2)處理跨平台兼容性,使用如SDL或Qt的跨平台圖形庫;3)進行性能優化,通過緩存、硬件加速和動態調整細節級別來提升性能;4)解決常見問題,如模糊文本和界面元素過小,通過正確應用DPI縮放來解決。

C 在實時操作系統(RTOS)編程中表現出色,提供了高效的執行效率和精確的時間管理。 1)C 通過直接操作硬件資源和高效的內存管理滿足RTOS的需求。 2)利用面向對象特性,C 可以設計靈活的任務調度系統。 3)C 支持高效的中斷處理,但需避免動態內存分配和異常處理以保證實時性。 4)模板編程和內聯函數有助於性能優化。 5)實際應用中,C 可用於實現高效的日誌系統。

在C 中測量線程性能可以使用標準庫中的計時工具、性能分析工具和自定義計時器。 1.使用庫測量執行時間。 2.使用gprof進行性能分析,步驟包括編譯時添加-pg選項、運行程序生成gmon.out文件、生成性能報告。 3.使用Valgrind的Callgrind模塊進行更詳細的分析,步驟包括運行程序生成callgrind.out文件、使用kcachegrind查看結果。 4.自定義計時器可靈活測量特定代碼段的執行時間。這些方法幫助全面了解線程性能,並優化代碼。

交易所內置量化工具包括:1. Binance(幣安):提供Binance Futures量化模塊,低手續費,支持AI輔助交易。 2. OKX(歐易):支持多賬戶管理和智能訂單路由,提供機構級風控。獨立量化策略平台有:3. 3Commas:拖拽式策略生成器,適用於多平台對沖套利。 4. Quadency:專業級算法策略庫,支持自定義風險閾值。 5. Pionex:內置16 預設策略,低交易手續費。垂直領域工具包括:6. Cryptohopper:雲端量化平台,支持150 技術指標。 7. Bitsgap:

在MySQL中,添加字段使用ALTERTABLEtable_nameADDCOLUMNnew_columnVARCHAR(255)AFTERexisting_column,刪除字段使用ALTERTABLEtable_nameDROPCOLUMNcolumn_to_drop。添加字段時,需指定位置以優化查詢性能和數據結構;刪除字段前需確認操作不可逆;使用在線DDL、備份數據、測試環境和低負載時間段修改表結構是性能優化和最佳實踐。

C 中使用字符串流的主要步驟和注意事項如下:1.創建輸出字符串流並轉換數據,如將整數轉換為字符串。 2.應用於復雜數據結構的序列化,如將vector轉換為字符串。 3.注意性能問題,避免在處理大量數據時頻繁使用字符串流,可考慮使用std::string的append方法。 4.注意內存管理,避免頻繁創建和銷毀字符串流對象,可以重用或使用std::stringstream。
