李開復正式宣布推出「全球最強」的開源大模型：處理40萬漢字，中英文皆位居榜首-人工智慧-PHP中文網

首頁

科技週邊

人工智慧

李開復正式宣布推出「全球最強」的開源大模型：處理40萬漢字，中英文皆位居榜首

PHPz

Nov 06, 2023 pm 06:13 PM

產業李開復 010,000 件東西

李開復指出：「要讓零一萬物躋身全球大模型的第一梯隊。」

李開復正式宣布推出「全球最強」的開源大模型：處理40萬漢字，中英文皆位居榜首

開源大模型宇宙又有了新的重量級成員，這次是創新工場董事長兼CE0 李開復大模型公司「零一萬物」推出的「Yi」系列開源大模型。據悉，零一萬物在今年 3 月底官方宣布成立，六、七月開始運營，李開復博士為創辦人兼 CEO。

11 月6 日，零一萬物正式發布「Yi」系列預訓練開源大模型，包括了 Yi-6B 和Yi-34B 兩個版本，給了開源大模型社群「一點小小的震撼」。

根據Hugging Face 英文開源社群平台和C-Eval 中文評測的最新名單，Yi-34B 預訓練模式取得了多項SOTA 國際最佳效能指標認可，成為全球開源大模型“雙料冠軍”，擊敗了LLaMA2 和Falcon 等開源競品。

李開復正式宣布推出「全球最強」的開源大模型：處理40萬漢字，中英文皆位居榜首

Yi-34B 也成為迄今為止唯一成功登頂 Hugging Face 全球開源模型排行榜的國產模型。

李開復正式宣布推出「全球最強」的開源大模型：處理40萬漢字，中英文皆位居榜首

以小博大，登頂全球英文及中文權威大模型榜單No 1

我們了解到，在Hugging Face 英文測試公開榜單Pretrained 預訓練開源模型排名中，Yi-34B 的各項指標表現亮眼，以70.72 的分數位列全球第一，以小博大，碾壓LLaMA2-70B 和Falcon-180B 等眾多大尺寸模型。

在參數量和性能方面，Yi-34B 相當於只用了不及LLaMA2-70B 一半、Falcon-180B 五分之一的參數量，取得了在各項測驗任務中超越全球領跑者的成績。憑藉出色表現，Yi-34B 躋身目前世界範圍內開源最強基礎模型之列。

李開復正式宣布推出「全球最強」的開源大模型：處理40萬漢字，中英文皆位居榜首

^{之後中使用：https://hugging#co/spaces/HuggingFace_4/##c/spaces/Hugging#c/spaces/Hugging#c/spaces/Hugging#H.}
#同時作為國產大模型，李開復表示，Yi-34B 更「懂」中文，

在C-Eval 中文權威榜單排行榜上超越了全球所有開源模型

。

相較於大模型最強王者GPT-4，Yi-34B 在CMMLU、E-Eval、Gaokao 三個主要中文指標上具有絕對優勢，凸顯中文世界的優異能力，能夠更好地滿足國內市場需求。

從更全面的評估來看，在全球大模型各項評測中最關鍵的「MMLU」（Massive Multitask Language Understanding，大規模多任務語言理解）、BBH 等反映模式綜合能力的評測集上，Yi-34B 表現最為突出，在通用能力、知識推理、閱讀理解等多項指標評比中全部勝出，與Hugging Face 評測高度一致。

李開復正式宣布推出「全球最強」的開源大模型：處理40萬漢字，中英文皆位居榜首

不過，與 LLaMA2 一樣，Yi 系列開源大模型在 GSM8k、MBPP 的數學和程式碼評測表現略遜 GPT 模型。未來，Yi 系列大模型將推出專攻程式碼能力與數學能力的繼續訓練模型。

上下文視窗大小突破200k，並直接開源

在對大模型實戰效果至關重要的上下文視窗方面，此次開源的Yi-34B 發布了全球最長、支援200K 超長上下文視窗版本，可以處理約40 萬漢字超長文字輸入，大致相當於一本《儒林外史》的長度。相較之下，OpenAI 的 GPT-4 上下文視窗只有 32K，文字處理量約 2.5 萬字。

李開復正式宣布推出「全球最強」的開源大模型：處理40萬漢字，中英文皆位居榜首

如何做到的呢？據了解，零一萬物技術團隊實施了一系列最佳化，包括了計算通訊重疊、序列並行、通訊壓縮等。透過這些能力增強，實現了在大規模模型訓練中近 100 倍的能力提升。

值得一提的是，零一萬物還是第一家將超長上下文視窗開源開放的大模型公司，允許開發者直接使用。

Yi-34B 的200K 上下文視窗直接開源，不僅能提供更豐富的語義信息，理解超過1000 頁的PDF 文件，讓很多依賴於向量資料庫構建外部知識庫的場景都可以用上下文視窗來進行替代。 Yi-34B 的開源屬性也為想要在更長上下文視窗進行微調的開發者提供了更多的可能性。

獨有科學訓模方法，訓練成本下降40%

##Yi- 34B 如此強大，這要歸功於以下兩個關鍵因素，即

AI Infra 團隊、自研規模化訓練平台。

李開復介紹稱，零一萬物內部設立了AI Infra（AI Infrastructure）團隊，主要負責大模型訓練和部署提供各種底層技術設施，包括處理器、作業系統、儲存系統、網路基礎設施、雲端運算平台等等，成為Yi 系列模型訓練背後極為關鍵的「保障技術」。

憑藉強大的 AI Infra 支撐，零一萬物團隊實現了超越行業水平的訓練效果。

Yi-34B 模型訓練成本實測下降 40%，實際訓練完成達標時間與預測的時間誤差不到一小時，進一步模擬上到千億規模訓練成本可下降多達 50%。

同時，零一萬物實現了從「粗放煉丹」到「科學訓模」方法論的轉化。

經過幾個月的建模和實驗，零一萬物自研出一套「規模化訓練實驗平台」，用來指導模型的設計與最佳化。資料配比、超參搜尋、模型結構實驗都可以在小規模實驗平台上進行，對 34B 模型每個節點的預測誤差都可以控制在 0.5% 以內。模型預測能力更強，大大減少了進行比較實驗所需的資源，也減少了訓練誤差對於計算資源的浪費。

資料處理管線和加大規模預測的訓練能力建設，把以往的大模型訓練碰運氣的「煉丹」過程變得極度細緻和科學化，不僅保證了目前發布Yi-34B、Yi-6B 模型的高性能，也為未來更大規模模型的訓練壓縮了時間和成本，還有能力以領先於行業的速度將模型規模擴大到數倍。

最後，李開復也宣布，在完成 Yi-34B 預訓練的同時，已經旋即啟動下一個千億參數模型的訓練。

未來幾個月，我們預計將看到更多的 Yi 後續大模型亮相。

以上是李開復正式宣布推出「全球最強」的開源大模型：處理40萬漢字，中英文皆位居榜首的詳細內容。更多資訊請關注PHP中文網其他相關文章！

本網站聲明

本文內容由網友自願投稿，版權歸原作者所有。本站不承擔相應的法律責任。如發現涉嫌抄襲或侵權的內容，請聯絡admin@php.cn

熱AI工具

熱工具

熱門話題

Java教學

1664

CakePHP 教程

1423

Laravel 教程

1320

PHP教程

1269

C# 教程

1249

Related knowledge

DeepMind機器人打乒乓球，正手、反手溜到飛起，全勝人類初學者 Aug 09, 2024 pm 04:01 PM

但可能打不過公園裡的老大爺？巴黎奧運正在如火如荼地進行中，乒乓球項目備受關注。同時，機器人打乒乓球也取得了新突破。剛剛，DeepMind提出了第一個在競技乒乓球比賽中達到人類業餘選手等級的學習型機器人智能體。論文地址：https://arxiv.org/pdf/2408.03906DeepMind這個機器人打乒乓球什麼程度呢？大概和人類業餘選手不相上下：正手反手都會：對手採用多種打法，機器人也能招架得住：接不同旋轉的發球：不過，比賽激烈程度似乎不如公園老大爺對戰。對機器人來說，乒乓球運動

首配機械爪！元蘿蔔亮相2024世界機器人大會，發布首個走進家庭的西洋棋機器人 Aug 21, 2024 pm 07:33 PM

8月21日，2024世界機器人大會在北京隆重召開。商湯科技旗下家用機器人品牌「元蘿蔔SenseRobot」家族全系產品集體亮相，並最新發布元蘿蔔AI下棋機器人－國際象棋專業版（以下簡稱「元蘿蔔國象機器人」），成為全球首個走進家庭的西洋棋機器人。作為元蘿蔔的第三款下棋機器人產品，全新的國象機器人在AI和工程機械方面進行了大量專項技術升級和創新，首次在家用機器人上實現了透過機械爪拾取立體棋子，並進行人機對弈、人人對弈、記譜複盤等功能，

Claude也變懶了！網友：學會給自己放假了 Sep 02, 2024 pm 01:56 PM

開學將至，該收心的不只即將開啟新學期的同學，可能還有AI大模型。前段時間，Reddit擠滿了吐槽Claude越來越懶的網友。「它的水平下降了很多，經常停頓，甚至輸出也變得很短。在發布的第一周，它可以一次性翻譯整整4頁文稿，現在連半頁都輸出不了！」https:// www.reddit.com/r/ClaudeAI/comments/1by8rw8/something_just_feels_wrong_with_claude_in_the/在一個名為“對Claude徹底失望了的帖子裡”，滿滿地

世界機器人大會上，這家承載「未來養老希望」的國產機器人被包圍了 Aug 22, 2024 pm 10:35 PM

在北京舉行的世界機器人大會上，人形機器人的展示成為了現場絕對的焦點，在星塵智能的展台上，由於AI機器人助理S1在一個展區上演揚琴、武術、書法三台大戲，能文能武，吸引了大量專業觀眾和媒體的駐足。在有彈性的琴弦上優雅的演奏，讓S1展現出速度、力度、精準度兼具的精細操作與絕對掌控。央視新聞對「書法」背後的模仿學習和智慧控制進行了專題報道，公司創始人來傑解釋到，絲滑動作的背後，是硬體側追求最好力控和最仿人身體指標（速度、負載等），而是在AI側則採集人的真實動作數據，讓機器人遇強則強，快速學習進化。而敏捷

ACL 2024獎項發表：華科大破解甲骨文最佳論文之一、GloVe時間檢驗獎 Aug 15, 2024 pm 04:37 PM

本屆ACL大會，投稿者「收穫滿滿」。為期六天的ACL2024正在泰國曼谷舉辦。 ACL是計算語言學和自然語言處理領域的頂級國際會議，由國際計算語言學協會組織，每年舉辦一次。一直以來，ACL在NLP領域的學術影響力都名列第一，它也是CCF-A類推薦會議。今年的ACL大會已是第62屆，接收了400餘篇NLP領域的前沿工作。昨天下午，大會公佈了最佳論文等獎項。此次，最佳論文獎7篇（兩篇未公開）、最佳主題論文獎1篇、傑出論文獎35篇。大會也評出了資源論文獎（ResourceAward）3篇、社會影響力獎（

李飛飛團隊提出ReKep，讓機器人具備空間智能，還能整合GPT-4o Sep 03, 2024 pm 05:18 PM

視覺與機器人學習的深度融合。當兩隻機器手絲滑地互相合作疊衣服、倒茶、將鞋子打包時，加上最近老上頭條的1X人形機器人NEO，你可能會產生一種感覺：我們似乎開始進入機器人時代了。事實上，這些絲滑動作正是先進機器人技術+精妙框架設計+多模態大模型的產物。我們知道，有用的機器人往往需要與環境進行複雜精妙的交互，而環境則可被表示成空間域和時間域上的限制。舉個例子，如果要讓機器人倒茶，那麼機器人首先需要抓住茶壺手柄並使之保持直立，不潑灑出茶水，然後平穩移動，一直到讓壺口與杯口對齊，之後以一定角度傾斜茶壺。這

分散式人工智慧盛會DAI 2024徵稿：Agent Day，強化學習之父Richard Sutton將出席！顏水成、Sergey Levine以及DeepMind科學家將做主旨報告 Aug 22, 2024 pm 08:02 PM

會議簡介隨著科技的快速發展，人工智慧成為了推動社會進步的重要力量。在這個時代，我們有幸見證並參與分散式人工智慧（DistributedArtificialIntelligence，DAI）的創新與應用。分散式人工智慧是人工智慧領域的重要分支，這幾年引起了越來越多的關注。基於大型語言模型（LLM）的智能體（Agent）異軍突起，透過結合大模型的強大語言理解和生成能力，展現了在自然語言互動、知識推理、任務規劃等方面的巨大潛力。 AIAgent正在接棒大語言模型，成為目前AI圈的熱門話題。 Au

鴻蒙智行享界S9全場景新品發表會，多款重磅新品齊發 Aug 08, 2024 am 07:02 AM

今天下午，鸿蒙智行正式迎来了新品牌与新车。8月6日，华为举行鸿蒙智行享界S9及华为全场景新品发布会，带来了全景智慧旗舰轿车享界S9、问界新M7Pro和华为novaFlip、MatePadPro12.2英寸、全新MatePadAir、华为毕昇激光打印机X1系列、FreeBuds6i、WATCHFIT3和智慧屏S5Pro等多款全场景智慧新品，从智慧出行、智慧办公到智能穿戴，华为全场景智慧生态持续构建，为消费者带来万物互联的智慧体验。鸿蒙智行：深度赋能，推动智能汽车产业升级华为联合中国汽车产业伙伴，为

See all articles

李開復正式宣布推出「全球最強」的開源大模型：處理40萬漢字，中英文皆位居榜首

熱AI工具

Undresser.AI Undress

AI Clothes Remover

Undress AI Tool

Clothoff.io

Video Face Swap

熱門文章

熱工具

記事本++7.3.1

SublimeText3漢化版

禪工作室 13.0.1

Dreamweaver CS6

SublimeText3 Mac版

熱門話題