逆に？ MLPに代わると主張する新しいコンテストでKANは1試合しか勝てなかった-AI-php.cn

ホームページ

テクノロジー周辺機器

逆に？ MLPに代わると主張する新しいコンテストでKANは1試合しか勝てなかった

WBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWB

Jul 28, 2024 am 08:05 AM

プロジェクト多層パーセプトロン

KAN leads in symbolic representation, but MLP is still a generalist.

完全接続フィードフォワードニューラルネットワークとしても知られる多層パーセプトロン (MLP) は、今日の深層学習モデルの基本コンポーネントです。 MLP は機械学習における非線形関数を近似するためのデフォルトの方法であるため、MLP の重要性はいくら強調してもしすぎることはありません。

ただし、MLP には、学習した表現の解釈の難しさやネットワークサイズの柔軟なスケーリングの難しさなど、特定の制限もあります。

KAN (コルモゴロフ – アーノルドネットワーク) の出現により、従来の MLP に代わる革新的なソリューションが提供されます。このメソッドは、精度と解釈可能性の点で MLP よりも優れており、非常に少数のパラメーターではるかに大きなパラメーターサイズで実行される MLP よりも優れたパフォーマンスを発揮できます。

それで、問題は、KANとMLPのどちらを選択すべきかということです。 KAN は単なる通常の MLP であり、まったく代替できないため、MLP を支持する人もいますが、現在の 2 つの比較も異なるパラメータまたは FLOP に限定されており、実験結果は不公平であると考える人もいます。

KANの可能性を探るためには、公正な環境でKANとMLPを総合的に比較する必要があります。

この目的を達成するために、シンガポール国立大学の研究者たちは、KAN と MLP のパラメーターまたは FLOP を制御しながら、記号式表現、機械学習などのさまざまな分野のタスクで KAN と MLP をトレーニングし、評価しました。 NLP と音声処理。これらの公正な設定の下では、KAN が記号式表現タスクでのみ MLP を上回り、他のタスクでは MLP が全体的に KAN を上回ったことがわかりました。

逆に？ MLPに代わると主張する新しいコンテストでKANは1試合しか勝てなかった

論文アドレス: https://arxiv.org/pdf/2407.16674
プロジェクトリンク: https://github.com/yu-rp/KANbeFair
論文タイトル: KAN またはMLP: より公平な比較

著者はさらに、シンボリック式表現におけるKANの利点がB-スプライン活性化関数の使用に由来していることを発見しました。当初、MLP の全体的なパフォーマンスは KAN に遅れていましたが、MLP の活性化関数を B スプラインに置き換えた後、そのパフォーマンスは KAN に匹敵するか、さらにはそれを超えました。ただし、B スプラインでは、コンピュータービジョンなどの他のタスクにおける MLP のパフォーマンスをさらに向上させることはできません。

著者らは、KAN が実際には継続学習タスクにおいて MLP よりも優れたパフォーマンスを発揮しないことも発見しました。 KAN の元の論文では、一連の 1 次元関数を使用した連続学習タスクにおける KAN と MLP のパフォーマンスを比較しました。ここで、後続の各関数は、前の関数を数軸に沿って変換したものです。このペーパーでは、より標準的なクラス増分継続学習設定における KAN と MLP のパフォーマンスを比較します。固定されたトレーニング反復条件の下では、KAN の忘却の問題が MLP よりも深刻であることがわかりました。

KAN、MLPの簡単な紹介

KANには2つの分岐があり、最初の分岐はB-スプライン分岐で、もう1つの分岐はショートカット分岐です。つまり、非線形活性化と線形変換は一緒に接続されます。公式実装では、ショートカット分岐は線形変換が後に続く SiLU 関数です。 x がサンプルの特徴ベクトルを表すものとします。次に、KAN スプライン分岐の順方程式は次のように書くことができます:

元の KAN アーキテクチャでは、スプライン関数は B スプライン関数として選択されます。各 B スプライン関数のパラメーターは、他のネットワークパラメーターと一緒に学習されます。

同様に、単層 MLP の順方程式は次のように表すことができます:

この式は、非線形関数が異なることを除いて、KAN の B スプライン分岐式と同じ形式をとります。。したがって、元の論文の KAN 構造の解釈に関係なく、KAN は全結合層とみなすこともできます。

したがって、KAN と通常の MLP の間には 2 つの主な違いがあります:

活性化関数が異なります。通常、MLP の活性化関数には ReLU や GELU などが含まれますが、これらは学習可能なパラメータを持たず、すべての入力要素に対して均一です。KAN では、活性化関数は学習可能なパラメータを持つスプライン関数であり、入力ごとに要素がすべて異なります。。
線形操作と非線形操作のシーケンス。일반적으로 연구자들은 MLP를 먼저 선형 변환을 수행한 다음 비선형 변환을 수행하는 것으로 개념화하는 반면 KAN은 실제로 비선형 변환을 먼저 수행한 다음 선형 변환을 수행합니다. 그러나 어느 정도 MLP의 완전 연결 레이어를 먼저 비선형으로 설명한 다음 선형으로 설명하는 것도 가능합니다.

KAN과 MLP를 비교함으로써 본 연구에서는 둘의 차이점은 주로 활성화 함수에 있다고 믿습니다. 따라서 그들은 활성화 함수의 차이로 인해 KAN과 MLP가 서로 다른 작업에 적합하고 결과적으로 두 모델 간의 기능적 차이가 발생한다는 가설을 세웠습니다. 이 가설을 테스트하기 위해 연구원들은 다양한 작업에서 KAN과 MLP의 성능을 비교하고 각 모델이 적합한 작업을 설명했습니다. 공정한 비교를 위해 본 연구에서는 먼저 KAN과 MLP의 매개변수 수와 FLOP를 계산하는 공식을 도출한다. 실험 프로세스는 KAN과 MLP의 성능을 비교하기 위해 동일한 수의 매개변수 또는 FLOP를 제어합니다.的 Kan 및 MLP의 매개변수 수와 FLOP의 제어 매개변수 수

ㅋㅋㅋ

🎜🎜🎜 🎜🎜🎜🎜🎜 🎜 🎜🎜🎜🎜🎜🎜, 단축 가중치, B 크기 가중치 가중치 및 편향항. 학습 가능한 매개변수의 총 개수는 다음과 같습니다. 🎜🎜🎜🎜🎜 여기서 d_in과 d_out은 신경망 계층의 입력 및 출력 차원을 나타내고, K는 공식 nn.Module의 매개변수 k에 해당하는 스플라인의 순서를 나타냅니다. 스플라인 함수의 다항식 기저의 차수인 KANLayer입니다. G는 공식 nn.Module KANLayer의 num 매개변수에 해당하는 스플라인 간격 수를 나타냅니다. 채우기 전의 B-스플라인 간격 수입니다. 채우기 전에는 제어점 수 - 1과 같습니다. 채우기 후에는 (K + G) 유효한 제어점이 있어야 합니다. 🎜🎜🎜🎜🎜따라서 MLP 레이어의 학습 가능한 매개 변수는 다음과 같습니다. 🎜🎜🎜🎜🎜🎜KAN 및 MLP의 FLOP🎜🎜🎜🎜🎜🎜저자의 평가에서 모든 산술 연산의 FLOP는 1로 간주됩니다. 부울 연산의 FLOP는 0으로 간주됩니다. De Boor-Cox 알고리즘의 0차 연산은 부동 소수점 연산이 필요하지 않은 일련의 부울 연산으로 변환될 수 있습니다. 따라서 이론적으로 FLOP는 0이다. 이는 부울 데이터를 연산을 위해 부동 소수점 데이터로 다시 변환하는 공식 KAN 구현과 다릅니다. 🎜🎜🎜🎜🎜저자의 평가에서는 하나의 샘플에 대해 FLOP를 계산했습니다. 공식 KAN 코드에서 De Boor-Cox 반복 공식을 사용하여 구현된 B-스플라인 FLOP는 다음과 같습니다. 🎜🎜🎜🎜🎜 지름길 경로의 FLOP와 두 분기를 병합하는 FLOP를 합하면 KAN 레이어의 전체 FLOP가 됩니다. 🎜🎜🎜🎜🎜 이에 따라 MLP 레이어의 FLOP는 다음과 같습니다. 🎜🎜🎜🎜🎜입력 차원과 출력 차원이 동일한 KAN 레이어와 MLP 레이어 간의 FLOP 차이는 다음과 같이 표현될 수 있습니다. 🎜🎜🎜🎜 🎜MLP가 비선형 연산도 먼저 수행하는 경우 최고항은 0이 됩니다. 🎜🎜🎜🎜🎜🎜 실험 🎜🎜🎜🎜🎜🎜저자의 목표는 매개변수 개수 또는 FLOP 개수가 동일할 때 KAN과 MLP의 성능 차이를 비교하는 것입니다. 실험은 기계 학습, 컴퓨터 비전, 자연어 처리, 오디오 처리 및 기호 수식 표현을 포함한 여러 영역을 다룹니다. 모든 실험은 Adam 최적화 프로그램을 사용했으며 모두 RTX3090 GPU에서 수행되었습니다. 🎜🎜🎜🎜🎜🎜성능 비교🎜🎜🎜🎜🎜🎜기계 학습. 저자들은 1개 또는 2개의 히든 레이어가 있는 KAN과 MLP를 사용하여 8개의 머신러닝 데이터세트에 대한 실험을 수행했으며, 각 데이터세트의 특성에 따라 신경망의 입력 및 출력 차원을 조정했습니다. 🎜🎜🎜🎜🎜MLP의 경우 숨겨진 레이어 너비가 32, 64, 128, 256, 512 또는 1024로 설정되고 활성화 함수로 GELU 또는 ReLU가 사용되는 반면 MLP에서는 정규화 레이어가 사용됩니다. KAN의 경우 숨겨진 레이어 너비는 2, 4, 8 또는 16이고 B-스플라인 메시 수는 3, 5, 10 또는 20이며 B-스플라인 각도는 2, 3 또는 5입니다.

원래 KAN 아키텍처에는 정규화 계층이 포함되어 있지 않기 때문에 MLP에서 정규화 계층의 가능한 이점의 균형을 맞추기 위해 저자는 KAN 스플라인 함수의 값 범위를 확장했습니다. 모든 실험은 20회 훈련 동안 수행되었으며 그림 2와 3에 표시된 것처럼 훈련 과정 동안 테스트 세트에서 달성된 최고의 정확도가 기록되었습니다.

기계 학습 데이터 세트에서는 MLP가 일반적으로 이점을 유지합니다. 8개 데이터 세트에 대한 실험에서 MLP는 그 중 6개 데이터 세트에서 KAN보다 성능이 뛰어났습니다. 그러나 그들은 또한 한 데이터 세트에서는 MLP와 KAN의 성능이 거의 동일했지만 다른 데이터 세트에서는 KAN이 MLP보다 더 나은 성능을 발휘한다는 것을 관찰했습니다.

전반적으로 MLP는 여전히 기계 학습 데이터 세트에 대한 일반적인 이점을 가지고 있습니다.

컴퓨터 비전. 저자는 8개의 컴퓨터 비전 데이터세트에 대해 실험을 수행했습니다. 그들은 하나 또는 두 개의 숨겨진 레이어가 있는 KAN과 MLP를 사용하여 데이터 세트에 따라 신경망의 입력 및 출력 차원을 조정했습니다.

컴퓨터 비전 데이터 세트에서 KAN 의 스플라인 함수에 의해 도입된 처리 편향은 효과가 없으며 성능은 항상 동일한 수의 매개변수 또는 FLOP를 사용하는 MLP보다 열등합니다.

오디오 및 자연어 처리. 저자는 2개의 오디오 분류 데이터셋과 2개의 텍스트 분류 데이터셋에 대해 실험을 수행했습니다. 그들은 은닉층이 1~2개 있는 KAN과 MLP를 사용했고, 데이터 세트의 특성에 따라 신경망의 입력과 출력 차원을 조정했습니다.

두 오디오 데이터 세트 모두에서 MLP가 KAN보다 성능이 뛰어납니다.

텍스트 분류 작업에서 MLP는 AG News 데이터 세트에 대한 이점을 유지합니다. 그러나 CoLA 데이터세트에서는 MLP와 KAN의 성능에 큰 차이가 없습니다. KAN은 제어 매개변수의 수가 동일할 때 CoLA 데이터세트에 유리한 것으로 보입니다. 그러나 KAN의 스플라인에는 더 높은 FLOP가 필요하므로 이 이점은 제어된 FLOP를 사용한 실험에서 일관되게 나타나지 않습니다. FLOP를 제어할 때 MLP가 더 우수한 것으로 보입니다. 따라서 CoLA 데이터세트에서 어떤 모델이 더 나은지에 대한 명확한 대답은 없습니다.

전반적으로 MLP가 오디오 및 텍스트 작업 모두에서 여전히 더 나은 선택입니다.

기호 수식 표현. 저자는 8가지 기호 수식 표현 작업에서 KAN과 MLP의 차이점을 비교했습니다. 그들은 1~4개의 숨겨진 레이어가 있는 KAN과 MLP를 사용하여 데이터 세트에 따라 신경망의 입력 및 출력 차원을 조정했습니다.

KAN은 매개변수 수를 제어하면서 8개 데이터 세트 중 7개에서 MLP보다 성능이 뛰어납니다. FLOP를 제어할 때 KAN은 대략 MLP와 동등한 성능을 발휘하여 두 데이터 세트에서 MLP보다 성능이 뛰어나고 스플라인으로 인해 발생하는 추가 계산 복잡성으로 인해 다른 데이터 세트에서는 MLP보다 열등합니다.

전반적으로 KAN은 기호식 표현 작업에서 MLP보다 성능이 뛰어납니다.

以上が逆に？ MLPに代わると主張する新しいコンテストでKANは1試合しか勝てなかったの詳細内容です。詳細については、PHP 中国語 Web サイトの他の関連記事を参照してください。

このウェブサイトの声明

この記事の内容はネチズンが自主的に寄稿したものであり、著作権は原著者に帰属します。このサイトは、それに相当する法的責任を負いません。盗作または侵害の疑いのあるコンテンツを見つけた場合は、admin@php.cn までご連絡ください。

ホットAIツール

Undresser.AI Undress

リアルなヌード写真を作成する AI 搭載アプリ

AI Clothes Remover

写真から衣服を削除するオンライン AI ツール。

Undress AI Tool

脱衣画像を無料で

Clothoff.io

AI衣類リムーバー

Video Face Swap

完全無料の AI 顔交換ツールを使用して、あらゆるビデオの顔を簡単に交換できます。

ホットツール

メモ帳++7.3.1

使いやすく無料のコードエディター

SublimeText3 中国語版

中国語版、とても使いやすい

ゼンドスタジオ 13.0.1

強力な PHP 統合開発環境

ドリームウィーバー CS6

ビジュアル Web 開発ツール

SublimeText3 Mac版

神レベルのコード編集ソフト（SublimeText3）

ホットトピック

Gmailメールのログイン入り口はどこですか？

7889

Java チュートリアル

1650

CakePHP チュートリアル

1411

Laravel チュートリアル

1302

PHP チュートリアル

1248

Related knowledge

ControlNet の作者がまたヒット作を出しました!写真から絵画を生成し、2 日間で 1.4,000 個のスターを獲得する全プロセス Jul 17, 2024 am 01:56 AM

これも Tusheng のビデオですが、PaintsUndo は別の道を歩んでいます。 ControlNet 作者 LvminZhang が再び生き始めました!今回は絵画の分野を目指します。新しいプロジェクト PaintsUndo は、開始されて間もなく 1.4kstar を獲得しました (まだ異常なほど上昇しています)。プロジェクトアドレス: https://github.com/lllyasviel/Paints-UNDO このプロジェクトを通じて、ユーザーが静止画像を入力すると、PaintsUndo が線画から完成品までのペイントプロセス全体のビデオを自動的に生成するのに役立ちます。。描画プロセス中の線の変化は驚くべきもので、最終的なビデオ結果は元の画像と非常によく似ています。完成した描画を見てみましょう。

オープンソース AI ソフトウェアエンジニアのリストのトップに立つ UIUC のエージェントレスソリューションは、SWE ベンチの実際のプログラミングの問題を簡単に解決します Jul 17, 2024 pm 10:02 PM

AIxivコラムは、当サイトが学術的・技術的な内容を掲載するコラムです。過去数年間で、このサイトの AIxiv コラムには 2,000 件を超えるレポートが寄せられ、世界中の主要な大学や企業のトップ研究室がカバーされ、学術交流と普及を効果的に促進しています。共有したい優れた作品がある場合は、お気軽に寄稿するか、報告のために当社までご連絡ください。提出電子メール: liyazhou@jiqizhixin.com; zhaoyunfeng@jiqizhixin.com この論文の著者は全員、イリノイ大学アーバナシャンペーン校 (UIUC) の Zhang Lingming 教師のチームのメンバーです。博士課程4年、研究者

RLHF から DPO、TDPO に至るまで、大規模なモデルアライメントアルゴリズムはすでに「トークンレベル」になっています Jun 24, 2024 pm 03:04 PM

AIxivコラムは、当サイトが学術的・技術的な内容を掲載するコラムです。過去数年間で、このサイトの AIxiv コラムには 2,000 件を超えるレポートが寄せられ、世界中の主要な大学や企業のトップ研究室がカバーされ、学術交流と普及を効果的に促進しています。共有したい優れた作品がある場合は、お気軽に寄稿するか、報告のために当社までご連絡ください。提出メール: liyazhou@jiqizhixin.com; zhaoyunfeng@jiqizhixin.com 人工知能の開発プロセスにおいて、大規模言語モデル (LLM) の制御とガイダンスは常に中心的な課題の 1 つであり、これらのモデルが両方とも確実に機能することを目指しています。強力かつ安全に人類社会に貢献します。初期の取り組みは人間のフィードバックによる強化学習手法に焦点を当てていました (RL

OpenAI Super Alignment チームの遺作: 2 つの大きなモデルがゲームをプレイし、出力がより理解しやすくなる Jul 19, 2024 am 01:29 AM

AIモデルによって与えられた答えがまったく理解できない場合、あなたはそれをあえて使用しますか?機械学習システムがより重要な分野で使用されるにつれて、なぜその出力を信頼できるのか、またどのような場合に信頼してはいけないのかを実証することがますます重要になっています。複雑なシステムの出力に対する信頼を得る方法の 1 つは、人間または他の信頼できるシステムが読み取れる、つまり、考えられるエラーが発生する可能性がある点まで完全に理解できる、その出力の解釈を生成することをシステムに要求することです。見つかった。たとえば、司法制度に対する信頼を築くために、裁判所に対し、決定を説明し裏付ける明確で読みやすい書面による意見を提供することを求めています。大規模な言語モデルの場合も、同様のアプローチを採用できます。ただし、このアプローチを採用する場合は、言語モデルが

リーマン予想の大きな進歩!陶哲軒氏はMITとオックスフォードの新しい論文を強く推薦し、37歳のフィールズ賞受賞者も参加した Aug 05, 2024 pm 03:32 PM

最近、2000年代の7大問題の一つとして知られるリーマン予想が新たなブレークスルーを達成した。リーマン予想は、数学における非常に重要な未解決の問題であり、素数の分布の正確な性質に関連しています (素数とは、1 とそれ自身でのみ割り切れる数であり、整数論において基本的な役割を果たします)。今日の数学文献には、リーマン予想 (またはその一般化された形式) の確立に基づいた 1,000 を超える数学的命題があります。言い換えれば、リーマン予想とその一般化された形式が証明されれば、これらの 1,000 を超える命題が定理として確立され、数学の分野に重大な影響を与えることになります。これらの命題の一部も有効性を失います。 MIT数学教授ラリー・ガスとオックスフォード大学から新たな進歩がもたらされる

arXiv 論文は「弾幕」として投稿可能、スタンフォード alphaXiv ディスカッションプラットフォームはオンライン、LeCun は気に入っています Aug 01, 2024 pm 05:18 PM

乾杯！紙面でのディスカッションが言葉だけになると、どんな感じになるでしょうか?最近、スタンフォード大学の学生が、arXiv 論文のオープンディスカッションフォーラムである alphaXiv を作成しました。このフォーラムでは、arXiv 論文に直接質問やコメントを投稿できます。 Web サイトのリンク: https://alphaxiv.org/ 実際、URL の arXiv を alphaXiv に変更するだけで、alphaXiv フォーラムの対応する論文を直接開くことができます。この Web サイトにアクセスする必要はありません。その中の段落を正確に見つけることができます。論文、文: 右側のディスカッションエリアでは、ユーザーは論文のアイデアや詳細について著者に尋ねる質問を投稿できます。たとえば、次のような論文の内容についてコメントすることもできます。

最初の Mamba ベースの MLLM が登場しました!モデルの重み、トレーニングコードなどはすべてオープンソースです Jul 17, 2024 am 02:46 AM

AIxivコラムは、当サイトが学術的・技術的な内容を掲載するコラムです。過去数年間で、このサイトの AIxiv コラムには 2,000 件を超えるレポートが寄せられ、世界中の主要な大学や企業のトップ研究室がカバーされ、学術交流と普及を効果的に促進しています。共有したい優れた作品がある場合は、お気軽に寄稿するか、報告のために当社までご連絡ください。提出電子メール: liyazhou@jiqizhixin.com; zhaoyunfeng@jiqizhixin.com。はじめに近年、さまざまな分野でマルチモーダル大規模言語モデル (MLLM) の適用が目覚ましい成功を収めています。ただし、多くの下流タスクの基本モデルとして、現在の MLLM はよく知られた Transformer ネットワークで構成されています。

公理的トレーニングにより、LLM は因果推論を学習できます。6,700 万個のパラメータモデルは、1 兆個のパラメータレベル GPT-4 に匹敵します。 Jul 17, 2024 am 10:14 AM

LLM に因果連鎖を示すと、LLM は公理を学習します。 AI はすでに数学者や科学者の研究を支援しています。たとえば、有名な数学者のテレンスタオは、GPT などの AI ツールを活用した研究や探索の経験を繰り返し共有しています。 AI がこれらの分野で競争するには、強力で信頼性の高い因果推論能力が不可欠です。この記事で紹介する研究では、小さなグラフでの因果的推移性公理の実証でトレーニングされた Transformer モデルが、大きなグラフでの推移性公理に一般化できることがわかりました。言い換えれば、Transformer が単純な因果推論の実行を学習すると、より複雑な因果推論に使用できる可能性があります。チームが提案した公理的トレーニングフレームワークは、デモンストレーションのみで受動的データに基づいて因果推論を学習するための新しいパラダイムです。

See all articles