ホームページ テクノロジー周辺機器 AI ハルビン工業大学が革新的な反復推論フレームワーク DPE-MNER を提案: マルチモーダル表現の可能性を最大限に活用

ハルビン工業大学が革新的な反復推論フレームワーク DPE-MNER を提案: マルチモーダル表現の可能性を最大限に活用

Jul 03, 2024 am 10:44 AM
プロジェクト DPE-MNER

哈工大提出创新迭代推理框架 DPE-MNER :充分发挥多模态表示潜力

AIxivコラムは、当サイトが学術的・技術的な内容を掲載するコラムです。過去数年間で、このサイトの AIxiv コラムには 2,000 件を超えるレポートが寄せられ、世界中の主要な大学や企業のトップ研究室がカバーされ、学術交流と普及を効果的に促進しています。共有したい優れた作品がある場合は、お気軽に寄稿するか、報告のために当社までご連絡ください。投稿メール: liyazhou@jiqizhixin.com; zhaoyunfeng@jiqizhixin.com


この記事の著者チームはハルビン工業大学のソーシャル コンピューティングおよび情報検索研究センターから来ています。著者チームは次のメンバーで構成されています。鄭子豪、張子涵、王則信、傅瑞基、劉明、王忠源、秦兵。

マルチモーダル表現

マルチモーダルナレッジグラフを構築する際の基本的かつ重要なタスクとして、マルチモーダル固有表現認識では、研究者が複数のモーダル情報を統合してテキストから固有表現を正確に抽出する必要があります。これまでの研究では、さまざまなレベルでのマルチモーダル表現の統合方法が検討されてきましたが、これらのマルチモーダル表現を融合して豊富なコンテキスト情報を提供し、それによってマルチモーダル固有表現認識のパフォーマンスを向上させるにはまだ不十分です。

この論文で、研究チームは、「分解、優先順位付け、排除」戦略に従い、多様なマルチモーダル表現を動的に統合する革新的な反復推論フレームワークであるDPE-MNERを提案します。このフレームワークは、マルチモーダル表現の融合を階層的で相互接続された融合層に巧みに分解し、処理プロセスを大幅に簡素化します。マルチモーダルな情報を統合する際、チームは「単純から複雑」および「マクロからミクロ」への段階的な移行に特に重点を置きました。さらに、クロスモーダル相関を明示的にモデル化することで、研究チームは、MNER の予測を誤解させる可能性のある無関係な情報を効果的に排除しています。 2 つの公開データセットに対する広範な実験を通じて、研究チームの方法はマルチモーダル固有表現認識の精度と効率を向上させるのに非常に効果的であることが証明されました。この論文は、LREC-COLING 2024 に受理された 1558 件の論文の中から上位 10 件の論文候補の 1 つです。

哈工大提出创新迭代推理框架 DPE-MNER :充分发挥多模态表示潜力

  • 紙のリンク: https://www.php.cn/link/4b4984066015df12cfc4e8f6d60b7147

モチベーション


哈工大提出创新迭代推理框架 DPE-MNER :充分发挥多模态表示潜力

マルチモーダル固有表現認識の例。研究チームは、固有表現認識の決定に役立つ可能性のあるさまざまなマルチモーダル表現を実証しました。人間は通常、この情報を反復的に頭の中で処理します。

この問題に対処するために、研究チームは複雑な問題解決の分野からインスピレーションを得ました (Sternberg and Frenchch、1992)。この分野は、複数の変数、不確実性、および高度な複雑性を伴う問題を解決するために人間とコンピューターが使用する方法と戦略の研究に焦点を当てています。まず、複雑な問題に直面したとき、人間は一般的に反復的なアプローチを採用すると考えられています。図に示されているように、研究チームは実際に MNER に対処する際に反復的なプロセスを使用しています。第二に、人間は、無関係な要素を分解、優先順位付け、排除するなど、特定の戦略を使用してこれらの問題を単純化します。

研究チームは、マルチモーダル固有表現認識 (MNER) を、マルチモーダル情報を統合し、これらの戦略を使用する反復プロセスとして扱うことが、MNER タスクに非常に適していると考えています。シングルステップ手法と比較して、マルチステップ手法は、固有表現認識 (NER) の結果を反復的に最適化するプロセスにおいて、多様なマルチモーダル表現をより包括的に活用できます。

さらに、これら 3 つの戦略は、マルチモーダル NER での複数の表現の統合に非常に適しています:

  • 分解戦略は、マルチモーダル表現の融合をより小さな、さまざまな粒度レベルでマルチモーダルなインタラクションを調査できる、扱いやすいユニット。
  • 優先順位付け戦略では、「簡単なものから難しいもの」、「粗いものから細かいもの」の順序に従ってマルチモーダル情報を統合することが推奨されており、この段階的な統合は、MNER 予測の段階的な最適化に貢献します。これにより、モデルは、単純だが大まかな情報から、複雑だが正確な詳細へと徐々に注意を移すことができます。
  • 無関係性排除戦略は、さまざまなマルチモーダル表現で無関係な情報を明示的に選別して除外することを促します。これにより、MNER のパフォーマンスに影響を与える可能性のある無関係な情報を排除できます。

方法

研究チームは、複数のマルチモーダル特徴を動的に融合する反復プロセスと予測ネットワークを含む、反復マルチモーダルエンティティ抽出フレームワークを設計しました。

哈工大提出创新迭代推理框架 DPE-MNER :充分发挥多模态表示潜力

反復モデリング MNER

研究チームは、拡散モデルに従い、反復ノイズ除去プロセスとしてオブジェクト認識、視覚的位置合わせ、およびテキスト エンティティ抽出をモデル化し、さらに拡散モデルを使用してマルチモーダル エンティティ抽出を組み合わせました。反復プロセスとしてモデル化されます。このモデルは、まず一連のエンティティ間隔 哈工大提出创新迭代推理框架 DPE-MNER :充分发挥多模态表示潜力 をランダムに初期化し、予測ネットワークを使用してマルチモーダル特徴をエンコードし、ノイズ除去プロセス中に繰り返しノイズを除去して、テキスト内の正しいエンティティ間隔 哈工大提出创新迭代推理框架 DPE-MNER :充分发挥多模态表示潜力 を取得します。

予測ネットワーク

図に示すように、研究チームはテキスト哈工大提出创新迭代推理框架 DPE-MNER :充分发挥多模态表示潜力で合計3つの粒度表現、つまり画像で2つの粒度と2つの難易度を取得しました(彼らは、それらが一致していると信じています)表現は単純な表現であり、位置がずれている表現は難しい表現です) 哈工大提出创新迭代推理框架 DPE-MNER :充分发挥多模态表示潜力。チームの予測ネットワーク AMRN には、エンコード ネットワーク (DMMF) とデコード ネットワーク (MER) が含まれています。予測ネットワークの設計は、前述の 3 つの戦略に基づいています。

図に示すように、エンコーディング ネットワークは、複数のマルチモーダルな特徴を融合して階層プロセスに分解する階層融合ネットワークです。ボトムアップのプロセスは、まず同じ粒度で異なる難易度の画像特徴量 を各粒度のテキスト特徴量 $x_i$ に統合し、次に異なる粒度の画像特徴量 $Y$ を各粒度のテキスト特徴量 に統合します。 、そして最後に、異なる粒度特徴 $Y$ を各粒度のテキスト特徴 哈工大提出创新迭代推理框架 DPE-MNER :充分发挥多模态表示潜力 に統合します。 画像特徴 哈工大提出创新迭代推理框架 DPE-MNER :充分发挥多模态表示潜力Y とテキスト特徴 X が融合されて、最終的なマルチモーダル表現が得られます。復号化のために復号化ネットワークに入力すると、復号化ネットワークは新しい間隔と各間隔のエンティティ タイプを取得します。

根底にある融合。このレベルの研究チームは、特定の粒度の画像特徴を特定の粒度のテキスト特徴に統合します。普及プロセスによれば、研究チームは現在のイテレーションのステータスを反映できるスケジューラを入手できます。これは
優先度を導入するための鍵でもあります。研究チームは、このスケジューラーに基づいて、さまざまな難易度の画像の特徴を融合して、哈工大提出创新迭代推理框架 DPE-MNER :充分发挥多模态表示潜力の相関関係哈工大提出创新迭代推理框架 DPE-MNER :充分发挥多模态表示潜力relを取得しました。これは、無関係な情報を排除するために使用されます。最後に、この相関関係に基づいてボトルネック変換器を使用してを融合し、一定の粒度のマルチモーダル画像とテキストの融合表現ハルビン工業大学が革新的な反復推論フレームワーク DPE-MNER を提案: マルチモーダル表現の可能性を最大限に活用が得られました。 哈工大提出创新迭代推理框架 DPE-MNER :充分发挥多模态表示潜力哈工大提出创新迭代推理框架 DPE-MNER :充分发挥多模态表示潜力

ミッドレイヤーフュージョン。この層の研究チームは、異なる粒度の画像特徴を特定の粒度のテキスト特徴に融合、つまりフュージョンハルビン工業大学が革新的な反復推論フレームワーク DPE-MNER を提案: マルチモーダル表現の可能性を最大限に活用します。この層では、スケジューラーを使用してさまざまな粒度の画像特徴を動的に融合し、特定の粒度のマルチモーダル テキスト表現を取得します哈工大提出创新迭代推理框架 DPE-MNER :充分发挥多模态表示潜力

トップフュージョン。この層の研究チームは、異なる粒度のマルチモーダル テキスト表現 ハルビン工業大学が革新的な反復推論フレームワーク DPE-MNER を提案: マルチモーダル表現の可能性を最大限に活用 を区間表現に融合して、全体的なマルチモーダル テキスト表現 哈工大提出创新迭代推理框架 DPE-MNER :充分发挥多模态表示潜力 を取得し、これを予測のために復号ネットワークに入力します。

実験結果

主な実験

著者チームは、MNERのいくつかの典型的な方法を比較しました。実験結果は、この方法が一般的に使用される 2 つのデータ セットで最高のパフォーマンスを達成することを示しています。
哈工大提出创新迭代推理框架 DPE-MNER :充分发挥多模态表示潜力
アブレーション実験

研究者らは、モデルのパフォーマンスを観察するために、論文の優先順位付け、階層化、および消去の設計を削除しました。その結果、各設計を削除するとパフォーマンスが低下することがわかりました。
哈工大提出创新迭代推理框架 DPE-MNER :充分发挥多模态表示潜力
静的特徴融合手法との比較

最大プーリング、平均プーリング、MLPベースおよびMoEベースの手法など、いくつかの典型的な静的マルチモーダル融合手法を比較しました。その結果彼らが提案した動的融合フレームワークが最高のパフォーマンスを達成できることを示しています。

哈工大提出创新迭代推理框架 DPE-MNER :充分发挥多模态表示潜力

典型的なサンプル分析

研究チームは、反復プロセスを説明するために 2 つの代表的なサンプルを選択しました。最初の反復ステップでは、タイム スクエアとキューブのタイプが誤って予測されたことがわかりますが、画像内の重要な特徴の手がかりに基づいて、正しいエンティティ タイプに反復的に修正されました。
哈工大提出创新迭代推理框架 DPE-MNER :充分发挥多模态表示潜力
結論

この論文は、優れた認識結果を得るために、マルチモーダル固有表現認識 (MNER) の分野におけるさまざまなマルチモーダル表現の可能性を最大限に活用することを目的としています。この目的を達成するために、著者らは革新的な反復推論フレームワークである DPE-MNER を設計し、提案しました。 DPE-MNER は、MNER タスクを複数の段階に分解することで、これらの豊富で多様なマルチモーダル表現の統合プロセスを巧みに簡素化します。この反復プロセスでは、マルチモーダル表現が「分解、優先順位付け、除去」の戦略に基づいて動的な融合と統合を実現します。一連の厳密な実験検証を通じて、研究チームは、DPE-MNER フレームワークの顕著な効果と優れたパフォーマンスを十分に実証しました。

参考文献:
[1] ナレッジグラフとマルチモーダル学習の融合: 包括的な調査、arxiv
[2] 分解、優先順位付け、除去: ダイバーシティをダイナミックに統合マルチモーダル固有表現認識のための表現、2024 年、計算言語学、言語資源および評価に関する国際会議
[3] 複雑な問題解決: 原理とメカニズム、1992 年、American Journal of Psycholog
[4] DiffusionNER: 固有表現認識のための境界拡散、ACL23
[5] DiffusionDet: オブジェクト検出のための拡散モデル、ICCV23
[6] 言語ガイド付き拡散視覚的グラウンディングのためのモデル、arxiv23

以上がハルビン工業大学が革新的な反復推論フレームワーク DPE-MNER を提案: マルチモーダル表現の可能性を最大限に活用の詳細内容です。詳細については、PHP 中国語 Web サイトの他の関連記事を参照してください。

このウェブサイトの声明
この記事の内容はネチズンが自主的に寄稿したものであり、著作権は原著者に帰属します。このサイトは、それに相当する法的責任を負いません。盗作または侵害の疑いのあるコンテンツを見つけた場合は、admin@php.cn までご連絡ください。

ホットAIツール

Undresser.AI Undress

Undresser.AI Undress

リアルなヌード写真を作成する AI 搭載アプリ

AI Clothes Remover

AI Clothes Remover

写真から衣服を削除するオンライン AI ツール。

Undress AI Tool

Undress AI Tool

脱衣画像を無料で

Clothoff.io

Clothoff.io

AI衣類リムーバー

Video Face Swap

Video Face Swap

完全無料の AI 顔交換ツールを使用して、あらゆるビデオの顔を簡単に交換できます。

ホットツール

メモ帳++7.3.1

メモ帳++7.3.1

使いやすく無料のコードエディター

SublimeText3 中国語版

SublimeText3 中国語版

中国語版、とても使いやすい

ゼンドスタジオ 13.0.1

ゼンドスタジオ 13.0.1

強力な PHP 統合開発環境

ドリームウィーバー CS6

ドリームウィーバー CS6

ビジュアル Web 開発ツール

SublimeText3 Mac版

SublimeText3 Mac版

神レベルのコード編集ソフト(SublimeText3)

ControlNet の作者がまたヒット作を出しました!写真から絵画を生成し、2 日間で 1.4,000 個のスターを獲得する全プロセス ControlNet の作者がまたヒット作を出しました!写真から絵画を生成し、2 日間で 1.4,000 個のスターを獲得する全プロセス Jul 17, 2024 am 01:56 AM

これも Tusheng のビデオですが、PaintsUndo は別の道を歩んでいます。 ControlNet 作者 LvminZhang が再び生き始めました!今回は絵画の分野を目指します。新しいプロジェクト PaintsUndo は、開始されて間もなく 1.4kstar を獲得しました (まだ異常なほど上昇しています)。プロジェクトアドレス: https://github.com/lllyasviel/Paints-UNDO このプロジェクトを通じて、ユーザーが静止画像を入力すると、PaintsUndo が線画から完成品までのペイントプロセス全体のビデオを自動的に生成するのに役立ちます。 。描画プロセス中の線の変化は驚くべきもので、最終的なビデオ結果は元の画像と非常によく似ています。完成した描画を見てみましょう。

オープンソース AI ソフトウェア エンジニアのリストのトップに立つ UIUC のエージェントレス ソリューションは、SWE ベンチの実際のプログラミングの問題を簡単に解決します オープンソース AI ソフトウェア エンジニアのリストのトップに立つ UIUC のエージェントレス ソリューションは、SWE ベンチの実際のプログラミングの問題を簡単に解決します Jul 17, 2024 pm 10:02 PM

AIxivコラムは、当サイトが学術的・技術的な内容を掲載するコラムです。過去数年間で、このサイトの AIxiv コラムには 2,000 件を超えるレポートが寄せられ、世界中の主要な大学や企業のトップ研究室がカバーされ、学術交流と普及を効果的に促進しています。共有したい優れた作品がある場合は、お気軽に寄稿するか、報告のために当社までご連絡ください。提出電子メール: liyazhou@jiqizhixin.com; zhaoyunfeng@jiqizhixin.com この論文の著者は全員、イリノイ大学アーバナ シャンペーン校 (UIUC) の Zhang Lingming 教師のチームのメンバーです。博士課程4年、研究者

RLHF から DPO、TDPO に至るまで、大規模なモデル アライメント アルゴリズムはすでに「トークンレベル」になっています RLHF から DPO、TDPO に至るまで、大規模なモデル アライメント アルゴリズムはすでに「トークンレベル」になっています Jun 24, 2024 pm 03:04 PM

AIxivコラムは、当サイトが学術的・技術的な内容を掲載するコラムです。過去数年間で、このサイトの AIxiv コラムには 2,000 件を超えるレポートが寄せられ、世界中の主要な大学や企業のトップ研究室がカバーされ、学術交流と普及を効果的に促進しています。共有したい優れた作品がある場合は、お気軽に寄稿するか、報告のために当社までご連絡ください。提出メール: liyazhou@jiqizhixin.com; zhaoyunfeng@jiqizhixin.com 人工知能の開発プロセスにおいて、大規模言語モデル (LLM) の制御とガイダンスは常に中心的な課題の 1 つであり、これらのモデルが両方とも確実に機能することを目指しています。強力かつ安全に人類社会に貢献します。初期の取り組みは人間のフィードバックによる強化学習手法に焦点を当てていました (RL

arXiv 論文は「弾幕」として投稿可能、スタンフォード alphaXiv ディスカッション プラットフォームはオンライン、LeCun は気に入っています arXiv 論文は「弾幕」として投稿可能、スタンフォード alphaXiv ディスカッション プラットフォームはオンライン、LeCun は気に入っています Aug 01, 2024 pm 05:18 PM

乾杯!紙面でのディスカッションが言葉だけになると、どんな感じになるでしょうか?最近、スタンフォード大学の学生が、arXiv 論文のオープン ディスカッション フォーラムである alphaXiv を作成しました。このフォーラムでは、arXiv 論文に直接質問やコメントを投稿できます。 Web サイトのリンク: https://alphaxiv.org/ 実際、URL の arXiv を alphaXiv に変更するだけで、alphaXiv フォーラムの対応する論文を直接開くことができます。この Web サイトにアクセスする必要はありません。その中の段落を正確に見つけることができます。論文、文: 右側のディスカッション エリアでは、ユーザーは論文のアイデアや詳細について著者に尋ねる質問を投稿できます。たとえば、次のような論文の内容についてコメントすることもできます。

リーマン予想の大きな進歩!陶哲軒氏はMITとオックスフォードの新しい論文を強く推薦し、37歳のフィールズ賞受賞者も参加した リーマン予想の大きな進歩!陶哲軒氏はMITとオックスフォードの新しい論文を強く推薦し、37歳のフィールズ賞受賞者も参加した Aug 05, 2024 pm 03:32 PM

最近、2000年代の7大問題の一つとして知られるリーマン予想が新たなブレークスルーを達成した。リーマン予想は、数学における非常に重要な未解決の問題であり、素数の分布の正確な性質に関連しています (素数とは、1 とそれ自身でのみ割り切れる数であり、整数論において基本的な役割を果たします)。今日の数学文献には、リーマン予想 (またはその一般化された形式) の確立に基づいた 1,000 を超える数学的命題があります。言い換えれば、リーマン予想とその一般化された形式が証明されれば、これらの 1,000 を超える命題が定理として確立され、数学の分野に重大な影響を与えることになります。これらの命題の一部も有効性を失います。 MIT数学教授ラリー・ガスとオックスフォード大学から新たな進歩がもたらされる

OpenAI Super Alignment チームの遺作: 2 つの大きなモデルがゲームをプレイし、出力がより理解しやすくなる OpenAI Super Alignment チームの遺作: 2 つの大きなモデルがゲームをプレイし、出力がより理解しやすくなる Jul 19, 2024 am 01:29 AM

AIモデルによって与えられた答えがまったく理解できない場合、あなたはそれをあえて使用しますか?機械学習システムがより重要な分野で使用されるにつれて、なぜその出力を信頼できるのか、またどのような場合に信頼してはいけないのかを実証することがますます重要になっています。複雑なシステムの出力に対する信頼を得る方法の 1 つは、人間または他の信頼できるシステムが読み取れる、つまり、考えられるエラーが発生する可能性がある点まで完全に理解できる、その出力の解釈を生成することをシステムに要求することです。見つかった。たとえば、司法制度に対する信頼を築くために、裁判所に対し、決定を説明し裏付ける明確で読みやすい書面による意見を提供することを求めています。大規模な言語モデルの場合も、同様のアプローチを採用できます。ただし、このアプローチを採用する場合は、言語モデルが

LLM は時系列予測にはあまり適していません。推論機能も使用しません。 LLM は時系列予測にはあまり適していません。推論機能も使用しません。 Jul 15, 2024 pm 03:59 PM

言語モデルは本当に時系列予測に使用できるのでしょうか?ベタリッジの見出しの法則 (疑問符で終わるニュース見出しは「いいえ」と答えることができます) によれば、答えは「いいえ」であるはずです。このような強力な LLM は時系列データを適切に処理できないという事実は真実のようです。時系列、つまり時系列とは、その名の通り、時間順に並べられた一連のデータ点のことを指します。時系列分析は、病気の蔓延予測、小売分析、ヘルスケア、金融などの多くの分野で重要です。時系列分析の分野では、多くの研究者が最近、大規模言語モデル (LLM) を使用して時系列の異常を分類、予測、検出する方法を研究しています。これらの論文では、テキスト内の逐次依存関係の処理に優れた言語モデルは時系列にも一般化できると想定しています。

最初の Mamba ベースの MLLM が登場しました!モデルの重み、トレーニング コードなどはすべてオープンソースです 最初の Mamba ベースの MLLM が登場しました!モデルの重み、トレーニング コードなどはすべてオープンソースです Jul 17, 2024 am 02:46 AM

AIxivコラムは、当サイトが学術的・技術的な内容を掲載するコラムです。過去数年間で、このサイトの AIxiv コラムには 2,000 件を超えるレポートが寄せられ、世界中の主要な大学や企業のトップ研究室がカバーされ、学術交流と普及を効果的に促進しています。共有したい優れた作品がある場合は、お気軽に寄稿するか、報告のために当社までご連絡ください。提出電子メール: liyazhou@jiqizhixin.com; zhaoyunfeng@jiqizhixin.com。はじめに 近年、さまざまな分野でマルチモーダル大規模言語モデル (MLLM) の適用が目覚ましい成功を収めています。ただし、多くの下流タスクの基本モデルとして、現在の MLLM はよく知られた Transformer ネットワークで構成されています。

See all articles