ホームページ テクノロジー周辺機器 AI Bytedance Doubaoと武漢大学がCALを提案:視覚的に関連したトークンを通じてマルチモーダルアライメント効果を強化

Bytedance Doubaoと武漢大学がCALを提案:視覚的に関連したトークンを通じてマルチモーダルアライメント効果を強化

Jun 19, 2024 am 09:53 AM
プロジェクト バイトダンス お手玉モデル

字节豆包、武大提出 CAL:通过视觉相关的 token 增强多模态对齐效果
AIxivコラムは、本サイト上で学術的・技術的な内容を掲載するコラムです。過去数年間で、このサイトの AIxiv コラムには 2,000 件を超えるレポートが寄せられ、世界中の主要な大学や企業のトップ研究室がカバーされ、学術交流と普及を効果的に促進しています。共有したい優れた作品がある場合は、お気軽に寄稿するか、報告のために当社までご連絡ください。送信メール: liyazhou@jiqizhixin.com; zhaoyunfeng@jiqizhixin.com

現在の主流のビジュアル言語モデル (VLM) は、主に大規模言語モデル (LLM) に基づいており、さらに微調整されています。したがって、さまざまな方法で画像を LLM の埋め込み空間にマッピングし、自己回帰手法を使用して画像トークンに基づいて答えを予測する必要があります。

このプロセスでは、テキストトークンを介して暗黙的に実装されます このステップを適切に配置する方法が非常に重要です。

この問題に対応して、武漢大学、ByteDance Beanbao Large Model Team、および中国科学院大学の研究者は、対照学習に基づいて、次のようなテキスト トークンを選別するためのテキスト トークン スクリーニング方法 (CAL) を提案しました。画像との関連性が高いものは、より正確なマルチモーダル アライメントを実現するために損失関数の重みが増加します。

字节豆包、武大提出 CAL:通过视觉相关的 token 增强多模态对齐效果

  • ペーパーリンク: https://arxiv.org/pdf/2405.17871
  • コードリンク: https://github.com/foundation-multimodal-models/CAL

CAL には次のような特徴があります:

  • は、追加の事前トレーニング段階を必要とせずにトレーニング プロセスに直接ネストできます。
  • は、OCR とキャプションのベンチマークで大幅な改善を達成しました。視覚化から、CAL により画像のモーダル配置が向上していることがわかります。
  • CAL は、ノイズの多いデータに対するトレーニング プロセスの耐性を高めます。

研究の動機

現在、視覚言語モデルは画像モダリティの調整に依存しており、調整を行う方法は非常に重要です。現在の主流の方法は、テキストの自動回帰によって暗黙的な位置合わせを実行することですが、画像の位置合わせに対する各テキスト トークンの寄与には一貫性がないため、これらのテキスト トークンを区別することが非常に必要です。

CAL は、既存の視覚言語モデル (VLM) トレーニング データにおいて、テキスト トークンが 3 つのカテゴリに分類できることを提案しました:

  • 写真に関連性の高いテキスト: エンティティ (人物、動物、物体など)、数量、色、テキストなど。これらのトークンは画像情報に直接対応しており、マルチモーダル位置合わせにとって重要です。
  • 画像と相関性の低い文章:続く単語や前の文章から推測できる内容など。これらのトークンは、実際には主に VLM のプレーン テキスト機能をトレーニングするために使用されます。
  • 画像コンテンツと矛盾するテキスト: これらのトークンは画像情報と矛盾しており、誤解を招く情報を提供する可能性もあり、マルチモーダル位置合わせプロセスに悪影響を及ぼします。

字节豆包、武大提出 CAL:通过视觉相关的 token 增强多模态对齐效果図 1: 緑色のマークは関連性の高いトークン、赤色はコンテンツのコンテンツ、無色は中立トークンです

トレーニング プロセス中、後者の 2 種類のトークンは実際には、より大きな割合を占めますが、画像に強く依存していないため、画像のモーダル配置にはほとんど影響しません。したがって、より良い位置合わせを実現するには、最初のタイプのテキスト トークン、つまり画像との関連性が高いトークンの重みを増やす必要があります。トークンのこの部分をどのように見つけるかが、この問題を解決する鍵となります。

方法

画像と関連性の高いトークンを見つける この問題は、条件対比によって解決できます。
トレーニング データ内の各画像とテキストのペアについて、画像入力がない場合、各テキスト トークンのロジットは、コンテキストと既存の知識値に基づいてこの状況の発生についての LLM の推定を表します。
  • 前に画像入力を追加すると、追加のコンテキスト情報を提供することと同じになり、各テキスト トークンのロジットは新しい状況に基づいて調整されます。これら 2 つのケースにおけるロジットの変化は、各テキスト トークンに対する画像の新しい状態の影響を表しています。
  • 具体的には、トレーニング プロセス中に、CAL は画像とテキスト シーケンス、および個々のテキスト シーケンスをそれぞれ大規模言語モデル (LLM) に入力して、各テキスト トークンのロジットを取得します。これら 2 つのケースのロジット差を計算することで、各トークンに対する画像の影響を測定できます。ロジットの差が大きいほど、トークンに対する画像の影響が大きくなるため、トークンは画像との関連性が高くなります。以下の図は、テキスト トークンのロジット diff メソッドと CAL メソッドのフローチャートを示しています。図 2: 左の図は 2 つの状況におけるトークン ロジット差分を視覚化したもの、右の図は CAL メソッドのプロセスを視覚化したものです

字节豆包、武大提出 CAL:通过视觉相关的 token 增强多模态对齐效果Cal 実験検証は 2 つの主流で行われました。モデル: MGM と MGM であり、異なるサイズのモデルでパフォーマンスの向上が達成されました。
以下の 4 つの検証部分が含まれています:

(1) CAL を使用するモデルは、さまざまなベンチマーク指標でより優れたパフォーマンスを示します。


(2) 2 つの画像とテキストのペアのテキストをランダムに均等に交換することで、ノイズ データ (画像とテキストの不一致) のバッチを作成し、CAL が作成するモデルのトレーニングに使用します。トレーニングプロセスは、より強力なデータ耐ノイズ性能を備えています。図 3: 異なる強度でのノイズ トレーニングの場合、CAL のパフォーマンスとベースライン

(3) QA ケースの回答部分の画像トークンに対する回答の注意スコアを計算します。そして、それを元の画像上にプロットすると、CAL でトレーニングされたモデルには、より明確な注意分布マップが表示されます。

字节豆包、武大提出 CAL:通过视觉相关的 token 增强多模态对齐效果

C 図 4: ベースラインと CAL のアテンション マップを視覚化できます。各ペアの右側は、最も類似した LLM ボキャブラリのテキスト トークンへの CAL
(4) です。元の画像の場合、CAL でトレーニングされたモデルのマッピング コンテンツは画像のコンテンツに近くなります。 buedtedancedantadantance beanbao bigモデルチームは2023年に設立され、業界で最も高度なAI大規模なモデルテクノロジーの開発、世界クラスの研究チームになり、技術的および社会的発展に貢献することに取り組んでいます。

字节豆包、武大提出 CAL:通过视觉相关的 token 增强多模态对齐效果
Doubao Big Model チームは、AI 分野における長期的なビジョンと決意を持っており、NLP、CV、音声などをカバーしており、中国に研究所と研究職を持っています。シンガポール、米国、その他の場所。チームは、プラットフォームの十分なデータ、コンピューティング、その他のリソースに依存して、マルチモーダル機能を提供するための自社開発の一般的な大規模モデルを立ち上げ、Doubao、Buttons、などの 50 以上のビジネスをサポートしています。および Jimeng であり、Volcano Engine 法人顧客を通じて一般に公開されています。現在、Doubao APP は中国市場で最も多くのユーザーを抱える AIGC アプリケーションとなっています。 ByteDance Beanbao モデル チームへの参加を歓迎します。

以上がBytedance Doubaoと武漢大学がCALを提案:視覚的に関連したトークンを通じてマルチモーダルアライメント効果を強化の詳細内容です。詳細については、PHP 中国語 Web サイトの他の関連記事を参照してください。

このウェブサイトの声明
この記事の内容はネチズンが自主的に寄稿したものであり、著作権は原著者に帰属します。このサイトは、それに相当する法的責任を負いません。盗作または侵害の疑いのあるコンテンツを見つけた場合は、admin@php.cn までご連絡ください。

ホットAIツール

Undresser.AI Undress

Undresser.AI Undress

リアルなヌード写真を作成する AI 搭載アプリ

AI Clothes Remover

AI Clothes Remover

写真から衣服を削除するオンライン AI ツール。

Undress AI Tool

Undress AI Tool

脱衣画像を無料で

Clothoff.io

Clothoff.io

AI衣類リムーバー

Video Face Swap

Video Face Swap

完全無料の AI 顔交換ツールを使用して、あらゆるビデオの顔を簡単に交換できます。

ホットツール

メモ帳++7.3.1

メモ帳++7.3.1

使いやすく無料のコードエディター

SublimeText3 中国語版

SublimeText3 中国語版

中国語版、とても使いやすい

ゼンドスタジオ 13.0.1

ゼンドスタジオ 13.0.1

強力な PHP 統合開発環境

ドリームウィーバー CS6

ドリームウィーバー CS6

ビジュアル Web 開発ツール

SublimeText3 Mac版

SublimeText3 Mac版

神レベルのコード編集ソフト(SublimeText3)

ControlNet の作者がまたヒット作を出しました!写真から絵画を生成し、2 日間で 1.4,000 個のスターを獲得する全プロセス ControlNet の作者がまたヒット作を出しました!写真から絵画を生成し、2 日間で 1.4,000 個のスターを獲得する全プロセス Jul 17, 2024 am 01:56 AM

これも Tusheng のビデオですが、PaintsUndo は別の道を歩んでいます。 ControlNet 作者 LvminZhang が再び生き始めました!今回は絵画の分野を目指します。新しいプロジェクト PaintsUndo は、開始されて間もなく 1.4kstar を獲得しました (まだ異常なほど上昇しています)。プロジェクトアドレス: https://github.com/lllyasviel/Paints-UNDO このプロジェクトを通じて、ユーザーが静止画像を入力すると、PaintsUndo が線画から完成品までのペイントプロセス全体のビデオを自動的に生成するのに役立ちます。 。描画プロセス中の線の変化は驚くべきもので、最終的なビデオ結果は元の画像と非常によく似ています。完成した描画を見てみましょう。

オープンソース AI ソフトウェア エンジニアのリストのトップに立つ UIUC のエージェントレス ソリューションは、SWE ベンチの実際のプログラミングの問題を簡単に解決します オープンソース AI ソフトウェア エンジニアのリストのトップに立つ UIUC のエージェントレス ソリューションは、SWE ベンチの実際のプログラミングの問題を簡単に解決します Jul 17, 2024 pm 10:02 PM

AIxivコラムは、当サイトが学術的・技術的な内容を掲載するコラムです。過去数年間で、このサイトの AIxiv コラムには 2,000 件を超えるレポートが寄せられ、世界中の主要な大学や企業のトップ研究室がカバーされ、学術交流と普及を効果的に促進しています。共有したい優れた作品がある場合は、お気軽に寄稿するか、報告のために当社までご連絡ください。提出電子メール: liyazhou@jiqizhixin.com; zhaoyunfeng@jiqizhixin.com この論文の著者は全員、イリノイ大学アーバナ シャンペーン校 (UIUC) の Zhang Lingming 教師のチームのメンバーです。博士課程4年、研究者

RLHF から DPO、TDPO に至るまで、大規模なモデル アライメント アルゴリズムはすでに「トークンレベル」になっています RLHF から DPO、TDPO に至るまで、大規模なモデル アライメント アルゴリズムはすでに「トークンレベル」になっています Jun 24, 2024 pm 03:04 PM

AIxivコラムは、当サイトが学術的・技術的な内容を掲載するコラムです。過去数年間で、このサイトの AIxiv コラムには 2,000 件を超えるレポートが寄せられ、世界中の主要な大学や企業のトップ研究室がカバーされ、学術交流と普及を効果的に促進しています。共有したい優れた作品がある場合は、お気軽に寄稿するか、報告のために当社までご連絡ください。提出メール: liyazhou@jiqizhixin.com; zhaoyunfeng@jiqizhixin.com 人工知能の開発プロセスにおいて、大規模言語モデル (LLM) の制御とガイダンスは常に中心的な課題の 1 つであり、これらのモデルが両方とも確実に機能することを目指しています。強力かつ安全に人類社会に貢献します。初期の取り組みは人間のフィードバックによる強化学習手法に焦点を当てていました (RL

OpenAI Super Alignment チームの遺作: 2 つの大きなモデルがゲームをプレイし、出力がより理解しやすくなる OpenAI Super Alignment チームの遺作: 2 つの大きなモデルがゲームをプレイし、出力がより理解しやすくなる Jul 19, 2024 am 01:29 AM

AIモデルによって与えられた答えがまったく理解できない場合、あなたはそれをあえて使用しますか?機械学習システムがより重要な分野で使用されるにつれて、なぜその出力を信頼できるのか、またどのような場合に信頼してはいけないのかを実証することがますます重要になっています。複雑なシステムの出力に対する信頼を得る方法の 1 つは、人間または他の信頼できるシステムが読み取れる、つまり、考えられるエラーが発生する可能性がある点まで完全に理解できる、その出力の解釈を生成することをシステムに要求することです。見つかった。たとえば、司法制度に対する信頼を築くために、裁判所に対し、決定を説明し裏付ける明確で読みやすい書面による意見を提供することを求めています。大規模な言語モデルの場合も、同様のアプローチを採用できます。ただし、このアプローチを採用する場合は、言語モデルが

リーマン予想の大きな進歩!陶哲軒氏はMITとオックスフォードの新しい論文を強く推薦し、37歳のフィールズ賞受賞者も参加した リーマン予想の大きな進歩!陶哲軒氏はMITとオックスフォードの新しい論文を強く推薦し、37歳のフィールズ賞受賞者も参加した Aug 05, 2024 pm 03:32 PM

最近、2000年代の7大問題の一つとして知られるリーマン予想が新たなブレークスルーを達成した。リーマン予想は、数学における非常に重要な未解決の問題であり、素数の分布の正確な性質に関連しています (素数とは、1 とそれ自身でのみ割り切れる数であり、整数論において基本的な役割を果たします)。今日の数学文献には、リーマン予想 (またはその一般化された形式) の確立に基づいた 1,000 を超える数学的命題があります。言い換えれば、リーマン予想とその一般化された形式が証明されれば、これらの 1,000 を超える命題が定理として確立され、数学の分野に重大な影響を与えることになります。これらの命題の一部も有効性を失います。 MIT数学教授ラリー・ガスとオックスフォード大学から新たな進歩がもたらされる

arXiv 論文は「弾幕」として投稿可能、スタンフォード alphaXiv ディスカッション プラットフォームはオンライン、LeCun は気に入っています arXiv 論文は「弾幕」として投稿可能、スタンフォード alphaXiv ディスカッション プラットフォームはオンライン、LeCun は気に入っています Aug 01, 2024 pm 05:18 PM

乾杯!紙面でのディスカッションが言葉だけになると、どんな感じになるでしょうか?最近、スタンフォード大学の学生が、arXiv 論文のオープン ディスカッション フォーラムである alphaXiv を作成しました。このフォーラムでは、arXiv 論文に直接質問やコメントを投稿できます。 Web サイトのリンク: https://alphaxiv.org/ 実際、URL の arXiv を alphaXiv に変更するだけで、alphaXiv フォーラムの対応する論文を直接開くことができます。この Web サイトにアクセスする必要はありません。その中の段落を正確に見つけることができます。論文、文: 右側のディスカッション エリアでは、ユーザーは論文のアイデアや詳細について著者に尋ねる質問を投稿できます。たとえば、次のような論文の内容についてコメントすることもできます。

最初の Mamba ベースの MLLM が登場しました!モデルの重み、トレーニング コードなどはすべてオープンソースです 最初の Mamba ベースの MLLM が登場しました!モデルの重み、トレーニング コードなどはすべてオープンソースです Jul 17, 2024 am 02:46 AM

AIxivコラムは、当サイトが学術的・技術的な内容を掲載するコラムです。過去数年間で、このサイトの AIxiv コラムには 2,000 件を超えるレポートが寄せられ、世界中の主要な大学や企業のトップ研究室がカバーされ、学術交流と普及を効果的に促進しています。共有したい優れた作品がある場合は、お気軽に寄稿するか、報告のために当社までご連絡ください。提出電子メール: liyazhou@jiqizhixin.com; zhaoyunfeng@jiqizhixin.com。はじめに 近年、さまざまな分野でマルチモーダル大規模言語モデル (MLLM) の適用が目覚ましい成功を収めています。ただし、多くの下流タスクの基本モデルとして、現在の MLLM はよく知られた Transformer ネットワークで構成されています。

公理的トレーニングにより、LLM は因果推論を学習できます。6,700 万個のパラメータ モデルは、1 兆個のパラメータ レベル GPT-4 に匹敵します。 公理的トレーニングにより、LLM は因果推論を学習できます。6,700 万個のパラメータ モデルは、1 兆個のパラメータ レベル GPT-4 に匹敵します。 Jul 17, 2024 am 10:14 AM

LLM に因果連鎖を示すと、LLM は公理を学習します。 AI はすでに数学者や科学者の研究を支援しています。たとえば、有名な数学者のテレンス タオは、GPT などの AI ツールを活用した研究や探索の経験を繰り返し共有しています。 AI がこれらの分野で競争するには、強力で信頼性の高い因果推論能力が不可欠です。この記事で紹介する研究では、小さなグラフでの因果的推移性公理の実証でトレーニングされた Transformer モデルが、大きなグラフでの推移性公理に一般化できることがわかりました。言い換えれば、Transformer が単純な因果推論の実行を学習すると、より複雑な因果推論に使用できる可能性があります。チームが提案した公理的トレーニング フレームワークは、デモンストレーションのみで受動的データに基づいて因果推論を学習するための新しいパラダイムです。

See all articles