Bytedance Doubaoと武漢大学がCALを提案：視覚的に関連したトークンを通じてマルチモーダルアライメント効果を強化-AI-php.cn

ホームページ

テクノロジー周辺機器

Bytedance Doubaoと武漢大学がCALを提案：視覚的に関連したトークンを通じてマルチモーダルアライメント効果を強化

WBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWB

Jun 19, 2024 am 09:53 AM

プロジェクトバイトダンスお手玉モデル

AIxivコラムは、本サイト上で学術的・技術的な内容を掲載するコラムです。過去数年間で、このサイトの AIxiv コラムには 2,000 件を超えるレポートが寄せられ、世界中の主要な大学や企業のトップ研究室がカバーされ、学術交流と普及を効果的に促進しています。共有したい優れた作品がある場合は、お気軽に寄稿するか、報告のために当社までご連絡ください。送信メール: liyazhou@jiqizhixin.com; zhaoyunfeng@jiqizhixin.com

現在の主流のビジュアル言語モデル (VLM) は、主に大規模言語モデル (LLM) に基づいており、さらに微調整されています。したがって、さまざまな方法で画像を LLM の埋め込み空間にマッピングし、自己回帰手法を使用して画像トークンに基づいて答えを予測する必要があります。

このプロセスでは、テキストトークンを介して暗黙的に実装されます このステップを適切に配置する方法が非常に重要です。

この問題に対応して、武漢大学、ByteDance Beanbao Large Model Team、および中国科学院大学の研究者は、対照学習に基づいて、次のようなテキストトークンを選別するためのテキストトークンスクリーニング方法 (CAL) を提案しました。画像との関連性が高いものは、より正確なマルチモーダルアライメントを実現するために損失関数の重みが増加します。

字节豆包、武大提出 CAL：通过视觉相关的 token 增强多模态对齐效果

ペーパーリンク: https://arxiv.org/pdf/2405.17871
コードリンク: https://github.com/foundation-multimodal-models/CAL

CAL には次のような特徴があります:

は、追加の事前トレーニング段階を必要とせずにトレーニングプロセスに直接ネストできます。
は、OCR とキャプションのベンチマークで大幅な改善を達成しました。視覚化から、CAL により画像のモーダル配置が向上していることがわかります。
CAL は、ノイズの多いデータに対するトレーニングプロセスの耐性を高めます。

研究の動機

現在、視覚言語モデルは画像モダリティの調整に依存しており、調整を行う方法は非常に重要です。現在の主流の方法は、テキストの自動回帰によって暗黙的な位置合わせを実行することですが、画像の位置合わせに対する各テキストトークンの寄与には一貫性がないため、これらのテキストトークンを区別することが非常に必要です。

CAL は、既存の視覚言語モデル (VLM) トレーニングデータにおいて、テキストトークンが 3 つのカテゴリに分類できることを提案しました:

写真に関連性の高いテキスト: エンティティ (人物、動物、物体など）、数量、色、テキストなど。これらのトークンは画像情報に直接対応しており、マルチモーダル位置合わせにとって重要です。
画像と相関性の低い文章：続く単語や前の文章から推測できる内容など。これらのトークンは、実際には主に VLM のプレーンテキスト機能をトレーニングするために使用されます。
画像コンテンツと矛盾するテキスト: これらのトークンは画像情報と矛盾しており、誤解を招く情報を提供する可能性もあり、マルチモーダル位置合わせプロセスに悪影響を及ぼします。

字节豆包、武大提出 CAL：通过视觉相关的 token 增强多模态对齐效果図 1: 緑色のマークは関連性の高いトークン、赤色はコンテンツのコンテンツ、無色は中立トークンです

トレーニングプロセス中、後者の 2 種類のトークンは実際には、より大きな割合を占めますが、画像に強く依存していないため、画像のモーダル配置にはほとんど影響しません。したがって、より良い位置合わせを実現するには、最初のタイプのテキストトークン、つまり画像との関連性が高いトークンの重みを増やす必要があります。トークンのこの部分をどのように見つけるかが、この問題を解決する鍵となります。

方法

画像と関連性の高いトークンを見つけるこの問題は、条件対比によって解決できます。

トレーニングデータ内の各画像とテキストのペアについて、画像入力がない場合、各テキストトークンのロジットは、コンテキストと既存の知識値に基づいてこの状況の発生についての LLM の推定を表します。

前に画像入力を追加すると、追加のコンテキスト情報を提供することと同じになり、各テキストトークンのロジットは新しい状況に基づいて調整されます。これら 2 つのケースにおけるロジットの変化は、各テキストトークンに対する画像の新しい状態の影響を表しています。

Cal 実験検証は 2 つの主流で行われました。モデル: MGM と MGM であり、異なるサイズのモデルでパフォーマンスの向上が達成されました。

以下の 4 つの検証部分が含まれています:

(1) CAL を使用するモデルは、さまざまなベンチマーク指標でより優れたパフォーマンスを示します。

(2) 2 つの画像とテキストのペアのテキストをランダムに均等に交換することで、ノイズデータ (画像とテキストの不一致) のバッチを作成し、CAL が作成するモデルのトレーニングに使用します。トレーニングプロセスは、より強力なデータ耐ノイズ性能を備えています。図 3: 異なる強度でのノイズトレーニングの場合、CAL のパフォーマンスとベースライン

(3) QA ケースの回答部分の画像トークンに対する回答の注意スコアを計算します。そして、それを元の画像上にプロットすると、CAL でトレーニングされたモデルには、より明確な注意分布マップが表示されます。

字节豆包、武大提出 CAL：通过视觉相关的 token 增强多模态对齐效果

C 図 4: ベースラインと CAL のアテンションマップを視覚化できます。各ペアの右側は、最も類似した LLM ボキャブラリのテキストトークンへの CAL

(4) です。元の画像の場合、CAL でトレーニングされたモデルのマッピングコンテンツは画像のコンテンツに近くなります。 buedtedancedantadantance beanbao bigモデルチームは2023年に設立され、業界で最も高度なAI大規模なモデルテクノロジーの開発、世界クラスの研究チームになり、技術的および社会的発展に貢献することに取り組んでいます。

^{Doubao Big Model チームは、AI 分野における長期的なビジョンと決意を持っており、NLP、CV、音声などをカバーしており、中国に研究所と研究職を持っています。シンガポール、米国、その他の場所。チームは、プラットフォームの十分なデータ、コンピューティング、その他のリソースに依存して、マルチモーダル機能を提供するための自社開発の一般的な大規模モデルを立ち上げ、Doubao、Buttons、などの 50 以上のビジネスをサポートしています。および Jimeng であり、Volcano Engine 法人顧客を通じて一般に公開されています。現在、Doubao APP は中国市場で最も多くのユーザーを抱える AIGC アプリケーションとなっています。 ByteDance Beanbao モデルチームへの参加を歓迎します。}

以上がBytedance Doubaoと武漢大学がCALを提案：視覚的に関連したトークンを通じてマルチモーダルアライメント効果を強化の詳細内容です。詳細については、PHP 中国語 Web サイトの他の関連記事を参照してください。

このウェブサイトの声明

この記事の内容はネチズンが自主的に寄稿したものであり、著作権は原著者に帰属します。このサイトは、それに相当する法的責任を負いません。盗作または侵害の疑いのあるコンテンツを見つけた場合は、admin@php.cn までご連絡ください。

ホットAIツール

Undresser.AI Undress

リアルなヌード写真を作成する AI 搭載アプリ

AI Clothes Remover

写真から衣服を削除するオンライン AI ツール。

Undress AI Tool

脱衣画像を無料で

Clothoff.io

AI衣類リムーバー

Video Face Swap

完全無料の AI 顔交換ツールを使用して、あらゆるビデオの顔を簡単に交換できます。

ホットツール

メモ帳++7.3.1

使いやすく無料のコードエディター

SublimeText3 中国語版

中国語版、とても使いやすい

ゼンドスタジオ 13.0.1

強力な PHP 統合開発環境

ドリームウィーバー CS6

ビジュアル Web 開発ツール

SublimeText3 Mac版

神レベルのコード編集ソフト（SublimeText3）

ホットトピック

Java チュートリアル

1668

CakePHP チュートリアル

1426

Laravel チュートリアル

1328

PHP チュートリアル

1273

C# チュートリアル

1256

Related knowledge

ControlNet の作者がまたヒット作を出しました!写真から絵画を生成し、2 日間で 1.4,000 個のスターを獲得する全プロセス Jul 17, 2024 am 01:56 AM

これも Tusheng のビデオですが、PaintsUndo は別の道を歩んでいます。 ControlNet 作者 LvminZhang が再び生き始めました!今回は絵画の分野を目指します。新しいプロジェクト PaintsUndo は、開始されて間もなく 1.4kstar を獲得しました (まだ異常なほど上昇しています)。プロジェクトアドレス: https://github.com/lllyasviel/Paints-UNDO このプロジェクトを通じて、ユーザーが静止画像を入力すると、PaintsUndo が線画から完成品までのペイントプロセス全体のビデオを自動的に生成するのに役立ちます。。描画プロセス中の線の変化は驚くべきもので、最終的なビデオ結果は元の画像と非常によく似ています。完成した描画を見てみましょう。

オープンソース AI ソフトウェアエンジニアのリストのトップに立つ UIUC のエージェントレスソリューションは、SWE ベンチの実際のプログラミングの問題を簡単に解決します Jul 17, 2024 pm 10:02 PM

AIxivコラムは、当サイトが学術的・技術的な内容を掲載するコラムです。過去数年間で、このサイトの AIxiv コラムには 2,000 件を超えるレポートが寄せられ、世界中の主要な大学や企業のトップ研究室がカバーされ、学術交流と普及を効果的に促進しています。共有したい優れた作品がある場合は、お気軽に寄稿するか、報告のために当社までご連絡ください。提出電子メール: liyazhou@jiqizhixin.com; zhaoyunfeng@jiqizhixin.com この論文の著者は全員、イリノイ大学アーバナシャンペーン校 (UIUC) の Zhang Lingming 教師のチームのメンバーです。博士課程4年、研究者

RLHF から DPO、TDPO に至るまで、大規模なモデルアライメントアルゴリズムはすでに「トークンレベル」になっています Jun 24, 2024 pm 03:04 PM

AIxivコラムは、当サイトが学術的・技術的な内容を掲載するコラムです。過去数年間で、このサイトの AIxiv コラムには 2,000 件を超えるレポートが寄せられ、世界中の主要な大学や企業のトップ研究室がカバーされ、学術交流と普及を効果的に促進しています。共有したい優れた作品がある場合は、お気軽に寄稿するか、報告のために当社までご連絡ください。提出メール: liyazhou@jiqizhixin.com; zhaoyunfeng@jiqizhixin.com 人工知能の開発プロセスにおいて、大規模言語モデル (LLM) の制御とガイダンスは常に中心的な課題の 1 つであり、これらのモデルが両方とも確実に機能することを目指しています。強力かつ安全に人類社会に貢献します。初期の取り組みは人間のフィードバックによる強化学習手法に焦点を当てていました (RL

arXiv 論文は「弾幕」として投稿可能、スタンフォード alphaXiv ディスカッションプラットフォームはオンライン、LeCun は気に入っています Aug 01, 2024 pm 05:18 PM

乾杯！紙面でのディスカッションが言葉だけになると、どんな感じになるでしょうか?最近、スタンフォード大学の学生が、arXiv 論文のオープンディスカッションフォーラムである alphaXiv を作成しました。このフォーラムでは、arXiv 論文に直接質問やコメントを投稿できます。 Web サイトのリンク: https://alphaxiv.org/ 実際、URL の arXiv を alphaXiv に変更するだけで、alphaXiv フォーラムの対応する論文を直接開くことができます。この Web サイトにアクセスする必要はありません。その中の段落を正確に見つけることができます。論文、文: 右側のディスカッションエリアでは、ユーザーは論文のアイデアや詳細について著者に尋ねる質問を投稿できます。たとえば、次のような論文の内容についてコメントすることもできます。

リーマン予想の大きな進歩!陶哲軒氏はMITとオックスフォードの新しい論文を強く推薦し、37歳のフィールズ賞受賞者も参加した Aug 05, 2024 pm 03:32 PM

最近、2000年代の7大問題の一つとして知られるリーマン予想が新たなブレークスルーを達成した。リーマン予想は、数学における非常に重要な未解決の問題であり、素数の分布の正確な性質に関連しています (素数とは、1 とそれ自身でのみ割り切れる数であり、整数論において基本的な役割を果たします)。今日の数学文献には、リーマン予想 (またはその一般化された形式) の確立に基づいた 1,000 を超える数学的命題があります。言い換えれば、リーマン予想とその一般化された形式が証明されれば、これらの 1,000 を超える命題が定理として確立され、数学の分野に重大な影響を与えることになります。これらの命題の一部も有効性を失います。 MIT数学教授ラリー・ガスとオックスフォード大学から新たな進歩がもたらされる

OpenAI Super Alignment チームの遺作: 2 つの大きなモデルがゲームをプレイし、出力がより理解しやすくなる Jul 19, 2024 am 01:29 AM

AIモデルによって与えられた答えがまったく理解できない場合、あなたはそれをあえて使用しますか?機械学習システムがより重要な分野で使用されるにつれて、なぜその出力を信頼できるのか、またどのような場合に信頼してはいけないのかを実証することがますます重要になっています。複雑なシステムの出力に対する信頼を得る方法の 1 つは、人間または他の信頼できるシステムが読み取れる、つまり、考えられるエラーが発生する可能性がある点まで完全に理解できる、その出力の解釈を生成することをシステムに要求することです。見つかった。たとえば、司法制度に対する信頼を築くために、裁判所に対し、決定を説明し裏付ける明確で読みやすい書面による意見を提供することを求めています。大規模な言語モデルの場合も、同様のアプローチを採用できます。ただし、このアプローチを採用する場合は、言語モデルが

LLM は時系列予測にはあまり適していません。推論機能も使用しません。 Jul 15, 2024 pm 03:59 PM

言語モデルは本当に時系列予測に使用できるのでしょうか?ベタリッジの見出しの法則 (疑問符で終わるニュース見出しは「いいえ」と答えることができます) によれば、答えは「いいえ」であるはずです。このような強力な LLM は時系列データを適切に処理できないという事実は真実のようです。時系列、つまり時系列とは、その名の通り、時間順に並べられた一連のデータ点のことを指します。時系列分析は、病気の蔓延予測、小売分析、ヘルスケア、金融などの多くの分野で重要です。時系列分析の分野では、多くの研究者が最近、大規模言語モデル (LLM) を使用して時系列の異常を分類、予測、検出する方法を研究しています。これらの論文では、テキスト内の逐次依存関係の処理に優れた言語モデルは時系列にも一般化できると想定しています。

最初の Mamba ベースの MLLM が登場しました!モデルの重み、トレーニングコードなどはすべてオープンソースです Jul 17, 2024 am 02:46 AM

AIxivコラムは、当サイトが学術的・技術的な内容を掲載するコラムです。過去数年間で、このサイトの AIxiv コラムには 2,000 件を超えるレポートが寄せられ、世界中の主要な大学や企業のトップ研究室がカバーされ、学術交流と普及を効果的に促進しています。共有したい優れた作品がある場合は、お気軽に寄稿するか、報告のために当社までご連絡ください。提出電子メール: liyazhou@jiqizhixin.com; zhaoyunfeng@jiqizhixin.com。はじめに近年、さまざまな分野でマルチモーダル大規模言語モデル (MLLM) の適用が目覚ましい成功を収めています。ただし、多くの下流タスクの基本モデルとして、現在の MLLM はよく知られた Transformer ネットワークで構成されています。

See all articles