Le premier MLLM basé sur Mamba est là ! Les poids des modèles, le code de formation, etc. sont tous open source-IA-php.cn

Maison

Périphériques technologiques

Le premier MLLM basé sur Mamba est là ! Les poids des modèles, le code de formation, etc. sont tous open source

WBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWB

Jul 17, 2024 am 02:46 AM

工程 Cobra

Le premier MLLM basé sur Mamba est là ! Les poids des modèles, le code de formation, etc. sont tous open source

La rubrique AIxiv est une rubrique où des contenus académiques et techniques sont publiés sur ce site. Au cours des dernières années, la rubrique AIxiv de ce site a reçu plus de 2 000 rapports, couvrant les meilleurs laboratoires des principales universités et entreprises du monde entier, favorisant efficacement les échanges et la diffusion académiques. Si vous souhaitez partager un excellent travail, n'hésitez pas à contribuer ou à nous contacter pour un rapport. Courriel de soumission : liyazhou@jiqizhixin.com ; zhaoyunfeng@jiqizhixin.com.

Introduction

Ces dernières années, l'application de grands modèles de langage multimodaux (MLLM) dans divers domaines a connu un succès significatif. Cependant, en tant que modèle sous-jacent à de nombreuses tâches en aval, les MLLM actuels sont constitués du célèbre réseau Transformer, dont la complexité de calcul quadratique est moins efficace. Afin d'améliorer l'efficacité de ces modèles de base, un grand nombre d'expériences montrent que : (1) Cobra a des performances extrêmement compétitives par rapport aux méthodes de pointe actuelles avec une efficacité de calcul élevée (par exemple, LLaVA-Phi, TinyLLaVA et MobileVLM v2), et grâce à la modélisation de séquences linéaires Cobra, qui est plus rapide. (2) Il est intéressant de noter que les résultats du test de prédiction difficile en ensemble fermé montrent que Cobra réussit bien à surmonter les illusions visuelles et les jugements sur les relations spatiales. (3) Il convient de noter que Cobra atteint des performances comparables à celles de LLaVA même lorsque le nombre de paramètres ne représente qu'environ 43 % de LLaVA.

Les grands modèles de langage (LLM) se limitent à interagir uniquement par le biais du langage, ce qui limite leur adaptabilité à gérer des tâches plus diverses. La compréhension multimodale est essentielle pour améliorer la capacité d’un modèle à relever efficacement les défis du monde réel. Par conséquent, les chercheurs travaillent activement à l’extension des grands modèles de langage afin d’incorporer des capacités de traitement de l’information multimodale. Des modèles de langage visuel (VLM) tels que GPT-4, LLaMA-Adapter et LLaVA ont été développés pour améliorer les capacités de compréhension visuelle des LLM.

Cependant, des recherches antérieures ont principalement tenté d'obtenir des VLM efficaces d'une manière similaire, c'est-à-dire en réduisant les paramètres du modèle de langage de base ou le nombre de jetons visuels tout en gardant inchangée la structure du Transformer basée sur l'attention. Cet article propose une perspective différente : en utilisant directement le modèle d'espace d'états (SSM) comme réseau principal, un MLLM avec une complexité de calcul linéaire est obtenu. De plus, cet article explore et étudie divers schémas de fusion modale pour créer un Mamba multimodal efficace. Plus précisément, cet article adopte le modèle de langage Mamba comme modèle de base de VLM, qui a montré des performances capables de rivaliser avec le modèle de langage Transformer, mais avec une efficacité d'inférence plus élevée. Les tests montrent que les performances d'inférence de Cobra sont 3 à 4 fois plus rapides que celles de MobileVLM v2 3B et TinyLLaVA 3B de même ampleur de paramètre. Même comparé au modèle LLaVA v1.5 (paramètres 7B), qui possède un nombre de paramètres beaucoup plus élevé, Cobra atteint toujours des performances équivalentes sur plusieurs benchmarks avec environ 43 % du nombre de paramètres.

Le premier MLLM basé sur Mamba est là ! Les poids des modèles, le code de formation, etc. sont tous open source

Les modèles linguistiques multimodaux à grande échelle (MLLM) existants étudiés reposent souvent sur des réseaux Transformer, qui présentent une complexité de calcul quadratique. Pour remédier à cette inefficacité, cet article présente Cobra, un nouveau MLLM avec une complexité informatique linéaire.

Plonge dans divers schémas de fusion modale pour optimiser l'intégration des informations visuelles et linguistiques dans le modèle linguistique Mamba. À travers des expériences, cet article explore l'efficacité de différentes stratégies de fusion et détermine la méthode qui produit la représentation multimodale la plus efficace.

- Lien original : https://arxiv.org/pdf/2403.14520v2.pdf
- Lien du projet : https://sites.google.com/view/cobravlm/
- Titre de l'article : Cobra : Extension de Mamba à un grand modèle de langage multimodal pour une inférence efficace Structure du ML se compose d’un projecteur dynamique et de l’épine dorsale du langage LLM. La partie principale de LLM utilise le modèle de langage Mamba pré-entraîné aux paramètres 2,8B, qui a été pré-entraîné sur l'ensemble de données SlimPajama avec 600B de jetons et affiné avec les instructions des données de conversation.网络 Diagramme de structure du réseau Cobra
Différent de LLAVA, etc., COBRA utilise la représentation visuelle de la fusion Dinov2 et SIGLIP En assemblant la sortie des deux codeurs visuels en alimentant le projecteur, le modèle peut mieux capturer le. les fonctionnalités sémantiques de haut niveau apportées par SigLIP et les fonctionnalités d'image à granularité fine de bas niveau extraites par DINOv2.

Schéma de formation

Des recherches récentes montrent que pour les paradigmes de formation existants basés sur LLaVA (c'est-à-dire, entraîner une seule fois l'étape de pré-alignement de la couche de projection et l'étape de réglage fin du squelette LLM chacun), les étapes de pré-alignement peuvent être inutiles et le modèle affiné peut encore être sous-ajusté. Par conséquent, Cobra abandonne l’étape de pré-alignement et affine directement l’ensemble de la structure du langage LLM et des projecteurs. Ce processus de réglage fin a été effectué pendant deux époques avec un échantillonnage aléatoire sur un ensemble de données combiné composé de :

Ensemble de données hybride utilisé dans LLaVA v1.5, qui contenait un total de 655 000 conversations visuelles à plusieurs tours, y compris académiques. Des échantillons VQA, ainsi que des données de réglage des instructions visuelles dans LLaVA-Instruct et des données de réglage des instructions en texte brut dans ShareGPT. LVIS-Instruct-4V, qui contient 220 000 images avec alignement visuel et instructions contextuelles générées par GPT-4V.

LRV-Instruct, un ensemble de données contenant 400K instructions visuelles couvrant 16 tâches de langage visuel, visant à atténuer les phénomènes d'hallucination.

L'ensemble de données contient environ 1,2 million d'images et plusieurs séries de données de conversation correspondantes, ainsi que des données de conversation en texte brut.

Expérience
1. Expérience quantitative
Test qualitatif

De plus, Cobra donne également deux exemples VQA pour illustrer qualitativement le Cobra dans l'objet de l'objet. Supériorité dans la capacité à reconnaître les relations spatiales et à réduire l'illusion du modèle.和 Figure COBRA et autres modèles de base dans le jugement des relations spatiales des objets

和 Figure Cobra et d'autres modèles de base dans l'exemple de l'illusion visuelle
Dans les exemples, Llava V1.5 et Mobilevlm reçoivent une réponse d'erreur, tandis que COBRA le fait. Une description précise a été donnée, surtout dans le deuxième cas, Cobra a identifié avec précision que l'image provenait de l'environnement de simulation du robot.

Expérience d'ablation
Cet article mène des recherches d'ablation sur la solution adoptée par Cobra à partir des deux dimensions de performance et de vitesse de génération. Le plan expérimental mène des expériences d'ablation sur le projecteur, l'encodeur visuel et le squelette du langage LLM respectivement. La comparaison des performances de l'expérience d'ablation de diagramme montre que les expériences d'ablation de la partie projet du projecteur montrent que l'effet du projecteur MLP adopté dans cet article est nettement meilleur que celui dédié à la réduction du nombre de jetons visuels au LDP. Le module améliore la vitesse de calcul.En même temps, comme la vitesse de traitement des séquences et la complexité de calcul de Cobra sont meilleures que celles de Transformer, le module LDP n'a aucun avantage évident en termes de vitesse de génération. Par conséquent, le modèle de classe Mamba est utilisé pour réduire le nombre de jetons visuels. en sacrifiant la précision, l'échantillonneur peut ne pas être nécessaire.和 Figure COBRA et autres modèles dans la gamme de comparaison de vitesse de génération
Les résultats d'ablation de la partie encodeur visuel montrent que la fusion des fonctionnalités de Dinov2 améliore efficacement les performances de COBRA. Dans l'expérience de base du langage, le modèle de langage Mamba sans réglage fin des instructions a été totalement incapable de donner des réponses raisonnables au test ouvert de questions et réponses, tandis que le modèle de langage Mamba affiné peut atteindre des performances considérables sur diverses tâches.
Conclusion

Cet article propose Cobra, qui résout le goulot d'étranglement d'efficacité des modèles de langage multimodaux existants à grande échelle qui s'appuient sur des réseaux Transformer avec une complexité informatique quadratique. Cet article explore la combinaison de modèles de langage avec une complexité informatique linéaire et une entrée multimodale. En termes de fusion d'informations visuelles et linguistiques, cet article optimise avec succès l'intégration des informations internes du modèle de langage Mamba et obtient une représentation multimodale plus efficace grâce à une recherche approfondie sur différents schémas de fusion modale. Les expériences montrent que Cobra améliore non seulement de manière significative l'efficacité informatique, mais est également comparable en termes de performances à des modèles avancés tels que LLaVA, en particulier pour surmonter les illusions visuelles et les jugements sur les relations spatiales. Cela réduit même considérablement le nombre de paramètres. Cela ouvre de nouvelles possibilités pour le déploiement futur de modèles d’IA hautes performances dans des environnements nécessitant un traitement à haute fréquence d’informations visuelles, tels que le contrôle par rétroaction des robots basé sur la vision.

Ce qui précède est le contenu détaillé de. pour plus d'informations, suivez d'autres articles connexes sur le site Web de PHP en chinois!

Déclaration de ce site Web

Le contenu de cet article est volontairement contribué par les internautes et les droits d'auteur appartiennent à l'auteur original. Ce site n'assume aucune responsabilité légale correspondante. Si vous trouvez un contenu suspecté de plagiat ou de contrefaçon, veuillez contacter admin@php.cn

Outils d'IA chauds

Undresser.AI Undress

Application basée sur l'IA pour créer des photos de nu réalistes

AI Clothes Remover

Outil d'IA en ligne pour supprimer les vêtements des photos.

Undress AI Tool

Images de déshabillage gratuites

Clothoff.io

Dissolvant de vêtements AI

Video Face Swap

Échangez les visages dans n'importe quelle vidéo sans effort grâce à notre outil d'échange de visage AI entièrement gratuit !

Afficher plus

Article chaud

<🎜>: Grow A Garden - Guide de mutation complet

3 Il y a quelques semaines By DDD

Comment réparer KB5055612 ne parvient pas à s'installer dans Windows 10?

3 Il y a quelques semaines By DDD

<🎜>: Bubble Gum Simulator Infinity - Comment obtenir et utiliser les clés royales

3 Il y a quelques semaines By 尊渡假赌尊渡假赌尊渡假赌

Mandragora: Whispers of the Witch Tree - Comment déverrouiller le grappin

3 Il y a quelques semaines By 尊渡假赌尊渡假赌尊渡假赌

Nordhold: Système de fusion, expliqué

3 Il y a quelques semaines By 尊渡假赌尊渡假赌尊渡假赌

Afficher plus

Outils chauds

Bloc-notes++7.3.1

Éditeur de code facile à utiliser et gratuit

SublimeText3 version chinoise

Version chinoise, très simple à utiliser

Envoyer Studio 13.0.1

Puissant environnement de développement intégré PHP

Dreamweaver CS6

Outils de développement Web visuel

SublimeText3 version Mac

Logiciel d'édition de code au niveau de Dieu (SublimeText3)

Afficher plus

Sujets chauds

Tutoriel Java

1667

Tutoriel CakePHP

1426

Tutoriel Laravel

1328

Tutoriel PHP

1273

Tutoriel C#

1255

Afficher plus

Related knowledge

L'auteur de ControlNet a encore un succès ! L'ensemble du processus de génération d'une peinture à partir d'une image, gagnant 1,4k étoiles en deux jours Jul 17, 2024 am 01:56 AM

Il s'agit également d'une vidéo Tusheng, mais PaintsUndo a emprunté une voie différente. L'auteur de ControlNet, LvminZhang, a recommencé à vivre ! Cette fois, je vise le domaine de la peinture. Le nouveau projet PaintsUndo a reçu 1,4kstar (toujours en hausse folle) peu de temps après son lancement. Adresse du projet : https://github.com/lllyasviel/Paints-UNDO Grâce à ce projet, l'utilisateur saisit une image statique et PaintsUndo peut automatiquement vous aider à générer une vidéo de l'ensemble du processus de peinture, du brouillon de ligne au suivi du produit fini. . Pendant le processus de dessin, les changements de lignes sont étonnants. Le résultat vidéo final est très similaire à l’image originale : jetons un coup d’œil à un dessin complet.

Du RLHF au DPO en passant par TDPO, les algorithmes d'alignement des grands modèles sont déjà « au niveau des jetons » Jun 24, 2024 pm 03:04 PM

La colonne AIxiv est une colonne où ce site publie du contenu académique et technique. Au cours des dernières années, la rubrique AIxiv de ce site a reçu plus de 2 000 rapports, couvrant les meilleurs laboratoires des principales universités et entreprises du monde entier, favorisant efficacement les échanges et la diffusion académiques. Si vous souhaitez partager un excellent travail, n'hésitez pas à contribuer ou à nous contacter pour un rapport. Courriel de soumission : liyazhou@jiqizhixin.com ; zhaoyunfeng@jiqizhixin.com Dans le processus de développement de l'intelligence artificielle, le contrôle et le guidage des grands modèles de langage (LLM) ont toujours été l'un des principaux défis, visant à garantir que ces modèles sont à la fois puissant et sûr au service de la société humaine. Les premiers efforts se sont concentrés sur les méthodes d’apprentissage par renforcement par feedback humain (RL

En tête de liste des ingénieurs logiciels d'IA open source, la solution sans agent de l'UIUC résout facilement les problèmes de programmation réels du banc SWE. Jul 17, 2024 pm 10:02 PM

La colonne AIxiv est une colonne où ce site publie du contenu académique et technique. Au cours des dernières années, la rubrique AIxiv de ce site a reçu plus de 2 000 rapports, couvrant les meilleurs laboratoires des principales universités et entreprises du monde entier, favorisant efficacement les échanges et la diffusion académiques. Si vous souhaitez partager un excellent travail, n'hésitez pas à contribuer ou à nous contacter pour un rapport. Courriel de soumission : liyazhou@jiqizhixin.com ; zhaoyunfeng@jiqizhixin.com Les auteurs de cet article font tous partie de l'équipe de l'enseignant Zhang Lingming de l'Université de l'Illinois à Urbana-Champaign (UIUC), notamment : Steven Code repair ; doctorant en quatrième année, chercheur

Les articles arXiv peuvent être publiés sous forme de 'barrage', la plateforme de discussion alphaXiv de Stanford est en ligne, LeCun l'aime Aug 01, 2024 pm 05:18 PM

acclamations! Qu’est-ce que ça fait lorsqu’une discussion sur papier se résume à des mots ? Récemment, des étudiants de l'Université de Stanford ont créé alphaXiv, un forum de discussion ouvert pour les articles arXiv qui permet de publier des questions et des commentaires directement sur n'importe quel article arXiv. Lien du site Web : https://alphaxiv.org/ En fait, il n'est pas nécessaire de visiter spécifiquement ce site Web. Il suffit de remplacer arXiv dans n'importe quelle URL par alphaXiv pour ouvrir directement l'article correspondant sur le forum alphaXiv : vous pouvez localiser avec précision les paragraphes dans. l'article, Phrase : dans la zone de discussion sur la droite, les utilisateurs peuvent poser des questions à l'auteur sur les idées et les détails de l'article. Par exemple, ils peuvent également commenter le contenu de l'article, tels que : "Donné à".

Une avancée significative dans l'hypothèse de Riemann ! Tao Zhexuan recommande fortement les nouveaux articles du MIT et d'Oxford, et le lauréat de la médaille Fields, âgé de 37 ans, a participé Aug 05, 2024 pm 03:32 PM

Récemment, l’hypothèse de Riemann, connue comme l’un des sept problèmes majeurs du millénaire, a réalisé une nouvelle avancée. L'hypothèse de Riemann est un problème mathématique non résolu très important, lié aux propriétés précises de la distribution des nombres premiers (les nombres premiers sont les nombres qui ne sont divisibles que par 1 et par eux-mêmes, et jouent un rôle fondamental dans la théorie des nombres). Dans la littérature mathématique actuelle, il existe plus d'un millier de propositions mathématiques basées sur l'établissement de l'hypothèse de Riemann (ou sa forme généralisée). En d’autres termes, une fois que l’hypothèse de Riemann et sa forme généralisée seront prouvées, ces plus d’un millier de propositions seront établies sous forme de théorèmes, qui auront un impact profond sur le domaine des mathématiques et si l’hypothèse de Riemann s’avère fausse, alors parmi eux ; ces propositions qui en font partie perdront également de leur efficacité. Une nouvelle percée vient du professeur de mathématiques du MIT, Larry Guth, et de l'Université d'Oxford

Travail posthume de l'équipe OpenAI Super Alignment : deux grands modèles jouent à un jeu et le résultat devient plus compréhensible Jul 19, 2024 am 01:29 AM

Si la réponse donnée par le modèle d’IA est incompréhensible du tout, oseriez-vous l’utiliser ? À mesure que les systèmes d’apprentissage automatique sont utilisés dans des domaines de plus en plus importants, il devient de plus en plus important de démontrer pourquoi nous pouvons faire confiance à leurs résultats, et quand ne pas leur faire confiance. Une façon possible de gagner confiance dans le résultat d'un système complexe est d'exiger que le système produise une interprétation de son résultat qui soit lisible par un humain ou un autre système de confiance, c'est-à-dire entièrement compréhensible au point que toute erreur possible puisse être trouvé. Par exemple, pour renforcer la confiance dans le système judiciaire, nous exigeons que les tribunaux fournissent des avis écrits clairs et lisibles qui expliquent et soutiennent leurs décisions. Pour les grands modèles de langage, nous pouvons également adopter une approche similaire. Cependant, lorsque vous adoptez cette approche, assurez-vous que le modèle de langage génère

LLM n'est vraiment pas bon pour la prédiction de séries chronologiques. Il n'utilise même pas sa capacité de raisonnement. Jul 15, 2024 pm 03:59 PM

Les modèles linguistiques peuvent-ils vraiment être utilisés pour la prédiction de séries chronologiques ? Selon la loi des gros titres de Betteridge (tout titre d'actualité se terminant par un point d'interrogation peut recevoir une réponse « non »), la réponse devrait être non. Le fait semble être vrai : un LLM aussi puissant ne peut pas bien gérer les données de séries chronologiques. Les séries chronologiques, c'est-à-dire les séries chronologiques, comme leur nom l'indique, font référence à un ensemble de séquences de points de données disposées par ordre temporel. L'analyse des séries chronologiques est essentielle dans de nombreux domaines, notamment la prévision de la propagation des maladies, l'analyse du commerce de détail, la santé et la finance. Dans le domaine de l'analyse des séries chronologiques, de nombreux chercheurs ont récemment étudié comment utiliser les grands modèles linguistiques (LLM) pour classer, prédire et détecter les anomalies dans les séries chronologiques. Ces articles supposent que les modèles de langage capables de gérer les dépendances séquentielles dans le texte peuvent également se généraliser aux séries chronologiques.

Le premier MLLM basé sur Mamba est là ! Les poids des modèles, le code de formation, etc. sont tous open source Jul 17, 2024 am 02:46 AM

La colonne AIxiv est une colonne où ce site publie du contenu académique et technique. Au cours des dernières années, la rubrique AIxiv de ce site a reçu plus de 2 000 rapports, couvrant les meilleurs laboratoires des principales universités et entreprises du monde entier, favorisant efficacement les échanges et la diffusion académiques. Si vous souhaitez partager un excellent travail, n'hésitez pas à contribuer ou à nous contacter pour un rapport. Courriel de soumission : liyazhou@jiqizhixin.com ; zhaoyunfeng@jiqizhixin.com. Introduction Ces dernières années, l'application de grands modèles de langage multimodaux (MLLM) dans divers domaines a connu un succès remarquable. Cependant, en tant que modèle de base pour de nombreuses tâches en aval, le MLLM actuel se compose du célèbre réseau Transformer, qui

See all articles