Maison Périphériques technologiques IA ICLR 2024 Oral | Pour faire face aux changements de distribution qui changent au fil du temps, l'Université de Western Ontario et d'autres ont proposé une méthode d'apprentissage de trajectoire de séries chronologiques

ICLR 2024 Oral | Pour faire face aux changements de distribution qui changent au fil du temps, l'Université de Western Ontario et d'autres ont proposé une méthode d'apprentissage de trajectoire de séries chronologiques

Jun 19, 2024 pm 08:45 PM
工程 SDE-EDG

ICLR 2024 Oral | 应对随时间变化的分布偏移,西安大略大学等提出学习时序轨迹方法
La rubrique AIxiv est une rubrique où ce site publie du contenu académique et technique. Au cours des dernières années, la rubrique AIxiv de ce site a reçu plus de 2 000 rapports, couvrant les meilleurs laboratoires des principales universités et entreprises du monde entier, favorisant efficacement les échanges et la diffusion académiques. Si vous souhaitez partager un excellent travail, n'hésitez pas à contribuer ou à nous contacter pour un rapport. Courriel de soumission : liyazhou@jiqizhixin.com ; zhaoyunfeng@jiqizhixin.com

L'auteur Zeng Qiulin est diplômé de l'Institut de technologie de Harbin et a obtenu une maîtrise de l'Université nationale de Singapour. Sous la direction du professeur Wang Bo et de l'académicien Ling Xiaofeng, au cours de sa période de doctorat, il a principalement mené des recherches théoriques de démonstration, de méthode et d'application sur la distribution des changements d'heure aléatoires. Actuellement, il a publié de nombreux articles académiques dans ICLR/AAAI/IEEE TNNLS.

Page d'accueil personnelle : https://hardworkingpearl.github.io/

Dans les applications d'apprentissage automatique du monde réel, les changements de distribution au fil du temps sont un problème courant. Cette situation est définie comme une généralisation de domaine variable dans le temps (EDG), où l'objectif est de permettre au modèle de bien se généraliser à des domaines cibles invisibles dans des systèmes variables dans le temps en apprenant des modèles évolutifs sous-jacents dans tous les domaines et en exploitant ces modèles. Cependant, en raison du nombre limité d'horodatages dans l'ensemble de données EDG, les méthodes existantes rencontrent des difficultés pour capturer la dynamique évolutive et éviter le surajustement à des horodatages clairsemés, ce qui limite leur généralisation et leur adaptabilité à de nouvelles tâches.

Pour résoudre ce problème, nous proposons une nouvelle méthode SDE-EDG, qui collecte la trajectoire d'évolution de la grille de subdivision infinie (IFGET) de la distribution des données en interpolant continuellement des échantillons pour surmonter le problème de surajustement. De plus, en exploitant la capacité inhérente des équations différentielles stochastiques (SDE) à capturer des trajectoires continues, nous proposons d'aligner les trajectoires modélisées par les SDE avec celles de l'IFGET grâce à une estimation du maximum de vraisemblance, permettant ainsi de capturer les tendances d'évolution de la distribution.

ICLR 2024 Oral | 应对随时间变化的分布偏移,西安大略大学等提出学习时序轨迹方法

  • Titre de l'article : Apprentissage de trajectoire latente pour des horodatages limités sous changement de distribution au fil du temps

  • Lien de l'article : https://openreview.net/pdf?id=bTMMNT7IdW

  • Lien du projet : https : //github.com/HardworkingPearl/SDE-EDG-iclr2024

Method

Core Idea

Pour surmonter ce défi, SDE-EDG propose une nouvelle approche en construisant des segments infinis, une trajectoire évolutive à grille infiniment fine (IFGET) crée des échantillons interpolés consécutifs dans l'espace de représentation latente pour combler l'écart entre les horodatages. De plus, SDE-EDG utilise la capacité inhérente des équations différentielles stochastiques (SDE) à capturer la dynamique de trajectoire continue et aligne les trajectoires modélisées par SDE avec IFGET via le régulariseur d'alignement de chemin, réalisant ainsi une capture inter-domaines des tendances de distribution en évolution.

Détails de la méthode

1. Construction d'IFGET :

Tout d'abord, SDE-EDG établit une correspondance d'échantillon à échantillon pour chaque échantillon dans l'espace de représentation latente et collecte la trajectoire d'évolution de chaque échantillon individuel. Pour tout échantillon ICLR 2024 Oral | 应对随时间变化的分布偏移,西安大略大学等提出学习时序轨迹方法 de chaque catégorie k à l'instant ICLR 2024 Oral | 应对随时间变化的分布偏移,西安大略大学等提出学习时序轨迹方法, nous recherchons le plus proche ICLR 2024 Oral | 应对随时间变化的分布偏移,西安大略大学等提出学习时序轨迹方法 de celle-ci dans l'espace des fonctionnalités à l'instant ICLR 2024 Oral | 应对随时间变化的分布偏移,西安大略大学等提出学习时序轨迹方法 et son échantillon correspondant dans ICLR 2024 Oral | Pour faire face aux changements de distribution qui changent au fil du temps, lUniversité de Western Ontario et dautres ont proposé une méthode dapprentissage de trajectoire de séries chronologiques :

ICLR 2024 Oral | 应对随时间变化的分布偏移,西安大略大学等提出学习时序轨迹方法

Voici ICLR 2024 Oral | 应对随时间变化的分布偏移,西安大略大学等提出学习时序轨迹方法 le calcul de la distance entre deux vecteurs, ICLR 2024 Oral | 应对随时间变化的分布偏移,西安大略大学等提出学习时序轨迹方法 est l'ensemble des ICLR 2024 Oral | 应对随时间变化的分布偏移,西安大略大学等提出学习时序轨迹方法 échantillons échantillonnés dans le champ suivant ICLR 2024 Oral | 应对随时间变化的分布偏移,西安大略大学等提出学习时序轨迹方法.

Cette correspondance est ensuite exploitée pour générer des échantillons interpolés consécutifs, visant à relier les écarts de temps entre les intervalles d'horodatage et à éviter le surajustement vers des horodatages clairsemés,

ICLR 2024 Oral | 应对随时间变化的分布偏移,西安大略大学等提出学习时序轨迹方法

iciICLR 2024 Oral | 应对随时间变化的分布偏移,西安大略大学等提出学习时序轨迹方法échantillonnés à partir de la distribution Beta. En collectant les traces temporelles ICLR 2024 Oral | 应对随时间变化的分布偏移,西安大略大学等提出学习时序轨迹方法 des échantillons générés de la manière ci-dessus, nous obtenons IFGET.

2. Modéliser des trajectoires à l'aide de SDE :

SDE-EDG adopte le SDE neuronal pour modéliser la trajectoire temporelle continue des données dans l'espace latent. Contrairement aux modèles traditionnels basés sur un horodatage discret, SDE convient naturellement à la simulation de trajectoires temporelles continues. SDE-EDG modélise les trajectoires des séries chronologiques et peut prédire des échantillons à tout moment futur ICLR 2024 Oral | Pour faire face aux changements de distribution qui changent au fil du temps, lUniversité de Western Ontario et dautres ont proposé une méthode dapprentissage de trajectoire de séries chronologiques grâce à des échantillons à un moment ICLR 2024 Oral | 应对随时间变化的分布偏移,西安大略大学等提出学习时序轨迹方法 :

ICLR 2024 Oral | 应对随时间变化的分布偏移,西安大略大学等提出学习时序轨迹方法

Ici, la variable d'espace de caractéristiques ICLR 2024 Oral | 应对随时间变化的分布偏移,西安大略大学等提出学习时序轨迹方法 est prédite à partir d'échantillons à un moment ICLR 2024 Oral | 应对随时间变化的分布偏移,西安大略大学等提出学习时序轨迹方法, ICLR 2024 Oral | 应对随时间变化的分布偏移,西安大略大学等提出学习时序轨迹方法 est la fonction de dérive, et ICLR 2024 Oral | 应对随时间变化的分布偏移,西安大略大学等提出学习时序轨迹方法 est fonction de diffusion.

3. Alignement du chemin et estimation du maximum de vraisemblance :

SDE-EDG entraîne le modèle en maximisant l'estimation de la vraisemblance de IFGET,

ICLR 2024 Oral | 应对随时间变化的分布偏移,西安大略大学等提出学习时序轨迹方法

La fonction d'entraînement finale est ICLR 2024 Oral | 应对随时间变化的分布偏移,西安大略大学等提出学习时序轨迹方法, et le premier terme est la perte d'erreur de la tâche de classification de prédiction. fonction .

4. Expérimentez

  • Le tableau suivant montre la comparaison de l'exactitude de la classification entre SDE-EDG et d'autres méthodes de base sur plusieurs ensembles de données. Ces ensembles de données incluent Rotated Gaussian (RG), Circle (Cir), Rotated MNIST (RM), Portraits (Por), Caltran (Cal), PowerSupply (PS) et Ocular Disease (OD). Les résultats montrent que SDE-EDG surpasse en moyenne les autres méthodes sur tous les ensembles de données.

ICLR 2024 Oral | 应对随时间变化的分布偏移,西安大略大学等提出学习时序轨迹方法

  • La figure ci-dessous fournit une comparaison intuitive, montrant la différence de représentation des caractéristiques entre l'algorithme SDE-EDG (à gauche) et la méthode DG traditionnelle IRM (à droite). Grâce à la visualisation de l'espace des caractéristiques des données, nous pouvons observer que la représentation des caractéristiques apprise par SDE-EDG a des limites de décision évidentes, dans lesquelles les points de données de différentes catégories sont clairement distingués et représentés par différentes formes, et les données de différents domaines sont représentées par barres arc-en-ciel. Cela démontre que SDE-EDG est capable de capturer avec succès la dynamique de l'évolution des données au fil du temps et de maintenir la séparabilité des classes dans l'espace des fonctionnalités. En revanche, la représentation des caractéristiques de l'IRM a tendance à regrouper les points de données dans une seule direction, ce qui entraîne des limites de décision peu claires, ce qui reflète l'incapacité de l'IRM à capturer les tendances de distribution variables dans le temps.

ICLR 2024 Oral | 应对随时间变化的分布偏移,西安大略大学等提出学习时序轨迹方法

  • La figure suivante démontre en profondeur à travers une série de sous-figures les avantages de l'algorithme SDE-EDG dans sa capacité à capturer l'évolution des données au fil du temps. La sous-figure (a) fournit la véritable distribution des étiquettes de l'ensemble de données Sine, où les exemples positifs et négatifs sont représentés par des points de couleurs différentes, fournissant une base de référence pour les comparaisons ultérieures. Ensuite, les sous-figures (b) et (c) montrent respectivement les résultats de prédiction de la méthode traditionnelle basée sur l'ERM et l'algorithme SDE-EDG sur le même ensemble de données. Par comparaison, nous pouvons voir les avantages évidents de SDE-EDG pour capturer le. modèle d'évolution des données. Les sous-figures (d) et (e) révèlent en outre le chemin d'évolution appris par SDE-EDG, où (d) montre le chemin après application de la perte d'alignement de chemin (fonction de perte de vraisemblance maximale), tandis que (e) montre le chemin sans le chemin lorsque en appliquant cette perte. À partir de cette comparaison, on peut intuitivement voir l’importance de la perte d’alignement de chemin pour garantir que le modèle peut correctement capturer et caractériser les changements de données au fil du temps.

ICLR 2024 Oral | 应对随时间变化的分布偏移,西安大略大学等提出学习时序轨迹方法

  • Le sous-graphique suivant (a) montre la trajectoire de convergence de précision lors de l'utilisation de différents algorithmes pour la formation sur l'ensemble de données Portraits. Cette sous-figure fournit une perspective intuitive pour comparer la façon dont les performances de l'algorithme SDE-EDG changent avec d'autres méthodes de base (telles que ERM, MLDG, GI) pendant la formation. En observant la tendance croissante de la précision de l’entraînement au fil du temps, nous pouvons évaluer la capacité d’apprentissage et la vitesse de convergence de différents algorithmes. La trajectoire de convergence de l'algorithme SDE-EDG présente un intérêt particulier car elle révèle l'efficacité et la stabilité de l'algorithme pour s'adapter à l'évolution des distributions de données.

    Les sous-figures suivantes (b) et (c) montrent respectivement les ensembles de données RMNIST et Circle. Les performances de l'algorithme SDE-EDG sur ces ensembles de données montrent sa supériorité dans le traitement des distributions variables dans le temps, même en face A élevé. la précision peut également être maintenue pour des domaines cibles sur une période plus longue, ce qui démontre la puissante capacité de l'algorithme SDE-EDG à capturer et à s'adapter aux modèles d'évolution des données.

    Les sous-figures suivantes (d) et (e) explorent l'impact de la perte de vraisemblance maximale sur les performances de SDE-EDG sur les ensembles de données RMNIST et PowerSupply. En modifiant la valeur du poids de régularisation α, ces deux sous-tracés démontrent l'impact spécifique des différents paramètres α sur les performances du modèle. Les résultats expérimentaux montrent que des valeurs α appropriées peuvent améliorer considérablement les performances de SDE-EDG sur des ensembles de données spécifiques, ce qui souligne l'importance d'ajuster les hyperparamètres en fonction des caractéristiques de l'ensemble de données et des exigences des tâches dans les applications pratiques.

ICLR 2024 Oral | 应对随时间变化的分布偏移,西安大略大学等提出学习时序轨迹方法

Conclusion

L'auteur de l'article a proposé une nouvelle méthode SDE-EDG pour modéliser les problèmes de généralisation de domaine variable dans le temps (EDG). Le procédé consiste à construire un IFGET en identifiant des correspondances d'échantillon à échantillon et en générant des échantillons interpolés consécutifs. Par la suite, les auteurs ont pris des équations différentielles stochastiques (SDE) et les ont alignées sur IFGET pour la formation. La contribution de l'article est de révéler l'importance de capturer les modèles évolutifs en collectant les trajectoires temporelles des individus et en interpolant entre les intervalles de temps pour atténuer le problème d'un nombre limité d'horodatages sources, ce qui empêche efficacement SDE-EDG d'avoir un nombre limité. d'horodatages.

Ce qui précède est le contenu détaillé de. pour plus d'informations, suivez d'autres articles connexes sur le site Web de PHP en chinois!

Déclaration de ce site Web
Le contenu de cet article est volontairement contribué par les internautes et les droits d'auteur appartiennent à l'auteur original. Ce site n'assume aucune responsabilité légale correspondante. Si vous trouvez un contenu suspecté de plagiat ou de contrefaçon, veuillez contacter admin@php.cn

Outils d'IA chauds

Undresser.AI Undress

Undresser.AI Undress

Application basée sur l'IA pour créer des photos de nu réalistes

AI Clothes Remover

AI Clothes Remover

Outil d'IA en ligne pour supprimer les vêtements des photos.

Undress AI Tool

Undress AI Tool

Images de déshabillage gratuites

Clothoff.io

Clothoff.io

Dissolvant de vêtements AI

Video Face Swap

Video Face Swap

Échangez les visages dans n'importe quelle vidéo sans effort grâce à notre outil d'échange de visage AI entièrement gratuit !

Article chaud

<🎜>: Bubble Gum Simulator Infinity - Comment obtenir et utiliser les clés royales
4 Il y a quelques semaines By 尊渡假赌尊渡假赌尊渡假赌
<🎜>: Grow A Garden - Guide de mutation complet
3 Il y a quelques semaines By DDD
Nordhold: Système de fusion, expliqué
4 Il y a quelques semaines By 尊渡假赌尊渡假赌尊渡假赌
Mandragora: Whispers of the Witch Tree - Comment déverrouiller le grappin
3 Il y a quelques semaines By 尊渡假赌尊渡假赌尊渡假赌

Outils chauds

Bloc-notes++7.3.1

Bloc-notes++7.3.1

Éditeur de code facile à utiliser et gratuit

SublimeText3 version chinoise

SublimeText3 version chinoise

Version chinoise, très simple à utiliser

Envoyer Studio 13.0.1

Envoyer Studio 13.0.1

Puissant environnement de développement intégré PHP

Dreamweaver CS6

Dreamweaver CS6

Outils de développement Web visuel

SublimeText3 version Mac

SublimeText3 version Mac

Logiciel d'édition de code au niveau de Dieu (SublimeText3)

Sujets chauds

Tutoriel Java
1670
14
Tutoriel PHP
1276
29
Tutoriel C#
1256
24
L'auteur de ControlNet a encore un succès ! L'ensemble du processus de génération d'une peinture à partir d'une image, gagnant 1,4k étoiles en deux jours L'auteur de ControlNet a encore un succès ! L'ensemble du processus de génération d'une peinture à partir d'une image, gagnant 1,4k étoiles en deux jours Jul 17, 2024 am 01:56 AM

Il s'agit également d'une vidéo Tusheng, mais PaintsUndo a emprunté une voie différente. L'auteur de ControlNet, LvminZhang, a recommencé à vivre ! Cette fois, je vise le domaine de la peinture. Le nouveau projet PaintsUndo a reçu 1,4kstar (toujours en hausse folle) peu de temps après son lancement. Adresse du projet : https://github.com/lllyasviel/Paints-UNDO Grâce à ce projet, l'utilisateur saisit une image statique et PaintsUndo peut automatiquement vous aider à générer une vidéo de l'ensemble du processus de peinture, du brouillon de ligne au suivi du produit fini. . Pendant le processus de dessin, les changements de lignes sont étonnants. Le résultat vidéo final est très similaire à l’image originale : jetons un coup d’œil à un dessin complet.

En tête de liste des ingénieurs logiciels d'IA open source, la solution sans agent de l'UIUC résout facilement les problèmes de programmation réels du banc SWE. En tête de liste des ingénieurs logiciels d'IA open source, la solution sans agent de l'UIUC résout facilement les problèmes de programmation réels du banc SWE. Jul 17, 2024 pm 10:02 PM

La colonne AIxiv est une colonne où ce site publie du contenu académique et technique. Au cours des dernières années, la rubrique AIxiv de ce site a reçu plus de 2 000 rapports, couvrant les meilleurs laboratoires des principales universités et entreprises du monde entier, favorisant efficacement les échanges et la diffusion académiques. Si vous souhaitez partager un excellent travail, n'hésitez pas à contribuer ou à nous contacter pour un rapport. Courriel de soumission : liyazhou@jiqizhixin.com ; zhaoyunfeng@jiqizhixin.com Les auteurs de cet article font tous partie de l'équipe de l'enseignant Zhang Lingming de l'Université de l'Illinois à Urbana-Champaign (UIUC), notamment : Steven Code repair ; doctorant en quatrième année, chercheur

Du RLHF au DPO en passant par TDPO, les algorithmes d'alignement des grands modèles sont déjà « au niveau des jetons » Du RLHF au DPO en passant par TDPO, les algorithmes d'alignement des grands modèles sont déjà « au niveau des jetons » Jun 24, 2024 pm 03:04 PM

La colonne AIxiv est une colonne où ce site publie du contenu académique et technique. Au cours des dernières années, la rubrique AIxiv de ce site a reçu plus de 2 000 rapports, couvrant les meilleurs laboratoires des principales universités et entreprises du monde entier, favorisant efficacement les échanges et la diffusion académiques. Si vous souhaitez partager un excellent travail, n'hésitez pas à contribuer ou à nous contacter pour un rapport. Courriel de soumission : liyazhou@jiqizhixin.com ; zhaoyunfeng@jiqizhixin.com Dans le processus de développement de l'intelligence artificielle, le contrôle et le guidage des grands modèles de langage (LLM) ont toujours été l'un des principaux défis, visant à garantir que ces modèles sont à la fois puissant et sûr au service de la société humaine. Les premiers efforts se sont concentrés sur les méthodes d’apprentissage par renforcement par feedback humain (RL

Les articles arXiv peuvent être publiés sous forme de 'barrage', la plateforme de discussion alphaXiv de Stanford est en ligne, LeCun l'aime Les articles arXiv peuvent être publiés sous forme de 'barrage', la plateforme de discussion alphaXiv de Stanford est en ligne, LeCun l'aime Aug 01, 2024 pm 05:18 PM

acclamations! Qu’est-ce que ça fait lorsqu’une discussion sur papier se résume à des mots ? Récemment, des étudiants de l'Université de Stanford ont créé alphaXiv, un forum de discussion ouvert pour les articles arXiv qui permet de publier des questions et des commentaires directement sur n'importe quel article arXiv. Lien du site Web : https://alphaxiv.org/ En fait, il n'est pas nécessaire de visiter spécifiquement ce site Web. Il suffit de remplacer arXiv dans n'importe quelle URL par alphaXiv pour ouvrir directement l'article correspondant sur le forum alphaXiv : vous pouvez localiser avec précision les paragraphes dans. l'article, Phrase : dans la zone de discussion sur la droite, les utilisateurs peuvent poser des questions à l'auteur sur les idées et les détails de l'article. Par exemple, ils peuvent également commenter le contenu de l'article, tels que : "Donné à".

Travail posthume de l'équipe OpenAI Super Alignment : deux grands modèles jouent à un jeu et le résultat devient plus compréhensible Travail posthume de l'équipe OpenAI Super Alignment : deux grands modèles jouent à un jeu et le résultat devient plus compréhensible Jul 19, 2024 am 01:29 AM

Si la réponse donnée par le modèle d’IA est incompréhensible du tout, oseriez-vous l’utiliser ? À mesure que les systèmes d’apprentissage automatique sont utilisés dans des domaines de plus en plus importants, il devient de plus en plus important de démontrer pourquoi nous pouvons faire confiance à leurs résultats, et quand ne pas leur faire confiance. Une façon possible de gagner confiance dans le résultat d'un système complexe est d'exiger que le système produise une interprétation de son résultat qui soit lisible par un humain ou un autre système de confiance, c'est-à-dire entièrement compréhensible au point que toute erreur possible puisse être trouvé. Par exemple, pour renforcer la confiance dans le système judiciaire, nous exigeons que les tribunaux fournissent des avis écrits clairs et lisibles qui expliquent et soutiennent leurs décisions. Pour les grands modèles de langage, nous pouvons également adopter une approche similaire. Cependant, lorsque vous adoptez cette approche, assurez-vous que le modèle de langage génère

Une avancée significative dans l'hypothèse de Riemann ! Tao Zhexuan recommande fortement les nouveaux articles du MIT et d'Oxford, et le lauréat de la médaille Fields, âgé de 37 ans, a participé Une avancée significative dans l'hypothèse de Riemann ! Tao Zhexuan recommande fortement les nouveaux articles du MIT et d'Oxford, et le lauréat de la médaille Fields, âgé de 37 ans, a participé Aug 05, 2024 pm 03:32 PM

Récemment, l’hypothèse de Riemann, connue comme l’un des sept problèmes majeurs du millénaire, a réalisé une nouvelle avancée. L'hypothèse de Riemann est un problème mathématique non résolu très important, lié aux propriétés précises de la distribution des nombres premiers (les nombres premiers sont les nombres qui ne sont divisibles que par 1 et par eux-mêmes, et jouent un rôle fondamental dans la théorie des nombres). Dans la littérature mathématique actuelle, il existe plus d'un millier de propositions mathématiques basées sur l'établissement de l'hypothèse de Riemann (ou sa forme généralisée). En d’autres termes, une fois que l’hypothèse de Riemann et sa forme généralisée seront prouvées, ces plus d’un millier de propositions seront établies sous forme de théorèmes, qui auront un impact profond sur le domaine des mathématiques et si l’hypothèse de Riemann s’avère fausse, alors parmi eux ; ces propositions qui en font partie perdront également de leur efficacité. Une nouvelle percée vient du professeur de mathématiques du MIT, Larry Guth, et de l'Université d'Oxford

LLM n'est vraiment pas bon pour la prédiction de séries chronologiques. Il n'utilise même pas sa capacité de raisonnement. LLM n'est vraiment pas bon pour la prédiction de séries chronologiques. Il n'utilise même pas sa capacité de raisonnement. Jul 15, 2024 pm 03:59 PM

Les modèles linguistiques peuvent-ils vraiment être utilisés pour la prédiction de séries chronologiques ? Selon la loi des gros titres de Betteridge (tout titre d'actualité se terminant par un point d'interrogation peut recevoir une réponse « non »), la réponse devrait être non. Le fait semble être vrai : un LLM aussi puissant ne peut pas bien gérer les données de séries chronologiques. Les séries chronologiques, c'est-à-dire les séries chronologiques, comme leur nom l'indique, font référence à un ensemble de séquences de points de données disposées par ordre temporel. L'analyse des séries chronologiques est essentielle dans de nombreux domaines, notamment la prévision de la propagation des maladies, l'analyse du commerce de détail, la santé et la finance. Dans le domaine de l'analyse des séries chronologiques, de nombreux chercheurs ont récemment étudié comment utiliser les grands modèles linguistiques (LLM) pour classer, prédire et détecter les anomalies dans les séries chronologiques. Ces articles supposent que les modèles de langage capables de gérer les dépendances séquentielles dans le texte peuvent également se généraliser aux séries chronologiques.

Le premier MLLM basé sur Mamba est là ! Les poids des modèles, le code de formation, etc. sont tous open source Le premier MLLM basé sur Mamba est là ! Les poids des modèles, le code de formation, etc. sont tous open source Jul 17, 2024 am 02:46 AM

La colonne AIxiv est une colonne où ce site publie du contenu académique et technique. Au cours des dernières années, la rubrique AIxiv de ce site a reçu plus de 2 000 rapports, couvrant les meilleurs laboratoires des principales universités et entreprises du monde entier, favorisant efficacement les échanges et la diffusion académiques. Si vous souhaitez partager un excellent travail, n'hésitez pas à contribuer ou à nous contacter pour un rapport. Courriel de soumission : liyazhou@jiqizhixin.com ; zhaoyunfeng@jiqizhixin.com. Introduction Ces dernières années, l'application de grands modèles de langage multimodaux (MLLM) dans divers domaines a connu un succès remarquable. Cependant, en tant que modèle de base pour de nombreuses tâches en aval, le MLLM actuel se compose du célèbre réseau Transformer, qui

See all articles