Avec une base théorique, nous pouvons réaliser une optimisation en profondeur.-IA-php.cn

Maison

Périphériques technologiques

Avec une base théorique, nous pouvons réaliser une optimisation en profondeur.

WBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWB

Sep 20, 2023 pm 03:05 PM

理论 transformer

Pourquoi le transformateur fonctionne-t-il si bien ? D'où vient la capacité d'apprentissage en contexte qu'elle apporte à de nombreux grands modèles de langage ? Dans le domaine de l’intelligence artificielle, le transformateur est devenu le modèle dominant en matière d’apprentissage profond, mais les bases théoriques de ses excellentes performances n’ont pas été suffisamment étudiées.

Récemment, de nouvelles recherches menées par des chercheurs de Google AI, de l'ETH Zurich et de Google DeepMind ont tenté de révéler la réponse au mystère. Dans le cadre de nouvelles recherches, ils ont procédé à une ingénierie inverse du transformateur et trouvé des méthodes d'optimisation. Article « Découvrir les algorithmes de mésa-optimisation dans Transformers » : Avec une base théorique, nous pouvons réaliser une optimisation en profondeur.

Avec une base théorique, nous pouvons réaliser une optimisation en profondeur.

lien de l'article : https://arxiv.org/abs/2309.05858

L'auteur prouve que la minimisation de la perte autorégressive générale se produira lors de la passe avant de Transformer Algorithme d'optimisation auxiliaire basé sur le gradient exécuté dans . Ce phénomène a récemment été appelé « mésa-optimisation ». En outre, les chercheurs ont découvert que l’algorithme d’optimisation mesa résultant présentait des capacités d’apprentissage contextuel à petite échelle, indépendamment de la taille du modèle. Les nouveaux résultats complètent donc les principes d’apprentissage à petite échelle qui ont émergé précédemment dans les grands modèles de langage.

Les chercheurs estiment que le succès de Transformers repose sur son parti pris architectural dans la mise en œuvre de l'algorithme d'optimisation mesa dans la passe avant : (i) définir des objectifs d'apprentissage internes, et (ii) les optimiser. ♥ . En tant que séquence d'entrée s_1, . . , s_t est traité au pas de temps t, Transformer (i) crée un ensemble d'entraînement interne composé de paires d'associations entrée-cible, (ii) définit une fonction objectif interne via l'ensemble de données de résultat, qui est utilisé pour mesurer les performances du modèle interne en utilisant les poids W, (iii) Optimiser cet objectif et utiliser le modèle appris pour générer des prédictions futures

Avec une base théorique, nous pouvons réaliser une optimisation en profondeur.

. ^{Les contributions de cette étude comprennent :}

Généralise la théorie de von Oswald et al et montre comment les Transformers peuvent théoriquement optimiser les objectifs construits en interne en utilisant des méthodes basées sur le gradient à partir de la régression prédisant le élément suivant de la séquence.

Des transformateurs expérimentés par ingénierie inverse se sont entraînés sur des tâches de modélisation de séquence simples et ont trouvé des preuves solides que leur passe avant implémente un algorithme en deux étapes : (i) une couche d'auto-attention précoce via des marqueurs de regroupement et de copie construit l'ensemble de données de formation interne, donc l'ensemble de données de formation interne est construit implicitement. Définir les fonctions d'objectif internes et (ii) optimiser ces objectifs à un niveau plus profond pour générer des prédictions.

Semblable au LLM, les expériences montrent que de simples modèles de formation autorégressive peuvent également devenir des apprenants contextuels, et les ajustements à la volée sont cruciaux pour améliorer l'apprentissage contextuel du LLM et peuvent également améliorer les performances dans des environnements spécifiques.
Inspiré par la découverte selon laquelle les couches d'attention tentent d'optimiser implicitement la fonction objectif interne, l'auteur présente la couche mesa, un nouveau type de couche d'attention qui peut résoudre efficacement le problème d'optimisation des moindres carrés au lieu de simplement prendre une seule étape de gradient. pour atteindre l’optimalité. Les expériences démontrent qu'une seule couche mesa surpasse les transformateurs d'auto-attention linéaires profonds et softmax sur des tâches séquentielles simples tout en offrant plus d'interprétabilité.

Avec une base théorique, nous pouvons réaliser une optimisation en profondeur.

Basé sur des travaux récents montrant que les transformateurs explicitement formés pour résoudre de petites tâches en contexte peuvent implémenter des algorithmes de descente de gradient (GD). Ici, les auteurs montrent que ces résultats se généralisent à la modélisation de séquences autorégressives, une approche typique de la formation des LLM.

Analysez d'abord les transformateurs entraînés sur une dynamique linéaire simple, où chaque séquence est générée par un W* différent - pour éviter la mémorisation de séquences croisées. Dans cette configuration simple, les auteurs démontrent un transformateur qui crée un ensemble de données mesa, puis utilise le GD prétraité pour optimiser la cible mesa.

Cette étude entraîne un transformateur profond sur une structure de jeton qui agrège des éléments de séquence adjacents. Il est intéressant de noter que ce simple prétraitement aboutit à une matrice de poids extrêmement clairsemée (moins de 1 % des poids sont différents de zéro), ce qui donne lieu à un algorithme d'ingénierie inverse.

Avec une base théorique, nous pouvons réaliser une optimisation en profondeur.

Pour une auto-attention linéaire monocouche, le poids correspond à un pas GD. Pour les transformateurs profonds, l’interprétabilité devient difficile. Cette étude s'appuie sur un sondage linéaire et examine si les activations cachées prédisent des cibles autorégressives ou des entrées prétraitées.

Fait intéressant, la prévisibilité des deux méthodes de détection s'améliore progressivement à mesure que la profondeur du réseau augmente. Cette découverte suggère que le GD prétraité est caché dans le modèle. Figure 2 : Ingénierie inverse de la couche d’auto-attention linéaire entraînée.

Avec une base théorique, nous pouvons réaliser une optimisation en profondeur.

^{L'étude a révélé que la couche d'entraînement peut être parfaitement ajustée lors de l'utilisation de tous les degrés de liberté dans la construction, y compris non seulement le taux d'apprentissage appris η, mais également un ensemble de poids initiaux appris W_0. Il est important de noter que, comme le montre la figure 2, l’algorithme en une étape appris fonctionne toujours bien mieux qu’une seule couche mesa.}

Nous pouvons remarquer que sous de simples paramètres de poids, il est facile de découvrir grâce à une optimisation de base que cette couche peut résoudre de manière optimale la tâche étudiée ici. Ce résultat démontre l’avantage des biais inductifs codés en dur en faveur de l’optimisation mesa.

Avec des informations théoriques sur le cas multicouche, analysez d'abord Deep Linear et Softmax en prêtant uniquement attention à Transformer. Les auteurs formatent l'entrée selon une structure à 4 canaux,

, ce qui correspond au choix W_0 = 0.

Comme pour le modèle monocouche, les auteurs voient une structure claire dans les poids du modèle entraîné. Dans le cadre d'une première analyse d'ingénierie inverse, cette étude exploite cette structure et construit un algorithme (RevAlg-d, où d représente le nombre de couches) contenant 16 paramètres par en-tête de couche (au lieu de 3200). Les auteurs ont découvert que cette expression compressée mais complexe peut décrire le modèle entraîné. En particulier, il permet l'interpolation entre les poids Transformer et RevAlg-d réels d'une manière presque sans perte.

Bien que l'expression RevAlg-d explique un transformateur multicouche entraîné avec un petit nombre de paramètres libres, il est difficile de l'interpréter comme un algorithme d'optimisation mesa. Par conséquent, les auteurs ont utilisé une analyse par sondage par régression linéaire (Alain et Bengio, 2017 ; Akyürek et al., 2023) pour trouver les caractéristiques de l’algorithme d’optimisation mesa hypothétique.

Sur le transformateur d'auto-attention linéaire profond illustré à la figure 3, nous pouvons voir que les deux sondes peuvent être décodées de manière linéaire et que les performances de décodage augmentent avec l'augmentation de la longueur de la séquence et de la profondeur du réseau. Par conséquent, l’optimisation de base découvre un algorithme hybride qui descend couche par couche sur l’objectif mésa d’origine Lt (W) tout en améliorant le numéro de condition du problème d’optimisation mesa. Il en résulte une diminution rapide du Lt (W) mésa-objectif. On peut également constater que les performances s’améliorent considérablement avec l’augmentation de la profondeur.

On peut donc considérer que le déclin rapide de l'objectif mésa autorégressif Lt (W) est obtenu par une optimisation mesa étape par étape (cross-layer) sur de meilleures données prétraitées.建 Figure 3 : Formation sur les transformateurs multicouches pour les entrées intégrées par ingénierie inverse.

Cela montre que si le transformateur est formé sur le jeton construit, il prédira avec l'optimisation mesa. Fait intéressant, lorsque des éléments de séquence sont donnés directement, le transformateur construira lui-même le jeton en regroupant les éléments, ce que l'équipe de recherche appelle « créer l'ensemble de données mesa ».

Conclusion

Avec une base théorique, nous pouvons réaliser une optimisation en profondeur.

Cette étude montre que le modèle Transformer est capable de développer des algorithmes d'inférence basés sur le gradient lorsqu'il est entraîné sur une tâche de prédiction de séquence sous un objectif autorégressif standard. Par conséquent, les résultats de pointe obtenus dans des contextes de méta-apprentissage multitâches peuvent également être transférés vers des contextes de formation LLM auto-supervisés traditionnels.

De plus, l'étude a révélé que les algorithmes d'inférence autorégressive appris peuvent être réutilisés pour résoudre des tâches d'apprentissage contextuel supervisé sans avoir besoin de recyclage, expliquant les résultats dans un seul cadre unifié.

Avec une base théorique, nous pouvons réaliser une optimisation en profondeur.

Alors, qu'est-ce que cela a à voir avec l'apprentissage en contexte ? L'étude estime qu'après avoir entraîné le transformateur à la tâche de séquence autorégressive, il obtient une optimisation mesa appropriée et peut donc effectuer un apprentissage contextuel en quelques étapes sans aucun réglage fin.

Avec une base théorique, nous pouvons réaliser une optimisation en profondeur.

Cette étude suppose que l'optimisation mesa existe également pour LLM, améliorant ainsi ses capacités d'apprentissage contextuel. Il est intéressant de noter que l’étude a également observé qu’une adaptation efficace des invites pour le LLM peut également conduire à des améliorations substantielles des capacités d’apprentissage contextuel.

Avec une base théorique, nous pouvons réaliser une optimisation en profondeur.

Les lecteurs intéressés peuvent lire le texte original de l'article pour en savoir plus sur le contenu de la recherche.

^{Contenu de référence :}

^{https://www.reddit.com/r/MachineLearning/comments/16jc2su/r_uncovering_mesaoptimization_algorithms_in/}

^{https://twitter.com/ oswaldjoh/statut/1701873029100241241}

Ce qui précède est le contenu détaillé de. pour plus d'informations, suivez d'autres articles connexes sur le site Web de PHP en chinois!

Déclaration de ce site Web

Le contenu de cet article est volontairement contribué par les internautes et les droits d'auteur appartiennent à l'auteur original. Ce site n'assume aucune responsabilité légale correspondante. Si vous trouvez un contenu suspecté de plagiat ou de contrefaçon, veuillez contacter admin@php.cn

Outils d'IA chauds

Undresser.AI Undress

Application basée sur l'IA pour créer des photos de nu réalistes

AI Clothes Remover

Outil d'IA en ligne pour supprimer les vêtements des photos.

Undress AI Tool

Images de déshabillage gratuites

Clothoff.io

Dissolvant de vêtements AI

AI Hentai Generator

Générez AI Hentai gratuitement.

Afficher plus

Article chaud

R.E.P.O. Crystals d'énergie expliqués et ce qu'ils font (cristal jaune)

3 Il y a quelques semaines By 尊渡假赌尊渡假赌尊渡假赌

R.E.P.O. Meilleurs paramètres graphiques

3 Il y a quelques semaines By 尊渡假赌尊渡假赌尊渡假赌

Assassin's Creed Shadows: Solution d'énigmes de coquille

2 Il y a quelques semaines By DDD

R.E.P.O. Comment réparer l'audio si vous n'entendez personne

3 Il y a quelques semaines By 尊渡假赌尊渡假赌尊渡假赌

WWE 2K25: Comment déverrouiller tout dans Myrise

4 Il y a quelques semaines By 尊渡假赌尊渡假赌尊渡假赌

Afficher plus

Outils chauds

Bloc-notes++7.3.1

Éditeur de code facile à utiliser et gratuit

SublimeText3 version chinoise

Version chinoise, très simple à utiliser

Envoyer Studio 13.0.1

Puissant environnement de développement intégré PHP

Dreamweaver CS6

Outils de développement Web visuel

SublimeText3 version Mac

Logiciel d'édition de code au niveau de Dieu (SublimeText3)

Afficher plus

Sujets chauds

Où se trouve l'entrée de connexion pour la messagerie Gmail ?

7479

Tutoriel CakePHP

1377

Quel est le format du nom de compte de Steam

Clé d&amp;amp;amp;amp;amp;amp;#39;activation Win11 permanent

NYT Connexions Indices et réponses

Afficher plus

Related knowledge

Repoussant les limites de la détection de défauts traditionnelle, « Defect Spectrum » permet pour la première fois une détection de défauts industriels d'une ultra haute précision et d'une sémantique riche. Jul 26, 2024 pm 05:38 PM

Dans la fabrication moderne, une détection précise des défauts est non seulement la clé pour garantir la qualité des produits, mais également la clé de l’amélioration de l’efficacité de la production. Cependant, les ensembles de données de détection de défauts existants manquent souvent de précision et de richesse sémantique requises pour les applications pratiques, ce qui rend les modèles incapables d'identifier des catégories ou des emplacements de défauts spécifiques. Afin de résoudre ce problème, une équipe de recherche de premier plan composée de l'Université des sciences et technologies de Hong Kong, Guangzhou et de Simou Technology a développé de manière innovante l'ensemble de données « DefectSpectrum », qui fournit une annotation à grande échelle détaillée et sémantiquement riche des défauts industriels. Comme le montre le tableau 1, par rapport à d'autres ensembles de données industrielles, l'ensemble de données « DefectSpectrum » fournit le plus grand nombre d'annotations de défauts (5 438 échantillons de défauts) et la classification de défauts la plus détaillée (125 catégories de défauts).

Le modèle de dialogue NVIDIA ChatQA a évolué vers la version 2.0, avec la longueur du contexte mentionnée à 128 Ko Jul 26, 2024 am 08:40 AM

La communauté ouverte LLM est une époque où une centaine de fleurs fleurissent et s'affrontent. Vous pouvez voir Llama-3-70B-Instruct, QWen2-72B-Instruct, Nemotron-4-340B-Instruct, Mixtral-8x22BInstruct-v0.1 et bien d'autres. excellents interprètes. Cependant, par rapport aux grands modèles propriétaires représentés par le GPT-4-Turbo, les modèles ouverts présentent encore des lacunes importantes dans de nombreux domaines. En plus des modèles généraux, certains modèles ouverts spécialisés dans des domaines clés ont été développés, tels que DeepSeek-Coder-V2 pour la programmation et les mathématiques, et InternVL pour les tâches de langage visuel.

Le point de vue de la nature : les tests de l'intelligence artificielle en médecine sont dans le chaos. Que faut-il faire ? Aug 22, 2024 pm 04:37 PM

Editeur | ScienceAI Sur la base de données cliniques limitées, des centaines d'algorithmes médicaux ont été approuvés. Les scientifiques se demandent qui devrait tester les outils et comment le faire au mieux. Devin Singh a vu un patient pédiatrique aux urgences subir un arrêt cardiaque alors qu'il attendait un traitement pendant une longue période, ce qui l'a incité à explorer l'application de l'IA pour réduire les temps d'attente. À l’aide des données de triage des salles d’urgence de SickKids, Singh et ses collègues ont construit une série de modèles d’IA pour fournir des diagnostics potentiels et recommander des tests. Une étude a montré que ces modèles peuvent accélérer les visites chez le médecin de 22,3 %, accélérant ainsi le traitement des résultats de près de 3 heures par patient nécessitant un examen médical. Cependant, le succès des algorithmes d’intelligence artificielle dans la recherche ne fait que le vérifier.

Google AI a remporté la médaille d'argent de l'Olympiade mathématique de l'OMI, le modèle de raisonnement mathématique AlphaProof a été lancé et l'apprentissage par renforcement est de retour. Jul 26, 2024 pm 02:40 PM

Pour l’IA, l’Olympiade mathématique n’est plus un problème. Jeudi, l'intelligence artificielle de Google DeepMind a réalisé un exploit : utiliser l'IA pour résoudre la vraie question de l'Olympiade mathématique internationale de cette année, l'OMI, et elle n'était qu'à un pas de remporter la médaille d'or. Le concours de l'OMI qui vient de se terminer la semaine dernière comportait six questions portant sur l'algèbre, la combinatoire, la géométrie et la théorie des nombres. Le système d'IA hybride proposé par Google a répondu correctement à quatre questions et a marqué 28 points, atteignant le niveau de la médaille d'argent. Plus tôt ce mois-ci, le professeur titulaire de l'UCLA, Terence Tao, venait de promouvoir l'Olympiade mathématique de l'IA (AIMO Progress Award) avec un prix d'un million de dollars. De manière inattendue, le niveau de résolution de problèmes d'IA s'était amélioré à ce niveau avant juillet. Posez les questions simultanément sur l'OMI. La chose la plus difficile à faire correctement est l'OMI, qui a la plus longue histoire, la plus grande échelle et la plus négative.

Formation avec des millions de données cristallines pour résoudre le problème de la phase cristallographique, la méthode d'apprentissage profond PhAI est publiée dans Science Aug 08, 2024 pm 09:22 PM

Editeur | KX À ce jour, les détails structurels et la précision déterminés par cristallographie, des métaux simples aux grandes protéines membranaires, sont inégalés par aucune autre méthode. Cependant, le plus grand défi, appelé problème de phase, reste la récupération des informations de phase à partir d'amplitudes déterminées expérimentalement. Des chercheurs de l'Université de Copenhague au Danemark ont développé une méthode d'apprentissage en profondeur appelée PhAI pour résoudre les problèmes de phase cristalline. Un réseau neuronal d'apprentissage en profondeur formé à l'aide de millions de structures cristallines artificielles et de leurs données de diffraction synthétique correspondantes peut générer des cartes précises de densité électronique. L'étude montre que cette méthode de solution structurelle ab initio basée sur l'apprentissage profond peut résoudre le problème de phase avec une résolution de seulement 2 Angströms, ce qui équivaut à seulement 10 à 20 % des données disponibles à la résolution atomique, alors que le calcul ab initio traditionnel

Afin de fournir un nouveau système de référence et d'évaluation de questions-réponses scientifiques et complexes pour les grands modèles, l'UNSW, Argonne, l'Université de Chicago et d'autres institutions ont lancé conjointement le cadre SciQAG. Jul 25, 2024 am 06:42 AM

L'ensemble de données ScienceAI Question Answering (QA) joue un rôle essentiel dans la promotion de la recherche sur le traitement du langage naturel (NLP). Des ensembles de données d'assurance qualité de haute qualité peuvent non seulement être utilisés pour affiner les modèles, mais également évaluer efficacement les capacités des grands modèles linguistiques (LLM), en particulier la capacité à comprendre et à raisonner sur les connaissances scientifiques. Bien qu’il existe actuellement de nombreux ensembles de données scientifiques d’assurance qualité couvrant la médecine, la chimie, la biologie et d’autres domaines, ces ensembles de données présentent encore certaines lacunes. Premièrement, le formulaire de données est relativement simple, et la plupart sont des questions à choix multiples. Elles sont faciles à évaluer, mais limitent la plage de sélection des réponses du modèle et ne peuvent pas tester pleinement la capacité du modèle à répondre aux questions scientifiques. En revanche, les questions et réponses ouvertes

Identifiez automatiquement les meilleures molécules et réduisez les coûts de synthèse. Le MIT développe un cadre d'algorithme de prise de décision en matière de conception moléculaire. Jun 22, 2024 am 06:43 AM

Éditeur | L’utilisation de Ziluo AI pour rationaliser la découverte de médicaments explose. Ciblez des milliards de molécules candidates pour détecter celles qui pourraient posséder les propriétés nécessaires au développement de nouveaux médicaments. Il y a tellement de variables à prendre en compte, depuis le prix des matériaux jusqu’au risque d’erreur, qu’évaluer les coûts de synthèse des meilleures molécules candidates n’est pas une tâche facile, même si les scientifiques utilisent l’IA. Ici, les chercheurs du MIT ont développé SPARROW, un cadre d'algorithme de prise de décision quantitative, pour identifier automatiquement les meilleurs candidats moléculaires, minimisant ainsi les coûts de synthèse tout en maximisant la probabilité que les candidats possèdent les propriétés souhaitées. L’algorithme a également identifié les matériaux et les étapes expérimentales nécessaires à la synthèse de ces molécules. SPARROW prend en compte le coût de synthèse d'un lot de molécules à la fois, puisque plusieurs molécules candidates sont souvent disponibles

Les performances de SOTA, la méthode d'IA de prédiction d'affinité protéine-ligand multimodale de Xiamen, combinent pour la première fois des informations sur la surface moléculaire Jul 17, 2024 pm 06:37 PM

Editeur | KX Dans le domaine de la recherche et du développement de médicaments, il est crucial de prédire avec précision et efficacité l'affinité de liaison des protéines et des ligands pour le criblage et l'optimisation des médicaments. Cependant, les études actuelles ne prennent pas en compte le rôle important des informations sur la surface moléculaire dans les interactions protéine-ligand. Sur cette base, des chercheurs de l'Université de Xiamen ont proposé un nouveau cadre d'extraction de caractéristiques multimodales (MFE), qui combine pour la première fois des informations sur la surface des protéines, la structure et la séquence 3D, et utilise un mécanisme d'attention croisée pour comparer différentes modalités. alignement. Les résultats expérimentaux démontrent que cette méthode atteint des performances de pointe dans la prédiction des affinités de liaison protéine-ligand. De plus, les études d’ablation démontrent l’efficacité et la nécessité des informations sur la surface des protéines et de l’alignement des caractéristiques multimodales dans ce cadre. Les recherches connexes commencent par "S

See all articles