Maison Périphériques technologiques IA CVPR 2023|Meitu et l'Université nationale des sciences et technologies ont proposé conjointement la méthode de régularisation DropKey : utiliser deux lignes de code pour éviter efficacement le problème de surajustement visuel du transformateur.

CVPR 2023|Meitu et l'Université nationale des sciences et technologies ont proposé conjointement la méthode de régularisation DropKey : utiliser deux lignes de code pour éviter efficacement le problème de surajustement visuel du transformateur.

Jan 14, 2024 pm 09:15 PM
理论


Récemment, les algorithmes basés sur Transformer ont été largement utilisés dans diverses tâches de vision par ordinateur, mais ce type d'algorithme est sujet à des problèmes de surajustement lorsque la quantité de données d'entraînement est faible. Les transformateurs de vision existants introduisent généralement directement l'algorithme d'abandon couramment utilisé dans CNN comme régulateur, qui effectue des baisses aléatoires sur la carte de poids d'attention et définit une probabilité de baisse unifiée pour les couches d'attention de différentes profondeurs. Bien que Dropout soit très simple, cette méthode de drop présente trois problèmes principaux.

Tout d'abord, une chute aléatoire après la normalisation softmax brisera la distribution de probabilité des poids d'attention et ne parviendra pas à pénaliser les pics de poids, ce qui entraînera un surajustement du modèle aux informations spécifiques locales (Figure 1). Deuxièmement, une probabilité de chute plus grande dans les couches plus profondes du réseau entraînera un manque d'informations sémantiques de haut niveau, tandis qu'une probabilité de chute plus faible dans les couches moins profondes conduira à un surajustement des caractéristiques détaillées sous-jacentes, donc une probabilité de chute constante conduire à une instabilité dans le processus de formation. Enfin, l’efficacité de la méthode de dépôt structuré couramment utilisée sur CNN sur Vision Transformer n’est pas claire.

CVPR 2023|两行代码高效缓解视觉Transformer过拟合,美图&国科大联合提出正则化方法DropKey

Figure 1 L'impact de différents régularisateurs sur la carte de distribution de l'attention

Le Meitu Imaging Research Institute (MT Lab) et l'Université de l'Académie chinoise des sciences ont publié un article sur le CVPR 2023, un nouveau régulateur plug-and-play DropKey est proposé, qui peut atténuer efficacement le problème de surajustement dans Vision Transformer.

CVPR 2023|两行代码高效缓解视觉Transformer过拟合,美图&国科大联合提出正则化方法DropKey


Lien papier : https://arxiv.org/abs/2208.02646

Les trois questions fondamentales suivantes sont étudiées dans l'article :

Tout d'abord, que faut-il faire dans la couche d'attention ? effectuer une opération Drop ? Différente de la suppression directe du poids d'attention, cette méthode effectue l'opération Drop avant de calculer la matrice d'attention et utilise la clé comme unité de base Drop. Cette méthode vérifie théoriquement que le régulariseur DropKey peut pénaliser les zones nécessitant une attention élevée et attribuer des pondérations d'attention à d'autres zones d'intérêt, améliorant ainsi la capacité du modèle à capturer des informations globales.

Deuxièmement, comment définir la probabilité de chute ? Comparé à toutes les couches partageant la même probabilité de chute, cet article propose une nouvelle méthode de définition de la probabilité de chute, qui atténue progressivement la valeur de probabilité de chute à mesure que la couche d'auto-attention s'approfondit.

Troisièmement, est-il nécessaire d'effectuer des opérations Drop structurées comme CNN ? Cette méthode a essayé une approche de dépôt structuré basée sur des fenêtres de bloc et des fenêtres croisées, et a constaté que cette technique n'était pas importante pour le Vision Transformer.

Background

Vision Transformer (ViT) est un nouveau paradigme dans les modèles récents de vision par ordinateur. Il est largement utilisé dans des tâches telles que la reconnaissance d'images, la segmentation d'images, la détection de points clés humains et la détection mutuelle de. les gens. Plus précisément, ViT divise l'image en un nombre fixe de blocs d'image, traite chaque bloc d'image comme une unité de base et introduit un mécanisme d'auto-attention multi-têtes pour extraire des informations sur les caractéristiques contenant des relations mutuelles. Cependant, les méthodes de type ViT existantes souffrent souvent de problèmes de surajustement sur de petits ensembles de données, c'est-à-dire qu'elles n'utilisent que les fonctionnalités locales de la cible pour accomplir des tâches spécifiées.

Afin de surmonter les problèmes ci-dessus, cet article propose un régulariseur plug-and-play DropKey qui peut être implémenté en seulement deux lignes de code pour atténuer le problème de surajustement de la méthode de classe ViT. Différent du Dropout existant, DropKey définit la clé sur l'objet déposé et a vérifié théoriquement et expérimentalement que ce changement peut punir les parties avec des valeurs d'attention élevées tout en encourageant le modèle à accorder plus d'attention aux autres patchs d'image liés à la cible, ce qui est utile pour capturer des fonctionnalités globales robustes. En outre, l'article propose également de définir des probabilités de suppression décroissantes pour des couches d'attention de plus en plus approfondies, ce qui peut éviter que le modèle ne surajuste les fonctionnalités de bas niveau tout en garantissant suffisamment de fonctionnalités de haut niveau pour un entraînement stable. De plus, l’article prouve expérimentalement que la méthode des gouttes structurées n’est pas nécessaire pour ViT.

DropKey

Afin d'explorer les raisons essentielles à l'origine du problème de surapprentissage, cette recherche a d'abord formalisé le mécanisme d'attention en un objectif d'optimisation simple et analysé sa forme d'expansion lagrangienne. Il a été constaté que lorsque le modèle est continuellement optimisé, les zones d'image avec une plus grande proportion d'attention dans l'itération actuelle auront tendance à se voir attribuer un poids d'attention plus important lors de l'itération suivante. Pour atténuer ce problème, DropKey attribue implicitement un opérateur adaptatif à chaque bloc d'attention en supprimant aléatoirement une partie de la clé pour contraindre la distribution de l'attention et la rendre plus fluide. Il convient de noter que par rapport à d'autres régulariseurs conçus pour des tâches spécifiques, DropKey ne nécessite aucune conception manuelle. Étant donné que des suppressions aléatoires sont effectuées sur Key pendant la phase de formation, ce qui entraînera des attentes de sortie incohérentes dans les phases de formation et de test, cette méthode propose également d'utiliser des méthodes de Monte Carlo ou des techniques de réglage fin pour aligner les attentes de sortie. De plus, la mise en œuvre de cette méthode ne nécessite que deux lignes de code, comme le montre la figure 2.

CVPR 2023|两行代码高效缓解视觉Transformer过拟合,美图&国科大联合提出正则化方法DropKey

Figure 2 Méthode d'implémentation de DropKey

De manière générale, ViT superpose plusieurs couches d'attention pour apprendre progressivement des fonctionnalités de grande dimension. En règle générale, les couches moins profondes extraient des caractéristiques visuelles de faible dimension, tandis que les couches profondes visent à extraire des informations grossières mais complexes sur l'espace de modélisation. Par conséquent, cette étude tente de définir une probabilité de chute plus faible pour les couches profondes afin d'éviter de perdre des informations importantes sur l'objet cible. Plus précisément, DropKey n'effectue pas de suppressions aléatoires avec une probabilité fixe sur chaque couche, mais réduit progressivement la probabilité de suppression à mesure que le nombre de couches augmente. De plus, l'étude a révélé que cette approche fonctionne non seulement avec DropKey, mais améliore également considérablement les performances de Dropout.

Bien que la méthode de dépôt structuré ait été étudiée en détail dans CNN, l'impact sur les performances de cette méthode de dépôt sur ViT n'a pas été étudié. Pour déterminer si cette stratégie améliorera encore les performances, l'article implémente deux formes structurées de DropKey, à savoir DropKey-Block et DropKey-Cross. Parmi eux, DropKey-Block supprime la zone continue dans la fenêtre carrée centrée sur le point de départ, et DropKey-Cross supprime la zone continue en forme de croix centrée sur le point de départ, comme le montre la figure 3. Cependant, l’étude a révélé que l’approche de suppression structurée n’entraînait pas d’amélioration des performances.

CVPR 2023|两行代码高效缓解视觉Transformer过拟合,美图&国科大联合提出正则化方法DropKey

Figure 3 Méthode de mise en œuvre structurée de DropKey

Résultats expérimentaux

CVPR 2023|两行代码高效缓解视觉Transformer过拟合,美图&国科大联合提出正则化方法DropKey

Figure 4 Comparaison des performances de DropKey et Drop out sur CIFAR10/100

CVPR 2023|两行代码高效缓解视觉Transformer过拟合,美图&国科大联合提出正则化方法DropKey

Figure 5 Comparaison des effets de visualisation de la carte d'attention de DropKey et Dropout sur CIFAR100

CVPR 2023|两行代码高效缓解视觉Transformer过拟合,美图&国科大联合提出正则化方法DropKey

Figure 6 Comparaison des performances de différentes stratégies de définition de probabilité de chute

Figure 7 Comparaison des performances de différentes stratégies d'alignement des attentes de sortie

CVPR 2023|两行代码高效缓解视觉Transformer过拟合,美图&国科大联合提出正则化方法DropKey

Image 9 Comparaison des performances de DropKey et Dropout sur ImageNet

CVPR 2023|两行代码高效缓解视觉Transformer过拟合,美图&国科大联合提出正则化方法DropKey

Figure 10 Comparaison des performances de DropKey et Dropout sur COCO

CVPR 2023|两行代码高效缓解视觉Transformer过拟合,美图&国科大联合提出正则化方法DropKey

Image 11 Comparaison des performances de DropKey et Dropout sur HICO-DET

CVPR 2023|两行代码高效缓解视觉Transformer过拟合,美图&国科大联合提出正则化方法DropKey


Figure 12 Comparaison des performances de DropKey et Dropout sur HICO-DET

CVPR 2023|两行代码高效缓解视觉Transformer过拟合,美图&国科大联合提出正则化方法DropKey



Figure 13 Comparaison visuelle des cartes d'attention entre DropKey et Dropout sur HICO-DET

Résumé

Cet article propose de manière innovante un régulariseur pour ViT, utilisé pour atténuer le surajustement problème de ViT. Par rapport aux régulariseurs existants, cette méthode peut fournir une répartition fluide de l'attention pour la couche d'attention en définissant simplement Key comme objet de dépôt. En outre, l'article propose également une nouvelle stratégie de définition de probabilité de chute, qui stabilise avec succès le processus de formation tout en atténuant efficacement le surapprentissage. Enfin, l'article explore également l'impact des méthodes de dépôt structuré sur les performances du modèle.

Ce qui précède est le contenu détaillé de. pour plus d'informations, suivez d'autres articles connexes sur le site Web de PHP en chinois!

Déclaration de ce site Web
Le contenu de cet article est volontairement contribué par les internautes et les droits d'auteur appartiennent à l'auteur original. Ce site n'assume aucune responsabilité légale correspondante. Si vous trouvez un contenu suspecté de plagiat ou de contrefaçon, veuillez contacter admin@php.cn

Outils d'IA chauds

Undresser.AI Undress

Undresser.AI Undress

Application basée sur l'IA pour créer des photos de nu réalistes

AI Clothes Remover

AI Clothes Remover

Outil d'IA en ligne pour supprimer les vêtements des photos.

Undress AI Tool

Undress AI Tool

Images de déshabillage gratuites

Clothoff.io

Clothoff.io

Dissolvant de vêtements AI

AI Hentai Generator

AI Hentai Generator

Générez AI Hentai gratuitement.

Article chaud

R.E.P.O. Crystals d'énergie expliqués et ce qu'ils font (cristal jaune)
2 Il y a quelques semaines By 尊渡假赌尊渡假赌尊渡假赌
Repo: Comment relancer ses coéquipiers
4 Il y a quelques semaines By 尊渡假赌尊渡假赌尊渡假赌
Hello Kitty Island Adventure: Comment obtenir des graines géantes
3 Il y a quelques semaines By 尊渡假赌尊渡假赌尊渡假赌
Combien de temps faut-il pour battre Split Fiction?
3 Il y a quelques semaines By DDD

Outils chauds

Bloc-notes++7.3.1

Bloc-notes++7.3.1

Éditeur de code facile à utiliser et gratuit

SublimeText3 version chinoise

SublimeText3 version chinoise

Version chinoise, très simple à utiliser

Envoyer Studio 13.0.1

Envoyer Studio 13.0.1

Puissant environnement de développement intégré PHP

Dreamweaver CS6

Dreamweaver CS6

Outils de développement Web visuel

SublimeText3 version Mac

SublimeText3 version Mac

Logiciel d'édition de code au niveau de Dieu (SublimeText3)

Repoussant les limites de la détection de défauts traditionnelle, « Defect Spectrum » permet pour la première fois une détection de défauts industriels d'une ultra haute précision et d'une sémantique riche. Repoussant les limites de la détection de défauts traditionnelle, « Defect Spectrum » permet pour la première fois une détection de défauts industriels d'une ultra haute précision et d'une sémantique riche. Jul 26, 2024 pm 05:38 PM

Dans la fabrication moderne, une détection précise des défauts est non seulement la clé pour garantir la qualité des produits, mais également la clé de l’amélioration de l’efficacité de la production. Cependant, les ensembles de données de détection de défauts existants manquent souvent de précision et de richesse sémantique requises pour les applications pratiques, ce qui rend les modèles incapables d'identifier des catégories ou des emplacements de défauts spécifiques. Afin de résoudre ce problème, une équipe de recherche de premier plan composée de l'Université des sciences et technologies de Hong Kong, Guangzhou et de Simou Technology a développé de manière innovante l'ensemble de données « DefectSpectrum », qui fournit une annotation à grande échelle détaillée et sémantiquement riche des défauts industriels. Comme le montre le tableau 1, par rapport à d'autres ensembles de données industrielles, l'ensemble de données « DefectSpectrum » fournit le plus grand nombre d'annotations de défauts (5 438 échantillons de défauts) et la classification de défauts la plus détaillée (125 catégories de défauts).

Le modèle de dialogue NVIDIA ChatQA a évolué vers la version 2.0, avec la longueur du contexte mentionnée à 128 Ko Le modèle de dialogue NVIDIA ChatQA a évolué vers la version 2.0, avec la longueur du contexte mentionnée à 128 Ko Jul 26, 2024 am 08:40 AM

La communauté ouverte LLM est une époque où une centaine de fleurs fleurissent et s'affrontent. Vous pouvez voir Llama-3-70B-Instruct, QWen2-72B-Instruct, Nemotron-4-340B-Instruct, Mixtral-8x22BInstruct-v0.1 et bien d'autres. excellents interprètes. Cependant, par rapport aux grands modèles propriétaires représentés par le GPT-4-Turbo, les modèles ouverts présentent encore des lacunes importantes dans de nombreux domaines. En plus des modèles généraux, certains modèles ouverts spécialisés dans des domaines clés ont été développés, tels que DeepSeek-Coder-V2 pour la programmation et les mathématiques, et InternVL pour les tâches de langage visuel.

Google AI a remporté la médaille d'argent de l'Olympiade mathématique de l'OMI, le modèle de raisonnement mathématique AlphaProof a été lancé et l'apprentissage par renforcement est de retour. Google AI a remporté la médaille d'argent de l'Olympiade mathématique de l'OMI, le modèle de raisonnement mathématique AlphaProof a été lancé et l'apprentissage par renforcement est de retour. Jul 26, 2024 pm 02:40 PM

Pour l’IA, l’Olympiade mathématique n’est plus un problème. Jeudi, l'intelligence artificielle de Google DeepMind a réalisé un exploit : utiliser l'IA pour résoudre la vraie question de l'Olympiade mathématique internationale de cette année, l'OMI, et elle n'était qu'à un pas de remporter la médaille d'or. Le concours de l'OMI qui vient de se terminer la semaine dernière comportait six questions portant sur l'algèbre, la combinatoire, la géométrie et la théorie des nombres. Le système d'IA hybride proposé par Google a répondu correctement à quatre questions et a marqué 28 points, atteignant le niveau de la médaille d'argent. Plus tôt ce mois-ci, le professeur titulaire de l'UCLA, Terence Tao, venait de promouvoir l'Olympiade mathématique de l'IA (AIMO Progress Award) avec un prix d'un million de dollars. De manière inattendue, le niveau de résolution de problèmes d'IA s'était amélioré à ce niveau avant juillet. Posez les questions simultanément sur l'OMI. La chose la plus difficile à faire correctement est l'OMI, qui a la plus longue histoire, la plus grande échelle et la plus négative.

Afin de fournir un nouveau système de référence et d'évaluation de questions-réponses scientifiques et complexes pour les grands modèles, l'UNSW, Argonne, l'Université de Chicago et d'autres institutions ont lancé conjointement le cadre SciQAG. Afin de fournir un nouveau système de référence et d'évaluation de questions-réponses scientifiques et complexes pour les grands modèles, l'UNSW, Argonne, l'Université de Chicago et d'autres institutions ont lancé conjointement le cadre SciQAG. Jul 25, 2024 am 06:42 AM

L'ensemble de données ScienceAI Question Answering (QA) joue un rôle essentiel dans la promotion de la recherche sur le traitement du langage naturel (NLP). Des ensembles de données d'assurance qualité de haute qualité peuvent non seulement être utilisés pour affiner les modèles, mais également évaluer efficacement les capacités des grands modèles linguistiques (LLM), en particulier la capacité à comprendre et à raisonner sur les connaissances scientifiques. Bien qu’il existe actuellement de nombreux ensembles de données scientifiques d’assurance qualité couvrant la médecine, la chimie, la biologie et d’autres domaines, ces ensembles de données présentent encore certaines lacunes. Premièrement, le formulaire de données est relativement simple, et la plupart sont des questions à choix multiples. Elles sont faciles à évaluer, mais limitent la plage de sélection des réponses du modèle et ne peuvent pas tester pleinement la capacité du modèle à répondre aux questions scientifiques. En revanche, les questions et réponses ouvertes

Le point de vue de la nature : les tests de l'intelligence artificielle en médecine sont dans le chaos. Que faut-il faire ? Le point de vue de la nature : les tests de l'intelligence artificielle en médecine sont dans le chaos. Que faut-il faire ? Aug 22, 2024 pm 04:37 PM

Editeur | ScienceAI Sur la base de données cliniques limitées, des centaines d'algorithmes médicaux ont été approuvés. Les scientifiques se demandent qui devrait tester les outils et comment le faire au mieux. Devin Singh a vu un patient pédiatrique aux urgences subir un arrêt cardiaque alors qu'il attendait un traitement pendant une longue période, ce qui l'a incité à explorer l'application de l'IA pour réduire les temps d'attente. À l’aide des données de triage des salles d’urgence de SickKids, Singh et ses collègues ont construit une série de modèles d’IA pour fournir des diagnostics potentiels et recommander des tests. Une étude a montré que ces modèles peuvent accélérer les visites chez le médecin de 22,3 %, accélérant ainsi le traitement des résultats de près de 3 heures par patient nécessitant un examen médical. Cependant, le succès des algorithmes d’intelligence artificielle dans la recherche ne fait que le vérifier.

Formation avec des millions de données cristallines pour résoudre le problème de la phase cristallographique, la méthode d'apprentissage profond PhAI est publiée dans Science Formation avec des millions de données cristallines pour résoudre le problème de la phase cristallographique, la méthode d'apprentissage profond PhAI est publiée dans Science Aug 08, 2024 pm 09:22 PM

Editeur | KX À ce jour, les détails structurels et la précision déterminés par cristallographie, des métaux simples aux grandes protéines membranaires, sont inégalés par aucune autre méthode. Cependant, le plus grand défi, appelé problème de phase, reste la récupération des informations de phase à partir d'amplitudes déterminées expérimentalement. Des chercheurs de l'Université de Copenhague au Danemark ont ​​développé une méthode d'apprentissage en profondeur appelée PhAI pour résoudre les problèmes de phase cristalline. Un réseau neuronal d'apprentissage en profondeur formé à l'aide de millions de structures cristallines artificielles et de leurs données de diffraction synthétique correspondantes peut générer des cartes précises de densité électronique. L'étude montre que cette méthode de solution structurelle ab initio basée sur l'apprentissage profond peut résoudre le problème de phase avec une résolution de seulement 2 Angströms, ce qui équivaut à seulement 10 à 20 % des données disponibles à la résolution atomique, alors que le calcul ab initio traditionnel

Les performances de SOTA, la méthode d'IA de prédiction d'affinité protéine-ligand multimodale de Xiamen, combinent pour la première fois des informations sur la surface moléculaire Les performances de SOTA, la méthode d'IA de prédiction d'affinité protéine-ligand multimodale de Xiamen, combinent pour la première fois des informations sur la surface moléculaire Jul 17, 2024 pm 06:37 PM

Editeur | KX Dans le domaine de la recherche et du développement de médicaments, il est crucial de prédire avec précision et efficacité l'affinité de liaison des protéines et des ligands pour le criblage et l'optimisation des médicaments. Cependant, les études actuelles ne prennent pas en compte le rôle important des informations sur la surface moléculaire dans les interactions protéine-ligand. Sur cette base, des chercheurs de l'Université de Xiamen ont proposé un nouveau cadre d'extraction de caractéristiques multimodales (MFE), qui combine pour la première fois des informations sur la surface des protéines, la structure et la séquence 3D, et utilise un mécanisme d'attention croisée pour comparer différentes modalités. alignement. Les résultats expérimentaux démontrent que cette méthode atteint des performances de pointe dans la prédiction des affinités de liaison protéine-ligand. De plus, les études d’ablation démontrent l’efficacité et la nécessité des informations sur la surface des protéines et de l’alignement des caractéristiques multimodales dans ce cadre. Les recherches connexes commencent par "S

Couvrant les tâches de texte, de positionnement et de segmentation, Zhiyuan et les Chinois de Hong Kong ont proposé conjointement le premier grand modèle médical multimodal 3D multifonctionnel Couvrant les tâches de texte, de positionnement et de segmentation, Zhiyuan et les Chinois de Hong Kong ont proposé conjointement le premier grand modèle médical multimodal 3D multifonctionnel Jun 22, 2024 am 07:16 AM

Auteur | Rédacteur Bai Fan, Université chinoise de Hong Kong | ScienceAI Récemment, l'Université chinoise de Hong Kong et Zhiyuan ont proposé conjointement la série de travaux M3D, comprenant M3D-Data, M3D-LaMed et M3D-Bench, pour promouvoir les images médicales 3D. de tous les aspects des ensembles de données, des modèles et des évaluations. Développement d'analyses. (1) M3D-Data est actuellement le plus grand ensemble de données d'images médicales 3D, comprenant M3D-Cap (120 000 paires d'images et de textes 3D), M3D-VQA (510 000 paires de questions et réponses), M3D-Seg (150 000 paires de masques 3D), M3D-RefSeg ( Segmentation d'inférence 3K) au total quatre sous-ensembles de données. (2) M3D-LaMed est actuellement le grand modèle médical multimodal 3D le plus polyvalent pouvant

See all articles