Grands modèles sous auto-récompense : Llama2 s'optimise grâce au méta-apprentissage, dépassant les performances de GPT-4-IA-php.cn

Maison

Grands modèles sous auto-récompense : Llama2 s'optimise grâce au méta-apprentissage, dépassant les performances de GPT-4

PHPz

Jan 23, 2024 pm 01:15 PM

meta 工程纽约大学 méthode d'auto-récompense

Le feedback d'intelligence artificielle (AIF) va-t-il remplacer le RLHF ?

Dans le domaine des grands modèles, la mise au point est une étape importante pour améliorer les performances du modèle. À mesure que le nombre de grands modèles open source augmente progressivement, les gens ont résumé de nombreuses méthodes de réglage fin, dont certaines ont obtenu de bons résultats.

Récemment, des chercheurs de Meta et de l'Université de New York ont utilisé la « méthode d'auto-récompense » pour permettre à de grands modèles de générer leurs propres données de réglage fin, ce qui a provoqué un nouveau choc chez les gens.

Dans la nouvelle méthode, l'auteur a affiné Llama 2 70B en trois itérations, et le modèle généré a surpassé un certain nombre de grands modèles importants existants dans le classement AlpacaEval 2.0, notamment Claude 2, Gemini Pro et GPT -4. .

Grands modèles sous auto-récompense : Llama2 soptimise grâce au méta-apprentissage, dépassant les performances de GPT-4

Le journal a donc attiré l’attention des gens quelques heures seulement après sa publication sur arXiv.

Bien que la méthode ne soit pas encore open source, on pense que la méthode utilisée dans l'article est clairement décrite et ne devrait pas être difficile à reproduire.

Grands modèles sous auto-récompense : Llama2 soptimise grâce au méta-apprentissage, dépassant les performances de GPT-4

Il est connu que le réglage de grands modèles de langage (LLM) à l'aide de données de préférences humaines peut considérablement améliorer les performances de suivi des instructions des modèles pré-entraînés. Dans la série GPT, OpenAI a proposé une méthode standard d'apprentissage par renforcement par rétroaction humaine (RLHF), qui permet à de grands modèles d'apprendre des modèles de récompense à partir des préférences humaines, puis de geler les modèles de récompense et de les utiliser pour entraîner le LLM à l'aide de l'apprentissage par renforcement. La méthode a remporté un énorme succès.

Une nouvelle idée qui a émergé récemment est d'éviter complètement la formation des modèles de récompense et d'utiliser directement les préférences humaines pour former le LLM, comme l'optimisation directe des préférences (DPO). Dans les deux cas ci-dessus, le réglage est gêné par la taille et la qualité des données de préférences humaines, et dans le cas du RLHF, la qualité du réglage est également gênée par la qualité des modèles de récompense gelés formés à partir de ceux-ci.

Dans de nouveaux travaux sur Meta, les auteurs proposent de former un modèle de récompense auto-amélioré qui, plutôt que d'être gelé, est continuellement mis à jour pendant le réglage du LLM pour éviter ce goulot d'étranglement.

La clé de cette approche est de développer un agent doté de toutes les capacités requises pendant la formation (plutôt que de le diviser en modèles de récompense et en modèles de langage), permettant une pré-formation aux tâches de suivi d'instructions et une formation multi-tâches pour permettre Entraînez simultanément plusieurs tâches pour réaliser la migration des tâches.

Ainsi, les auteurs introduisent un modèle de langage auto-récompensé, dont les agents agissent à la fois en suivant les instructions du modèle, en générant des réponses aux invites données, et peuvent également générer et évaluer de nouvelles instructions basées sur des exemples à ajouter aux leurs. ensembles de formation.

La nouvelle méthode utilise un framework similaire au DPO itératif pour former ces modèles. À partir d'un modèle de départ, comme le montre la figure 1, à chaque itération, il existe un processus de création d'auto-instruction, dans lequel le modèle génère des réponses candidates pour les invites nouvellement créées, et des récompenses sont ensuite attribuées par le même modèle. Ce dernier est réalisé grâce aux incitations du LLM-as-a-Judge, qui peut également être considérée comme une tâche de suivi d'instructions. Un ensemble de données de préférences est construit à partir des données générées et la prochaine itération du modèle est formée via DPO.

Grands modèles sous auto-récompense : Llama2 soptimise grâce au méta-apprentissage, dépassant les performances de GPT-4

Titre de l'article : Modèles linguistiques auto-récompensants
Lien de l'article : https://arxiv.org/abs/2401.10020

Modèle de langage auto-récompensant

L'approche proposée par l'auteur suppose d'abord : l'accès à un modèle de langage de base pré-entraîné et à une petite quantité de données de départ annotées par l'homme, puis construit un modèle qui vise à posséder les deux compétences :

1. Suivez les instructions : donnez des invites qui décrivent la demande de l'utilisateur et soyez capable de générer des réponses de haute qualité, utiles (et inoffensives).

2. Création d'auto-instructions : Capacité à générer et évaluer de nouvelles instructions en suivant des exemples à ajouter à votre propre ensemble de formation.

Ces compétences sont utilisées pour permettre au modèle de s'auto-aligner, c'est-à-dire qu'elles sont les composants utilisés pour s'entraîner de manière itérative à l'aide du feedback d'intelligence artificielle (AIF).

La création d'auto-instructions consiste à générer des réponses de candidats puis à laisser le modèle lui-même juger de sa qualité, c'est-à-dire qu'il agit comme son propre modèle de récompense, remplaçant ainsi le besoin d'un modèle externe. Ceci est réalisé grâce au mécanisme LLM-as-a-Judge [Zheng et al., 2023b], c'est-à-dire en formulant l'évaluation de la réponse comme une tâche suivant une instruction. Ces données de préférences AIF auto-créées ont été utilisées comme ensemble de formation.

Ainsi lors du processus de mise au point, le même modèle est utilisé pour les deux rôles : en tant qu'« apprenant » et en tant que « juge ». Basé sur le rôle émergent du juge, le modèle peut encore améliorer les performances grâce à un ajustement contextuel.

Le processus global d'auto-alignement est un processus itératif qui procède par la construction d'une série de modèles, chacun étant une amélioration par rapport au précédent. Ce qui est important ici, c'est que puisque le modèle peut à la fois améliorer ses capacités génératives et utiliser le même mécanisme génératif que son propre modèle de récompense, cela signifie que le modèle de récompense lui-même peut s'améliorer grâce à ces itérations, ce qui est cohérent avec la norme inhérente aux modèles de récompense. . Il existe des différences d’approche.

Les chercheurs pensent que cette approche peut augmenter le potentiel de ces modèles d'apprentissage pour s'améliorer à l'avenir et éliminer les goulots d'étranglement restrictifs.

La figure 1 montre un aperçu de la méthode.

Grands modèles sous auto-récompense : Llama2 soptimise grâce au méta-apprentissage, dépassant les performances de GPT-4

Expérience

Dans l'expérience, le chercheur a utilisé Llama 2 70B comme modèle de base de pré-entraînement. Ils ont constaté que l’alignement LLM sur l’auto-récompense améliorait non seulement les performances de suivi des instructions, mais également les capacités de modélisation des récompenses par rapport au modèle de départ de base.

Cela signifie que dans l'entraînement itératif, le modèle est capable de se fournir un ensemble de données de préférences de meilleure qualité dans une itération donnée que dans l'itération précédente. Bien que cet effet ait tendance à saturer dans le monde réel, il offre la possibilité intéressante que le modèle de récompense qui en résulte (et donc le LLM) soit meilleur qu'un modèle formé uniquement à partir de données brutes écrites par des humains.

En termes d'instruction suivant la capacité, les résultats expérimentaux sont présentés dans la figure 3 :

Grands modèles sous auto-récompense : Llama2 soptimise grâce au méta-apprentissage, dépassant les performances de GPT-4 Les chercheurs ont évalué le modèle d'auto-récompense sur la liste de classement AlpacaEval 2, et les résultats sont présentés dans le tableau 1. Ils ont observé la même conclusion que l'évaluation face-à-face, c'est-à-dire que le taux de réussite des itérations de formation était supérieur à celui de GPT4-Turbo, de 9,94 % dans l'itération 1, à 15,38 % dans l'itération 2, à 20,44 % dans itération 3. Pendant ce temps, le modèle Iteration 3 surpasse de nombreux modèles existants, notamment Claude 2, Gemini Pro et GPT4 0613.

Grands modèles sous auto-récompense : Llama2 soptimise grâce au méta-apprentissage, dépassant les performances de GPT-4

Les résultats de l'évaluation de la modélisation des récompenses sont présentés dans le tableau 2. Les conclusions comprennent :

L'EFT s'est amélioré par rapport à l'utilisation de l'IFT seul, en utilisant l'IFT+EFT, les cinq indicateurs de mesure se sont améliorés. Par exemple, l’accord de précision par paire avec les humains est passé de 65,1 % à 78,7 %.
Améliorez les capacités de modélisation des récompenses grâce à l'auto-formation. Après une série d'entraînement à l'auto-récompense, la capacité du modèle à fournir des auto-récompenses pour la prochaine itération est améliorée, ainsi que sa capacité à suivre les instructions.
L'importance des conseils LLMas-a-Judge. Les chercheurs ont utilisé divers formats d'invite et ont découvert que les invites LLMas-a-Judge avaient une précision par paire plus élevée lors de l'utilisation de la ligne de base SFT.

L'auteur estime que la méthode de formation d'auto-récompense améliore non seulement la capacité de suivi des instructions du modèle, mais améliore également la capacité de modélisation des récompenses du modèle par itérations.

Bien qu'il ne s'agisse que d'une étude préliminaire, cela semble être une direction de recherche passionnante. De tels modèles peuvent mieux attribuer les récompenses dans les itérations futures pour améliorer le respect des instructions et parvenir à un cycle bénin.

Cette méthode ouvre également certaines possibilités pour des méthodes de jugement plus complexes. Par exemple, les grands modèles peuvent vérifier l’exactitude de leurs réponses en effectuant une recherche dans une base de données, ce qui permet d’obtenir des résultats plus précis et plus fiables.

^{Contenu de référence :}^{https://www.reddit.com/r/MachineLearning/comments/19atnu0/r_selfrewarding_lingual_models_meta_2024/}

Ce qui précède est le contenu détaillé de. pour plus d'informations, suivez d'autres articles connexes sur le site Web de PHP en chinois!

Déclaration de ce site Web

Le contenu de cet article est volontairement contribué par les internautes et les droits d'auteur appartiennent à l'auteur original. Ce site n'assume aucune responsabilité légale correspondante. Si vous trouvez un contenu suspecté de plagiat ou de contrefaçon, veuillez contacter admin@php.cn

Outils d'IA chauds

Undresser.AI Undress

Application basée sur l'IA pour créer des photos de nu réalistes

AI Clothes Remover

Outil d'IA en ligne pour supprimer les vêtements des photos.

Undress AI Tool

Images de déshabillage gratuites

Clothoff.io

Dissolvant de vêtements AI

AI Hentai Generator

Générez AI Hentai gratuitement.

Afficher plus

Article chaud

R.E.P.O. Crystals d'énergie expliqués et ce qu'ils font (cristal jaune)

3 Il y a quelques semaines By 尊渡假赌尊渡假赌尊渡假赌

R.E.P.O. Meilleurs paramètres graphiques

3 Il y a quelques semaines By 尊渡假赌尊渡假赌尊渡假赌

Assassin's Creed Shadows: Solution d'énigmes de coquille

1 Il y a quelques semaines By DDD

R.E.P.O. Comment réparer l'audio si vous n'entendez personne

3 Il y a quelques semaines By 尊渡假赌尊渡假赌尊渡假赌

Où trouver la courte de la grue à atomide atomique

1 Il y a quelques semaines By DDD

Afficher plus

Outils chauds

Bloc-notes++7.3.1

Éditeur de code facile à utiliser et gratuit

SublimeText3 version chinoise

Version chinoise, très simple à utiliser

Envoyer Studio 13.0.1

Puissant environnement de développement intégré PHP

Dreamweaver CS6

Outils de développement Web visuel

SublimeText3 version Mac

Logiciel d'édition de code au niveau de Dieu (SublimeText3)

Afficher plus

Sujets chauds

Où se trouve l'entrée de connexion pour la messagerie Gmail ?

7444

Tutoriel CakePHP

1371

Quel est le format du nom de compte de Steam

Clé d&amp;amp;amp;amp;amp;amp;#39;activation Win11 permanent

NYT Connexions Indices et réponses

Afficher plus

Related knowledge

L'auteur de ControlNet a encore un succès ! L'ensemble du processus de génération d'une peinture à partir d'une image, gagnant 1,4k étoiles en deux jours Jul 17, 2024 am 01:56 AM

Il s'agit également d'une vidéo Tusheng, mais PaintsUndo a emprunté une voie différente. L'auteur de ControlNet, LvminZhang, a recommencé à vivre ! Cette fois, je vise le domaine de la peinture. Le nouveau projet PaintsUndo a reçu 1,4kstar (toujours en hausse folle) peu de temps après son lancement. Adresse du projet : https://github.com/lllyasviel/Paints-UNDO Grâce à ce projet, l'utilisateur saisit une image statique et PaintsUndo peut automatiquement vous aider à générer une vidéo de l'ensemble du processus de peinture, du brouillon de ligne au suivi du produit fini. . Pendant le processus de dessin, les changements de lignes sont étonnants. Le résultat vidéo final est très similaire à l’image originale : jetons un coup d’œil à un dessin complet.

Un nouveau casque VR Meta Quest 3S abordable apparaît sur FCC, suggérant un lancement imminent Sep 04, 2024 am 06:51 AM

L'événement Meta Connect 2024 est prévu du 25 au 26 septembre et lors de cet événement, la société devrait dévoiler un nouveau casque de réalité virtuelle abordable. Selon la rumeur, il s'agirait du Meta Quest 3S, le casque VR serait apparemment apparu sur la liste FCC. Cela suggère

En tête de liste des ingénieurs logiciels d'IA open source, la solution sans agent de l'UIUC résout facilement les problèmes de programmation réels du banc SWE. Jul 17, 2024 pm 10:02 PM

La colonne AIxiv est une colonne où ce site publie du contenu académique et technique. Au cours des dernières années, la rubrique AIxiv de ce site a reçu plus de 2 000 rapports, couvrant les meilleurs laboratoires des principales universités et entreprises du monde entier, favorisant efficacement les échanges et la diffusion académiques. Si vous souhaitez partager un excellent travail, n'hésitez pas à contribuer ou à nous contacter pour un rapport. Courriel de soumission : liyazhou@jiqizhixin.com ; zhaoyunfeng@jiqizhixin.com Les auteurs de cet article font tous partie de l'équipe de l'enseignant Zhang Lingming de l'Université de l'Illinois à Urbana-Champaign (UIUC), notamment : Steven Code repair ; doctorant en quatrième année, chercheur

Travail posthume de l'équipe OpenAI Super Alignment : deux grands modèles jouent à un jeu et le résultat devient plus compréhensible Jul 19, 2024 am 01:29 AM

Si la réponse donnée par le modèle d’IA est incompréhensible du tout, oseriez-vous l’utiliser ? À mesure que les systèmes d’apprentissage automatique sont utilisés dans des domaines de plus en plus importants, il devient de plus en plus important de démontrer pourquoi nous pouvons faire confiance à leurs résultats, et quand ne pas leur faire confiance. Une façon possible de gagner confiance dans le résultat d'un système complexe est d'exiger que le système produise une interprétation de son résultat qui soit lisible par un humain ou un autre système de confiance, c'est-à-dire entièrement compréhensible au point que toute erreur possible puisse être trouvé. Par exemple, pour renforcer la confiance dans le système judiciaire, nous exigeons que les tribunaux fournissent des avis écrits clairs et lisibles qui expliquent et soutiennent leurs décisions. Pour les grands modèles de langage, nous pouvons également adopter une approche similaire. Cependant, lorsque vous adoptez cette approche, assurez-vous que le modèle de langage génère

Le premier modèle open source à dépasser le niveau GPT4o ! Llama 3.1 fuite : 405 milliards de paramètres, liens de téléchargement et cartes de modèles sont disponibles Jul 23, 2024 pm 08:51 PM

Préparez votre GPU ! Llama3.1 est finalement apparu, mais la source n'est pas officielle de Meta. Aujourd'hui, la nouvelle divulguée du nouveau grand modèle Llama est devenue virale sur Reddit. En plus du modèle de base, elle comprend également des résultats de référence de 8B, 70B et le paramètre maximum de 405B. La figure ci-dessous montre les résultats de comparaison de chaque version de Llama3.1 avec OpenAIGPT-4o et Llama38B/70B. On peut voir que même la version 70B dépasse GPT-4o sur plusieurs benchmarks. Source de l'image : https://x.com/mattshumer_/status/1815444612414087294 Évidemment, version 3.1 de 8B et 70

La formation Axiom permet au LLM d'apprendre le raisonnement causal : le modèle à 67 millions de paramètres est comparable au niveau de mille milliards de paramètres GPT-4. Jul 17, 2024 am 10:14 AM

Montrez la chaîne causale à LLM et il pourra apprendre les axiomes. L'IA aide déjà les mathématiciens et les scientifiques à mener des recherches. Par exemple, le célèbre mathématicien Terence Tao a partagé à plusieurs reprises son expérience de recherche et d'exploration à l'aide d'outils d'IA tels que GPT. Pour que l’IA soit compétitive dans ces domaines, des capacités de raisonnement causal solides et fiables sont essentielles. La recherche présentée dans cet article a révélé qu'un modèle Transformer formé sur la démonstration de l'axiome de transitivité causale sur de petits graphes peut se généraliser à l'axiome de transitivité sur de grands graphes. En d’autres termes, si le Transformateur apprend à effectuer un raisonnement causal simple, il peut être utilisé pour un raisonnement causal plus complexe. Le cadre de formation axiomatique proposé par l'équipe est un nouveau paradigme pour l'apprentissage du raisonnement causal basé sur des données passives, avec uniquement des démonstrations.

Les articles arXiv peuvent être publiés sous forme de 'barrage', la plateforme de discussion alphaXiv de Stanford est en ligne, LeCun l'aime Aug 01, 2024 pm 05:18 PM

acclamations! Qu’est-ce que ça fait lorsqu’une discussion sur papier se résume à des mots ? Récemment, des étudiants de l'Université de Stanford ont créé alphaXiv, un forum de discussion ouvert pour les articles arXiv qui permet de publier des questions et des commentaires directement sur n'importe quel article arXiv. Lien du site Web : https://alphaxiv.org/ En fait, il n'est pas nécessaire de visiter spécifiquement ce site Web. Il suffit de remplacer arXiv dans n'importe quelle URL par alphaXiv pour ouvrir directement l'article correspondant sur le forum alphaXiv : vous pouvez localiser avec précision les paragraphes dans. l'article, Phrase : dans la zone de discussion sur la droite, les utilisateurs peuvent poser des questions à l'auteur sur les idées et les détails de l'article. Par exemple, ils peuvent également commenter le contenu de l'article, tels que : "Donné à".

Une avancée significative dans l'hypothèse de Riemann ! Tao Zhexuan recommande fortement les nouveaux articles du MIT et d'Oxford, et le lauréat de la médaille Fields, âgé de 37 ans, a participé Aug 05, 2024 pm 03:32 PM

Récemment, l’hypothèse de Riemann, connue comme l’un des sept problèmes majeurs du millénaire, a réalisé une nouvelle avancée. L'hypothèse de Riemann est un problème mathématique non résolu très important, lié aux propriétés précises de la distribution des nombres premiers (les nombres premiers sont les nombres qui ne sont divisibles que par 1 et par eux-mêmes, et jouent un rôle fondamental dans la théorie des nombres). Dans la littérature mathématique actuelle, il existe plus d'un millier de propositions mathématiques basées sur l'établissement de l'hypothèse de Riemann (ou sa forme généralisée). En d’autres termes, une fois que l’hypothèse de Riemann et sa forme généralisée seront prouvées, ces plus d’un millier de propositions seront établies sous forme de théorèmes, qui auront un impact profond sur le domaine des mathématiques et si l’hypothèse de Riemann s’avère fausse, alors parmi eux ; ces propositions qui en font partie perdront également de leur efficacité. Une nouvelle percée vient du professeur de mathématiques du MIT, Larry Guth, et de l'Université d'Oxford

See all articles