Table des matières
Introduction à la méthode
Expériences et résultats
Maison Périphériques technologiques IA Quand GPT-4 réfléchit à son erreur : les performances ont augmenté de près de 30 % et la capacité de programmation a augmenté de 21 %

Quand GPT-4 réfléchit à son erreur : les performances ont augmenté de près de 30 % et la capacité de programmation a augmenté de 21 %

Apr 04, 2023 am 11:55 AM
ai gpt-4

La façon de penser du GPT-4 devient de plus en plus humaine.

Lorsque les humains font des erreurs, ils réfléchissent à leurs actions pour éviter de commettre des erreurs à nouveau. Si les grands modèles de langage tels que GPT-4 ont également la capacité de réfléchir, les performances seront améliorées d'autant.

Il est bien connu que les grands modèles de langage (LLM) ont démontré des performances sans précédent sur diverses tâches. Cependant, ces méthodes SOTA nécessitent généralement un réglage fin du modèle, une optimisation des politiques et d'autres opérations sur l'espace d'état défini. En raison du manque de données de formation de haute qualité et d’un espace d’état bien défini, il est encore difficile de mettre en œuvre un modèle optimisé. De plus, les modèles ne possèdent pas encore certaines qualités inhérentes au processus de décision humain, notamment la capacité d’apprendre de ses erreurs.

Mais maintenant, dans un article récent, des chercheurs de la Northeastern University, du MIT et d'autres institutions ont proposé Reflexion, qui donne à l'agent la capacité de se souvenir de manière dynamique et de s'auto-réfléchir.

Afin de vérifier l'efficacité de la méthode, cette étude a évalué la capacité de l'agent à accomplir des tâches de prise de décision dans l'environnement AlfWorld, et sa capacité à accomplir des tâches de questions et réponses à forte intensité de connaissances et basées sur la recherche dans l'environnement HotPotQA. Le taux de réussite dans ces deux tâches est respectivement de 97% et 51%.

Quand GPT-4 réfléchit à son erreur : les performances ont augmenté de près de 30 % et la capacité de programmation a augmenté de 21 %

Adresse papier : https://arxiv.org/pdf/2303.11366.pdf

Adresse du projet : https://github.com/GammaTauAI/reflexion-human-eval

Comme le montre l'image ci-dessous, dans AlfWorld Dans l'environnement, il y a divers objets disposés dans la pièce, et l'agent doit donner un plan de raisonnement pour obtenir un certain objet. La partie supérieure de l'image ci-dessous échoue en raison du plan inefficace de l'agent. Après réflexion, l'agent se rend compte de l'erreur, corrige la trajectoire du raisonnement, et donne une méthode de trajectoire concise (partie inférieure de la figure).

Quand GPT-4 réfléchit à son erreur : les performances ont augmenté de près de 30 % et la capacité de programmation a augmenté de 21 %

Modèle de réflexion sur les stratégies de recherche défectueuses :

Quand GPT-4 réfléchit à son erreur : les performances ont augmenté de près de 30 % et la capacité de programmation a augmenté de 21 %

Cet article montre que vous pouvez corriger cette erreur en demandant à GPT-4 de réfléchir à « Pourquoi vous êtes-vous trompé et de générer une nouvelle invite pour vous-même ? » sont pris en compte jusqu'à ce que le résultat soit correct, améliorant ainsi les performances du GPT-4 d'un étonnant 30 %.

Quand GPT-4 réfléchit à son erreur : les performances ont augmenté de près de 30 % et la capacité de programmation a augmenté de 21 %

Les internautes ne peuvent s'empêcher de soupirer : la vitesse de développement de l'intelligence artificielle a dépassé notre capacité d'adaptation.

Quand GPT-4 réfléchit à son erreur : les performances ont augmenté de près de 30 % et la capacité de programmation a augmenté de 21 %

Introduction à la méthode

L'architecture globale de l'agent Reflexion est présentée dans la figure 1 ci-dessous, où Reflexion utilise ReAct (Yao et al., 2023). Dans le premier essai, l'agent se voit confier une tâche de l'environnement qui constitue la requête initiale, puis l'agent exécute une séquence d'actions générée par le LLM et reçoit des observations et des récompenses de l'environnement. Pour les environnements offrant des récompenses descriptives ou continues, l’étude limite les résultats à de simples états de réussite binaires pour garantir l’applicabilité.

Quand GPT-4 réfléchit à son erreur : les performances ont augmenté de près de 30 % et la capacité de programmation a augmenté de 21 %

Après chaque action a_t, l'agent calcule une fonction heuristique h, comme le montre la figure ci-dessous

Quand GPT-4 réfléchit à son erreur : les performances ont augmenté de près de 30 % et la capacité de programmation a augmenté de 21 %

Cette fonction heuristique est conçue pour détecter l'illusion d'information (c'est-à-dire des informations fausses ou erronées) produite par l'agent Ou inefficace, et "indiquer" à l'agent quand il doit réfléchir (réflexion), où t est le pas de temps, s_t est l'état actuel, Ω représente le nombre de cycles d'action répétés, ε représente le nombre total maximum d'actions effectuées, [ a_o, o_0 , a_(t−1), o_(t−1)] représente l'historique de la trajectoire. répéter est une fonction simple qui détermine le nombre de fois qu'une boucle d'actions répétées produit le même résultat.

Si la fonction h indique à l'agent qu'il doit réfléchir, alors l'agent interroge le LLM pour refléter sa tâche actuelle, son historique de trajectoire et sa dernière récompense, puis l'agent réinitialise l'environnement et réessaye lors des essais suivants. Si la fonction h n'indique pas à l'agent qu'une réflexion est nécessaire, alors l'agent ajoute a_t et o_t à son historique de trajectoire et interroge le LLM pour l'action suivante.

Si l'heuristique h suggère une réflexion à l'étape de temps t, l'agent réfléchira en fonction de son état actuel s_t, de sa dernière récompense r_t, des actions et observations précédentes [a_0, o_0, , a_t, o_t] et du travail existant de. l'agent est stocké dans la mémoire, ce qui lance un processus de réflexion.

Le but de la réflexion est d'aider l'agent à corriger les « illusions » et les inefficacités par essais et erreurs. Le modèle utilisé pour la réflexion est un LLM qui utilise des trajectoires d'échec spécifiques et des exemples de réflexion idéaux pour inciter.

Quand GPT-4 réfléchit à son erreur : les performances ont augmenté de près de 30 % et la capacité de programmation a augmenté de 21 %

L'agent effectuera de manière itérative le processus de réflexion ci-dessus. Dans les expériences, l'étude a fixé le nombre de réflexions stockées dans la mémoire de l'agent à un maximum de 3 fois afin d'éviter que les requêtes ne dépassent les limites du LLM. L'exécution se terminera dans les situations suivantes :

  • Dépasse le nombre maximum d'essais ;
  • Ne parvient pas à améliorer les performances entre deux essais consécutifs ;
  • Termine la tâche.

Expériences et résultats

AlfWorld propose six tâches différentes et plus de 3 000 environnements, qui nécessitent que l'agent comprenne la tâche cible, formule un plan séquentiel pour les sous-tâches et effectue des opérations dans un environnement donné.

L'étude a testé l'agent dans 134 environnements AlfWorld, avec des tâches telles que trouver des objets cachés (par exemple, trouver un couteau à fruits dans un tiroir), déplacer des objets (par exemple, déplacer un couteau vers une planche à découper) et utiliser d'autres objets pour manipuler. d'autres objets. Un objet (par exemple, des tomates dans le réfrigérateur).

Sans réflexion, la précision de l'agent est de 63 %, puis la réflexion est ajoutée à des fins de comparaison. Les résultats ont montré que l’agent était capable de gérer 97 % de l’environnement au cours de 12 essais et n’a réussi à résoudre que 4 tâches sur 134.

Quand GPT-4 réfléchit à son erreur : les performances ont augmenté de près de 30 % et la capacité de programmation a augmenté de 21 %

L'expérience suivante a été menée dans HotPotQA, qui est un ensemble de données basé sur Wikipédia et contient 113 000 paires de questions et réponses, principalement utilisées pour tester la capacité de l'agent à analyser le contenu et la raison.

Sur les 100 tests de paires de questions-réponses de HotpotQA, l'étude a comparé les agents de base et les agents basés sur Reflexion jusqu'à ce qu'ils ne parviennent pas à améliorer la précision au cours des essais successifs. Les résultats montrent que les performances de l'agent basique ne se sont pas améliorées. Lors du premier test, la précision de l'agent basique était de 34 % et celle de l'agent Reflexion était de 32 %. Cependant, après 7 tests, la performance de l'agent Reflexion était de 34 %. L'agent s'est considérablement amélioré. L'amélioration est proche de 30%, ce qui est bien meilleur que l'agent de base.

Quand GPT-4 réfléchit à son erreur : les performances ont augmenté de près de 30 % et la capacité de programmation a augmenté de 21 %

De même, GPT-4 avec Reflexion a également largement surpassé le GPT-4 classique lors du test de la capacité du modèle à écrire du code :

Quand GPT-4 réfléchit à son erreur : les performances ont augmenté de près de 30 % et la capacité de programmation a augmenté de 21 %

Ce qui précède est le contenu détaillé de. pour plus d'informations, suivez d'autres articles connexes sur le site Web de PHP en chinois!

Déclaration de ce site Web
Le contenu de cet article est volontairement contribué par les internautes et les droits d'auteur appartiennent à l'auteur original. Ce site n'assume aucune responsabilité légale correspondante. Si vous trouvez un contenu suspecté de plagiat ou de contrefaçon, veuillez contacter admin@php.cn

Outils d'IA chauds

Undresser.AI Undress

Undresser.AI Undress

Application basée sur l'IA pour créer des photos de nu réalistes

AI Clothes Remover

AI Clothes Remover

Outil d'IA en ligne pour supprimer les vêtements des photos.

Undress AI Tool

Undress AI Tool

Images de déshabillage gratuites

Clothoff.io

Clothoff.io

Dissolvant de vêtements AI

AI Hentai Generator

AI Hentai Generator

Générez AI Hentai gratuitement.

Article chaud

R.E.P.O. Crystals d'énergie expliqués et ce qu'ils font (cristal jaune)
2 Il y a quelques semaines By 尊渡假赌尊渡假赌尊渡假赌
Repo: Comment relancer ses coéquipiers
4 Il y a quelques semaines By 尊渡假赌尊渡假赌尊渡假赌
Hello Kitty Island Adventure: Comment obtenir des graines géantes
3 Il y a quelques semaines By 尊渡假赌尊渡假赌尊渡假赌
Combien de temps faut-il pour battre Split Fiction?
3 Il y a quelques semaines By DDD

Outils chauds

Bloc-notes++7.3.1

Bloc-notes++7.3.1

Éditeur de code facile à utiliser et gratuit

SublimeText3 version chinoise

SublimeText3 version chinoise

Version chinoise, très simple à utiliser

Envoyer Studio 13.0.1

Envoyer Studio 13.0.1

Puissant environnement de développement intégré PHP

Dreamweaver CS6

Dreamweaver CS6

Outils de développement Web visuel

SublimeText3 version Mac

SublimeText3 version Mac

Logiciel d'édition de code au niveau de Dieu (SublimeText3)

Laquelle des dix principales applications de trading de devises virtuelles est la meilleure? Laquelle des dix principales applications de trading de devises virtuelles est la meilleure? Mar 19, 2025 pm 05:00 PM

Top 10 des classements de trading de devises virtuels: 1. Okx, 2. Binance, 3. Gate.io, 4. Kraken, 5. Huobi, 6. Coinbase, 7. Kucoin, 8. Crypto.com, 9. BitFinex, 10. Gemini. La sécurité, la liquidité, les frais de traitement, la sélection des devises, l'interface utilisateur et le support client doivent être pris en compte lors du choix d'une plate-forme.

Le dernier portail d'inscription pour le site officiel d'OUYI 2025 Le dernier portail d'inscription pour le site officiel d'OUYI 2025 Mar 21, 2025 pm 05:57 PM

2025 OUYI OKX Enregistrement des prévisions et guides de sécurité de l'entrée: Comprenez le processus d'inscription futur à l'avance et saisissez l'initiative dans le trading d'actifs numériques! Cet article prédit que l'enregistrement OUYI OKX en 2025 renforcera la certification KYC, mettra en œuvre des procédures d'enregistrement régionales et renforcera les mesures de sécurité, telles que la vérification de l'identité multi-facteurs et la reconnaissance des empreintes digitales de l'appareil. Pour assurer une inscription sûre, assurez-vous d'accéder au site Web via des canaux officiels, définissez un mot de passe solide, activez la vérification à deux facteurs et soyez attentif aux sites Web et aux e-mails de phishing. Ce n'est qu'en comprenant le processus d'enregistrement à l'avance et en prévenant les risques que vous pouvez obtenir un avantage dans les futures transactions d'actifs numériques. Lisez maintenant et maîtrisez les secrets de l'enregistrement OUYI OKX en 2025!

Top 10 des applications de trading de devises virtuelles officielles Top 10 des plates-formes de trading de devises virtuelles officielles pour les téléphones mobiles Top 10 des applications de trading de devises virtuelles officielles Top 10 des plates-formes de trading de devises virtuelles officielles pour les téléphones mobiles Mar 19, 2025 pm 05:21 PM

Top 10 des applications officielles de trading de devises virtuelles: 1. Okx, 2. Binance, 3. Gate.io, 4. Kraken, 5. Huobi, 6. Coinbase, 7. Kucoin, 8. Crypto.com, 9. Bitfinex, 10. Gemini. La sécurité, la liquidité, les frais de traitement, la sélection des devises, l'interface utilisateur et le support client doivent être pris en compte lors du choix d'une plate-forme.

Top 10 de classement de plate-forme de trading de devises virtuel Top 10 de classement de plate-forme de trading de devises virtuel Mar 19, 2025 pm 04:51 PM

Top 10 de classement de plate-forme de trading de devises virtuels: 1. Okx, 2. Binance, 3. Gate.io, 4. Kraken, 5. Huobi, 6. Coinbase, 7. Kucoin, 8. Crypto.com, 9. BitFinex, 10. Gemini. La sécurité, la liquidité, les frais de traitement, la sélection des devises, l'interface utilisateur et le support client doivent être pris en compte lors du choix d'une plate-forme.

Tutoriel détaillé sur la façon de s'inscrire à Binance (2025 Guide du débutant) Tutoriel détaillé sur la façon de s'inscrire à Binance (2025 Guide du débutant) Mar 18, 2025 pm 01:57 PM

Cet article fournit un guide complet sur les paramètres d'enregistrement et de sécurité des binances, couvrant les préparations de pré-inscription (y compris l'équipement, le courrier électronique, le numéro de téléphone mobile et la préparation des documents d'identité), et introduit deux méthodes d'enregistrement sur le site officiel et l'application, ainsi que différents niveaux de vérification d'identité (KYC). De plus, l'article se concentre également sur les étapes de sécurité clés telles que la configuration d'un mot de passe de fonds, l'activation de la vérification à deux facteurs (2FA, y compris Google Authenticator et SMS Verification) et la mise en place de codes anti-phishing, aidant les utilisateurs à s'inscrire et à utiliser la plate-forme de binance de binance pour les transactions de crypto-monnaie en toute sécurité et pratique. Assurez-vous de comprendre les lois et réglementations pertinentes et les risques de marché avant de négocier et d'investir avec prudence.

Un résumé des dix principales applications de plateformes de trading de devises virtuelles, classement des dix principales plates-formes de trading de devises virtuelles 2025 Un résumé des dix principales applications de plateformes de trading de devises virtuelles, classement des dix principales plates-formes de trading de devises virtuelles 2025 Mar 19, 2025 pm 05:15 PM

Top 10 des applications de plate-forme de trading de devises virtuelles recommandées: 1. Okx, 2. Binance, 3. Gate.io, 4. Kraken, 5. Huobi, 6. Coinbase, 7. Kucoin, 8. Crypto.com, 9. BitFinex, 10. Gemini. La sécurité, la liquidité, les frais de traitement, la sélection des devises, l'interface utilisateur et le support client doivent être pris en compte lors du choix d'une plate-forme.

Top 10 du classement des applications de négociation de devises virtuelles Top 10 des recommandations d'applications de trading de devises virtuelles Top 10 du classement des applications de négociation de devises virtuelles Top 10 des recommandations d'applications de trading de devises virtuelles Mar 19, 2025 pm 05:18 PM

Cet article répertorie les dix applications de trading de devises virtuelles recommandées, notamment OKX, Binance, Gate.io, Kraken, Huobi, Coinbase, Kucoin, Crypto.com, Bitfinex et Gemini, sans ordre particulier. Ces plates-formes présentent leurs propres avantages en liquidité, en sécurité, en sélection des devises, en frais de traitement et en expérience utilisateur. Pour choisir une plateforme de trading de devises virtuelle, vous devez considérer la sécurité, la liquidité, les frais de traitement, la sélection des devises et l'utilisation

Logiciel de trading de devises Logiciel de trading de devises Mar 19, 2025 pm 04:09 PM

Cet article fournit une comparaison approfondie et une analyse des fonctions de trading du réseau des trois principaux échanges, Binance, Ouyi et Sesame, visant à aider les investisseurs à choisir la plate-forme la plus appropriée. Le trading de grille est une stratégie de négociation automatisée qui réalise les bénéfices en achetant bas et en vendant de haut dans la gamme de prix prédéfinis, qui convient pour fluctuer les conditions du marché. L'article détaille les avantages, les risques et les fonctions du trading de grille et de l'excellent logiciel de trading de grille, et évalue de manière approfondie les fonctions de trading de grille des trois échanges ci-dessus, y compris les fonctions, la facilité d'utilisation, les fonctions de backtesting, etc. Enfin, il fournit des suggestions de sélection des utilisateurs pour différentes expériences de trading et des préférences de risque pour vous aider à trouver l'outil de trading de grille le plus approprié.

See all articles