En tête de liste des ingénieurs logiciels d'IA open source, la solution sans agent de l'UIUC résout facilement les problèmes de programmation réels du banc SWE.-IA-php.cn

Maison

En tête de liste des ingénieurs logiciels d'IA open source, la solution sans agent de l'UIUC résout facilement les problèmes de programmation réels du banc SWE.

WBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWB

Jul 17, 2024 pm 10:02 PM

工程

En tête de liste des ingénieurs logiciels dIA open source, la solution sans agent de lUIUC résout facilement les problèmes de programmation réels du banc SWE.

La rubrique AIxiv est une rubrique où ce site publie du contenu académique et technique. Au cours des dernières années, la rubrique AIxiv de ce site a reçu plus de 2 000 rapports, couvrant les meilleurs laboratoires des principales universités et entreprises du monde entier, favorisant efficacement les échanges et la diffusion académiques. Si vous souhaitez partager un excellent travail, n'hésitez pas à contribuer ou à nous contacter pour un rapport. Courriel de soumission : liyazhou@jiqizhixin.com ; zhaoyunfeng@jiqizhixin.com

Les auteurs de cet article font tous partie de l'équipe de l'enseignant Zhang Lingming de l'Université de l'Illinois à Urbana-Champaign (UIUC), dont : Steven Xia , un doctorant de quatrième année, dont la direction de recherche est la réparation automatique de code basée sur de grands modèles d'IA ; Deng Yinlin, un doctorant de quatrième année, dont la direction de recherche est la génération de code basée sur de grands modèles d'IA ; Soren Dunn, un stagiaire en recherche scientifique ; , est actuellement étudiant en troisième année à l'UIUC. L'enseignant Zhang Lingming est actuellement professeur agrégé au Département d'informatique de l'UIUC, principalement engagé dans la recherche liée au génie logiciel, à l'apprentissage automatique et aux grands modèles de code.

Pour des informations plus détaillées, veuillez consulter la page d'accueil personnelle du professeur Zhang : https://lingming.cs.illinois.edu/

Depuis que Devin (le premier ingénieur logiciel d'IA entièrement automatique) l'a proposé, l'IA pour l'ingénierie logicielle La conception de l'agent est devenue le centre de la recherche. De plus en plus d'ingénieurs logiciels automatiques d'IA basés sur des agents ont été proposés, et ont obtenu de bonnes performances sur l'ensemble de données du banc SWE et ont réparé automatiquement de nombreux problèmes réels de GitHub.

Cependant, un système d'agent complexe entraînera une surcharge et une incertitude supplémentaires. Avons-nous vraiment besoin d'utiliser un agent aussi complexe pour résoudre les problèmes de GitHub ? Une solution sans agent peut-elle se rapprocher de leurs performances ?

Partant de ces deux problématiques, l'équipe du professeur Zhang Lingming de l'Université de l'Illinois à Urbana-Champaign (UIUC) a proposé OpenAutoCoder-Agentless, une solution sans agent simple, efficace et totalement open source qui peut résoudre un vrai problème GitHub pour seulement 0,34 $. Agentless a attiré plus de 300 stars de GitHub sur GitHub en quelques jours seulement et s'est hissé dans le top trois de la liste hebdomadaire de DAIR.AI des articles ML les plus en vogue.

En tête de liste des ingénieurs logiciels dIA open source, la solution sans agent de lUIUC résout facilement les problèmes de programmation réels du banc SWE.

Article : AGENTLESS : Démystifier les agents de génie logiciel basés sur LLM
Adresse de l'article : https://huggingface.co/papers/2407.01489
Code source ouvert : https://github. com /OpenAutoCoder/Agentless

Leo Boytsov, chercheur scientifique chez AWS, a déclaré : « Le framework Agentless a surpassé toutes les solutions Agent open source et a presque atteint le niveau le plus élevé de SWE Bench Lite (27 %). De plus, il l'a battu à un niveau nettement inférieur. Le framework utilise une approche de requête hiérarchique (en demandant à LLM de rechercher des fichiers, des classes, des fonctions, etc.) pour déterminer les emplacements des correctifs, mais ne permet pas à LLM de prendre des décisions de planification sans agent. résolution de problèmes de développement logiciel qui utilise une approche simple en deux phases pour localiser et corriger les bogues dans votre base de code. Lors de la phase de localisation, Agentless utilise une approche hiérarchique pour se limiter progressivement aux fichiers, classes/fonctions et emplacements d'édition spécifiques suspects. Pour les correctifs, il utilise un simple format de comparaison (référencé à partir de l'outil open source Aider) pour générer plusieurs correctifs candidats, en les filtrant et en les triant.

En tête de liste des ingénieurs logiciels dIA open source, la solution sans agent de lUIUC résout facilement les problèmes de programmation réels du banc SWE.

Les chercheurs ont comparé l'agent sans agent aux agents logiciels d'IA existants, y compris les projets open source et commerciaux/fermés de pointe. Étonnamment, Agentless peut surpasser tous les agents logiciels open source existants à moindre coût ! Le mode sans agent a résolu 27,33 % des problèmes, soit le taux le plus élevé parmi les solutions open source, et l'a résolu pour une moyenne de 0,29 $ par problème et environ 0,34 $ en moyenne pour tous les problèmes (résolvables et non résolus).

En tête de liste des ingénieurs logiciels dIA open source, la solution sans agent de lUIUC résout facilement les problèmes de programmation réels du banc SWE.

De plus, Agentless a le potentiel de s'améliorer. Le mode sans agent peut résoudre 41 % des problèmes en considérant tous les correctifs générés, une limite supérieure qui indique une marge d'amélioration significative dans les étapes de tri et de sélection des correctifs. De plus, Agentless est capable de résoudre certains problèmes uniques que même le meilleur outil commercial (Alibaba Lingma Agent) ne peut pas résoudre, ce qui suggère qu'il peut être utilisé en complément des outils existants.

En tête de liste des ingénieurs logiciels dIA open source, la solution sans agent de lUIUC résout facilement les problèmes de programmation réels du banc SWE.

Analyse de l'ensemble de données SWE-bench Lite

Les chercheurs ont également effectué une inspection manuelle et une analyse détaillée de l'ensemble de données SWE-bench Lite.

L'étude a révélé que 4,3 % des problèmes dans l'ensemble de données SWE-bench Lite donnaient des réponses complètes directement dans la description du problème, qui est le correctif correct. Tandis que les 10 % restants des questions décrivent les étapes exactes menant à la bonne solution. Cela suggère que certains problèmes dans SWE-bench Lite peuvent être plus faciles à résoudre.

De plus, l'équipe de recherche a observé que 4,3 % des problèmes incluaient des solutions proposées par les utilisateurs ou des étapes dans la description du problème, mais que ces solutions n'étaient pas cohérentes avec les correctifs réels des développeurs. Cela révèle en outre un problème potentiel avec ce benchmark, car ces solutions trompeuses pourraient amener l'outil d'IA à générer des solutions incorrectes simplement en suivant la description du problème.

En termes de qualité de description des problèmes, les chercheurs ont observé que bien que la plupart des tâches de SWE-bench Lite contiennent suffisamment d'informations et que de nombreuses tâches fournissent également des exemples d'échecs pour reproduire les erreurs, 9,3 % des problèmes ne contiennent toujours pas suffisamment d'informations. Par exemple, vous devez implémenter une nouvelle fonction ou ajouter un message d'erreur, mais le nom de la fonction spécifique ou la chaîne du message d'erreur spécifique n'est pas indiqué dans la description du problème. Cela signifie que même si la fonctionnalité sous-jacente est correctement implémentée, le test échouera si le nom de la fonction ou la chaîne du message d'erreur ne correspond pas exactement.

En tête de liste des ingénieurs logiciels dIA open source, la solution sans agent de lUIUC résout facilement les problèmes de programmation réels du banc SWE.

Des chercheurs de l'Université de Princeton et l'un des auteurs de SWE-Bench, Ofir Press, ont confirmé leurs conclusions : "Agentless a effectué une bonne analyse manuelle de SWE-bench Lite. Ils pensent que la théorie sur Lite est la plus élevée. Le score est probablement de 90,7 %. Je pense que la limite supérieure réelle peut être inférieure (environ 80 %). Certaines questions contiennent des informations insuffisantes et d'autres sont testées de manière trop rigoureuse »

En tête de liste des ingénieurs logiciels dIA open source, la solution sans agent de lUIUC résout facilement les problèmes de programmation réels du banc SWE.

SWE-bench Lite-S : réussi. sous-ensemble de problèmes

Pour résoudre ces problèmes, les chercheurs ont proposé un sous-ensemble de problèmes strict SWE-bench Lite-S (contenant 252 questions). Plus précisément, les problèmes contenant des correctifs exacts, des solutions trompeuses ou ne fournissant pas suffisamment d'informations dans la description du problème ont été exclus de SWE-bench Lite (contenant 300 problèmes). Cela supprime les questions déraisonnables et standardise le niveau de difficulté du benchmark. Par rapport au SWE-bench Lite original, le benchmark filtré reflète plus précisément les véritables capacités des outils de développement logiciel automatisés.

Conclusion

Bien que le développement de logiciels basés sur des agents soit très prometteur, les auteurs estiment qu'il est temps pour la communauté technologique et de recherche de s'arrêter et de réfléchir à ses principales méthodes de conception et d'évaluation, plutôt que de se précipiter pour publier davantage d'agents. Les chercheurs espèrent que le système sans agent pourra aider à réinitialiser la ligne de base et l’orientation des agents dans le futur génie logiciel.

Ce qui précède est le contenu détaillé de. pour plus d'informations, suivez d'autres articles connexes sur le site Web de PHP en chinois!

Déclaration de ce site Web

Le contenu de cet article est volontairement contribué par les internautes et les droits d'auteur appartiennent à l'auteur original. Ce site n'assume aucune responsabilité légale correspondante. Si vous trouvez un contenu suspecté de plagiat ou de contrefaçon, veuillez contacter admin@php.cn

Outils d'IA chauds

Undresser.AI Undress

Application basée sur l'IA pour créer des photos de nu réalistes

AI Clothes Remover

Outil d'IA en ligne pour supprimer les vêtements des photos.

Undress AI Tool

Images de déshabillage gratuites

Clothoff.io

Dissolvant de vêtements AI

Video Face Swap

Échangez les visages dans n'importe quelle vidéo sans effort grâce à notre outil d'échange de visage AI entièrement gratuit !

Afficher plus

Article chaud

<🎜>: Grow A Garden - Guide de mutation complet

3 Il y a quelques semaines By DDD

Comment réparer KB5055612 ne parvient pas à s'installer dans Windows 10?

3 Il y a quelques semaines By DDD

<🎜>: Bubble Gum Simulator Infinity - Comment obtenir et utiliser les clés royales

3 Il y a quelques semaines By 尊渡假赌尊渡假赌尊渡假赌

Mandragora: Whispers of the Witch Tree - Comment déverrouiller le grappin

3 Il y a quelques semaines By 尊渡假赌尊渡假赌尊渡假赌

Nordhold: Système de fusion, expliqué

3 Il y a quelques semaines By 尊渡假赌尊渡假赌尊渡假赌

Afficher plus

Outils chauds

Bloc-notes++7.3.1

Éditeur de code facile à utiliser et gratuit

SublimeText3 version chinoise

Version chinoise, très simple à utiliser

Envoyer Studio 13.0.1

Puissant environnement de développement intégré PHP

Dreamweaver CS6

Outils de développement Web visuel

SublimeText3 version Mac

Logiciel d'édition de code au niveau de Dieu (SublimeText3)

Afficher plus

Sujets chauds

Tutoriel Java

1667

Tutoriel CakePHP

1426

Tutoriel Laravel

1328

Tutoriel PHP

1273

Tutoriel C#

1255

Afficher plus

Related knowledge

L'auteur de ControlNet a encore un succès ! L'ensemble du processus de génération d'une peinture à partir d'une image, gagnant 1,4k étoiles en deux jours Jul 17, 2024 am 01:56 AM

Il s'agit également d'une vidéo Tusheng, mais PaintsUndo a emprunté une voie différente. L'auteur de ControlNet, LvminZhang, a recommencé à vivre ! Cette fois, je vise le domaine de la peinture. Le nouveau projet PaintsUndo a reçu 1,4kstar (toujours en hausse folle) peu de temps après son lancement. Adresse du projet : https://github.com/lllyasviel/Paints-UNDO Grâce à ce projet, l'utilisateur saisit une image statique et PaintsUndo peut automatiquement vous aider à générer une vidéo de l'ensemble du processus de peinture, du brouillon de ligne au suivi du produit fini. . Pendant le processus de dessin, les changements de lignes sont étonnants. Le résultat vidéo final est très similaire à l’image originale : jetons un coup d’œil à un dessin complet.

Du RLHF au DPO en passant par TDPO, les algorithmes d'alignement des grands modèles sont déjà « au niveau des jetons » Jun 24, 2024 pm 03:04 PM

La colonne AIxiv est une colonne où ce site publie du contenu académique et technique. Au cours des dernières années, la rubrique AIxiv de ce site a reçu plus de 2 000 rapports, couvrant les meilleurs laboratoires des principales universités et entreprises du monde entier, favorisant efficacement les échanges et la diffusion académiques. Si vous souhaitez partager un excellent travail, n'hésitez pas à contribuer ou à nous contacter pour un rapport. Courriel de soumission : liyazhou@jiqizhixin.com ; zhaoyunfeng@jiqizhixin.com Dans le processus de développement de l'intelligence artificielle, le contrôle et le guidage des grands modèles de langage (LLM) ont toujours été l'un des principaux défis, visant à garantir que ces modèles sont à la fois puissant et sûr au service de la société humaine. Les premiers efforts se sont concentrés sur les méthodes d’apprentissage par renforcement par feedback humain (RL

En tête de liste des ingénieurs logiciels d'IA open source, la solution sans agent de l'UIUC résout facilement les problèmes de programmation réels du banc SWE. Jul 17, 2024 pm 10:02 PM

La colonne AIxiv est une colonne où ce site publie du contenu académique et technique. Au cours des dernières années, la rubrique AIxiv de ce site a reçu plus de 2 000 rapports, couvrant les meilleurs laboratoires des principales universités et entreprises du monde entier, favorisant efficacement les échanges et la diffusion académiques. Si vous souhaitez partager un excellent travail, n'hésitez pas à contribuer ou à nous contacter pour un rapport. Courriel de soumission : liyazhou@jiqizhixin.com ; zhaoyunfeng@jiqizhixin.com Les auteurs de cet article font tous partie de l'équipe de l'enseignant Zhang Lingming de l'Université de l'Illinois à Urbana-Champaign (UIUC), notamment : Steven Code repair ; doctorant en quatrième année, chercheur

Les articles arXiv peuvent être publiés sous forme de 'barrage', la plateforme de discussion alphaXiv de Stanford est en ligne, LeCun l'aime Aug 01, 2024 pm 05:18 PM

acclamations! Qu’est-ce que ça fait lorsqu’une discussion sur papier se résume à des mots ? Récemment, des étudiants de l'Université de Stanford ont créé alphaXiv, un forum de discussion ouvert pour les articles arXiv qui permet de publier des questions et des commentaires directement sur n'importe quel article arXiv. Lien du site Web : https://alphaxiv.org/ En fait, il n'est pas nécessaire de visiter spécifiquement ce site Web. Il suffit de remplacer arXiv dans n'importe quelle URL par alphaXiv pour ouvrir directement l'article correspondant sur le forum alphaXiv : vous pouvez localiser avec précision les paragraphes dans. l'article, Phrase : dans la zone de discussion sur la droite, les utilisateurs peuvent poser des questions à l'auteur sur les idées et les détails de l'article. Par exemple, ils peuvent également commenter le contenu de l'article, tels que : "Donné à".

Une avancée significative dans l'hypothèse de Riemann ! Tao Zhexuan recommande fortement les nouveaux articles du MIT et d'Oxford, et le lauréat de la médaille Fields, âgé de 37 ans, a participé Aug 05, 2024 pm 03:32 PM

Récemment, l’hypothèse de Riemann, connue comme l’un des sept problèmes majeurs du millénaire, a réalisé une nouvelle avancée. L'hypothèse de Riemann est un problème mathématique non résolu très important, lié aux propriétés précises de la distribution des nombres premiers (les nombres premiers sont les nombres qui ne sont divisibles que par 1 et par eux-mêmes, et jouent un rôle fondamental dans la théorie des nombres). Dans la littérature mathématique actuelle, il existe plus d'un millier de propositions mathématiques basées sur l'établissement de l'hypothèse de Riemann (ou sa forme généralisée). En d’autres termes, une fois que l’hypothèse de Riemann et sa forme généralisée seront prouvées, ces plus d’un millier de propositions seront établies sous forme de théorèmes, qui auront un impact profond sur le domaine des mathématiques et si l’hypothèse de Riemann s’avère fausse, alors parmi eux ; ces propositions qui en font partie perdront également de leur efficacité. Une nouvelle percée vient du professeur de mathématiques du MIT, Larry Guth, et de l'Université d'Oxford

Travail posthume de l'équipe OpenAI Super Alignment : deux grands modèles jouent à un jeu et le résultat devient plus compréhensible Jul 19, 2024 am 01:29 AM

Si la réponse donnée par le modèle d’IA est incompréhensible du tout, oseriez-vous l’utiliser ? À mesure que les systèmes d’apprentissage automatique sont utilisés dans des domaines de plus en plus importants, il devient de plus en plus important de démontrer pourquoi nous pouvons faire confiance à leurs résultats, et quand ne pas leur faire confiance. Une façon possible de gagner confiance dans le résultat d'un système complexe est d'exiger que le système produise une interprétation de son résultat qui soit lisible par un humain ou un autre système de confiance, c'est-à-dire entièrement compréhensible au point que toute erreur possible puisse être trouvé. Par exemple, pour renforcer la confiance dans le système judiciaire, nous exigeons que les tribunaux fournissent des avis écrits clairs et lisibles qui expliquent et soutiennent leurs décisions. Pour les grands modèles de langage, nous pouvons également adopter une approche similaire. Cependant, lorsque vous adoptez cette approche, assurez-vous que le modèle de langage génère

LLM n'est vraiment pas bon pour la prédiction de séries chronologiques. Il n'utilise même pas sa capacité de raisonnement. Jul 15, 2024 pm 03:59 PM

Les modèles linguistiques peuvent-ils vraiment être utilisés pour la prédiction de séries chronologiques ? Selon la loi des gros titres de Betteridge (tout titre d'actualité se terminant par un point d'interrogation peut recevoir une réponse « non »), la réponse devrait être non. Le fait semble être vrai : un LLM aussi puissant ne peut pas bien gérer les données de séries chronologiques. Les séries chronologiques, c'est-à-dire les séries chronologiques, comme leur nom l'indique, font référence à un ensemble de séquences de points de données disposées par ordre temporel. L'analyse des séries chronologiques est essentielle dans de nombreux domaines, notamment la prévision de la propagation des maladies, l'analyse du commerce de détail, la santé et la finance. Dans le domaine de l'analyse des séries chronologiques, de nombreux chercheurs ont récemment étudié comment utiliser les grands modèles linguistiques (LLM) pour classer, prédire et détecter les anomalies dans les séries chronologiques. Ces articles supposent que les modèles de langage capables de gérer les dépendances séquentielles dans le texte peuvent également se généraliser aux séries chronologiques.

Le premier MLLM basé sur Mamba est là ! Les poids des modèles, le code de formation, etc. sont tous open source Jul 17, 2024 am 02:46 AM

La colonne AIxiv est une colonne où ce site publie du contenu académique et technique. Au cours des dernières années, la rubrique AIxiv de ce site a reçu plus de 2 000 rapports, couvrant les meilleurs laboratoires des principales universités et entreprises du monde entier, favorisant efficacement les échanges et la diffusion académiques. Si vous souhaitez partager un excellent travail, n'hésitez pas à contribuer ou à nous contacter pour un rapport. Courriel de soumission : liyazhou@jiqizhixin.com ; zhaoyunfeng@jiqizhixin.com. Introduction Ces dernières années, l'application de grands modèles de langage multimodaux (MLLM) dans divers domaines a connu un succès remarquable. Cependant, en tant que modèle de base pour de nombreuses tâches en aval, le MLLM actuel se compose du célèbre réseau Transformer, qui

See all articles