Convertissez automatiquement les images en texte et les descriptions des images sont de meilleure qualité et plus précises.-IA-php.cn

Maison

Convertissez automatiquement les images en texte et les descriptions des images sont de meilleure qualité et plus précises.

PHPz

Jun 28, 2024 pm 09:41 PM

工程

Convertissez automatiquement les images en texte et les descriptions des images sont de meilleure qualité et plus précises.

La rubrique AIxiv est une rubrique où des contenus académiques et techniques sont publiés sur ce site. Au cours des dernières années, la rubrique AIxiv de ce site a reçu plus de 2 000 rapports, couvrant les meilleurs laboratoires des principales universités et entreprises du monde entier, favorisant efficacement les échanges et la diffusion académiques. Si vous souhaitez partager un excellent travail, n'hésitez pas à contribuer ou à nous contacter pour un rapport. Courriel de soumission : liyazhou@jiqizhixin.com ; zhaoyunfeng@jiqizhixin.com

Pi Renjie : doctorant en troisième année à l'Université des sciences et technologies de Hong Kong, étudiant sous la direction du professeur Zhang Tong et du professeur Zhou Xiaofang. A reçu une bourse Apple en 2024. Les principales orientations de recherche actuelles sont les grands modèles de langage multimodaux et l’IA centrée sur les données.

Zhang Jianshu : Étudiant de troisième année à l'Université de Wuhan, il travaille actuellement comme stagiaire de recherche sous la direction du professeur Zhang Tong. Ses principaux domaines de recherche sont les grands modèles de langage, les grands modèles de langage multimodaux et l'apprentissage continu. Actuellement à la recherche d'opportunités d'admission au doctorat pour l'automne 2025.

Dans le développement des grands modèles multimodaux d'aujourd'hui, les performances du modèle sont étroitement liées à la qualité des données d'entraînement. On peut dire que « les données donnent au modèle la plupart de ses capacités ».

En cela, les ensembles de données image-texte jouent un rôle essentiel dans de nombreux domaines tels que la compréhension des images, la génération de texte et la récupération d'images.

Cependant, les ensembles de données de description d'image existants sont principalement dérivés de l'exploration du réseau et de l'annotation manuelle, et il existe des problèmes tels qu'une qualité inégale, un manque de détails et un bruit de description élevé. Bien que les humains puissent fournir des descriptions détaillées des images, le coût élevé de l’annotation limite son échelle et sa faisabilité. Il existe donc un besoin urgent d’une méthode efficace et évolutive pour générer des descriptions d’images précises et détaillées.

Afin de relever les défis ci-dessus, des chercheurs de l'Université des sciences et technologies de Hong Kong, de l'Université de Wuhan, de l'Université du Zhejiang et de l'UIUC ont proposé conjointement un cadre d'automatisation innovant - Image-Textualisation (IT), qui intègre de grands modèles de langage multimodaux. (MLLM) et une variété de modèles experts visuels collaborent pour textualiser les informations d'image, et enfin utilisent un grand modèle de langage de texte pur doté de puissantes capacités de raisonnement pour transformer ces informations textualisées en descriptions d'images de haute qualité.

Convertissez automatiquement les images en texte et les descriptions des images sont de meilleure qualité et plus précises.

Papier : Textualisation d'images : Un cadre automatique pour créer des descriptions d'images précises et détaillées
Adresse du papier : https://arxiv.org/pdf/2406.07502v1
Adresse du projet : https : //github.com/sterzhang/image-textualization/

Convertissez automatiquement les images en texte et les descriptions des images sont de meilleure qualité et plus précises.

utilise une image créée par des modèles multimodaux pour décrire plutôt que d'utiliser des images informatiques pour décrire de manière générale. , la contribution de cet article comprend :
Cadre innovant : nous proposons un cadre de textualisation d'images, qui utilise les capacités de compréhension d'images à gros grain des grands modèles multimodaux, les capacités de perception à grain fin des modèles experts visuels, et les capacités de raisonnement des grands modèles de langage en texte brut pour générer automatiquement des descriptions d'images riches en détails et clairement articulées.
Repères d'évaluation et expériences : plusieurs critères d'évaluation pour évaluer les descriptions détaillées d'images sont proposés, et l'efficacité du cadre est vérifiée par des expériences approfondies.

Convertissez automatiquement les images en texte et les descriptions des images sont de meilleure qualité et plus précises. Publication de l'ensemble de données et du code : en tirant parti de notre cadre de textualisation d'images, nous avons généré un ensemble de données de description d'image à grande échelle et de haute qualité (IT-170K). Pour faciliter les recherches futures, nous avons rendu public tous les codes sources et les ensembles de données générés.

🎜Méthode de textualisation d'images 🎜🎜🎜Le framework d'image-textualisation (IT) comprend les trois étapes suivantes : 🎜

1. Textualisation d'images à gros grains (textualisation holistique) : Tout d'abord, utilisez un grand modèle de langage multimodal pour générer des descriptions de référence pour les images. Bien que ces descriptions puissent manquer de détails et d'illusions, elles représentent les informations visuelles et l'expression du langage. de l’image. La structure de base est fournie. La structure visuelle ici se reflète principalement dans le fait que les descriptions de référence contiennent souvent des objets de base volumineux, qui peuvent fournir un effet « d'ancrage » pour les détails ultérieurs, améliorant ainsi la récapitulation textuelle finale des détails ajoutés. De plus, la structure de l'expression du langage se reflète principalement dans le grand modèle de langage en texte brut inclus dans le grand modèle multimodal, ce qui lui confère de fortes capacités linguistiques. Cela permet à la description de référence générée ici d'être bien organisée en langage. Par exemple, il s'agira d'abord de dire ce que l'image décrit grossièrement, puis de développer les détails et enfin de résumer. Ce style de description est plus orienté vers les préférences humaines. Cela permet également de traiter la récapitulation textuelle finale sur un modèle doté de meilleures capacités linguistiques.

2. Textualisation des détails visuels : À ce stade, nous extrayons les détails du côté image et du côté texte en même temps.

Le premier est le côté texte. Puisque la description de référence que nous avons générée à l'aide du grand modèle multimodal à l'étape précédente peut contenir des hallucinations, la première chose que nous faisons ici est la « détection des hallucinations ». Nous utilisons d'abord LLM pour capturer l'entité contenue dans la description de référence, puis utilisons un détecteur d'ensemble ouvert pour faire correspondre l'entité dans l'image. Si elle n'est pas détectée, l'entité est jugée comme une illusion. Ici, nous textualisons également les hallucinations détectées et les supprimons dans la récapitulation textuelle finale.

Convertissez automatiquement les images en texte et les descriptions des images sont de meilleure qualité et plus précises.

Du côté visuel, nous utilisons des modèles experts visuels sur diverses tâches entraînées sur des images haute résolution pour extraire des informations détaillées dans l'image. Si vous souhaitez exprimer les informations détaillées d'un objet dans une image à l'aide de texte, il ne suffit pas d'utiliser simplement la légende de l'objet. Nous utilisons d'abord le cadre de délimitation de ces objets pour extraire la relation gauche-droite de ces objets dans le formulaire. du texte. Mais les objets de l'image contiennent non seulement des informations gauche et droite, mais également des informations recto et verso. À cet égard, nous utilisons d'abord le modèle de segmentation pour extraire les masques de ces objets, puis convertissons les images originales en cartes de profondeur et reflétons les informations de profondeur dans le texte en calculant les scores de profondeur correspondant aux masques d'objets spécifiques en profondeur. carte. À ce stade, nous pouvons utiliser du texte pour restaurer des informations détaillées telles que la taille, les positions gauche et droite et le contexte de chaque objet de l'image.

Convertissez automatiquement les images en texte et les descriptions des images sont de meilleure qualité et plus précises.

3. Récapitulation textualisée : En combinant les résultats de textualisation des informations d'image dans les deux premières étapes, ainsi que notre invite réécrite soigneusement conçue, le grand modèle de langage de texte brut peut être très bon. Il restaure les informations d'image via des méthodes pures. texte et génère des descriptions d’images détaillées et précises grâce à de puissantes capacités de compréhension et de raisonnement.

Évaluation complète et vérification expérimentale

Pour vérifier l'efficacité de notre cadre, nous avons construit trois référentiels d'évaluation, à savoir DID-Bench (Detailed Image Description Benchmark), D2I-Bench (Description-to-Image Benchmark) et LIN - Banc (Benchmark linguistique). Nous menons des expériences approfondies et montrons que les descriptions d'images générées par le cadre informatique surpassent considérablement les méthodes existantes en termes de richesse de détails et de précision. En particulier, les MLLM formés sur des ensembles de données générés par notre cadre informatique, tels que LLaVA-7B, présentent des capacités de description d'images plus fortes et des phénomènes d'hallucination réduits.

DID-Bench (Detailed Image Description Benchmark) : utilisé pour évaluer la similarité entre les descriptions d'images et les descriptions d'images détaillées étiquetées manuellement par l'homme. On peut voir que nos descriptions d'images IT-{LLaVA} et IT-{GPT4-V} modifiées sont plus détaillées et précises qu'avant la modification, et sont plus cohérentes avec les descriptions marquées par les humains.

Convertissez automatiquement les images en texte et les descriptions des images sont de meilleure qualité et plus précises.

D2I-Bench (Description to Image Benchmark) : utilisez le modèle de graphique vincentien pour convertir la description générée en image et comparez la similarité avec l'image originale. Ici, nous avons sélectionné CLIP-score et DINO-score pour évaluation. . peut obtenir des scores plus élevés.

Convertissez automatiquement les images en texte et les descriptions des images sont de meilleure qualité et plus précises.

De plus, nous avons également vérifié sur POPE et LIN-Bench que LLaVA-7B, qui est formé à l'aide des données générées par notre framework, peut générer des descriptions plus détaillées et complexes (LIN-Bench sur le côté droit du tableau), et peut également réduire les hallucinations (repère POPE sur le côté gauche du tableau).

Convertissez automatiquement les images en texte et les descriptions des images sont de meilleure qualité et plus précises.

Enfin, nous avons comparé statistiquement les données générées, et nous pouvons constater que le nombre de chaque partie du discours dans notre description modifiée a été grandement amélioré.

Convertissez automatiquement les images en texte et les descriptions des images sont de meilleure qualité et plus précises.

Future Outlook

Notre travail aborde non seulement les limites des ensembles de données de description d'images existants, mais fournit également une source d'inspiration pour concevoir des méthodes plus efficaces et évolutives. Nous attendons avec impatience que le cadre informatique démontre son potentiel dans davantage de domaines d’application et favorise le développement ultérieur de la compréhension et de la technologie de génération d’images.

Ce qui précède est le contenu détaillé de. pour plus d'informations, suivez d'autres articles connexes sur le site Web de PHP en chinois!

Déclaration de ce site Web

Le contenu de cet article est volontairement contribué par les internautes et les droits d'auteur appartiennent à l'auteur original. Ce site n'assume aucune responsabilité légale correspondante. Si vous trouvez un contenu suspecté de plagiat ou de contrefaçon, veuillez contacter admin@php.cn

Outils d'IA chauds

Undresser.AI Undress

Application basée sur l'IA pour créer des photos de nu réalistes

AI Clothes Remover

Outil d'IA en ligne pour supprimer les vêtements des photos.

Undress AI Tool

Images de déshabillage gratuites

Clothoff.io

Dissolvant de vêtements AI

Video Face Swap

Échangez les visages dans n'importe quelle vidéo sans effort grâce à notre outil d'échange de visage AI entièrement gratuit !

Afficher plus

Article chaud

Comment réparer KB5055612 ne parvient pas à s'installer dans Windows 10?

4 Il y a quelques semaines By DDD

<🎜>: Grow A Garden - Guide de mutation complet

3 Il y a quelques semaines By DDD

<🎜>: Bubble Gum Simulator Infinity - Comment obtenir et utiliser les clés royales

3 Il y a quelques semaines By 尊渡假赌尊渡假赌尊渡假赌

Nordhold: Système de fusion, expliqué

4 Il y a quelques semaines By 尊渡假赌尊渡假赌尊渡假赌

Mandragora: Whispers of the Witch Tree - Comment déverrouiller le grappin

3 Il y a quelques semaines By 尊渡假赌尊渡假赌尊渡假赌

Afficher plus

Outils chauds

Bloc-notes++7.3.1

Éditeur de code facile à utiliser et gratuit

SublimeText3 version chinoise

Version chinoise, très simple à utiliser

Envoyer Studio 13.0.1

Puissant environnement de développement intégré PHP

Dreamweaver CS6

Outils de développement Web visuel

SublimeText3 version Mac

Logiciel d'édition de code au niveau de Dieu (SublimeText3)

Afficher plus

Sujets chauds

Tutoriel Java

1670

Tutoriel CakePHP

1428

Tutoriel Laravel

1329

Tutoriel PHP

1274

Tutoriel C#

1256

Afficher plus

Related knowledge

L'auteur de ControlNet a encore un succès ! L'ensemble du processus de génération d'une peinture à partir d'une image, gagnant 1,4k étoiles en deux jours Jul 17, 2024 am 01:56 AM

Il s'agit également d'une vidéo Tusheng, mais PaintsUndo a emprunté une voie différente. L'auteur de ControlNet, LvminZhang, a recommencé à vivre ! Cette fois, je vise le domaine de la peinture. Le nouveau projet PaintsUndo a reçu 1,4kstar (toujours en hausse folle) peu de temps après son lancement. Adresse du projet : https://github.com/lllyasviel/Paints-UNDO Grâce à ce projet, l'utilisateur saisit une image statique et PaintsUndo peut automatiquement vous aider à générer une vidéo de l'ensemble du processus de peinture, du brouillon de ligne au suivi du produit fini. . Pendant le processus de dessin, les changements de lignes sont étonnants. Le résultat vidéo final est très similaire à l’image originale : jetons un coup d’œil à un dessin complet.

En tête de liste des ingénieurs logiciels d'IA open source, la solution sans agent de l'UIUC résout facilement les problèmes de programmation réels du banc SWE. Jul 17, 2024 pm 10:02 PM

La colonne AIxiv est une colonne où ce site publie du contenu académique et technique. Au cours des dernières années, la rubrique AIxiv de ce site a reçu plus de 2 000 rapports, couvrant les meilleurs laboratoires des principales universités et entreprises du monde entier, favorisant efficacement les échanges et la diffusion académiques. Si vous souhaitez partager un excellent travail, n'hésitez pas à contribuer ou à nous contacter pour un rapport. Courriel de soumission : liyazhou@jiqizhixin.com ; zhaoyunfeng@jiqizhixin.com Les auteurs de cet article font tous partie de l'équipe de l'enseignant Zhang Lingming de l'Université de l'Illinois à Urbana-Champaign (UIUC), notamment : Steven Code repair ; doctorant en quatrième année, chercheur

Du RLHF au DPO en passant par TDPO, les algorithmes d'alignement des grands modèles sont déjà « au niveau des jetons » Jun 24, 2024 pm 03:04 PM

La colonne AIxiv est une colonne où ce site publie du contenu académique et technique. Au cours des dernières années, la rubrique AIxiv de ce site a reçu plus de 2 000 rapports, couvrant les meilleurs laboratoires des principales universités et entreprises du monde entier, favorisant efficacement les échanges et la diffusion académiques. Si vous souhaitez partager un excellent travail, n'hésitez pas à contribuer ou à nous contacter pour un rapport. Courriel de soumission : liyazhou@jiqizhixin.com ; zhaoyunfeng@jiqizhixin.com Dans le processus de développement de l'intelligence artificielle, le contrôle et le guidage des grands modèles de langage (LLM) ont toujours été l'un des principaux défis, visant à garantir que ces modèles sont à la fois puissant et sûr au service de la société humaine. Les premiers efforts se sont concentrés sur les méthodes d’apprentissage par renforcement par feedback humain (RL

Les articles arXiv peuvent être publiés sous forme de 'barrage', la plateforme de discussion alphaXiv de Stanford est en ligne, LeCun l'aime Aug 01, 2024 pm 05:18 PM

acclamations! Qu’est-ce que ça fait lorsqu’une discussion sur papier se résume à des mots ? Récemment, des étudiants de l'Université de Stanford ont créé alphaXiv, un forum de discussion ouvert pour les articles arXiv qui permet de publier des questions et des commentaires directement sur n'importe quel article arXiv. Lien du site Web : https://alphaxiv.org/ En fait, il n'est pas nécessaire de visiter spécifiquement ce site Web. Il suffit de remplacer arXiv dans n'importe quelle URL par alphaXiv pour ouvrir directement l'article correspondant sur le forum alphaXiv : vous pouvez localiser avec précision les paragraphes dans. l'article, Phrase : dans la zone de discussion sur la droite, les utilisateurs peuvent poser des questions à l'auteur sur les idées et les détails de l'article. Par exemple, ils peuvent également commenter le contenu de l'article, tels que : "Donné à".

Travail posthume de l'équipe OpenAI Super Alignment : deux grands modèles jouent à un jeu et le résultat devient plus compréhensible Jul 19, 2024 am 01:29 AM

Si la réponse donnée par le modèle d’IA est incompréhensible du tout, oseriez-vous l’utiliser ? À mesure que les systèmes d’apprentissage automatique sont utilisés dans des domaines de plus en plus importants, il devient de plus en plus important de démontrer pourquoi nous pouvons faire confiance à leurs résultats, et quand ne pas leur faire confiance. Une façon possible de gagner confiance dans le résultat d'un système complexe est d'exiger que le système produise une interprétation de son résultat qui soit lisible par un humain ou un autre système de confiance, c'est-à-dire entièrement compréhensible au point que toute erreur possible puisse être trouvé. Par exemple, pour renforcer la confiance dans le système judiciaire, nous exigeons que les tribunaux fournissent des avis écrits clairs et lisibles qui expliquent et soutiennent leurs décisions. Pour les grands modèles de langage, nous pouvons également adopter une approche similaire. Cependant, lorsque vous adoptez cette approche, assurez-vous que le modèle de langage génère

Une avancée significative dans l'hypothèse de Riemann ! Tao Zhexuan recommande fortement les nouveaux articles du MIT et d'Oxford, et le lauréat de la médaille Fields, âgé de 37 ans, a participé Aug 05, 2024 pm 03:32 PM

Récemment, l’hypothèse de Riemann, connue comme l’un des sept problèmes majeurs du millénaire, a réalisé une nouvelle avancée. L'hypothèse de Riemann est un problème mathématique non résolu très important, lié aux propriétés précises de la distribution des nombres premiers (les nombres premiers sont les nombres qui ne sont divisibles que par 1 et par eux-mêmes, et jouent un rôle fondamental dans la théorie des nombres). Dans la littérature mathématique actuelle, il existe plus d'un millier de propositions mathématiques basées sur l'établissement de l'hypothèse de Riemann (ou sa forme généralisée). En d’autres termes, une fois que l’hypothèse de Riemann et sa forme généralisée seront prouvées, ces plus d’un millier de propositions seront établies sous forme de théorèmes, qui auront un impact profond sur le domaine des mathématiques et si l’hypothèse de Riemann s’avère fausse, alors parmi eux ; ces propositions qui en font partie perdront également de leur efficacité. Une nouvelle percée vient du professeur de mathématiques du MIT, Larry Guth, et de l'Université d'Oxford

LLM n'est vraiment pas bon pour la prédiction de séries chronologiques. Il n'utilise même pas sa capacité de raisonnement. Jul 15, 2024 pm 03:59 PM

Les modèles linguistiques peuvent-ils vraiment être utilisés pour la prédiction de séries chronologiques ? Selon la loi des gros titres de Betteridge (tout titre d'actualité se terminant par un point d'interrogation peut recevoir une réponse « non »), la réponse devrait être non. Le fait semble être vrai : un LLM aussi puissant ne peut pas bien gérer les données de séries chronologiques. Les séries chronologiques, c'est-à-dire les séries chronologiques, comme leur nom l'indique, font référence à un ensemble de séquences de points de données disposées par ordre temporel. L'analyse des séries chronologiques est essentielle dans de nombreux domaines, notamment la prévision de la propagation des maladies, l'analyse du commerce de détail, la santé et la finance. Dans le domaine de l'analyse des séries chronologiques, de nombreux chercheurs ont récemment étudié comment utiliser les grands modèles linguistiques (LLM) pour classer, prédire et détecter les anomalies dans les séries chronologiques. Ces articles supposent que les modèles de langage capables de gérer les dépendances séquentielles dans le texte peuvent également se généraliser aux séries chronologiques.

Le premier MLLM basé sur Mamba est là ! Les poids des modèles, le code de formation, etc. sont tous open source Jul 17, 2024 am 02:46 AM

La colonne AIxiv est une colonne où ce site publie du contenu académique et technique. Au cours des dernières années, la rubrique AIxiv de ce site a reçu plus de 2 000 rapports, couvrant les meilleurs laboratoires des principales universités et entreprises du monde entier, favorisant efficacement les échanges et la diffusion académiques. Si vous souhaitez partager un excellent travail, n'hésitez pas à contribuer ou à nous contacter pour un rapport. Courriel de soumission : liyazhou@jiqizhixin.com ; zhaoyunfeng@jiqizhixin.com. Introduction Ces dernières années, l'application de grands modèles de langage multimodaux (MLLM) dans divers domaines a connu un succès remarquable. Cependant, en tant que modèle de base pour de nombreuses tâches en aval, le MLLM actuel se compose du célèbre réseau Transformer, qui

See all articles