突破分辨率极限：字节联合中科大揭示多模态文档大模型-人工智能-PHP中文网

各项测评成绩显着提升

从频域出发解决分辨率问题

首页

科技周边

人工智能

突破分辨率极限：字节联合中科大揭示多模态文档大模型

王林

Dec 04, 2023 pm 02:14 PM

数据训练

现在甚至有了大型的多模态高分辨率文档！

这项技术不仅能够准确识别图像中的信息，还能够根据用户需求调用自身的知识库来回答问题

比如，看到图中马里奥的界面，直接就回答出了这是任天堂公司的作品。

突破分辨率极限：字节联合中科大揭示多模态文档大模型

这个模型是由字节跳动和中国科学技术大学合作研究的，于2023年11月24日上传至arXiv

在此研究中，作者团队提出DocPedia，一个统一的高分辨率多模态文档大模型DocPedia。

突破分辨率极限：字节联合中科大揭示多模态文档大模型

在此研究中，作者用一种新的方式解决了现有模型不能解析高分辨文档图像的短板。

DocPedia分辨率可达2560×2560，而目前业内先进多模态大模型如LLaVA、MiniGPT-4等处理图像分辨率上限为336×336，无法解析高分辨率的文档图像。

那么，这款模型究竟表现如何，又使用了怎样的优化方式呢？

各项测评成绩显着提升

在这篇论文中，作者展示了DocPedia高分辨图文理解的示例。可以观察到DocPedia有能力理解指令内容，并从高分辨率的文档图像和自然场景图像中准确地提取相关的图文信息

比如这组图中，DocPedia轻松从图片中挖掘出了车牌号、电脑配置等文本信息，甚至手写文字也能准确判断。

突破分辨率极限：字节联合中科大揭示多模态文档大模型

结合图像中的文本信息，DocPedia还可以利用大模型推理能力，根据上下文分析问题。

突破分辨率极限：字节联合中科大揭示多模态文档大模型

DocPedia在读取完图片信息后，还会根据其丰富的世界知识库，回答图像中未展示的扩展内容

突破分辨率极限：字节联合中科大揭示多模态文档大模型

下表定量对比了现有的一些多模态大模型和DocPedia的关键信息抽取（KIE）和视觉问答（VQA）能力。

通过提升分辨率和采用有效的训练方法，我们可以看到DocPedia在各项测试基准上都取得了显着的提升

突破分辨率极限：字节联合中科大揭示多模态文档大模型

那么，DocPedia是如何实现这样的效果的呢呢？

从频域出发解决分辨率问题

DocPedia的训练分为两个阶段：预训练和微调。为了训练DocPedia，作者团队收集了包含各类文档的大量图文数据，并构建指令微调数据集。

在预训练阶段，大型语言模型将被冻结，而只优化视觉编码器的部分，以使其输出的token表征空间与大型语言模型保持一致

在这个阶段，作者团队提出主要训练DocPedia的感知能力，包括对文字和自然场景的感知

预训练任务包括文字检测、文字识别、端到端OCR、段落阅读、全文阅读，以及图像文字说明。

在微调阶段，大型语言模型解除冻结，进行端到端整体优化

作者团队提出了感知-理解联合训练策略：在原有的低阶感知任务基础上，增加了文档理解和场景图像两种高阶的偏语义理解任务

这样一种感知-理解联合训练策略，进一步提高了DocPedia的性能。

突破分辨率极限：字节联合中科大揭示多模态文档大模型

在分辨率问题的策略上，与现有方法不同，DocPedia从频域的角度出发去解决。

在处理高分辨率文档图像时，DocPedia会首先提取其DCT系数矩阵。这个矩阵可以在不损失原图像的图文信息的情况下，将其空间分辨率下采样8倍

经过这一步骤后，我们会使用级联的频域适配器（Frequency Adapter）将输入信号传递给视觉编码器（Vision Encoder），以进行更深层次的分辨率压缩和特征提取

通过此方法，一张2560×2560的图像，其图文信息可以用1600个token表示。

该方法相较于直接将原始图像输入到视觉编码器（如Swin Transformer）中，token数量减少4倍。

最后，这些token与指令转换而来的token进行序列维度拼接，输入到大模型进行回答。

突破分辨率极限：字节联合中科大揭示多模态文档大模型

消融实验的结果显示，提高分辨率和进行感知-理解联合微调是提升DocPedia性能的两个重要因素

下图对比了DocPedia对于一张论文图像以及同一个指令，在不同输入尺度下的回答。可以看到，当且仅当分辨率提升至2560×2560时，DocPedia回答正确。

突破分辨率极限：字节联合中科大揭示多模态文档大模型

下图则对比了DocPedia对于同一张场景文字图像以及同一个指令，在不同微调策略下模型的回答。

通过这个例子可以看出，经过感知-理解联合微调的模型，能够准确地进行文字识别和语义问答

突破分辨率极限：字节联合中科大揭示多模态文档大模型

请点击以下链接查看论文：https://arxiv.org/abs/2311.11810

以上是突破分辨率极限：字节联合中科大揭示多模态文档大模型的详细内容。更多信息请关注PHP中文网其他相关文章！

本站声明

本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn

热AI工具

热工具

热门话题

gmail邮箱登陆入口在哪里

7467

CakePHP 教程

1376

steam的账户名称是什么格式

win11激活密钥永久

NYT连接提示和答案

显示更多

Related knowledge

使用ddrescue在Linux上恢复数据 Mar 20, 2024 pm 01:37 PM

DDREASE是一种用于从文件或块设备(如硬盘、SSD、RAM磁盘、CD、DVD和USB存储设备)恢复数据的工具。它将数据从一个块设备复制到另一个块设备，留下损坏的数据块，只移动好的数据块。ddreasue是一种强大的恢复工具，完全自动化，因为它在恢复操作期间不需要任何干扰。此外，由于有了ddasue地图文件，它可以随时停止和恢复。DDREASE的其他主要功能如下：它不会覆盖恢复的数据，但会在迭代恢复的情况下填补空白。但是，如果指示工具显式执行此操作，则可以将其截断。将数据从多个文件或块恢复到单

开源！超越ZoeDepth！ DepthFM：快速且精确的单目深度估计！ Apr 03, 2024 pm 12:04 PM

0.这篇文章干了啥？提出了DepthFM：一个多功能且快速的最先进的生成式单目深度估计模型。除了传统的深度估计任务外，DepthFM还展示了在深度修复等下游任务中的最先进能力。DepthFM效率高，可以在少数推理步骤内合成深度图。下面一起来阅读一下这项工作~1.论文信息标题：DepthFM:FastMonocularDepthEstimationwithFlowMatching作者：MingGui,JohannesS.Fischer,UlrichPrestel,PingchuanMa,Dmytr

你好，电动Atlas！波士顿动力机器人复活，180度诡异动作吓坏马斯克 Apr 18, 2024 pm 07:58 PM

波士顿动力Atlas，正式进入电动机器人时代！昨天，液压Atlas刚刚「含泪」退出历史舞台，今天波士顿动力就宣布：电动Atlas上岗。看来，在商用人形机器人领域，波士顿动力是下定决心要和特斯拉硬刚一把了。新视频放出后，短短十几小时内，就已经有一百多万观看。旧人离去，新角色登场，这是历史的必然。毫无疑问，今年是人形机器人的爆发年。网友锐评：机器人的进步，让今年看起来像人类的开幕式动作、自由度远超人类，但这真不是恐怖片？视频一开始，Atlas平静地躺在地上，看起来应该是仰面朝天。接下来，让人惊掉下巴

谷歌狂喜：JAX性能超越Pytorch、TensorFlow！或成GPU推理训练最快选择 Apr 01, 2024 pm 07:46 PM

谷歌力推的JAX在最近的基准测试中性能已经超过Pytorch和TensorFlow，7项指标排名第一。而且测试并不是在JAX性能表现最好的TPU上完成的。虽然现在在开发者中，Pytorch依然比Tensorflow更受欢迎。但未来，也许有更多的大模型会基于JAX平台进行训练和运行。模型最近，Keras团队为三个后端（TensorFlow、JAX、PyTorch）与原生PyTorch实现以及搭配TensorFlow的Keras2进行了基准测试。首先，他们为生成式和非生成式人工智能任务选择了一组主流

iPhone上的蜂窝数据互联网速度慢：修复 May 03, 2024 pm 09:01 PM

在iPhone上面临滞后，缓慢的移动数据连接？通常，手机上蜂窝互联网的强度取决于几个因素，例如区域、蜂窝网络类型、漫游类型等。您可以采取一些措施来获得更快、更可靠的蜂窝互联网连接。修复1–强制重启iPhone有时，强制重启设备只会重置许多内容，包括蜂窝网络连接。步骤1–只需按一次音量调高键并松开即可。接下来，按降低音量键并再次释放它。步骤2–该过程的下一部分是按住右侧的按钮。让iPhone完成重启。启用蜂窝数据并检查网络速度。再次检查修复2–更改数据模式虽然5G提供了更好的网络速度，但在信号较弱

快手版Sora「可灵」开放测试：生成超120s视频，更懂物理，复杂运动也能精准建模 Jun 11, 2024 am 09:51 AM

什么？疯狂动物城被国产AI搬进现实了？与视频一同曝光的，是一款名为「可灵」全新国产视频生成大模型。Sora利用了相似的技术路线，结合多项自研技术创新，生产的视频不仅运动幅度大且合理，还能模拟物理世界特性，具备强大的概念组合能力和想象力。数据上看，可灵支持生成长达2分钟的30fps的超长视频，分辨率高达1080p，且支持多种宽高比。另外再划个重点，可灵不是实验室放出的Demo或者视频结果演示，而是短视频领域头部玩家快手推出的产品级应用。而且主打一个务实，不开空头支票、发布即上线，可灵大模型已在快影

超级智能体生命力觉醒！可自我更新的AI来了，妈妈再也不用担心数据瓶颈难题 Apr 29, 2024 pm 06:55 PM

哭死啊，全球狂炼大模型，一互联网的数据不够用，根本不够用。训练模型搞得跟《饥饿游戏》似的，全球AI研究者，都在苦恼怎么才能喂饱这群数据大胃王。尤其在多模态任务中，这一问题尤为突出。一筹莫展之际，来自人大系的初创团队，用自家的新模型，率先在国内把“模型生成数据自己喂自己”变成了现实。而且还是理解侧和生成侧双管齐下，两侧都能生成高质量、多模态的新数据，对模型本身进行数据反哺。模型是啥？中关村论坛上刚刚露面的多模态大模型Awaker1.0。团队是谁？智子引擎。由人大高瓴人工智能学院博士生高一钊创立，高

美国空军高调展示首个AI战斗机！部长亲自试驾全程未干预，10万行代码试飞21次 May 07, 2024 pm 05:00 PM

最近，军事圈被这个消息刷屏了：美军的战斗机，已经能由AI完成全自动空战了。是的，就在最近，美军的AI战斗机首次公开，揭开了神秘面纱。这架战斗机的全名是可变稳定性飞行模拟器测试飞机（VISTA），由美空军部长亲自搭乘，模拟了一对一的空战。5月2日，美国空军部长FrankKendall在Edwards空军基地驾驶X-62AVISTA升空注意，在一小时的飞行中，所有飞行动作都由AI自主完成！Kendall表示——在过去的几十年中，我们一直在思考自主空对空作战的无限潜力，但它始终显得遥不可及。然而如今，

See all articles

突破分辨率极限：字节联合中科大揭示多模态文档大模型

各项测评成绩显着提升

从频域出发解决分辨率问题

热AI工具

Undresser.AI Undress

AI Clothes Remover

Undress AI Tool

Clothoff.io

AI Hentai Generator

热门文章

热工具

记事本++7.3.1

SublimeText3汉化版

禅工作室 13.0.1

Dreamweaver CS6

SublimeText3 Mac版

热门话题