把整个地球装进神经网络，北航团队推出全球遥感图像生成模型-人工智能-PHP中文网

覆盖全球的遥感图像生成模型

6亿参数扩散模型“复刻”地球

△MetaEarth的整体框架

团队简介

首页

科技周边

人工智能

把整个地球装进神经网络，北航团队推出全球遥感图像生成模型

PHPz

Jun 09, 2024 pm 09:56 PM

图像模型生成

北航的研究团队，用扩散模型“复刻”了一个地球？

在全球的任意位置，模型都能生成多种分辨率的遥感图像，创造出丰富多样的“平行场景”。

而且地形、气候、植被等复杂的地理特征，也全都考虑到了。

把整个地球装进神经网络，北航团队推出全球遥感图像生成模型

受Google Earth启发，北航的研究团队从俯拍视角出发，将整颗地球的卫星遥感影像“装进”了深度神经网络。

基于这样的网络，团队构建出了覆盖全球的俯视视角视觉生成模型MetaEarth。

MetaEarth拥有6亿参数，可实现多种分辨率、无界且覆盖全球任意地理位置的遥感图像生成。

把整个地球装进神经网络，北航团队推出全球遥感图像生成模型

覆盖全球的遥感图像生成模型

相比于此前的研究，构建世界范围的视觉生成基础模型更具挑战性，过程之中克服了多个难点。

模型容量是挑战，因为地球具有城市、森林、沙漠、海洋、冰川和雪地等广泛的地理特征，需要模型能够理解并表征。

即使是同一类型的人造地物，在不同的纬度、气候和文化环境下，也会表现出巨大差异，这对生成模型的容量提出了很高的要求。

MetaEarth成功解决了这一困难，实现了不同地点、地貌的高分辨率、大范围场景生成。

把整个地球装进神经网络，北航团队推出全球遥感图像生成模型

另外，实现分辨率可控的遥感图像生成，同样是一项挑战。

因为在俯拍图像成像过程中，地物特征的展现受分辨率影响很大，在不同图像分辨率下具有明显的差异，难以具备在指定分辨率（米/像素）下精准生成的能力。

而在MetaEarth生成不同分辨率的图像时，都能准确合理地呈现地物特征，而且不同分辨率之间的关联性也得到了精确对应。

把整个地球装进神经网络，北航团队推出全球遥感图像生成模型

最后是无界图像生成的挑战——与日常自然图像不同，遥感图像具有超大幅宽的特性，边长可能达到数万像素，此前的方法都难以生成连续、任意大小的无界图像。

但MetaEarth生成的连续无界场景，避开了这一缺陷，可以看到随着“镜头”的平移图像的移动十分丝滑。

把整个地球装进神经网络，北航团队推出全球遥感图像生成模型

此外，MetaEarth具有强大的泛化性能，能够以未知场景作为条件输入级联生成多分辨率图像。

例如，将GPT4-V生成的“潘多拉星球”作为初始条件输入模型，MetaEarth仍然能够生成具有合理地物分布和逼真细节的图像。

把整个地球装进神经网络，北航团队推出全球遥感图像生成模型

下游任务上的验证结果表明，MetaEarth作为一种全新的数据引擎，有望为地球观测领域各类下游任务提供虚拟环境和训练数据支持。

实验过程中，作者选择了遥感图像分类这一基础任务进行验证，结果显示，MetaEarth所生成的高质量图像的辅助下，下游任务分类精度有显著提升。

把整个地球装进神经网络，北航团队推出全球遥感图像生成模型

作者认为，MetaEarth有望为卫星等空天无人系统平台提供一个逼真的虚拟环境，并在城市规划、环境监测、灾害管理、农业优化等领域广泛应用；

除了作为数据引擎之外，MetaEarth在构建生成式世界模型方面也具有巨大潜力，为未来的研究提供新的可能。。

那么，MetaEarth究竟是如何实现的呢？

6亿参数扩散模型“复刻”地球

MetaEarth基于概率扩散模型构建，具有超过六亿的参数规模。

为支持模型训练，团队收集了一个大型遥感图像数据集，包含覆盖全球大多数地区的多个空间分辨率的图像及其地理信息（纬度、经度和分辨率）。

在本项研究中，作者提出了一种分辨率引导的自级联生成框架。

把整个地球装进神经网络，北航团队推出全球遥感图像生成模型

△MetaEarth的整体框架

在该框架下，仅用单一模型即可实现给定地理位置的多分辨率图像生成，并在每一级分辨率下创造出丰富多样的“平行场景”。

具体来说，这是一种编解码器结构的去噪网络，将低分辨率条件图像和空间分辨率编码后与去噪过程的时间步嵌入相结合，预测每个时间步的噪声，实现图像生成。

为了生成无界的任意大小图像，作者还设计了一种内存高效的滑动窗口生成方法和噪声采样策略。

该策略将生成的图像切分成重叠的图像块作为条件，通过特定的噪声采样策略，使相邻图像块的共享区域生成相似的内容，从而避免拼接缝隙。

此外，这种噪声采样策略，也使得模型能在实现任意尺寸的无界图像生成时，消耗更少的显存资源。

团队简介

本研究的作者来自北京航空航天大学的“学习、视觉与遥感实验室”（LEarning, VIsion and Remote sensing laboratory，LEVIR Lab），实验室由国家杰青史振威教授领导。

史振威教授曾经的博士生、密歇根大学博士后，现任该实验室成员的邹征夏教授，是本文的通讯作者。

论文地址：https://www.php.cn/link/31bb2feb402ac789507479daf9713b00
项目主页：https://www.php.cn/link/a0098fd07db7692267fca4f4169c9ba2

以上是把整个地球装进神经网络，北航团队推出全球遥感图像生成模型的详细内容。更多信息请关注PHP中文网其他相关文章！

本站声明

本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn

热AI工具

热工具

热门话题

Java教程

1673

CakePHP 教程

1429

Laravel 教程

1333

PHP教程

1278

C# 教程

1257

显示更多

Related knowledge

全球最强开源 MoE 模型来了，中文能力比肩 GPT-4，价格仅为 GPT-4-Turbo 的近百分之一 May 07, 2024 pm 04:13 PM

想象一下，一个人工智能模型，不仅拥有超越传统计算的能力，还能以更低的成本实现更高效的性能。这不是科幻，DeepSeek-V2[1]，全球最强开源MoE模型来了。DeepSeek-V2是一个强大的专家混合（MoE）语言模型，具有训练经济、推理高效的特点。它由236B个参数组成，其中21B个参数用于激活每个标记。与DeepSeek67B相比，DeepSeek-V2性能更强，同时节省了42.5%的训练成本，减少了93.3%的KV缓存，最大生成吞吐量提高到5.76倍。DeepSeek是一家探索通用人工智

AI颠覆数学研究！菲尔兹奖得主、华裔数学家领衔11篇顶刊论文｜陶哲轩转赞 Apr 09, 2024 am 11:52 AM

AI，的确正在改变数学。最近，一直十分关注这个议题的陶哲轩，转发了最近一期的《美国数学学会通报》（BulletinoftheAmericanMathematicalSociety）。围绕「机器会改变数学吗？」这个话题，众多数学家发表了自己的观点，全程火花四射，内容硬核，精彩纷呈。作者阵容强大，包括菲尔兹奖得主AkshayVenkatesh、华裔数学家郑乐隽、纽大计算机科学家ErnestDavis等多位业界知名学者。AI的世界已经发生了天翻地覆的变化，要知道，其中很多文章是在一年前提交的，而在这一

谷歌狂喜：JAX性能超越Pytorch、TensorFlow！或成GPU推理训练最快选择 Apr 01, 2024 pm 07:46 PM

谷歌力推的JAX在最近的基准测试中性能已经超过Pytorch和TensorFlow，7项指标排名第一。而且测试并不是在JAX性能表现最好的TPU上完成的。虽然现在在开发者中，Pytorch依然比Tensorflow更受欢迎。但未来，也许有更多的大模型会基于JAX平台进行训练和运行。模型最近，Keras团队为三个后端（TensorFlow、JAX、PyTorch）与原生PyTorch实现以及搭配TensorFlow的Keras2进行了基准测试。首先，他们为生成式和非生成式人工智能任务选择了一组主流

你好，电动Atlas！波士顿动力机器人复活，180度诡异动作吓坏马斯克 Apr 18, 2024 pm 07:58 PM

波士顿动力Atlas，正式进入电动机器人时代！昨天，液压Atlas刚刚「含泪」退出历史舞台，今天波士顿动力就宣布：电动Atlas上岗。看来，在商用人形机器人领域，波士顿动力是下定决心要和特斯拉硬刚一把了。新视频放出后，短短十几小时内，就已经有一百多万观看。旧人离去，新角色登场，这是历史的必然。毫无疑问，今年是人形机器人的爆发年。网友锐评：机器人的进步，让今年看起来像人类的开幕式动作、自由度远超人类，但这真不是恐怖片？视频一开始，Atlas平静地躺在地上，看起来应该是仰面朝天。接下来，让人惊掉下巴

替代MLP的KAN，被开源项目扩展到卷积了 Jun 01, 2024 pm 10:03 PM

本月初，来自MIT等机构的研究者提出了一种非常有潜力的MLP替代方法——KAN。KAN在准确性和可解释性方面表现优于MLP。而且它能以非常少的参数量胜过以更大参数量运行的MLP。比如，作者表示，他们用KAN以更小的网络和更高的自动化程度重现了DeepMind的结果。具体来说，DeepMind的MLP有大约300,000个参数，而KAN只有约200个参数。KAN与MLP一样具有强大的数学基础，MLP基于通用逼近定理，而KAN基于Kolmogorov-Arnold表示定理。如下图所示，KAN在边上具

DualBEV：大幅超越BEVFormer、BEVDet4D，开卷！ Mar 21, 2024 pm 05:21 PM

这篇论文探讨了在自动驾驶中，从不同视角（如透视图和鸟瞰图）准确检测物体的问题，特别是如何有效地从透视图（PV）到鸟瞰图（BEV）空间转换特征，这一转换是通过视觉转换（VT）模块实施的。现有的方法大致分为两种策略：2D到3D和3D到2D转换。2D到3D的方法通过预测深度概率来提升密集的2D特征，但深度预测的固有不确定性，尤其是在远处区域，可能会引入不准确性。而3D到2D的方法通常使用3D查询来采样2D特征，并通过Transformer学习3D和2D特征之间对应关系的注意力权重，这增加了计算和部署的

特斯拉机器人进厂打工，马斯克：手的自由度今年将达到22个！ May 06, 2024 pm 04:13 PM

特斯拉机器人Optimus最新视频出炉，已经可以在厂子里打工了。正常速度下，它分拣电池（特斯拉的4680电池）是这样的：官方还放出了20倍速下的样子——在小小的“工位”上，拣啊拣啊拣：这次放出的视频亮点之一在于Optimus在厂子里完成这项工作，是完全自主的，全程没有人为的干预。并且在Optimus的视角之下，它还可以把放歪了的电池重新捡起来放置，主打一个自动纠错：对于Optimus的手，英伟达科学家JimFan给出了高度的评价：Optimus的手是全球五指机器人里最灵巧的之一。它的手不仅有触觉

$牛津大学最新！Mickey：3D中的2D图像匹配SOTA！(CVPR\'24)$ 牛津大学最新！Mickey：3D中的2D图像匹配SOTA！(CVPR\'24) Apr 23, 2024 pm 01:20 PM

写在前面项目链接：https://nianticlabs.github.io/mickey/给定两张图片，可以通过建立图片之间的对应关系来估计它们之间的相机姿态。通常，这些对应关系是二维到二维的，而我们估计的姿态在尺度上是不确定的。一些应用，例如随时随地实现即时增强现实，需要尺度度量的姿态估计，因此它们依赖于外部的深度估计器来恢复尺度。本文提出了MicKey，这是一个关键点匹配流程，能够够预测三维相机空间中的度量对应关系。通过学习跨图像的三维坐标匹配，我们能够在没有深度测试的情况下推断出度量相对

See all articles

把整个地球装进神经网络，北航团队推出全球遥感图像生成模型

覆盖全球的遥感图像生成模型

6亿参数扩散模型“复刻”地球

△MetaEarth的整体框架

团队简介

热AI工具

Undresser.AI Undress

AI Clothes Remover

Undress AI Tool

Clothoff.io

Video Face Swap

热门文章

热工具

记事本++7.3.1

SublimeText3汉化版

禅工作室 13.0.1

Dreamweaver CS6

SublimeText3 Mac版

热门话题