NikitaIvanov谈GridGain的Hadoop内存片内加速技术-mysql教程-PHP中文网

关于被访问者

首页

数据库

mysql教程

NikitaIvanov谈GridGain的Hadoop内存片内加速技术

WBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWB

Jun 07, 2016 pm 04:05 PM

hadoop 内

GridGain最近在2014年的Spark峰会上发布了Hadoop内存片内加速技术，可以为Hadoop应用带来内存片内计算的相关收益。该技术包括两个单元：和Hadoop HDFS兼容的内存片内文件系统，以及为内存片内处理而优化的MapReduce实现。这两个单元对基于磁盘的HDFS和传统

GridGain最近在2014年的Spark峰会上发布了Hadoop内存片内加速技术，可以为Hadoop应用带来内存片内计算的相关收益。

该技术包括两个单元：和Hadoop HDFS兼容的内存片内文件系统，以及为内存片内处理而优化的MapReduce实现。这两个单元对基于磁盘的HDFS和传统的MapReduce进行了扩展，为大数据处理情况提供了更好的性能。

内存片内加速技术消除了在传统Hadoop架构模型中与作业追踪者（job tracker）、任务追踪者（task tracker）相关的系统开销，它可以和现有的MapReduce应用一起工作而无需改动任何原有的MapReduce、HDFS和YARN环境的代码。

下面是InfoQ对GridGain的CTO Nikita Ivanov关于Hadoop内存片内加速技术和架构细节的访谈。

InfoQ: Hadoop内存片内加速技术的关键特性在于GridGain的内存片内文件系统和内存片内MapReduce，你能描述一下这两个组件是如何协同工作的吗？

Nikita：GridGain的Hadoop内存片内加速技术是一种免费、开源和即插即用的解决方案，它提升了传统MapReduce工作（MapReduce jobs）的速度，你只需用10分钟进行下载和安装，就可以得到十几倍的性能提升，并且不需要对代码做任何改动。该产品是业界第一个基于双模、高性能内存片内文件系统，以及为内存片内处理而优化的MapReduce实现方案，这个文件系统和Hadoop的HDFS百分百的兼容。内存片内HDFS和内存片内MapReduce以易用的方式对基于磁盘的HDFS和传统的MapReduce进行了扩展，以带来显著的性能提升。

简要地说，GridGain的内存片内文件系统GGFS提供了一个高性能、分布式并与HDFS兼容的内存片内计算平台，并在此进行数据的存储，这样我们基于YARN的MapReduce实现就可以在数据存储这块利用GGFS做针对性的优化。这两个组件都是必需的，这样才能达到十几倍的性能提升（在一些边界情况下可以更高）。

InfoQ: 如何对这两种组合做一下比较，一种是内存片内HDFS和内存片内MapReduce的组合，另一种是基于磁盘的HDFS和传统的MapReduce的组合？

Nikita：GridGain的内存片内方案和传统的HDFS/MapReduce方案最大的不同在于：

在GridGain的内存片内计算平台里，数据是以分布式的方式存储在内存中。
GridGain的MapReduce实现是从底层向上优化，以充分利用数据存储在内存中这一优势，同时改善了Hadoop之前架构中的一些缺陷。在GridGain的MapReduce实现中，执行路径是从客户端应用的工作提交者（job submitter）直接到数据节点，然后完成进程内（in-process）的数据处理，数据处理是基于数据节点中的内存片内数据分区，这样就绕过了传统实现中的作业跟踪者（job tracker）、任务跟踪者（task tracker）和名字节点（name nodes）这些单元，也避免了相关的延迟。

相比而言，传统的MapReduce实现中，数据是存储在低速的磁盘上，而MapReduce实现也是基于此而做优化的。

InfoQ：你能描述一下这个在Hadoop内存片内加速技术背后的双模、高性能的内存片内文件系统是如何工作的？它与传统的文件系统又有何不同呢？

Nikita：GridGain的内存片内文件系统GGFS支持两种模式，一种模式是作为独立的Hadoop簇的主文件系统，另一种模式是和HDFS进行串联，此时GGFS作为主文件系统HDFS的智能缓存层。

作为缓存层，GGFS可以提供直接读和直接写的逻辑，这些逻辑是高度可调节的，并且用户也可以自由地选择哪些文件和目录要被缓存以及如何缓存。这两种情况下，GGFS可以作为对传统HDFS的嵌入式替代方案，或者是一种扩展，而这都会立刻带来性能的提升。

InfoQ：如何比较GridGain的内存片内MapReduce方案和其它的一些实时流解决方案，比如Storm或者Apache Spark？

Nikita：最本质的差别在于GridGain的内存片内加速技术支持即插即用这一特性。不同于Storm或者Spark（顺便说一下，两者都是伟大的项目），它们需要对你原有的Hadoop MapReduce代码进行完全的推倒重来，而GridGain不需要修改一行代码，就能得到相同甚至更高的性能优势。

InfoQ：什么情况下需要使用Hadoop内存片内加速技术呢？

Nikita：实际上当你听到“实时分析”这个词时，也就听到了Hadoop内存片内加速技术的新用例。如你所知，在传统的Hadoop中并没有实时的东西。我们在新兴的HTAP (hybrid transactional and analytical processing)中正看到一些这样的用例，比如欺诈保护，游戏中分析，算法交易，投资组合分析和优化等等。

InfoQ：你能谈谈GridGain的Visor和基于图形界面的文件系统分析工具吗，以及他们如何帮助监视和管理Hadoop工作（Hadoop jobs）的？

Nikita：GridGain的Hadoop内存片内加速是和GridGain的Visor合在一起的，Visor是一种对GridGain产品进行管理和监视的方案。Visor提供了对Hadoop内存片内加速技术的直接支持，它为HDFS兼容的文件系统提供了精细的文件管理器和HDFS分析工具，通过它你可以看到并分析和HDFS相关的各种实时性能信息。

InfoQ：后面的产品路标是怎么样的呢？

Nikita：我们会持续投资（同我们的开源社区一起）来为Hadoop相关产品技术，包括Hive、Pig和Hbase，提供性能提升方案。

Taneja Group也有相关报道（Memory is the Hidden Secret to Success with Big Data, 下载全部报告需要先注册），讨论了GridGain如何把Hadoop内存片内加速技术和已有的Hadoop簇、传统基于磁盘的有缺陷的数据库系统以及面向批处理的MapReduce技术进行集成。

关于被访问者

Nikita Ivanov是GridGain系统公司的发起人和CTO，GridGain成立于2007年，投资者包括RTP Ventures和Almaz Capital。Nikita领导GridGain开发了领先的分布式内存片内数据处理技术-领先的Java内存片内计算平台，今天在全世界每10秒它就会启动运行一次。Nikita有超过20年的软件应用开发经验，创建了HPC和中间件平台，并在一些创业公司和知名企业都做出过贡献，包括Adaptec, Visa和BEA Systems。Nikita也是使用Java技术作为服务器端开发应用的先驱者，1996年他在为欧洲大型系统做集成工作时他就进行了相关实践。

查看参考原文：Nikita Ivanov on GridGain’s In-Memory Accelerator for Hadoop

本站声明

本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn

热AI工具

Undresser.AI Undress

人工智能驱动的应用程序，用于创建逼真的裸体照片

AI Clothes Remover

用于从照片中去除衣服的在线人工智能工具。

Undress AI Tool

免费脱衣服图片

Clothoff.io

AI脱衣机

AI Hentai Generator

免费生成ai无尽的。

显示更多

热工具

记事本++7.3.1

好用且免费的代码编辑器

SublimeText3汉化版

中文版，非常好用

禅工作室 13.0.1

功能强大的PHP集成开发环境

Dreamweaver CS6

视觉化网页开发工具

SublimeText3 Mac版

神级代码编辑软件(SublimeText3)

显示更多

热门话题

gmail邮箱登陆入口在哪里

7469

CakePHP 教程

1376

steam的账户名称是什么格式

win11激活密钥永久

NYT连接提示和答案

显示更多

Related knowledge

Java错误：Hadoop错误，如何处理和避免 Jun 24, 2023 pm 01:06 PM

Java错误：Hadoop错误，如何处理和避免当使用Hadoop处理大数据时，常常会遇到一些Java异常错误，这些错误可能会影响任务的执行，导致数据处理失败。本文将介绍一些常见的Hadoop错误，并提供处理和避免这些错误的方法。Java.lang.OutOfMemoryErrorOutOfMemoryError是Java虚拟机内存不足的错误。当Hadoop任

在Beego中使用Hadoop和HBase进行大数据存储和查询 Jun 22, 2023 am 10:21 AM

随着大数据时代的到来，数据处理和存储变得越来越重要，如何高效地管理和分析大量的数据也成为企业面临的挑战。Hadoop和HBase作为Apache基金会的两个项目，为大数据存储和分析提供了一种解决方案。本文将介绍如何在Beego中使用Hadoop和HBase进行大数据存储和查询。一、Hadoop和HBase简介Hadoop是一个开源的分布式存储和计算系统，它可

如何使用PHP和Hadoop进行大数据处理 Jun 19, 2023 pm 02:24 PM

随着数据量的不断增大，传统的数据处理方式已经无法处理大数据时代带来的挑战。Hadoop是开源的分布式计算框架，它通过分布式存储和处理大量的数据，解决了单节点服务器在大数据处理中带来的性能瓶颈问题。PHP是一种脚本语言，广泛应用于Web开发，而且具有快速开发、易于维护等优点。本文将介绍如何使用PHP和Hadoop进行大数据处理。什么是HadoopHadoop是

探索Java在大数据领域的应用：Hadoop、Spark、Kafka等技术栈的了解 Dec 26, 2023 pm 02:57 PM

Java大数据技术栈：了解Java在大数据领域的应用，如Hadoop、Spark、Kafka等随着数据量不断增加，大数据技术成为了当今互联网时代的热门话题。在大数据领域，我们常常听到Hadoop、Spark、Kafka等技术的名字。这些技术起到了至关重要的作用，而Java作为一门广泛应用的编程语言，也在大数据领域发挥着巨大的作用。本文将重点介绍Java在大

linux下安装Hadoop的方法是什么 May 18, 2023 pm 08:19 PM

一：安装JDK1.执行以下命令，下载JDK1.8安装包。wget--no-check-certificatehttps://repo.huaweicloud.com/java/jdk/8u151-b12/jdk-8u151-linux-x64.tar.gz2.执行以下命令，解压下载的JDK1.8安装包。tar-zxvfjdk-8u151-linux-x64.tar.gz3.移动并重命名JDK包。mvjdk1.8.0_151//usr/java84.配置Java环境变量。echo'

利用PHP实现大规模数据处理：Hadoop、Spark、Flink等 May 11, 2023 pm 04:13 PM

随着数据量的不断增加，大规模数据处理已经成为了企业必须面对和解决的问题。传统的关系型数据库已经无法满足这种需求，而对于大规模数据的存储和分析，Hadoop、Spark、Flink等分布式计算平台成为了最佳选择。在数据处理工具的选择过程中，PHP作为一种易于开发和维护的语言，越来越受到开发者的欢迎。在本文中，我们将探讨如何利用PHP来实现大规模数据处理，以及如

PHP中的数据处理引擎(Spark, Hadoop等) Jun 23, 2023 am 09:43 AM

在当前的互联网时代，海量数据的处理是各个企业和机构都需要面对的问题。作为一种广泛应用的编程语言，PHP同样需要在数据处理方面跟上时代的步伐。为了更加高效地处理海量数据，PHP开发引入了一些大数据处理工具，如Spark和Hadoop等。Spark是一款开源的数据处理引擎，可以用于大型数据集的分布式处理。Spark的最大特点是具有快速的数据处理速度和高效的数据存

Redis与Hadoop的对比及应用场景 Jun 21, 2023 am 08:28 AM

Redis和Hadoop都是常用的分布式数据存储和处理系统。然而，两者在设计、性能、使用场景等方面存在着明显的区别。在本文中，我们将详细比较Redis和Hadoop的不同之处，并探讨它们的适用场景。Redis概述Redis是一个开源的基于内存的数据存储系统，支持多种数据结构和高效的读写操作。Redis的主要特点包括：内存存储：Redis

See all articles

NikitaIvanov谈GridGain的Hadoop内存片内加速技术

关于被访问者

热AI工具

Undresser.AI Undress

AI Clothes Remover

Undress AI Tool

Clothoff.io

AI Hentai Generator

热门文章

热工具

记事本++7.3.1

SublimeText3汉化版

禅工作室 13.0.1

Dreamweaver CS6

SublimeText3 Mac版

热门话题