mongodb - spark集群中每个节点都有一个独立数据库，可以实现分布式统计计算吗？

Question

我将spark搭建在两台机器上，其中一台即是master又是slave，另一台是slave，两台机器上均装有独立的mongodb数据库。我的主程序让它们统计自身数据库的内容，然后将结果汇总到一台服务器上的数据库里。目前代码是...

PHP中文网 · Answer

Posez et répondez à vos propres questions. La raison peut être la suivante :

val mongoRDD = sc.newAPIHadoopRDD(config, classOf[com.mongodb.hadoop.MongoInputFormat], classOf[Object], classOf[BSONObject])

Cette ligne de code signifie que le pilote lit la base de données puis charge les données qualifiées dans le RDD Puisque le paramètre précédent devait utiliser 127.0.0.1 comme entrée, c'est-à-dire que les données sont lues à partir du mongodb du pilote. Puisque le driver est sur le maître, les données lues sont naturellement les données sur le maître.