Spark DataFrame 内の各グループの最初の行を効率的に選択するにはどうすればよいですか?-mysql チュートリアル-php.cn

Spark DataFrame 内の各グループの最初の行を効率的に選択するにはどうすればよいですか?

Susan Sarandon

リリース： 2025-01-23 13:06:10

オリジナル

355 人が閲覧しました

How to Efficiently Select the First Row of Each Group in a Spark DataFrame?

Spark DataFrame で各グループの最初の行を効率的に選択するにはどうすればよいですか?

Hour、Category、および TotalValue 列を含む DataFrame が与えられた場合、タスクは各グループの最初の行を選択することです。ここで、各グループは時間とカテゴリの一意の組み合わせによって定義されます。

ウィンドウ関数を使用する

<code>import org.apache.spark.sql.functions._
import org.apache.spark.sql.expressions.Window

val w = Window.partitionBy($"Hour").orderBy($"TotalValue".desc)

val dfTop = df.withColumn("rn", row_number.over(w)).where($"rn" === 1).drop("rn")</code>

ログイン後にコピー

集計後に単純な SQL を使用して結合

<code>val dfMax = df.groupBy($"Hour").agg(max($"TotalValue").as("max_value"))

val dfTopByJoin = df.join(dfMax, ($"Hour" === dfMax("Hour")) && ($"TotalValue" === dfMax("max_value"))).drop(dfMax("Hour")).drop(dfMax("max_value"))</code>

ログイン後にコピー

構造的並べ替えを使用する

<code>val dfTop = df.select($"Hour", struct($"TotalValue", $"Category").alias("vs"))
  .groupBy($"Hour")
  .agg(max("vs").alias("vs"))
  .select($"Hour", $"vs.Category", $"vs.TotalValue")</code>

ログイン後にコピー

DataSet API を使用する (Spark 1.6、2.0)

<code>import org.apache.spark.sql.Encoder
import org.apache.spark.sql.expressions.Aggregator

case class Record(Hour: Integer, Category: String, TotalValue: Double)

def firstOfHour[T: Encoder : Aggregator]: TypedColumn[Record, Record] = {
  aggregator[Record, (Option[Record], Long)](Record(Hour = 0, Category = null, TotalValue = 0.0)) { (buffer, record) =>
    if (record.Hour > buffer._2) buffer else (Some(record), record.Hour)
  } { (buffer1, buffer2) =>
    if (buffer1._2 > buffer2._2) buffer1 else buffer2
  } { x =>
    x._1 match {
      case Some(r) => r
      case _ => Record(Hour = 0, Category = "0", TotalValue = 0.0)
    }
  }
}

df.as[Record].groupByKey(_.Hour).agg(firstOfHour[Record]).show</code>

ログイン後にコピー

以上がSpark DataFrame 内の各グループの最初の行を効率的に選択するにはどうすればよいですか?の詳細内容です。詳細については、PHP 中国語 Web サイトの他の関連記事を参照してください。