Spark DataFrame에서 그룹당 상위 N개 항목을 가져오는 방법은 무엇입니까?
Spark DataFrame GroupBy를 사용하여 그룹당 상위 N개 항목 가져오기
Spark DataFrame 작업에서 특정 열을 기준으로 데이터를 그룹화하고 상위 N개를 검색해야 할 수도 있습니다. 각 그룹 내의 항목. 이 문서에서는 Python 예제에서 영감을 받아 Scala를 사용하여 이를 달성하는 방법을 보여줍니다.
제공된 DataFrame을 고려하세요.
user1 item1 rating1 user1 item2 rating2 user1 item3 rating3 user2 item1 rating4 ...
Scala 솔루션
상위 N개 항목을 검색하려면 각 사용자 그룹에 대해 orderBy 및 where 작업과 함께 창 기능을 활용할 수 있습니다. 구현은 다음과 같습니다.
// Import required functions and classes import org.apache.spark.sql.expressions.Window import org.apache.spark.sql.functions.{rank, desc} // Specify the number of desired top N items val n: Int = ??? // Define the window definition for ranking val w = Window.partitionBy($"user").orderBy(desc("rating")) // Calculate the rank within each group using the rank function val rankedDF = df.withColumn("rank", rank.over(w)) // Filter the DataFrame to select only the top N items val topNDF = rankedDF.where($"rank" <= n)
대체 옵션
동률이 문제가 되지 않으면 순위를 row_number로 대체할 수 있습니다.
val topNDF = rankedDF.withColumn("row_num", row_number.over(w)).where($"row_num" <= n)
이 접근 방식을 사용하면 DataFrame에서 각 사용자 그룹의 상위 N개 항목을 효율적으로 검색할 수 있습니다.
위 내용은 Spark DataFrame에서 그룹당 상위 N개 항목을 가져오는 방법은 무엇입니까?의 상세 내용입니다. 자세한 내용은 PHP 중국어 웹사이트의 기타 관련 기사를 참조하세요!

핫 AI 도구

Undresser.AI Undress
사실적인 누드 사진을 만들기 위한 AI 기반 앱

AI Clothes Remover
사진에서 옷을 제거하는 온라인 AI 도구입니다.

Undress AI Tool
무료로 이미지를 벗다

Clothoff.io
AI 옷 제거제

AI Hentai Generator
AI Hentai를 무료로 생성하십시오.

인기 기사

뜨거운 도구

메모장++7.3.1
사용하기 쉬운 무료 코드 편집기

SublimeText3 중국어 버전
중국어 버전, 사용하기 매우 쉽습니다.

스튜디오 13.0.1 보내기
강력한 PHP 통합 개발 환경

드림위버 CS6
시각적 웹 개발 도구

SublimeText3 Mac 버전
신 수준의 코드 편집 소프트웨어(SublimeText3)

뜨거운 주제











Alter Table 문을 사용하여 MySQL에서 테이블을 어떻게 변경합니까?

MySQL의 문제를 해결하는 방법 공유 라이브러리를 열 수 없습니다.

Linux에서 MySQL을 실행합니다 (Phpmyadmin이있는 Podman 컨테이너가 포함되지 않음)

인기있는 MySQL GUI 도구는 무엇입니까 (예 : MySQL Workbench, Phpmyadmin)?
