Spark DataFrame에서 그룹당 상위 N개 항목을 가져오는 방법은 무엇입니까?-MySQL 튜토리얼-php.cn

Spark DataFrame GroupBy를 사용하여 그룹당 상위 N개 항목 가져오기

Scala 솔루션

대체 옵션

집

데이터 베이스

MySQL 튜토리얼

Spark DataFrame에서 그룹당 상위 N개 항목을 가져오는 방법은 무엇입니까?

Linda Hamilton

Dec 23, 2024 am 01:57 AM

How to Get the Top N Items per Group in a Spark DataFrame?

Spark DataFrame GroupBy를 사용하여 그룹당 상위 N개 항목 가져오기

Spark DataFrame 작업에서 특정 열을 기준으로 데이터를 그룹화하고 상위 N개를 검색해야 할 수도 있습니다. 각 그룹 내의 항목. 이 문서에서는 Python 예제에서 영감을 받아 Scala를 사용하여 이를 달성하는 방법을 보여줍니다.

제공된 DataFrame을 고려하세요.

user1 item1 rating1
user1 item2 rating2
user1 item3 rating3
user2 item1 rating4
...

로그인 후 복사

Scala 솔루션

상위 N개 항목을 검색하려면 각 사용자 그룹에 대해 orderBy 및 where 작업과 함께 창 기능을 활용할 수 있습니다. 구현은 다음과 같습니다.

// Import required functions and classes
import org.apache.spark.sql.expressions.Window
import org.apache.spark.sql.functions.{rank, desc}

// Specify the number of desired top N items
val n: Int = ???

// Define the window definition for ranking
val w = Window.partitionBy($"user").orderBy(desc("rating"))

// Calculate the rank within each group using the rank function
val rankedDF = df.withColumn("rank", rank.over(w))

// Filter the DataFrame to select only the top N items
val topNDF = rankedDF.where($"rank" <= n)

로그인 후 복사

대체 옵션

동률이 문제가 되지 않으면 순위를 row_number로 대체할 수 있습니다.

val topNDF = rankedDF.withColumn("row_num", row_number.over(w)).where($"row_num" <= n)

로그인 후 복사

이 접근 방식을 사용하면 DataFrame에서 각 사용자 그룹의 상위 N개 항목을 효율적으로 검색할 수 있습니다.

위 내용은 Spark DataFrame에서 그룹당 상위 N개 항목을 가져오는 방법은 무엇입니까?의 상세 내용입니다. 자세한 내용은 PHP 중국어 웹사이트의 기타 관련 기사를 참조하세요!

본 웹사이트의 성명

본 글의 내용은 네티즌들의 자발적인 기여로 작성되었으며, 저작권은 원저작자에게 있습니다. 본 사이트는 이에 상응하는 법적 책임을 지지 않습니다. 표절이나 침해가 의심되는 콘텐츠를 발견한 경우 admin@php.cn으로 문의하세요.

핫 AI 도구

뜨거운 도구

뜨거운 주제

Gmail 이메일의 로그인 입구는 어디에 있나요?

7315

자바 튜토리얼

1625

Cakephp 튜토리얼

1348

라라벨 튜토리얼

1261

PHP 튜토리얼

1207

Related knowledge

Docker에서 MySQL 메모리 사용을 줄입니다 Mar 04, 2025 pm 03:52 PM

Docker에서 MySQL 메모리 사용을 줄입니다

Alter Table 문을 사용하여 MySQL에서 테이블을 어떻게 변경합니까? Mar 19, 2025 pm 03:51 PM

Alter Table 문을 사용하여 MySQL에서 테이블을 어떻게 변경합니까?

MySQL의 문제를 해결하는 방법 공유 라이브러리를 열 수 없습니다. Mar 04, 2025 pm 04:01 PM

MySQL의 문제를 해결하는 방법 공유 라이브러리를 열 수 없습니다.

Linux에서 MySQL을 실행합니다 (Phpmyadmin이있는 Podman 컨테이너가 포함되지 않음) Mar 04, 2025 pm 03:54 PM

Linux에서 MySQL을 실행합니다 (Phpmyadmin이있는 Podman 컨테이너가 포함되지 않음)

sqlite 란 무엇입니까? 포괄적 인 개요 Mar 04, 2025 pm 03:55 PM

sqlite 란 무엇입니까? 포괄적 인 개요

MacOS에서 여러 MySQL 버전을 실행 : 단계별 가이드 Mar 04, 2025 pm 03:49 PM

MacOS에서 여러 MySQL 버전을 실행 : 단계별 가이드

MySQL 연결에 대한 SSL/TLS 암호화를 어떻게 구성합니까? Mar 18, 2025 pm 12:01 PM

MySQL 연결에 대한 SSL/TLS 암호화를 어떻게 구성합니까?

인기있는 MySQL GUI 도구는 무엇입니까 (예 : MySQL Workbench, Phpmyadmin)? Mar 21, 2025 pm 06:28 PM

인기있는 MySQL GUI 도구는 무엇입니까 (예 : MySQL Workbench, Phpmyadmin)?

See all articles

Spark DataFrame에서 그룹당 상위 N개 항목을 가져오는 방법은 무엇입니까?

Spark DataFrame GroupBy를 사용하여 그룹당 상위 N개 항목 가져오기

Scala 솔루션

대체 옵션

핫 AI 도구

Undresser.AI Undress

AI Clothes Remover

Undress AI Tool

Clothoff.io

AI Hentai Generator

인기 기사

뜨거운 도구

메모장++7.3.1

SublimeText3 중국어 버전

스튜디오 13.0.1 보내기

드림위버 CS6

SublimeText3 Mac 버전

뜨거운 주제