無法分解 Spark 資料框中的巢狀 JSON

WBOY
發布: 2024-02-11 10:51:03
轉載
445 人瀏覽過

无法分解 Spark 数据框中的嵌套 JSON

問題內容

我是 spark 新手。我試圖展平數據框,但未能透過「爆炸」做到這一點。

原始資料框架構如下:

id|approvaljson
1|[{"approvertype":"1st line manager","status":"approved"},{"approvertype":"2nd line manager","status":"approved"}]
2|[{"approvertype":"1st line manager","status":"approved"},{"approvertype":"2nd line manager","status":"rejected"}]
登入後複製

我需要將其轉換為以下架構?

id|approvaltype|status
1|1st line manager|approved
1|2nd line manager|approved
2|1st line manager|approved
2|2nd line manager|rejected
登入後複製

我已經嘗試過

df_exploded = df.withcolumn("approvaljson", explode("approvaljson"))
登入後複製

但是我得到了錯誤:

Cannot resolve "explode(ApprovalJSON)" due to data type mismatch:
parameter 1 requires ("ARRAY" or "MAP") type, however, "ApprovalJSON"
is of "STRING" type.;
登入後複製


正確答案


首先將類似json 的字串解析為結構數組,然後使用inline 將數組分解為行和列

df1 = df.withcolumn("approvaljson", f.from_json("approvaljson", schema="array<struct<approvertype string, status string>>"))
df1 = df1.select("id", f.inline('approvaljson'))
登入後複製

結果

df1.show()

+---+----------------+--------+
| ID|    ApproverType|  Status|
+---+----------------+--------+
|  1|1st Line Manager|Approved|
|  1|2nd Line Manager|Approved|
|  2|1st Line Manager|Approved|
|  2|2nd Line Manager|Rejected|
+---+----------------+--------+
登入後複製

以上是無法分解 Spark 資料框中的巢狀 JSON的詳細內容。更多資訊請關注PHP中文網其他相關文章!

相關標籤:
來源:stackoverflow.com
本網站聲明
本文內容由網友自願投稿,版權歸原作者所有。本站不承擔相應的法律責任。如發現涉嫌抄襲或侵權的內容,請聯絡admin@php.cn
最新問題
熱門教學
更多>
最新下載
更多>
網站特效
網站源碼
網站素材
前端模板