UDF

UDAF

UDTF

首頁

資料庫

mysql教程

Hive自定义函数

WBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWB

Jun 07, 2016 pm 03:28 PM

hive 內建函數提供自訂

当Hive提供的内置函数无法满足你的业务处理需要时，此时就可以考虑使用用户自定义函数（UDF：user-defined function）。 Hive目前只支持用java语言书写自定义函数。如果需要采用其他语言，比如Python，可以考虑上一节提到的transform语法来实现。 Hive支持三

当Hive提供的内置函数无法满足你的业务处理需要时，此时就可以考虑使用用户自定义函数（UDF：user-defined function）。

Hive目前只支持用java语言书写自定义函数。如果需要采用其他语言，比如Python，可以考虑上一节提到的transform语法来实现。

Hive支持三种自定义函数，我们逐个讲解。

UDF

这是普通的用户自定义函数。接受单行输入，并产生单行输出。

编写java代码如下：

package com.oserp.hiveudf;

import org.apache.hadoop.hive.ql.exec.UDF;

import org.apache.hadoop.io.Text;

public classPassExam extendsUDF {

publicText evaluate(Integer score)

{

Text result = new Text();

if(score

result.set("Failed");

else

result.set("Pass");

return result;

}

然后，打包成.jar文件，比如hiveudf.jar。

执行以下语句：

add jar /home/user/hadoop_jar/hiveudf.jar;

create temporary function pass_scorecom.oserp.hiveudf.PassExam;

select stuNo,pass_score(score) from student;

输出结果为：

N0101 Pass

N0102 Failed

N0201 Pass

N0103 Pass

N0302 Pass

N0202 Pass

N0203 Pass

N0301 Failed

N0306 Pass

第一个语句注册jar文件；第二个语句为自定义函数取别名；第三个语句调用自定义函数。

Java代码中，自定义函数的类继承自UDF类，且提供了一个evaluate方法。这个方法接受一个整数值作为参数，并返回字符串。结构十分明了。其中的evaluate方法并没有作为interface提供，因为实际使用时，函数的参数个数及类型是多变的。

以上UDF名称是不区分大小写的，比如调用时写成PASS_SCORE也是可以的（因为它是hive中的别名，不是java类名）。

使用完成后，可调用以下语句删除函数别名：

Drop temporary function pass_score;

UDAF

用户定义聚集函数（User-defined aggregate function）。接受多行输入，并产生单行输出。比如MAX，COUNT函数。

编写以下Java代码：

packagecom.oserp.hiveudf;

importorg.apache.hadoop.hive.ql.exec.UDAF;

importorg.apache.hadoop.hive.ql.exec.UDAFEvaluator;

importorg.apache.hadoop.hive.serde2.io.DoubleWritable;

importorg.apache.hadoop.io.IntWritable;

publicclass HiveAvgextends UDAF {

public staticclass AvgEvaluate implements UDAFEvaluator

{

public staticclass PartialResult

{

public intcount;

public doubletotal;

public PartialResult()

{

count = 0;

total = 0;

}

private PartialResultpartialResult;

@Override

public voidinit() {

partialResult = new PartialResult();

}

public booleaniterate(IntWritable value)

{

// 此处一定要判断partialResult是否为空，否则会报错

// 原因就是init函数只会被调用一遍，不会为每个部分聚集操作去做初始化

//此处如果不加判断就会出错

if (partialResult==null)

{

partialResult =new PartialResult();

}

if (value !=null)

{

partialResult.total =partialResult.total +value.get();

partialResult.count=partialResult.count + 1;

}

return true;

}

public PartialResult terminatePartial()

{

returnpartialResult;

}

public booleanmerge(PartialResult other)

{

partialResult.total=partialResult.total + other.total;

partialResult.count=partialResult.count + other.count;

return true;

}

public DoubleWritable terminate()

{

return newDoubleWritable(partialResult.total /partialResult.count);

}

然后打包成jar文件，比如hiveudf.jar。

执行以下语句：

add jar/home/user/hadoop_jar/hiveudf.jar;

create temporary function avg_udf as'com.oserp.hiveudf.HiveAvg';

select classNo, avg_udf(score) from studentgroup by classNo;

输出结果如下：

C01 68.66666666666667

C02 80.66666666666667

C03 73.33333333333333

参照以上图示（来自Hadoop权威教程）我们来看看各个函数：

l Init在类似于构造函数，用于UDF的初始化。

注意上图中红色框中的init函数。在实际运行中，无论hive将记录集划分了多少个部分去做（比如上图中的file1和file2两个部分），init函数仅被调用一次。所以上图中的示例是有歧义的。这也是为什么上面的代码中加了特别的注释来说明。或者换一句话说，init函数中不应该用于初始化部分聚集值相关的逻辑，而应该处理全局的一些数据逻辑。

l Iterate函数用于聚合。当每一个新的值被聚合时，此函数被调用。

l TerminatePartial函数在部分聚合完成后被调用。当hive希望得到部分记录的聚合结果时，此函数被调用。

l Merge函数用于合并先前得到的部分聚合结果（也可以理解为分块记录的聚合结果）。

l Terminate返回最终的聚合结果。

我们可以看出merge的输入参数类型和terminatePartial函数的返回值类型必须是一致的。

UDTF

用户定义表生成函数（User-defined table-generating function）。接受单行输入，并产生多行输出（即一个表）。不是特别常用，此处不详述。

本網站聲明

本文內容由網友自願投稿，版權歸原作者所有。本站不承擔相應的法律責任。如發現涉嫌抄襲或侵權的內容，請聯絡admin@php.cn

熱AI工具

熱工具

熱門話題

Java教學

1666

CakePHP 教程

1425

Laravel 教程

1327

PHP教程

1273

C# 教程

1252

Related knowledge

golang函數動態建立新函數的技巧 Apr 25, 2024 pm 02:39 PM

Go語言提供了兩種動態函數創建技術：closures和反射。 closures允許存取閉包作用域內的變量，而反射可使用FuncOf函數建立新函數。這些技術在自訂HTTP路由器、實現高度可自訂的系統和建置可插拔的元件方面非常有用。

C++ 函數命名中參數順序的考慮 Apr 24, 2024 pm 04:21 PM

在C++函數命名中，考慮參數順序至關重要，可提高可讀性、減少錯誤並促進重構。常見的參數順序約定包括：動作-物件、物件-動作、語意意義和遵循標準函式庫。最佳順序取決於函數目的、參數類型、潛在混淆和語言慣例。

excel函數公式大全 May 07, 2024 pm 12:04 PM

1. SUM函數，用於對一列或一組單元格中的數字進行求和，例如：=SUM(A1:J10)。 2、AVERAGE函數，用於計算一列或一組儲存格中的數字的平均值，例如：=AVERAGE(A1:A10)。 3.COUNT函數，用於計算一列或一組單元格中的數字或文字的數量，例如：=COUNT(A1:A10)4、IF函數，用於根據指定的條件進行邏輯判斷，並返回相應的結果。

C++ 函式預設參數與可變參數的優缺點比較 Apr 21, 2024 am 10:21 AM

C++函數中預設參數的優點包括簡化呼叫、增強可讀性、避免錯誤。缺點是限制靈活性、命名限制。可變參數的優點包括無限彈性、動態綁定。缺點包括複雜性更高、隱式型別轉換、除錯困難。

C++ 函式回傳參考型別有什麼好處？ Apr 20, 2024 pm 09:12 PM

C++中的函數傳回參考類型的好處包括：效能提升：引用傳遞避免了物件複製，從而節省了記憶體和時間。直接修改：呼叫方可以直接修改傳回的參考對象，而無需重新賦值。程式碼簡潔：引用傳遞簡化了程式碼，無需額外的賦值操作。

如何在Java中寫出高效和可維護的函數？ Apr 24, 2024 am 11:33 AM

編寫高效且可維護的Java函數的關鍵在於：保持簡潔。使用有意義的命名。處理特殊情況。使用適當的可見性。

自訂 PHP 函數和預定義函數之間有什麼區別？ Apr 22, 2024 pm 02:21 PM

自訂PHP函數與預定義函數的差異在於：作用域：自訂函數僅限於其定義範圍，而預定義函數可在整個腳本中存取。定義方式：自訂函數使用function關鍵字定義，而預先定義函數則由PHP核心定義。參數傳遞：自訂函數接收參數，而預先定義函數可能不需要參數。擴充性：自訂函數可以根據需要創建，而預定義函數是內建的且無法修改。

C++ 函式異常進階：客製化錯誤處理 May 01, 2024 pm 06:39 PM

C++中的異常處理可透過自訂異常類別增強，提供特定錯誤訊息、上下文資訊以及根據錯誤類型執行自訂操作。定義繼承自std::exception的異常類，提供特定的錯誤訊息。使用throw關鍵字拋出自訂異常。在try-catch區塊中使用dynamic_cast將捕獲到的異常轉換為自訂異常類型。在實戰案例中，open_file函數會拋出FileNotFoundException異常，捕捉並處理該異常可提供更具體的錯誤訊息。

See all articles

Hive自定义函数

UDF

UDAF

UDTF

熱AI工具

Undresser.AI Undress

AI Clothes Remover

Undress AI Tool

Clothoff.io

Video Face Swap

熱門文章

熱工具

記事本++7.3.1

SublimeText3漢化版

禪工作室 13.0.1

Dreamweaver CS6

SublimeText3 Mac版

熱門話題