您的位置：鳄鱼CMS > pitstop 运算符怎么用 Apache Pig Distinct运算符

pitstop 运算符怎么用 Apache Pig Distinct运算符

2023-05-27 11:25 ApachePig教程

pitstop 运算符怎么用

DISTINCT 运算符用于从关系中删除冗余（重复）元组。

语法

下面给出了 DISTINCT 运算符的语法。

grunt> Relation_name2 = DISTINCT Relatin_name1;

例

假设在HDFS目录 /pig_data/ 中有一个名为 student_details.txt 的文件，如下所示。

student_details.txt

001,Rajiv,Reddy,9848022337,Hyderabad
002,siddarth,Battacharya,9848022338,Kolkata 
002,siddarth,Battacharya,9848022338,Kolkata 
003,Rajesh,Khanna,9848022339,Delhi 
003,Rajesh,Khanna,9848022339,Delhi 
004,Preethi,Agarwal,9848022330,Pune 
005,Trupthi,Mohanthy,9848022336,Bhuwaneshwar
006,Archana,Mishra,9848022335,Chennai 
006,Archana,Mishra,9848022335,Chennai

通过关系 student_details 将此文件加载到Pig中，如下所示。

grunt> student_details = LOAD 'hdfs://localhost:9000/pig_data/student_details.txt' USING PigStorage(',') 
   as (id:int, firstname:chararray, lastname:chararray, phone:chararray, city:chararray);

现在，让我们使用 DISTINCT 运算符从 student_details 关系中删除冗余（重复）元组，并将其另存在一个名为 distinct_data 的关系如下所示。

grunt> distinct_data = DISTINCT student_details;

验证

使用 DUMP 运算符验证关系 distinct_data ，如下所示。

grunt> Dump distinct_data;

输出

它将产生以下输出，显示关系 distinct_data 的内容如下。

(1,Rajiv,Reddy,9848022337,Hyderabad)
(2,siddarth,Battacharya,9848022338,Kolkata) 
(3,Rajesh,Khanna,9848022339,Delhi) 
(4,Preethi,Agarwal,9848022330,Pune) 
(5,Trupthi,Mohanthy,9848022336,Bhuwaneshwar)
(6,Archana,Mishra,9848022335,Chennai)

阅读全文

以上是鳄鱼CMS为你收集整理的pitstop 运算符怎么用 Apache Pig Distinct运算符全部内容。

声明：本站所有文章资源内容，如无特殊说明或标注，均为采集网络资源。如若本站内容侵犯了原著者的合法权益，可联系本站删除。

hadoop配置环境变量 Hadoop 配置

2023-05-11 Hadoop教程

配置hadoop之前做好准备工作1.修改主机名称，我这里创建了三个虚拟主机，分别命名node-1，node-2，node-3，进入 network 文件删...
hadoopshuffle过程 Hadoop Shuffle

2023-04-18 Hadoop教程

对Map的结果进行排序并传输到Reduce进行处理 Map的结果并不是直接存放到硬盘,而是利用缓存做一些预排序处理 Map会调用Combiner，...
verilog模块例化语法 Verilog 模块例化

2023-06-02 Verilog手册

关键字：例化，generate，全加器，层次访问在一个模块中引用另一个模块，对其端口进行相关连接，叫做模块例化。模块例化建立了描...
微信小程序 icon 微信小程序内容组件标 icon

2023-03-24

icon基础库 1.0.0 开始支持，低版本需做兼容处理。图标。组件属性的长度单位默认为px，2.4.0起支持传入单位(rpx/px)。属性名类型...
verilog仿真激励文件 Verilog 仿真激励

2023-03-16 Verilog手册

关键词：testbench，仿真，文件读写Verilog代码设计完成后，还需要进行重要的步骤，即逻辑功能仿真。仿真激励文件称之为testbenc...