微信搜索bigdata029 | 邀请体验:数阅–数据管理、OLAP分析与可视化平台 | 联系作者:lxw1234@qq.com | 赞助作者:赞助作者
Hive

在Hive中实现存储过程–HQL/SQL

在Hive中实现存储过程–HQL/SQL
关键字:Hive 存储过程、PL/HQL、HQL/SQL、Procedural SQL on Hadoop 目前版本的Hive中没有提供类似存储过程的功能,使用Hive做数据开发时候,一般是将一段一段的HQL语句封装在Shell或者其他脚本中,然后以命令行的方式调用,完成一个业务...

3年前 (2015-09-16) 13760℃ 13喜欢

Hive

Hive中如何快速的复制一张分区表(包括数据)

Hive中如何快速的复制一张分区表(包括数据)
关键字:Hive 复制表 Hive中有时候会遇到复制表的需求,复制表指的是复制表结构和数据。 如果是针对非分区表,那很简单,可以使用CREATE TABLE new_table AS SELECT * FROM old_table; 那么如果是分区表呢? 首先想到的办法可能是: ...

3年前 (2015-09-11) 10170℃ 22喜欢

Hadoop

合并HDFS和本地文件系统中的小文件

合并HDFS和本地文件系统中的小文件
关键字:hadoop hdfs 小文件、appendToFile、getmerge 众所周知,HDFS中过多的小文件,会给NameNode造成很大的压力,所谓的小文件,是指远远小于文件块大小的文件。 在使用HDFS的过程中,应尽量避免生成过多的小文件。 本文以TextFile为例...

3年前 (2015-09-10) 8708℃ 6喜欢

Spark

Spark1.5发布

Spark1.5发布
Apache Spark社区刚刚发布了1.5版本,大家一定想知道这个版本的主要变化,这篇文章告诉你答案。 DataFrame执行后端优化(Tungsten第一阶段) DataFrame可以说是整个Spark项目最核心的部分,在1.5这个开发周期内最大的变化就是Tungsten项目...

3年前 (2015-09-10) 3059℃ 3喜欢

数据仓库/数据库

数据仓库中历史拉链表的更新方法

数据仓库中历史拉链表的更新方法
关键字:数据仓库、极限存储、历史拉链表、更新 在之前介绍过数据仓库中的历史拉链表《数据仓库数据模型之:极限存储–历史拉链表》, 使用这种方式即可以记录历史,而且最大程度的节省存储。这里简单介绍一下这种历史拉链表的更新方法。 本文中假设: 数据仓库中订单历史表的刷新频率为一天,当...

3年前 (2015-08-27) 28014℃ 59喜欢

大数据平台

大数据环境下互联网行业数据仓库/数据平台的架构之漫谈

大数据环境下互联网行业数据仓库/数据平台的架构之漫谈
关键字:互联网、大数据、数据仓库、数据平台、架构 导读: 整体架构 数据采集 数据存储与分析 数据共享 数据应用 实时计算 任务调度与监控 元数据管理 总结 一直想整理一下这块内容,既然是漫谈,就想起什么说什么吧。我一直是在互联网行业,就以互联网行业来说。 先大概列一下互联网...

3年前 (2015-08-19) 34924℃ 121喜欢

Spark

Spark On Yarn系列文章

Spark On Yarn系列文章
Spark On Yarn:提交Spark应用程序到Yarn 在Yarn上运行spark-shell和spark-sql命令行 SparkSQL On Yarn with Hive,操作和访问Hive表   持续更新中。。。 您可以关注 我的博客,或者 加入邮件列表...

3年前 (2015-08-19) 9337℃ 11喜欢

Spark

SparkSQL On Yarn with Hive,操作和访问Hive表

SparkSQL On Yarn with Hive,操作和访问Hive表
关键字:SparkSQL on Yarn、SparkSQL Hive On Yarn 前面的文章介绍过如何向Yarn中提交Spark应用程序《Spark On Yarn:提交Spark应用程序到Yarn》, 以及在Yarn上运行spark-shell和spark-sql命令行《在...

3年前 (2015-08-19) 7895℃ 9喜欢

Hadoop

Java API 写 Hive Orc文件

Java API 写 Hive Orc文件
关键字:Hive Orc、Java API 读写Hive OrcFile 接前面的文章 《Java API 读取Hive Orc文件》,本文中介绍使用Java API写Orc格式的文件。 下面的代码将三行数据: 张三,20 李四,22 王五,30 写入HDFS上的/tmp/lxw...

3年前 (2015-08-18) 7198℃ 5喜欢

Hadoop

Java API 读取Hive Orc文件

Java API 读取Hive Orc文件
关键字:Hive Orc、Java API 读取Hive OrcFile Orc是Hive特有的一种列式存储的文件格式,它有着非常高的压缩比和读取效率,因此很快取代了之前的RCFile,成为Hive中非常常用的一种文件格式。 在实际业务场景中,可能需要使用Java API,或者M...

3年前 (2015-08-18) 7022℃ 6喜欢

编程语言

Java中ArrayList和HashMap的排序

Java中ArrayList和HashMap的排序
关键字:ArrayList排序、HashMap排序、集合排序、升序、降序、key排序、value排序 最近在需求中经常需要对Java的集合,特别是Map根据key或者value进行升序降序排序,在这里整理记录一下,对java不熟,用于以后备查。 主要使用Collections提供...

3年前 (2015-08-18) 8720℃ 2喜欢

Hive

[一起学Hive]之十八-Hive UDF开发

[一起学Hive]之十八-Hive UDF开发
关键字:Hive udf、UDF、GenericUDF Hive中,除了提供丰富的内置函数(见[一起学Hive]之二–Hive函数大全-完整版)之外,还允许用户使用Java开发自定义的UDF函数。 开发自定义UDF函数有两种方式,一个是继承org.apache.hadoop.hi...

3年前 (2015-08-17) 12167℃ 2喜欢

其他

使用SecureCRT的端口转发功能访问其他内网机器

使用SecureCRT的端口转发功能访问其他内网机器
关键字:SecureCRT 端口转发 在实际工作环境中,经常有这样的网络环境,如图所示: 机器A和机器B处于同一个内网环境,机器A有外网IP,可以供我的机器访问,但是我还想通过自己的机器访问机器B。 显然直接访问不了。比如:机器B为Hadoop的ResourceManager,...

3年前 (2015-08-11) 5800℃ 2喜欢