基于Hadoop的数据仓库Hive 基础知识

- - IT瘾-bigdata

Hive是基于Hadoop的数据仓库工具，可对存储在HDFS上的文件中的数据集进行数据整理、特殊查询和分析处理，提供了类似于SQL语言的查询语言–HiveQL，可通过HQL语句实现简单的MR统计，Hive将HQL语句转换成MR任务进行执行. 数据仓库（Data Warehouse）是一个面向主题的（Subject Oriented）、集成的（Integrated）、相对稳定的（Non-Volatile）、反应历史变化（Time Variant）的数据集合，用于支持管理决策.

从数据仓库系统对比看Hive发展前景

- - 技术改变世界创新驱动中国 - 《程序员》官网

大数据时代的信息爆炸，使得分布式/并行处理变得如此重要. 无论是传统行业，还是新兴行业（特别是互联网行业），日常业务运行所产生的海量用户和服务数据都需要更大的硬件资源来处理. 需要并行处理的应用领域主要为网页搜索、广告投放和机器翻译等. 从单机应用到集群应用的过渡中，诞生了MapReduce这样的分布式框架，简化了并行程序的开发，提供了水平扩展和容错能力.

数据仓库中的SQL性能优化（Hive篇）

- - 奔跑的兔子

一个Hive查询生成多个map reduce job，一个map reduce job又有map，reduce，spill，shuffle，sort等多个阶段，所以针对hive查询的优化可以大致分为针对MR中单个步骤的优化（其中又会有细分），针对MR全局的优化，和针对整个查询（多MR job）的优化，下文会分别阐述.

Kylin：基于Hadoop的开源数据仓库OLAP分析引擎

- - 标点符

Kylin是一个开源、分布式的OLAP分析引擎，它由eBay公司开发，并且基于Hadoop提供了SQL接口和OLAP接口，能够支持TB到PB级别的数据量. OLAP即联机分析处理，它能够帮助分析人员、管理人员或执行人员从多角度快速、一致、交互地存取信息和更加深入的了解信息. OLAP的目标是满足决策支持或者满足在多维环境下特定的查询和报表需求.

基于Hadoop生态圈的数据仓库实践 —— ETL（一）

- - CSDN博客推荐文章

一、使用Sqoop抽取数据. Sqoop是一个在Hadoop与结构化数据存储（如关系数据库）之间高效传输大批量数据的工具. 它在2012年3月被成功孵化，现在已是Apache的顶级项目. Sqoop有Sqoop1和Sqoop2两代，Sqoop1最后的稳定版本是1.4.6，Sqoop2最后版本是1.99.6.

深入浅出数据仓库中SQL性能优化之Hive篇

- - 极客521 | 极客521

一个Hive查询生成多个Map Reduce Job，一个Map Reduce Job又有Map，Reduce，Spill，Shuffle，Sort等多个阶段，所以针对Hive查询的优化可以大致分为针对MR中单个步骤的优化（其中又会有细分），针对MR全局的优化，和针对整个查询（多MRJob）的优化，下文会分别阐述.

大规模Hadoop集群在腾讯数据仓库TDW的实践

- - 标点符

随着业务的快速增长，TDW的节点数也在增加，对单个大规模Hadoop集群的需求也越来越强烈. TDW需要做单个大规模集群，主要是从数据共享、计算资源共享、减轻运营负担和成本等三个方面考虑. TDW之前在多个IDC部署数十个集群，主要是根据业务分别部署，这样当一个业务需要其他业务的数据，或者需要公共数据时，就需要跨集群或者跨IDC访问数据，这样会占用IDC之间的网络带宽.

漫谈数据仓库之拉链表（原理、设计以及在Hive中的实现）

- - IT瘾-bigdata

本文将会谈一谈在数据仓库中拉链表相关的内容，包括它的原理、设计、以及在我们大数据场景下的实现方式. 先分享一下拉链表的用途、什么是拉链表. 通过一些小的使用场景来对拉链表做近一步的阐释，以及拉链表和常用的切片表的区别. 举一个具体的应用场景，来设计并实现一份拉链表，最后并通过一些例子说明如何使用我们设计的这张表（因为现在Hive的大规模使用，我们会以Hive场景下的设计为例）.

Hadoop Hive sql语法详解5--HiveQL与SQL区别

- - SQL - 编程语言 - ITeye博客

1.hive内联支持什么格式. 3.hive中empty是否为null. 4.hive是否支持插入现有表或则分区中. 5.hive是否支持INSERT INTO 表 values（）. 1、Hive不支持等值连接 . •SQL中对两表内联可以写成：. •分号是SQL语句结束标记，在HiveQL中也是，但是在HiveQL中，对分号的识别没有那么智慧，例如：.

Hadoop 归档和HIVE 如何使用har 归档文件

- - CSDN博客云计算推荐文章

但对于MapReduce 来说起不到任何作用，因为har文件就相当一个目录，仍然不能讲小文件合并到一个split中去，一个小文件一个split ，任然是低效的，这里要说一点<>对这个翻译有问题，上面说可以分配到一个split中去，但是低效的. 既然有优势自然也有劣势，这里不说它的不足之处，仅介绍如果使用har 并在hadoop中更好的使用har 文件.

基于Hadoop的数据仓库Hive 基础知识

一、概述

1-1 数据仓库概念

1-2 传统数据仓库的问题

1-3 Hive

1-4 Hive与Hadoop生态系统中其他组件的关系

1-5 Hive与传统数据库的对比

1-6 Hive的部署和应用

二、Hive系统架构

三、Hive工作原理

3-1 SQL语句转换成MapReduce作业的基本原理

四、Hive HA基本原理

五、Impala

5-1 Impala简介

5-2 Impala系统架构

5-3 Impala查询执行过程

5-4 Impala与Hive

相关 [hadoop 数据仓库 hive] 推荐：