当前位置：首页 > 软件库 > 大数据 > 其他 >

Astro Spark SQL

HBase 的 Spark SQL

授权协议 Apache

开发语言 Java

所属分类大数据、其他

软件类型开源软件

地区不详

投递者华泳

操作系统跨平台

开源组织华为

适用人群未知

软件官网

软件文档

官方下载

软件概览

华为2015年7月20日在O'Reilly Open Source Convention (OSCON) 上宣布Spark SQL on HBase package正式开源。Spark SQL on HBase package 项目又名 Astro，端到端整合了 Spark，Spark SQL和HBase的能力，有助于推动帮助Spark进入NoSQL的广泛客户群，并提供强大的在线查询和分析以及在垂直企业大规模数据处理能力。

Apache HBase 是数据在 HDFS 上的 Key-Value 存储。它用来给 Google 的 Big Table 建模，并提供了 API 用于查询数据。这些数据通过它的“row keys”来组织、区分和发布。在每个分区上，数据被指定的“列”数据集合“列族”物理分区。这些数据模型是宽且零散的，在这些表中列是动态的，零散的。

尽管 HBase 是非常有用的大数据存储，但是它的访问机制非常原始，只能通过客户端的 API，Map/Reduce 接口和交互的 shell。SQL 访问 HBase 数据可通过 Map/Reduce 或者接口机制，如 Apache Hive 和 Impala，或者一些“本地的” SQL 技术，如 Apache Phoenix。前者实现和使用起来通常比较便宜，它们的延迟和效率通常不如后者，并且只适用于离线分析。后者，与之相反，通常执行得更好，并且限定多个作为联机引擎。它们通常在特定的执行引擎的顶层。

当前的 Astro 1.0 依赖于 Spark 1.4.0,HBase 0.98

构建方法（要求 Maven）：

$ git clone https://github.com/HuaweiBigData/astro
$ cd astro
$ mvn -DskipTests clean install 
$ mvn clean install
$mvn -Phbase,hadoop-2.4 test  #运行测试

使用案例

HBase 的 Spark SQL Astro

Astro 详细介绍华为2015年7月20日在O'Reilly Open Source Convention (OSCON) 上宣布Spark SQL on HBase package正式开源。Spark SQL on HBase package 项目又名 Astro，端到端整合了 Spark，Spark SQL和HBase的能力，有助于推动帮助Spark进入NoSQL的广泛客户群，并提供强大的
Spark,Hive,HBase相互结合--数据读取和计算的几种方式

Spark与Hive可以相互结合，同时Spark也可以使用DataFrame读取HBase里的数据，Hive也同样可以直接读取HBase的数据。只不过在Spark和Hive读取HBase数据的时候，需要做列簇或列映射，对于列不确定的需要列簇映射。几种数据读取和分析思路 Hive on HBase做好表映射，然后使用Tez替换MR引擎，使用Hive做数据分析这是最基本的一种方式，对于上层的数据分
Spark操作Hbase

Spark 下操作 HBase（1.0.0 新 API） HBase经过七年发展，终于在今年2月底，发布了 1.0.0 版本。这个版本提供了一些让人激动的功能，并且，在不牺牲稳定性的前提下，引入了新的API。虽然 1.0.0 兼容旧版本的 API，不过还是应该尽早地来熟悉下新版API。并且了解下如何与当下正红的 Spark 结合，进行数据的写入与读取。鉴于国内外有关 HBase 1.0.0 新 A
Spark 下操作 HBase

Spark 下操作 HBase（1.0.0 新 API） Hbase经过七年发展，终于在今年2月底，发布了 1.0.0 版本。这个版本提供了一些让人激动的功能，并且，在不牺牲稳定性的前提下，引入了新的API。虽然 1.0.0 兼容旧版本的 API，不过还是应该尽早地来熟悉下新版API。并且了解下如何与当下正红的 Spark 结合，进行数据的写入与读取。鉴于国内外有关 HBase 1.0.0 新 A
Spark 下操作 HBase（1.0.0 新 API）

HBase经过七年发展，终于在今年2月底，发布了 1.0.0 版本。这个版本提供了一些让人激动的功能，并且，在不牺牲稳定性的前提下，引入了新的API。虽然 1.0.0 兼容旧版本的 API，不过还是应该尽早地来熟悉下新版API。并且了解下如何与当下正红的 Spark 结合，进行数据的写入与读取。鉴于国内外有关 HBase 1.0.0 新 API 的资料甚少，故作此文。本文将分两部分介绍，第一部分
Astro —— 华为开源的 SparkSQL on HBase

华为2015年7月20日在O'Reilly Open Source Convention (OSCON) 上宣布Spark SQL on HBase package正式开源。Spark SQL on HBase package 项目又名 Astro，端到端整合了Spark，Spark SQL和HBase的能力，有助于推动帮助Spark进入NoSQL的广泛客户群，并提供强大的在线查询和分析以及在垂直

Astro Spark SQL

同类工具

相关阅读

相关文章

相关问答

相关文档