HBase数据读写示例程序如何编写,HBase存储原理是什么

HBase数据读写示例程序的核心操作是Put和Get,通过Java API可以快速实现数据的写入和读取,掌握这些示例代码是HBase开发的基础。

HBase数据读写示例程序:Put与Get操作详解

HBase的读写操作分别对应Put和Get两个核心类,Put负责写入数据,Get负责查询数据,下面通过具体示例展示从单行操作到批量处理的基本用法。

16_5.3.5 读写HBase数据(配置Spark并编写程序读取HBase数据)
加载中
16_5.3.5 读写HBase数据(配置Spark并编写程序读取HBase数据)

Put写入示例:从单行到批量

单行写入是最简单的模式,先构造一个Put对象,指定行键,然后通过addColumn方法添加列族、列名和值,最后调用Table的put方法提交。

Put put = new Put(Bytes.toBytes("rowKey1"));
put.addColumn(Bytes.toBytes("cf"), Bytes.toBytes("name"), Bytes.toBytes("Alice"));
put.addColumn(Bytes.toBytes("cf"), Bytes.toBytes("age"), Bytes.toBytes("30"));
table.put(put);

当需要写入多条数据时,建议使用批量写入,将多个Put对象放入List中,调用table.put(List)即可,相比逐条写入,批量写入能大幅减少网络交互次数,提升整体吞吐量参考2

List<Put> puts = new ArrayList<>();
puts.add(new Put(Bytes.toBytes("row1")).addColumn(/.../));
puts.add(new Put(Bytes.toBytes("row2")).addColumn(/.../));
table.put(puts);

在HBase Java API写入示例中,批量操作是常规推荐做法,需要注意,如果批量中某条失败,整批是否会回滚取决于配置,通常建议将一批数据控制在合理大小,避免占用过多内存。

Get读取示例:精确查询与范围扫描

精确查询使用Get对象,指定行键即可获取整行数据,也可以指定列族和列来缩小返回量。

Get get = new Get(Bytes.toBytes("rowKey1"));
get.addColumn(Bytes.toBytes("cf"), Bytes.toBytes("name"));
Result result = table.get(get);
byte[] value = result.getValue(Bytes.toBytes("cf"), Bytes.toBytes("name"));

HBase数据读写示例程序如何编写,HBase存储原理是什么

范围扫描则使用Scan对象,通过设置起始行和结束行,可以获取一个区间的多行数据,Scan还支持过滤器(如PrefixFilter、FilterList)来实现更精细的过滤。参考2

Scan scan = new Scan();
scan.setStartRow(Bytes.toBytes("row1"));
scan.setStopRow(Bytes.toBytes("row3"));
ResultScanner scanner = table.getScanner(scan);
for (Result r : scanner) {
    // 处理每一行
}
scanner.close();

扫描后必须关闭ResultScanner,否则会占用RegionServer资源,这是HBase读写操作代码示例中容易忽略的细节。

HBase存储示例:批量写入与读取优化

实际生产环境中,单条读写往往无法满足性能要求,批量写入和读取优化是HBase存储示例中最常被关注的部分,直接关系到系统吞吐量。

批量写入:提升吞吐量的关键

除了上述table.put(List)方式,还可以使用BufferedMutator,它内部维护一个写缓冲区,当缓冲区满或达到一定时间后自动批量提交,适合持续写入的场景。

BufferedMutator mutator = connection.getBufferedMutator(tableName);
mutator.mutate(put);
mutator.flush(); // 手动刷出

批量写入可以显著减少RPC调用次数,据统计,当数据量较大时,批量写入的吞吐量可能是逐条写入的5倍以上(具体数值因环境而异),但也要注意,批量大小不宜过大,否则可能触发RegionServer的写压力,导致RegionTooBusyException,建议根据Row大小和网络条件调整,一般每批1000-5000条较为常见。

读取优化:合理使用Scan缓存

Scan默认每次只从服务器拉取一行,导致大量小包交互,通过setCaching()设置缓存行数,可以一次拉取多行,减少网络往返。

scan.setCaching(500); // 一次拉取500行

缓存行数越大,查询越快,但会占用更多客户端内存。

HBase数据读写示例程序如何编写,HBase存储原理是什么

行业共识认为,对于RowKey均匀分布的场景,设置1000左右的缓存是一个平衡点,使用过滤器(如SingleColumnValueFilter、PageFilter)可以在服务端提前过滤,避免传输无用数据。参考2

HBase读写操作代码示例:Java API 实战

下面是一个完整的示例,从创建表到写入数据,再到读取和删除,涵盖HBase读写操作代码示例的主要步骤。

完整示例:从创建表到数据读写

import org.apache.hadoop.conf.Configuration;
import org.apache.hadoop.hbase.;
import org.apache.hadoop.hbase.client.;
import org.apache.hadoop.hbase.util.Bytes;
public class HBaseDemo {
    public static void main(String[] args) throws Exception {
        Configuration conf = HBaseConfiguration.create();
        conf.set("hbase.zookeeper.quorum", "localhost:2181");
        try (Connection conn = ConnectionFactory.createConnection(conf);
             Admin admin = conn.getAdmin()) {
            TableName tableName = TableName.valueOf("test_table");
            // 创建表
            if (!admin.tableExists(tableName)) {
                TableDescriptor desc = TableDescriptorBuilder.newBuilder(tableName)
                        .setColumnFamily(ColumnFamilyDescriptorBuilder.of("cf"))
                        .build();
                admin.createTable(desc);
            }
            // 写入数据
            try (Table table = conn.getTable(tableName)) {
                Put put = new Put(Bytes.toBytes("row1"));
                put.addColumn(Bytes.toBytes("cf"), Bytes.toBytes("col1"), Bytes.toBytes("value1"));
                table.put(put);
                // 读取数据
                Get get = new Get(Bytes.toBytes("row1"));
                Result result = table.get(get);
                System.out.println(Bytes.toString(result.getValue(Bytes.toBytes("cf"), Bytes.toBytes("col1"))));
            }
            // 删除表(可选)
            // admin.disableTable(tableName);
            // admin.deleteTable(tableName);
        }
    }
}

HBase数据读写示例程序如何编写,HBase存储原理是什么

代码中使用了try-with-resources自动关闭资源,这是推荐做法,Connection是重量级对象,应全局复用,不要每次操作都创建。

常见错误与调试

  • ZooKeeper连接失败:检查hbase.zookeeper.quorum配置是否正确,端口是否开放。
  • RegionTooBusyException:通常由写入超出RegionServer处理能力引起,可增大写缓冲区或增加Region数量。
  • Scan没有结果:检查StartRow和StopRow的设置,注意行键是字节数组,比较是字典序。
  • 表不存在异常:确认表名正确,且已经创建。

通过上述示例,你可以快速掌握HBase数据读写的基本方法,在实际项目中,结合批量操作、缓存优化和合理的表设计,能更好地发挥HBase在大数据场景下的存储优势。

HBase数据读写示例程序常见问题解答

问题1:HBase读写示例中如何连接HBase集群?

需要配置ZooKeeper地址,通过HBaseConfiguration创建Configuration对象,然后调用ConnectionFactory.createConnection获取连接,示例代码中已包含具体配置方式,注意Connection是线程安全的,应在整个应用生命周期内复用。

问题2:批量写入时出现RegionTooBusyException怎么办?

可以尝试增大写缓冲区大小(通过BufferedMutator的setWriteBufferSize),或增加客户端重试次数,如果问题持续,说明RegionServer写入压力过大,建议通过预分区或增加RegionServer实例来分摊负载。

问题3:使用Scan扫描时如何设置缓存?

通过Scan.setCaching(int)设置一次远程调用返回的行数,默认值1,建议根据行的大小和可用内存调整,通常设置100到2000之间,注意,扫描完成后需要调用ResultScanner.close()释放资源,否则可能导致RegionServer端连接泄漏。

首发原创文章,作者:王坚‌,如若转载,请注明出处:https://test.idctop.com/article/532630.html

(0)
html播放音乐地址怎么用?,怎么设置?
上一篇 2026年7月31日 03:34
HTTPS证书购买和管理有哪些注意事项,哪个平台便宜
下一篇 2026年7月31日 03:35

相关推荐

  • 广州300g高防dns解析解决方案,300g高防dns解析怎么选

    面对日益复杂的DDoS攻击环境,广州300g高防dns解析解决方案的核心价值在于构建“超大带宽清洗+智能调度+极速响应”的三位一体防御体系,确保业务在遭受大规模流量攻击时仍能保持连续性和可用性,这不仅是单一产品的堆砌,而是基于网络层、传输层到应用层的纵深防御策略,通过专业的DNS解析服务将流量牵引至清洗中心,实……

    2026年4月1日
    10300
  • html中如何插入js代码?js脚本引入方式有哪些

    在HTML中插入JavaScript的核心方法是将代码包裹在<script>标签内,推荐优先使用<script src=”file.js”></script>引入外部文件以保持结构清晰,或直接在页面底部使用内联脚本确保DOM加载完成,网页开发中,HTML负责骨架,CSS负责皮……

    2026年6月12日
    3500
  • 服务器带宽配置选错了?服务器带宽多少合适才不卡

    服务器卡顿、网站访问缓慢,绝大多数情况下并非服务器整体性能不足,而是带宽配置与实际业务流量模型不匹配,这是许多企业在IT基础设施建设中极易忽视的“隐形杀手”,核心问题在于,很多运维人员或企业管理者只关注服务器的CPU和内存指标,却忽略了数据传输的“管道”粗细,导致高配服务器依然出现严重的网络拥塞,一旦带宽成为瓶……

    2026年3月8日
    10900
  • 注册域名一年要多少钱?域名注册价格及费用详解

    注册域名的年费并非固定不变,通常根据后缀不同在几元到几百元不等,普通.com域名首年价格多在55-80元之间,后续续费则可能涨至70-90元,很多人以为域名就像买衣服,买一次穿一辈子,其实域名更像租房,每年都要交租金,对于刚起步的创业者或博主来说,这笔钱虽然不多,但如果选错了后缀或者被坑了续费价格,一年下来也是……

    2026年6月24日
    3710
  • 电商网站服务器带宽多少够用?电商服务器带宽一般需要多大

    电商网站服务器带宽的选择,核心结论在于:不存在一个通用的固定数值,带宽配置必须遵循“并发峰值优先”原则,并预留30%至50%的冗余空间以应对流量突发,对于初创期日均IP在1000左右的电商平台,3Mbps至5Mbps的独享带宽通常足以支撑日常运营;而对于日均IP过万的中型电商,建议起步配置10Mbps至20Mb……

    2026年3月7日
    11400
  • VPS带宽和服务器带宽区别?VPS带宽和服务器带宽有什么不同

    VPS带宽与服务器带宽的本质差异在于资源归属与性能隔离机制,前者是共享逻辑下的虚拟分割,后者是独占物理资源的硬性保障, 对于企业级应用而言,选择何种带宽模式,直接决定了业务高峰期的稳定性和用户体验,VPS带宽更像是在“拼车”,而独立服务器带宽则是“专车直达”,理解这一核心区别,是构建高可用IT架构的基础,底层架……

    2026年3月8日
    11700
  • 武汉AI团队算力租用还是买卡自建怎么选,哪个更划算

    对于大多数AI团队,算力租用比买卡自建更划算,但最终选择取决于你的项目周期、资金规模和运维能力,算力选择为什么成了AI团队的“分水岭”武汉的AI创业氛围越来越浓,但也带出一个现实问题:算力到底怎么搞,租用还是自建,这个决定不仅在初期影响现金流,还会在后续几个月卡住你的进度,不少团队在买卡后发现显卡利用率不到30……

    网络与线路 2026年8月9日
    800
  • 广州GPU服务器秘钥类型有哪些?GPU云服务器密钥选择指南

    在广州地区部署高性能计算集群,选择正确的秘钥类型是保障GPU服务器数据安全的第一道防线,直接决定了业务系统的生存能力与合规性,广州作为华南地区的数据中心枢纽,其GPU服务器集群承载着大量人工智能训练、渲染及科学计算任务,数据资产价值极高,秘钥管理并非简单的密码设置,而是涉及加密算法、存储介质及权限控制的综合安全……

    2026年3月28日
    8300
  • Ubuntu如何安装PyCharm?在Linux下配置PyCharm

    在Ubuntu系统上安装PyCharm最稳定且推荐的方式是通过Snap或官方安装包进行部署,其中Snap版本能自动处理依赖更新,适合大多数开发者;而专业版需付费,社区版则完全免费,对于许多初次接触Linux环境的Python开发者而言,配置开发环境往往比编写代码本身更令人头疼,Ubuntu作为服务器和桌面端最流……

    2026年6月18日
    4000
  • HTML中间文字怎么对齐?CSS文字水平居中方法

    HTML中间文字对齐的核心答案是通过CSS的text-align属性实现块级元素内文本的水平居中,或使用Flexbox布局的justify-content属性实现更复杂的垂直与水平双重居中,在网页开发的日常工作中,文字排版是最基础也最容易被忽视的环节,很多初学者在面对“如何让文字居中”这个问题时,往往会陷入各种……

    网络与线路 2026年6月9日
    2300

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注