问题：

加速Storm拓扑

汪胤

2023-03-14

8台机器一直在使用。每一个都有22个核心和512 GB的RAM。但是，我们的代码运行得真的很慢。传输600万个数据需要10分钟才能完成。

60个文件中的10 MB在一秒钟内传输到HDFS。我们正在努力优化我们的代码，但很明显我们做了一些非常错误的事情。

对于蜂巢表，我们有64个桶。

HdfsSpout hdfsSpout = new HdfsSpout()
    .withOutputFields(TextFileReader.defaultFields)
    .setReaderType("text")
    .setHdfsUri(hdfsUri)
    .setSourceDir("/data/in")
    .setArchiveDir("/data/done")
    .setBadFilesDir("/data/bad")
    .setClocksInSync(true) // NTP installed on all hosts
    .setIgnoreSuffix("_COPYING_") 
// do not begin reading file until it is completely copied to HDFS
    .setMaxOutstanding(50_000);

DelimitedRecordHiveMapper mapper = new DelimitedRecordHiveMapper()
    .withColumnFields(new Fields(TTDPIRecord.fieldsList))
    .withPartitionFields(new Fields(TTDPIRecord.partitionFieldsList));

HiveOptions hiveOptions = new HiveOptions(metaStoreURI, dbName, tblName, mapper)
    .withAutoCreatePartitions(true)
    .withHeartBeatInterval(3)
    .withCallTimeout(10_000) // default = 10.000
    .withTxnsPerBatch(2)
    .withBatchSize(50_000) 
// doing below because its affecting storm metrics most likely
    .withTickTupleInterval(1);

Config conf = new Config();
conf.setNumWorkers(6);
conf.setNumAckers(6);
conf.registerMetricsConsumer(LoggingMetricsConsumer.class);

TopologyBuilder builder = new TopologyBuilder();
builder.setSpout("hdfsSpout", hdfsSpout, 8);
builder.setBolt("recordParserBolt", recordParserBolt, 8).localOrShuffleGrouping("hdfsSpout");
builder.setBolt("hiveBolt", hiveBolt, 8).localOrShuffleGrouping("recordParserBolt");

在HDFS喷口；.setmaxextending(50000)；

在蜂巢喷口选项；.WithTxNsperBatch(2).WithBatchSize(500_000).WithTickTupleInterval(1)；

配置中；.SetNumWorkers（6）；.设置编号器（6）；

hiveBolt执行程序：8个完成延迟：1092.624ms

共有1个答案

伯英锐

2023-03-14

您正在执行conf.setnumworkers(6)；，这意味着您只使用8台计算机中的6台，您可以将其设置为8来使用您拥有的所有硬件。

您可以更改的另一个参数是bolts的并行性提示，这意味着组件的执行器（线程）的初始数量。您只给出了8的并行度，您可以将其增加到100/200，看看性能如何变化。

您可以通过这些来理解Storm中并行性是如何工作的。

类似资料：

Storm创建拓扑

我正在尝试使用Eclipse在Linux中运行Storm启动示例。我收到以下错误和函数从未被调用。错误：我的拓扑类：我正在虚拟机环境中工作，所以不知道这是否是由于安装了Zookeeper。有什么想法吗？
Storm拓扑配置

如何为storm拓扑提供自定义配置？例如，如果我构建了一个连接到MySQL集群的拓扑，并且我希望能够更改需要连接到哪些服务器而不需要重新编译，我将如何做到这一点？我更喜欢使用配置文件，但我担心文件本身没有部署到集群中，因此它不会运行（除非我对集群工作方式的理解有缺陷）。到目前为止，我所看到的在运行时将配置选项传递到storm拓扑的唯一方法是通过命令行参数，但当您获得大量参数时，这将是混乱的。有一
Apache Storm-Storm集群映射拓扑

我读了很多和Storm有关的网站。但我仍然无法将拓扑结构完美地映射到Storm集群中。请帮助我理解这一点。在Storm集群中有这样的术语 null null null 所有这些都要用Storm集群来映射。我已经在一个项目里工作了。所以我知道拓扑结构。
Apache Storm拓扑部署

我是阿帕奇Storm的新手。我已经在intellij中用java创建了一个storm项目，它成功地创建了一个本地集群，并将拓扑提交给它，然后在本地运行。我想在亚马逊EC2上运行这个Storm项目。我跟踪了https://github.com/nathanmarz/storm-deploy/wiki链接。跟随链接成功发射了2个主管，1个动物园管理员和1个灵光。现在我想在服务器上运行我的拓扑。这是我在
Storm喷口/拓扑性能

我对Apache Storm的性能有一个问题，主要是从喷口出来的。我有一个从kestrel队列发出项目的拓扑。我获取大约2000个项目，每次在喷注中调用时，我都会发出一个。我正在使用1个spout任务和1个spout执行器运行。我已将设置为10。为什么每次调用之间有这么大的时间间隔？outputCollector在发出一个新元组之前是否正在等待听到每个元组的反馈？我正在运行Java8和st
实现多个storm拓扑

我正在研究一个storm拓扑，需要为不同的客户端位置构建多个拓扑。谢谢你的回复。

加速Storm拓扑

共有1个答案

相关问答

相关文章

相关阅读

相关工具

相关文档