news 2026/9/15 23:08:53

数据采集-----案例

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
数据采集-----案例

1)启动zookeper集群并查看集群状态

三台:

cd /opt/module/zookeeper/

bin/zkServer.sh start

bin/zkServer.sh status

(2)启动Hadoop集群并查看相应的进程

master:start-dfs.sh

slave1:start-yarn.sh

(3)启动kafka集群,并且开启kafka消费者消费指定主题

三台:

cd /opt/module/kafka/

bin/kafka-server-start.sh -daemon config/server.properties

kafka

消费主题

bin/kafka-console-consumer.sh --bootstrap-server=master:9092 --topic=BigData2403

(4)启动efak对kafka集群的监控平台

master:

cd /opt/module/efak/

bin/ke.sh start

(5)启动maxell数据采集工具

master:

cd /opt/module/maxwell/

bin/maxwell --user='maxwell' --password='123456' --host='master' --producer=kafka --kafka.bootstrap.servers=master:9092 --kafka_topic=BigData2403

(6)运行产生业务数据的脚本,向mysql数据库中注入数据,并且观察kafka消费者中消费到的数据。

产生数据

master:

cd /opt/module/db_data/

java -jar gmall2020-mock-db-2021-11-14.jar

(7)启动flume数据采集通道,将数据从kafka集群上的指定主题中采集到HDFS上。

脚本:

#定义组件
a1.sources = r1
a1.channels = c1
a1.sinks = k1


#对source进行配置
a1.sources.r1.type = org.apache.flume.source.kafka.KafkaSource
a1.sources.r1.kafka.bootstrap.servers = master:9092,slave1:9092,slave2:9092
a1.sources.r1.kafka.topics = BigData2403

#添加拦截器的配置对数据进行处理

a1.sources.r1.interceptors=i1
a1.sources.r1.interceptors.i1.type=com.BigData.TableNameInterceptor$Builder


a1.channels.c1.type = file
a1.channels.c1.dataDirs=/opt/module/flume/file/data
a1.channels.c1.checkpointDir=/opt/module/flume/file

a1.sinks.k1.type = hdfs
a1.sinks.k1.hdfs.path = hdfs://master:8020/gmall/db/%{table}/%Y-%m-%d

a1.sources.r1.channels = c1
a1.sinks.k1.channel = c1

运行flume脚本

cd /opt/module/kafka/


bin/kafka-console-consumer.sh --bootstrap-server=master:9092 --topic=BigData2403

(8)运行Datax采集工具,将HDFS上指定的数据内容到Mysql数。

master:

cd /opt/module/datax/

python bin/datax.py job/mysql_datax_hdfs.json

(9)启动FineBI报表工具,将mysql数据库中的数据进行展示\

master:

cd /opt/FineBI6.0/

bin/finebi



http://master:37799/webroot/decision(若内存太小,无法启动)(解决方法:停掉所有的集群,只启动这个)

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/16 1:30:03

2025有哪些免费降ai率工具?有哪些免费AI率查重工具?

市场上的降AI率工具良莠不齐,如何科学判断降AI率效果是很多学生、老师最关心的问题,担心降不来AI率,耽误时间还花不少钱。 本文将从以下五个维度系统,分析2025年主流的8个降AI工具,教大家如何选择适合自己的降AIGC工具…

作者头像 李华
网站建设 2026/9/14 19:08:28

大模型应用开发-Langchain(V1-最新版)-上

一 结构1.1 langchain-coreLangchain核心包,定义了基础抽象接口,和最基础Langchain整体运行的依赖可实例化类说明Langchain_core.runnablesLangchain_core.messageLangchain_core.promptsLangchain_core.toolsLangchain_core.ouput_parsersLangchain_cor…

作者头像 李华
网站建设 2026/9/15 3:28:09

知网AI率降到3%,还免费降AI500字,这个降AI工具真好!

市场上的降AI率工具良莠不齐,如何科学判断降AI率效果是很多学生、老师最关心的问题,担心降不来AI率,耽误时间还花不少钱。 本文将从以下五个维度系统,分析2025年主流的8个降AI工具,教大家如何选择适合自己的降AIGC工具…

作者头像 李华
网站建设 2026/9/15 17:31:24

终极性能释放:AMD APU隐藏的30%算力这样激活

终极性能释放:AMD APU隐藏的30%算力这样激活 【免费下载链接】ROCmLibs-for-gfx1103-AMD780M-APU ROCm Library Files for gfx1103 and update with others arches based on AMD GPUs for use in Windows. 项目地址: https://gitcode.com/gh_mirrors/ro/ROCmLibs…

作者头像 李华
网站建设 2026/9/15 15:03:31

FusionCompute 8.0完整资源获取指南:从零开始搭建虚拟化实验环境

FusionCompute 8.0完整资源获取指南:从零开始搭建虚拟化实验环境 【免费下载链接】FusionCompute8.0资源下载指南分享 本仓库提供了一个详细的资源文件,内含百度网盘连接及提取码,以及详细的资源列表,方便您学习和使用FusionCompu…

作者头像 李华
网站建设 2026/9/12 15:22:22

The Mirror版本控制系统终极指南:实现高效协作与智能冲突解决

The Mirror版本控制系统终极指南:实现高效协作与智能冲突解决 【免费下载链接】the-mirror 项目地址: https://gitcode.com/GitHub_Trending/th/the-mirror 在现代软件开发中,实时协作与版本管理已成为团队效率的关键。The Mirror通过创新的冲突…

作者头像 李华