发布时间:2026/8/31 3:57:45
大数据-258 离线数仓 - Griffin架构 配置安装 Livy 架构设计 解压配置 Hadoop Hive 点一下关注吧非常感谢持续更新----------------------Java篇开始了---------目前开始更新 MyBatis一起深入浅出目前已经更新到了---------* Hadoop已更完* HDFS已更完* MapReduce已更完* Hive已更完* Flume已更完* Sqoop已更完* Zookeeper已更完* HBase已更完* Redis 已更完* Kafka已更完* Spark已更完* Flink已更完* ClickHouse已更完* Kudu已更完* Druid已更完* Kylin已更完* Elasticsearch已更完* DataX已更完* Tez已更完* 数据挖掘已更完* Prometheus已更完* Grafana已更完* 离线数仓正在更新…章节内容----* 数据质量监控 监控方法* Griffin架构上节到了Griffin的编译安装 下面继续---------------------编译安装----续接上节上节到了 Elasticsearch### Livy#### 基本介绍Livy 是一个用于 Apache Spark 的 REST 接口旨在简化 Spark 作业的提交和管理特别是在大数据处理场景中。它的主要功能是通过 REST API 与 Spark 集群进行交互允许用户提交作业、执行代码片段并查询作业的状态和结果而不需要直接与 Spark 的底层架构交互。 Livy 的一些关键功能包括* 简化 Spark 作业提交用户可以通过 HTTP 请求向 Livy 发送 Spark 作业而不需要直接使用 spark-submit命令。* 多语言支持Livy 支持使用不同的编程语言提交作业包括 Python通过 PySpark、Scala 和 R。* Session 管理Livy 可以管理 Spark 会话允许多个用户在同一集群上共享会话并执行交互式代码片段。* 作业状态管理Livy 提供 API 来查看作业的状态、日志以及结果便于跟踪和监控任务执行。* 集成Livy 通常与 Jupyter Notebook、Zeppelin 等工具集成以便用户可以在这些环境中使用 Spark 集群执行代码。#### 配置计划我们的Spark是集群三台节点配置的但是Livy可以不用配置集群我们计划在主节点上进行配置 h121.wzk.icu #### 解压配置 cd /opt/software unzip livy-0.5.0-incubating-bin.zip mv livy-0.5.0-incubating-bin/ …/servers/livy-0.5.0 处理结果如下图所示#### 环境变量 # 设置环境变量 vim /etc/profile # 设置完之后 记得刷新 source /etc/profile 写入内容如下 export LIVY_HOME/opt/servers/livy-0.5.0 export PATHPATH:PATH:PATH:LIVY_HOME/bin 对应的内容如下所示#### 修改配置 mv $LIVY_HOME/conf/livy.conf.template $LIVY_HOME/conf/livy.conf vim $LIVY_HOME/conf/livy.conf 修改内容如下 livy.server.host 0.0.0.0 livy.spark.master yarn livy.spark.deployMode cluster livy.repl.enable-hive-context true 修改内容如下所示修改配置文件 mv $LIVY_HOME/conf/livy-env.sh.template $LIVY_HOME/conf/livy-env.sh vimLIVYHOME/conf/livy−env.sh写入内容如下所示exportSPARKHOME/opt/servers/spark−2.4.5exportHADOOPHOME/opt/servers/hadoop−2.9.2/exportHADOOPCONFDIRLIVY_HOME/conf/livy-env.sh 写入内容如下所示 export SPARK_HOME/opt/servers/spark-2.4.5 export HADOOP_HOME/opt/servers/hadoop-2.9.2/ export HADOOP_CONF_DIRLIVYH​OME/conf/livy−env.sh写入内容如下所示exportSPARKH​OME/opt/servers/spark−2.4.5exportHADOOPH​OME/opt/servers/hadoop−2.9.2/exportHADOOPC​ONFD​IRHADOOP_HOME/etc/hadoop 写入内容如下所示#### 启动服务 cd /opt/servers/livy-0.5.0 mkdir logs nohup $LIVY_HOME/bin/livy-server Griffin-------### 前置介绍“Griffin”是一个大数据领域的开源项目特别是在分布式流处理和大数据系统的管理中具有一定的影响力。它最早由LinkedIn开发用于处理大规模数据流。Griffin的设计目标是简化和自动化流数据处理和监控工作使得在大数据应用中能够高效地处理实时数据流同时提升数据的可追溯性和可靠性。随着大数据技术的发展实时流处理如Apache Kafka、Apache Flink等在许多应用场景中扮演着越来越重要的角色。处理这些流数据时不仅需要确保高效的计算和数据吞吐量还要实现数据的可追溯性和监控。为了应对这些挑战Griffin应运而生致力于提供一个高效、可扩展的解决方案尤其是在数据质量监控和流处理作业的管理方面。Griffin的目标包括* 数据质量控制 自动化数据质量检查确保流数据的准确性和完整性。* 流处理作业管理 对流处理作业进行有效的调度和监控及时发现异常。* 数据管道的透明度 提供对数据流动过程的清晰视图便于追踪和排查问题。* 实时数据处理 结合流处理系统如Apache Kafka和Apache Flink优化数据处理效率。### 主要功能Griffin的功能集中在数据质量控制和流处理管理上以下是其一些核心功能* 数据质量监控 Griffin可以实时监控数据流中的各种质量问题如数据丢失、重复、格式错误等并生成报告或警告。这对于需要高质量数据的实时分析和决策过程尤为重要。* 流数据治理 它帮助管理数据流动的每个环节确保数据在处理过程中符合质量要求减少因数据问题导致的错误和偏差。* 作业调度和监控 对流处理作业进行调度实时监控其状态和性能。它能够识别系统中可能的瓶颈保证流处理任务的高效执行。* 数据追溯 在数据出现问题时Griffin提供对数据来源的追溯功能帮助用户快速定位问题的根源确保数据的透明度和可追溯性。### 架构设计Griffin的架构通常包括以下几个组件* 数据接入层 负责从数据源接入数据流。常见的数据源包括Apache Kafka、Apache Flink等流处理系统。* 数据处理层 对数据进行质量检查和流处理操作。该层可能包括数据清洗、校验等操作确保流数据符合预期的质量标准。* 监控和告警层 提供流处理作业的监控和告警机制及时发现问题并通知管理员。* 数据存储和可视化层 存储分析结果和质量报告并通过可视化界面展示给用户帮助用户理解数据流的状况。### 解压配置软件解压缩(这里我是在 h122 节点) cd /opt/software unzip griffin-griffin-0.5.0.zip mv griffin-griffin-0.5.0/ …/servers/griffin-0.5.0/ cd …/servers/griffin-0.5.0 运行结果如下图所示#### SQL初始化在MySQL中创建数据库quartz并初始化 # SQL 文件如下 /opt/servers/griffin-0.5.0/service/src/main/resources/Init_quartz_mysql_innodb.sql 备注要做简单的修改主要是增加 use quartz; vim /opt/servers/griffin-0.5.0/service/src/main/resources/Init_quartz_mysql_innodb.sql # 写入 use quartz; 执行如下的结果创建数据库 # 在MySQL中执行 # mysql中执行创建数据库 create database quartz; 执行结果如下运行SQL文件 # 在外部执行 # 命令行执行创建表 cd /opt/servers/griffin-0.5.0/service/src/main/resources/ mysql -uhive -phivewzk.icu Init_quartz_mysql_innodb.sql 执行结果可以连上数据库查看#### Hadoop 和 Hive在HDFS上创建 /spark/spark_conf目录并将Hive的配置文件hive-site.xml上传到该目录下 hdfs dfs -mkdir -p /spark/spark_conf hdfs dfs -putKaTeX parse error: Expected EOF, got # at position 198: …文件上传到HDFS对应目录中#̲### 环境变量确认如下的必要…HADOOP_HOME/etc/hadoop

相关新闻

2026/8/31 3:57:45

用AI打造单文件学习工具:从单词卡到部署全流程

在真实开发里,做学习工具最麻烦的不是技术,而是需求小、周期短、又不想为一个页面引入整套工程。最近用 AI 辅助做了几个帮助学习的小网页,比如单词记忆卡、公式速查页、古诗文背诵检查器。这个项目不做任何课程推广,也不卖课&…

2026/8/31 3:57:45

MPX跨端小程序框架上手实践:从原理到构建一次讲清

在小程序开发领域,“用一辈子 mpx”并不是官方口号,更像是社区里流传的一种玩笑式表达:当同一个产品要同时落到微信、支付宝、百度、字节等多个小程序平台时,与其每个端单独维护一套原生代码,不如认定一个长期维护的跨…

2026/8/31 4:12:46

【MySQL篇】事务的认识以及四大特性

何为事务?-----*事务(Transaction)是指一组操作的集合,这些操作要么全部执行成功,要么全部不执行。事务通常用于保证数据库的一致性、完整性和可靠性,确保数据的完整性与正确性。有效避免部分执行&#xff…

2026/8/31 4:12:46

【MySQL】链接池原理:简单理解网站的数据流动

前言:本节内容是博主快速上手mysql专栏的最后一篇文章。 本节内容不讲解mysql语法了, 而是以网站为例,讲一下前后端的逻辑与联系。 友友们可以当成一个故事听。> > ps:本节不需要门槛, 当成一个故事听即可!*目录…

2026/8/31 4:12:46

从GLM-5.3-Flash到MHS标准:大模型成本与信任的双线竞争

早上打开 BestBlogs 早报,08-28 这一期被我扫到了两条:一条是 GLM-5.3-Flash 发布,另一条是 Anthropic 推进 MHS 标准。单看标题,这两句话都可以当普通的行业动态刷过去——每天都有模型发布,每天都有公司说自己在做标…

2026/8/31 4:12:46

Shell脚本实战:从基础语法到自动化运维脚本编写

Shell 脚本是 Linux 自动化运维里最基础也最高频的技能。很多新手把ls、cd当成 shell 的全部,但遇到批量改文件、清理日志、定时备份、服务异常拉起这些任务时,才发现自己只会手动一条条敲命令,敲完还容易漏掉某一步。这篇文章默认读者没有写…

2026/8/31 4:12:46

Python爬虫+数据可视化:天气轮播图完整项目实战

最近不少同学都在找 Python 期末大作业的完整案例。如果项目既要体现爬虫,又要把数据可视化做出来,还要在答辩或演示时有点亮点,那“天气数据爬取 数据可视化 天气轮播图”这一套组合就非常合适。它把 Python 爬虫、数据处理和图表展示都串…

2026/8/31 4:07:45

基于STM32的步进电机搅拌机控制系统设计与实现

单片机类课程设计和毕业设计中,步进电机控制一直是一个经典又有代表性的选题:既涉及 GPIO 输出、定时器中断、按键状态机,又包含电机驱动电路和硬件接线,能够把嵌入式开发的常用知识点串起来。本文以“基于 STM32 单片机步进电机控…

2026/8/31 1:05:20

vSound小提琴数字处理器实操指南:从接线到演出的完整配置

电小提琴或者原声小提琴插电演出,第一个绕不开的坎就是声音难听。原声琴的共鸣和空气感一旦进了拾音器,出来的往往是一坨干瘪、发尖、带着奇怪塑料味的信号。我当初第一次把琴接上乐队调音台,直接被主唱吐槽"你这声音像在锯钢丝"。…

2026/8/31 2:14:20

传感器接口IC如何攻克生物化学传感的微弱信号难题?

1. 从电极到比特流:为什么生物化学传感必须依赖专用接口IC 做生物化学传感的人都有过类似的经历:明明传感器本身性能很好,信号输出却一塌糊涂——噪声大、漂移明显、重复性差,怎么调都达不到预期。很多时候问题并不在传感器&#…

2026/8/31 1:41:28

STM32F411CEU6多通道ADC采集:扫描模式+DMA实现详解

1. 多通道 ADC 的用武之地把“Multichannel ADC”和“STM32F411CEU6”这两个关键字放在一起,其实就是嵌入式开发里最常遇到的一类需求:用一块不算贵的 MCU,同时采集多路模拟信号。STM32F411CEU6 是 48 引脚的 Cortex-M4F 主控,主频…

2026/8/31 0:07:32

STM32C5设备支持包(IAR DFP)安装指南与常见坑

上一阵子在IAR里折腾一块基于STM32C5系列的新板子,工程从STM32CubeMX导出来之后怎么都编译不过。报错信息很干脆:找不到设备描述文件。跟着错误路径去查,发现指向的是一个让我愣了一下的名字:STMicroelectronics.stm32c5xx.2.1.0.…

2026/8/31 0:07:32

STM32N657 SWO引脚矛盾:CubeMX显示PB3,数据手册为PB5

拿到STM32N657这颗料的第一天,我就撞上了一个让人原地懵圈的引脚矛盾:CubeMX里清清楚楚显示SWO在PB3,翻开数据手册的引脚说明表,却赫然写着PB5。对于一个靠SWO输出调试日志吃饭的人而言,这种"工具和手册打架"…

2026/8/28 16:16:48

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/28 16:16:50

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/28 11:06:45

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…