本课程是黑马程序员推出的Python+大数据年度钻石会员课程,内容体系完整,覆盖从零基础到大数据开发的全链路技能。课程共分为14个阶段,循序渐进地讲解Python基础编程、面向对象、多任务编程、网络编程、前端基础,以及大数据框架、Hadoop生态、Spark技术栈、Flink实时计算等核心内容。 课程注重实战应用,包含多个企业级项目,如“知行教育数仓项目”和“星途车联网”等,帮助学员在真实业务场景中掌握数据处理、分析、可视化及实时计算技术。此外,课程还涵盖SQL、NoSQL、实时计算等高级内容,并配有面试强化与就业加强课,为学员进入数据科学领域提供系统支持。 课程内容亮点: 从Python基础…...

本教程由尚硅谷出品,是一套完整的大数据项目实战课程,以“线上问诊”业务为背景,带领学员从零搭建企业级离线数仓。课程内容覆盖数据采集、仓库架构设计、技术选型、集群搭建、数据同步与优化等全流程开发环节,深入讲解Hadoop、Zookeeper、Kafka、Flume、Hive等核心组件的实际应用。
课程结构清晰,循序渐进,共包含100个视频章节,从基础概念到实战操作一应俱全。学员将依次学习:
- 环境搭建与集群部署:包括虚拟机安装、集群分发脚本、JDK配置、Hadoop集群搭建与参数调优、Zookeeper与Kafka安装配置等。
- 数据采集与同步:涵盖Flume配置、Maxwell数据同步、DataX安装与使用,以及全量表与增量表的数据同步脚本编写。
- 数仓建模与设计:深入讲解数据仓库分层、维度模型、事实表设计(事务型、周期型快照、累积型快照)、拉链表、多值维度等核心建模理论。
- Hive实战与优化:包括Hive on Spark搭建、ODS层与DIM层建表、数据加载脚本编写,以及常见问题解决方案。
课程附赠完整源码与课件,适合大数据开发工程师、数据分析师以及对大数据技术感兴趣的学员,帮助快速掌握企业级数仓开发的核心技能与项目实战经验。
关键词:大数据项目实战、尚硅谷、离线数仓、线上问诊、Hadoop
📢 以下文件由夸克网盘用户于2024-09-28分享(文件数量过多时仅展示部分文件)
【尚硅谷】大数据项目《线上问诊离线数仓》 - 带源码课件3.5GB
01-数据采集课程内容介绍.mp49.58MB
02-数据仓库的概念.mp413.58MB
03-数据仓库的架构.mp412.6MB
04-项目需求分析.mp415.1MB
05-技术选型.mp422.98MB
06-系统数据流程设计.mp420.6MB
07-框架版本的选择.mp418MB
08-服务器的选型.mp416.1MB
09-集群规模.mp414.01MB
10-集群规模设计.mp422.48MB
11-业务数据说明.mp427.11MB
12-虚拟机安装配置.mp488.88MB
13-集群分发脚本.mp457.47MB
14-安装jdk.mp433.11MB
15-环境变量配置说明.mp412.35MB
16-查看进程脚本.mp410.31MB
17-安装hadoop-配置集群.mp461.42MB
18-安装hadoop-配置历史服务器.mp431.08MB
19-hadoop群起脚本.mp413.7MB
20-hdfs存储多目录.mp421.88MB
21-集群数据均衡.mp430.59MB
22-hadoop参数调优.mp425.67MB
23-安装zookeeper.mp429.15MB
24-zookeeper启动脚本.mp414.92MB
25-zookeeper常用指令.mp421.38MB
26-安装kafka.mp450.58MB
27-kafka群起脚本.mp424.63MB
28-kafka常用指令-topic相关.mp462.24MB
29-kafka常用指令-生产者和消费者相关.mp430.28MB
30-flume安装与项目经验.mp420.57MB
31-安装mysql.mp425.9MB
32-模拟生成数据.mp431.96MB
33-客户端连接异常问题.mp414.49MB
34-maxwell简介.mp418.65MB
35-mysql原理.mp419.66MB
36-安装maxwell.mp463.09MB
37-maxwell启动脚本.mp432.37MB
38-maxwell数据同步.mp459.42MB
39-同步策略.mp426.87MB
40-数据同步工具.mp424.89MB
41-datax简介和框架设计.mp424.64MB
42-datax运行流程.mp412.71MB
43-datax调度思路.mp411.23MB
44-datax与sqoop的对比.mp411.2MB
45-datax安装.mp427.15MB
46-将数据从mysql导入到hdfs-tableMode模式.mp495.47MB
47-将数据从mysql导入到hdfs-querysql模式.mp428.5MB
48-datax传参.mp420.1MB
49-将数据从hdfs导入到mysql.mp475.48MB
50-datax优化.mp433.2MB
51-datax配置文件生成.mp469.07MB
52-全量表数据同步脚本.mp483.28MB
53-flume配置01.mp4150.07MB
54-flume配置02.mp4145.39MB
55-增量表首日同步.mp437.69MB
56-flume启动停止脚本.mp434.77MB
57-安装hive.mp494.31MB
58-在线就诊数仓项目简介.mp413.93MB
59-数仓的概念.mp427.24MB
60-数仓架构.mp440.46MB
61-建模的意义.mp427.75MB
62-ER模型.mp475.12MB
63-维度模型.mp425.62MB
64-事实表介绍.mp413.96MB
65-事务型事实表概述.mp418.53MB
66-事务型事实表的设计流程.mp451.6MB
67-事务型事实表的不足.mp425.27MB
68-事务型事实表的不足.mp421.05MB
69-周期型快照事实表的概念.mp432.35MB
70-周期型快照事实表设计与事实类型.mp430.02MB
71-累积型快照事实表.mp455.92MB
72-维度表设计.mp471.61MB
73-规范化与反规范化.mp414.54MB
74-全量快照维度表.mp421.09MB
75-拉链表.mp424.45MB
76-多值维度.mp425.89MB
77-多值属性.mp49.03MB
78-数据仓库的分层.mp428.36MB
79-数仓的构建流程.mp430.14MB
80-数据调研.mp422.07MB
81-明确数据域.mp46.15MB
82-业务总线矩阵.mp419.59MB
83-明确统计指标.mp442.27MB
84-维度模型与汇总模型设计.mp412.99MB
85-hive引擎简介.mp412.67MB
86-hive on spark兼容性说明.mp413.52MB
87-搭建hive on spark.mp452.16MB
88-ApplicationMaster资源比例调整.mp426.73MB
89-datagrip使用.mp434.82MB
90-模拟产生数据.mp492.59MB
91-hive常见问题和解决方案.mp445.86MB
92-ods层设计要点.mp420.29MB
93-全量表建表.mp462.32MB
94-复杂数据类型回顾.mp454.69MB
95-json数据建表.mp438.49MB
96-增量表建表.mp441.55MB
97-ods数据加载脚本.mp4101.53MB
98-维度表建模理论回顾.mp432.31MB
99-dim层设计要点.mp417.2MB
100-医生维度表建表.mp444.32MB
共100个文件,合计:3.5GB

10积分