本课程由尚硅谷精心打造,专为期望掌握电商数据仓库搭建的学员量身定制。它涵盖了从基础概念到高级技术的全面内容,是大数据初学者和希望提升数据仓库技能的开发者的理想选择。课程通过实战视频教学的方式展开,学员将系统学习如何运用Hadoop、Flume、Kafka等工具进行数据采集、处理和分析。在学习过程中,学员不仅能掌握集群配置、日志处理、数据同步策略等关键技能,还能深入了解用户行为采集、业务数据采集等重要环节。课程的特色在于其丰富的实战内容,从电商业务流程、表结构等常识讲解,到数仓理论中的分层、命名规范、建模等知识,再到数仓搭建的具体操作,如ODS层、DWD层、DWS_DWT_ADS层的处理等,都有…...

本教程由尚硅谷出品,聚焦大数据项目实战,以“线上问诊”业务为背景,完整呈现离线数仓从零到上线的全流程开发。课程内容覆盖数据采集、数仓架构设计、技术选型、集群搭建、数据同步及性能优化等核心环节,深入讲解Hadoop、Zookeeper、Kafka、Flume、Hive等主流大数据组件的实战应用。
教程附带完整源码与课件,帮助学员在真实业务场景中掌握企业级数仓的设计思路与开发技能。无论是大数据开发工程师、数据分析师,还是对大数据技术感兴趣的初学者,都能通过本课程系统提升项目落地能力。
课程内容亮点:
- 从需求分析、技术选型到集群规划,完整还原企业项目启动流程
- 涵盖Hadoop、Zookeeper、Kafka、Flume、Maxwell、DataX、Hive等工具安装配置与调优
- 深入讲解数仓分层、维度建模、事实表设计等核心理论
- 包含全量/增量数据同步、ODS/DIM层建表、数据加载脚本等实操内容
- 附赠源码与课件,便于学员对照学习与复用
适合人群:
- 希望积累大数据项目经验的开发工程师
- 需要掌握离线数仓设计与实现的数据分析师
- 对大数据技术栈感兴趣、想系统提升实战能力的学员
📢 以下文件由夸克网盘用户于2024-09-28分享(文件数量过多时仅展示部分文件)
【尚硅谷】大数据项目《线上问诊离线数仓》 - 带源码课件3.5GB
01-数据采集课程内容介绍.mp49.58MB
02-数据仓库的概念.mp413.58MB
03-数据仓库的架构.mp412.6MB
04-项目需求分析.mp415.1MB
05-技术选型.mp422.98MB
06-系统数据流程设计.mp420.6MB
07-框架版本的选择.mp418MB
08-服务器的选型.mp416.1MB
09-集群规模.mp414.01MB
10-集群规模设计.mp422.48MB
11-业务数据说明.mp427.11MB
12-虚拟机安装配置.mp488.88MB
13-集群分发脚本.mp457.47MB
14-安装jdk.mp433.11MB
15-环境变量配置说明.mp412.35MB
16-查看进程脚本.mp410.31MB
17-安装hadoop-配置集群.mp461.42MB
18-安装hadoop-配置历史服务器.mp431.08MB
19-hadoop群起脚本.mp413.7MB
20-hdfs存储多目录.mp421.88MB
21-集群数据均衡.mp430.59MB
22-hadoop参数调优.mp425.67MB
23-安装zookeeper.mp429.15MB
24-zookeeper启动脚本.mp414.92MB
25-zookeeper常用指令.mp421.38MB
26-安装kafka.mp450.58MB
27-kafka群起脚本.mp424.63MB
28-kafka常用指令-topic相关.mp462.24MB
29-kafka常用指令-生产者和消费者相关.mp430.28MB
30-flume安装与项目经验.mp420.57MB
31-安装mysql.mp425.9MB
32-模拟生成数据.mp431.96MB
33-客户端连接异常问题.mp414.49MB
34-maxwell简介.mp418.65MB
35-mysql原理.mp419.66MB
36-安装maxwell.mp463.09MB
37-maxwell启动脚本.mp432.37MB
38-maxwell数据同步.mp459.42MB
39-同步策略.mp426.87MB
40-数据同步工具.mp424.89MB
41-datax简介和框架设计.mp424.64MB
42-datax运行流程.mp412.71MB
43-datax调度思路.mp411.23MB
44-datax与sqoop的对比.mp411.2MB
45-datax安装.mp427.15MB
46-将数据从mysql导入到hdfs-tableMode模式.mp495.47MB
47-将数据从mysql导入到hdfs-querysql模式.mp428.5MB
48-datax传参.mp420.1MB
49-将数据从hdfs导入到mysql.mp475.48MB
50-datax优化.mp433.2MB
51-datax配置文件生成.mp469.07MB
52-全量表数据同步脚本.mp483.28MB
53-flume配置01.mp4150.07MB
54-flume配置02.mp4145.39MB
55-增量表首日同步.mp437.69MB
56-flume启动停止脚本.mp434.77MB
57-安装hive.mp494.31MB
58-在线就诊数仓项目简介.mp413.93MB
59-数仓的概念.mp427.24MB
60-数仓架构.mp440.46MB
61-建模的意义.mp427.75MB
62-ER模型.mp475.12MB
63-维度模型.mp425.62MB
64-事实表介绍.mp413.96MB
65-事务型事实表概述.mp418.53MB
66-事务型事实表的设计流程.mp451.6MB
67-事务型事实表的不足.mp425.27MB
68-事务型事实表的不足.mp421.05MB
69-周期型快照事实表的概念.mp432.35MB
70-周期型快照事实表设计与事实类型.mp430.02MB
71-累积型快照事实表.mp455.92MB
72-维度表设计.mp471.61MB
73-规范化与反规范化.mp414.54MB
74-全量快照维度表.mp421.09MB
75-拉链表.mp424.45MB
76-多值维度.mp425.89MB
77-多值属性.mp49.03MB
78-数据仓库的分层.mp428.36MB
79-数仓的构建流程.mp430.14MB
80-数据调研.mp422.07MB
81-明确数据域.mp46.15MB
82-业务总线矩阵.mp419.59MB
83-明确统计指标.mp442.27MB
84-维度模型与汇总模型设计.mp412.99MB
85-hive引擎简介.mp412.67MB
86-hive on spark兼容性说明.mp413.52MB
87-搭建hive on spark.mp452.16MB
88-ApplicationMaster资源比例调整.mp426.73MB
89-datagrip使用.mp434.82MB
90-模拟产生数据.mp492.59MB
91-hive常见问题和解决方案.mp445.86MB
92-ods层设计要点.mp420.29MB
93-全量表建表.mp462.32MB
94-复杂数据类型回顾.mp454.69MB
95-json数据建表.mp438.49MB
96-增量表建表.mp441.55MB
97-ods数据加载脚本.mp4101.53MB
98-维度表建模理论回顾.mp432.31MB
99-dim层设计要点.mp417.2MB
100-医生维度表建表.mp444.32MB
共100个文件,合计:3.5GB

10积分