01
数仓分层与架构
理解 ODS、DWD、DWS、ADS 的职责边界,以及离线数仓、实时数仓和湖仓一体的选型依据。
面向数据仓库、数据开发和大数据开发岗位,按“架构分层、维度建模、指标治理、性能优化”整理高频面试考点。 这里不是概念清单,而是一条能从基础定义逐步走到项目追问的复习路径。
复习时先建立数据从源端进入 ODS、经过明细与汇总加工、最终服务业务分析的完整链路,再把每个概念放回链路中理解。
从题目进入详情页,先用自己的语言回答,再对照解析补齐原理、场景和常见追问。
明确数据来源、采集、分层加工、调度、质量校验和下游消费,避免孤立地背概念。
每个模型都回答为什么这样分层、粒度如何确定、宽表与维度模型如何选择。
准备迟到数据、数据回刷、口径变更、任务失败、数据倾斜和小文件等真实问题。
把去重、拉链、留存、TopN 和连续行为等题型写出来,形成可以落地的表达。
高频范围包括数仓分层、维度建模、事实表与维度表、拉链表、指标体系、数据治理、数据质量、离线与实时链路,以及 Hive 和 Spark 性能优化。
建议先理解完整数据链路,再学习分层与建模,随后补齐指标治理和任务优化,最后结合项目说明为什么这样设计以及出现问题时如何排查。
不够。面试官通常会继续追问业务粒度、模型取舍、数据回刷、口径变更和性能问题,需要把概念放进真实项目场景中表达。
需要。窗口函数、连续登录、留存、漏斗、TopN、去重和同比环比都是数仓与数据开发岗位的常见 SQL 题型。