VIPSpark

Spark随机Key双重聚合和大表加盐扩容怎么做?为什么能解决数据倾斜

先抓住题目的核心考点,再把答案拆成可复述的面试表达。

34 次浏览2026/7/9
先下定义一句话说清它是什么,面试官先听到结论。
再讲机制拆出关键流程、边界条件和常见坑位。
最后落场景结合生产经验,说出什么时候用、怎么权衡。

题目描述

请回答:Spark随机Key双重聚合和大表加盐扩容怎么做?为什么能解决数据倾斜

数据倾斜面试里,“加盐”是最容易被说烂也最容易被追问穿的点。很多人只会说 热点 Key 加随机前缀,但面试官真正想听的是:为什么加盐能把一个热点 Task 拆成多个 Task?双重聚合为什么要聚两次?大表 Join 小表时为什么小表要扩容?加盐会不会改变结果?

参考答案

评论

登录 后参与评论

加载中...