VIPSpark

Spark Shuffle Read阶段怎么拉取数据?为什么会造成网络拥堵

先抓住题目的核心考点,再把答案拆成可复述的面试表达。

37 次浏览2026/7/9
先下定义一句话说清它是什么,面试官先听到结论。
再讲机制拆出关键流程、边界条件和常见坑位。
最后落场景结合生产经验,说出什么时候用、怎么权衡。

题目描述

请回答:Spark Shuffle Read阶段怎么拉取数据?为什么会造成网络拥堵

这是 Spark Shuffle 里偏底层、也很实战的一题。面试官问 Shuffle Read,不是想听你说“Reduce 端从 Map 端拉数据”就结束,他想看的是:Reduce Task 怎么知道去哪里拉、是一次性全拉还是分批拉、为什么很多任务同时拉会打满网络、Spark UI 里的 Fetch Wait Time 到底说明什么。这题答好了,基本能说明你真的看过 Spark UI 排查过慢任务。

参考答案

评论

登录 后参与评论

加载中...