Senior
Skew, shuffle, join strategy, and Spark UI evidence.
How do you diagnose a slow Spark stage?
You process 10 TB/day. How would you design partitioning and shuffle strategy?
How do you choose executor size?
How do you debug a production issue related to RDDs?
How do you debug a production issue related to DataFrames and schemas?
How do you debug a production issue related to Narrow vs wide transformations?
How do you debug a production issue related to Actions that trigger jobs?
How do you debug a production issue related to Why Spark is lazy?
How do you debug a production issue related to Partitions?
How do you debug a production issue related to What a shuffle actually does?
How do you debug a production issue related to Join strategies in Spark?
How do you debug a production issue related to Cache and persist?
How do you debug a production issue related to Driver vs executors?
How do you debug a production issue related to Jobs, stages, and tasks?
How do you debug a production issue related to The Spark DAG?
How do you debug a production issue related to Catalyst optimizer?
How do you debug a production issue related to Tungsten execution engine?
How do you debug a production issue related to Data skew?
How do you debug a production issue related to Broadcast joins?
How do you debug a production issue related to Adaptive Query Execution?
How do you debug a production issue related to Databricks architecture?
How do you debug a production issue related to Delta Lake?
How do you debug a production issue related to Unity Catalog?