Problems
Practice data engineering, algorithms, and schema design
ETL pipelines use PySpark execution. Run costs 1 credit, Submit costs 3 credits.
| # | Title | Languages | ||
|---|---|---|---|---|
| 1 | Star Schema Fact Table Build | PySpark | Hard | 35% |
| 2 | Late-Arriving Fact Records | PySpark | Hard | 67% |
| 3 | Data Quality Pipeline | PySpark | Hard | 65% |
| 4 | Employee Salary Ranking | PySpark | Medium | 75% |
| 5 | Schema Evolution Handling | PySpark | Medium | 89% |
| 6 | Slowly Changing Dimension Type 2 | PySpark | Hard | 29% |
| 7 | Pivot Sales Metrics | PySpark | Medium | 88% |
| 8 | Incremental Data Load | PySpark | Medium | 31% |
| 9 | Customer Record Deduplication | PySpark | Medium | 90% |
| 10 | Multi-File Sales Union | PySpark | Easy | 71% |
| 11 | JSON Event Flattening | PySpark | Easy | 84% |
| 12 | CSV to Data Warehouse | PySpark | Easy | 70% |
Showing 1–12 of 12