Here’s a comprehensive description of the project:


Dataset

The data is high-dimensional with many columns, and both train and test sets contain missing values across multiple features.


Pipeline & Methodology

1. Data Loading & Exploration

2. Feature Selection — Numeric Only

3. Train/Validation Split

4. Preprocessing Pipeline

5. Feature Importance via Permutation Importance

6. Model Training — Random Forest Classifier

7. Submission


Key Design Choices & Observations

Aspect Detail
Target variable loss — a binary/multiclass classification target
Feature engineering None; raw numeric features only
Imputation Mean imputation (could miss non-MAR patterns)
Feature selection Permutation importance via a proxy Logistic Regression
Final model Random Forest (small forest with 10 estimators)
Evaluation metric Cross-validation accuracy
Categorical features Dropped entirely

Kaggle