Feature Engineering � Models ko 2x Better Karna
Feature engineering = raw data se naye columns banana jo model ko patterns asaan banate hain. Yahi difference ek average (80% accuracy) aur excellent (95% accuracy) model ke beech hota hai. Learn � datetime se features, categorical to numeric, scaling aur interaction features � all in Pandas.
WHY: Feature Engineering kyun zaroori hai?
Models patterns dhoondte hain data mein. Agar wo pattern missing hai ya raw input kitna hi sahi ho, model struggle karta hai. Acchha feature = model ko straightforward decision dena. Example: 'selling_price' aur 'tax' ke bajaye 'total_price' banana model ke liye bohot asaan hai.
Senior data scientists ka approximation: kisi project ka 50-60% lift feature engineering se aata hai � model tuning nahi.
HOW: Practical feature engineering techniques
1. Datetime se date-relevant features
df['order_ts'] = pd.to_datetime(df['order_ts']) df['weekday'] = df['order_ts'].dt.day_name() df['is_weekend'] = df['weekday'].isin(['Saturday','Sunday']).astype(int) df['hour'] = df['order_ts'].dt.hour
Orders kaam ke din vs weekly weekend � is difference ko model easily note karta hai.
2. Categorical features � numbering ya one-hot?
df = pd.get_dummies(df, columns=['city'], drop_first=True) # many categories df['has_employer'] = df['employer'].notnull().astype(int) # binary flags
Yeh too-many unique values wale categorical columns mein label-encoding ka so today hataao � dummies saare levels ko ekdum neutral rakhte hain.
3. Numeric features: scaling aur ratios
from sklearn.preprocessing import StandardScaler df['scaled_amount'] = StandardScaler().fit_transform(df[['amount']]) df['amount_per_km'] = df['amount'] / df['distance_km'] # ratio features
Ratio features (revenue per user, clicks per visit) tab useful hote hain jab raw counts alag-alag help hain.
4. Domain-and-look features
df['email_domain'] = df['email'].str.split('@').str[1]
df['signup_days'] = (pd.Timestamp.now() - df['created_at']).dt.daysJoe data expert kisi domain ko 2 saal samajhta hai, wo features banane mein hi credit deta hai � companies ko engineer se zyada woh features hi chahiye.
5. Feature importance check � kya work kiya?
model.feature_importances_
Trained model se feature importance nikal kar drop the features jo 0 ke paas hain � simple, faster, cleaner model.
Try it: Feature engineering practice
Kisi house-price dataset mein: date, area, floor se kam se kam 5 naye features banao. Phir baseline model banao, aur feature-engineered model se accuracy compare karke improvement batao.
Pro feature engineering tips
- Har step ke saath code ekdum small keep karo � ek cell mein ek hi task.
- Original data ka backup hamesha rakho, processed dataframe alag naam se save karo.
- Log karo (comments) ki kisi column ko kyun saaf kiya � 3 mahine baad wahi reasoning yaad nahi rehti.
- Practice data cleaning on raw CSV files from real sources (not perfect toy datasets).
Common feature engineering mistakes
- Outliers ko bina context delete karna � poora customer base hata sakta hai.
- Missing-drop karna jab wo rows aapke analysis mein zaroori hain.
- Feature engineering mein train aur test data ko salah mix karna (data leakage).
- Dummy variables banana with too many categories � memory aur model size badh jate hain.
Next up: Regression � continue the data science path with live examples and practice exercises.