Lesson 06 � Algorithm
RANDOM FOREST
SABSE STRONG.
Random forest multiple decision trees ka ensemble hai � ek tree galat ho sakta hai, 100 trees nahi. Sabse reliable algorithm hai jo bagging aur feature randomness ka use karta hai.
WHY: Random Forest kyun?
Single decision tree overfit ho sakta hai. Random forest us problem ko solve karta hai � multiple trees banata hai aur unka majority vote leta hai. Sab trees milkar better decision lete hain.
Multiple models milke kaam karte hain � jab sab milkar decide karein toh result better hota hai.
Bootstrap sampling � original data se random samples leke har tree ko alag-alag data pe train karte hain.
Har split pe sirf random features consider karte hain � taaki trees diverse ho aur overfit na karein.
Majority vote se final decision � sabse zyada trees jo bole wohi winner hai.
HOW: Random Forest kaise kaam karta hai?
Random Forest ek ensemble learning technique hai jo bagging aur feature randomness ka use karke multiple decision trees banata hai.
Step-by-step process:
- Bootstrap Sampling: Original dataset se random samples banao (replacement ke saath)
- Feature Selection: Har tree ko sirf kuch random features do split ke liye
- Tree Building: Har sample pe apni tree banao
- Voting: Sab trees ka prediction lo aur majority decide karo
Key Hyperparameters:
- n_estimators: Kitni trees banana hai (default 100)
- max_features: Har split pe kitne features consider karna hai
- max_depth: Tree kitni depth tak ja sakti hai
Code Example
from sklearn.ensemble import RandomForestClassifier
from sklearn.model_selection import train_test_split
from sklearn.metrics import accuracy_score
import numpy as np
X = np.random.rand(200, 5)
y = (X[:,0] + X[:,1] > 1).astype(int)
X_train, X_test, y_train, y_test = train_test_split(
X, y, test_size=0.3, random_state=42
)
model = RandomForestClassifier(n_estimators=100, random_state=42)
model.fit(X_train, y_train)
print(f"Accuracy: {model.score(X_test, y_test):.2%}")
print(f"Feature importances: {model.feature_importances_}")Try it: code ko run karo
Quick check
Random Forest ka main idea kya hai✓ Kaise yeh single tree se better hota hai?
Ek tree galat ho sakta hai � lekin agar bahut saare trees ho aur majority bole, toh answer zyada reliable hoga.
Common mistakes
- Bohot kam trees: Agar n_estimators bahut kam hai (jaise 5) toh ensemble ka fayda nahi milega � 100+ rakhna better hai.
- Feature scaling na karna: Random forest ko feature scaling ki zaroorat nahi hai � yeh tree-based hai.
- Single tree se compare karna: Random forest hamesha single tree se better hota hai � yeh uska main advantage hai.
Ab Ensemble Methods par chalo � bagging, boosting, stacking aur voting ke baare mein detail mein seekho.