Lesson 02 � Data Science
DATA KI
LANGUAGE SEEKHO.
Statistics data ki language hai � mean, median, mode sab statistics ke concepts hain. Data Science without statistics possible nahi hai. Yeh lesson aapko basic statistical measures seekhayega jo har data analysis mein use hote hain.
WHY: Statistics kyun zaroori hai?
Data aata hai raw form mein � numbers, names, dates. Isme se meaning nikalne ke liye statistics chahiye. "Average marks kitne hain?" � mean se pata chalega. "Sabse zyada kisne score kiya?" � mode batayega. "Marks kitne spread hain?" � standard deviation dikhaayega. Statistics ke bina data sirf numbers ka hai, insights nahi.
Sab values ka average � total sum divided by count. Data ka central tendency dikhata hai.
Middle value jab data sorted ho. Outliers se affect nahi hota � robust measure hai.
Sabse frequently aane wali value. Categorical data mein sabse useful measure.
Data kitna spread hai mean se. Kam standard deviation = data tightly packed, zyada = data scattered.
HOW: mean kaise nikalein
Mean sabse basic statistical measure hai. Sab numbers ko add karo aur count se divide karo � bas. Python mein statistics.mean() se directly mil jaata hai.
import statistics
data = [85, 90, 78, 92, 88, 76, 95, 89]
# Mean - sab marks ka average
mean = statistics.mean(data)
print(f"Mean: {mean}") # 86.625MEDIAN: middle value
Median tab useful hota hai jab data mein outliers hon � bahut chhote ya bahut bade values. Pehle data sort karo, phir middle value nikalo. Agar even count hai toh dono middle values ka average lo.
import statistics
data = [85, 90, 78, 92, 88, 76, 95, 89]
# Median - middle value
median = statistics.median(data)
print(f"Median: {median}") # 88.5
# Odd count mein seedha middle value
odd_data = [85, 90, 78, 92, 88]
print(f"Median: {statistics.median(odd_data)}") # 88MODE: most frequent value
Mode sabse zyada baar aane wali value hai. Exam mein sabse common marks kaunse hain, ya shop mein sabse zyada bikne wali cheez kaunsi hai � mode se pata chalta hai.
import statistics
scores = [85, 90, 85, 78, 90, 85]
# Mode - sabse frequent value
mode = statistics.mode(scores)
print(f"Mode: {mode}") # 85STD DEV & VARIANCE: data kitna spread hai
Standard deviation batata hai ki data mean se kitna door hai. Kam standard deviation ka matlab hai data tightly packed hai. Variance standard deviation ka square hai � spread ka squared measure.
import statistics
data = [85, 90, 78, 92, 88, 76, 95, 89]
# Standard Deviation - spread kitna hai
stdev = statistics.stdev(data)
print(f"Std Dev: {stdev:.2f}") # 6.30
# Variance - spread ka square
variance = statistics.variance(data)
print(f"Variance: {variance:.2f}") # 39.70Try it: statistics calculate karo
Neeche ka editor Python jaisa hai. Yahan apna code likho aur "Run Python" dabao. Screen par results dikhenge � yeh browser-based simulation hai, real server nahi.
Sab statistics ek saath
Ek script mein saare basic statistics nikal sakte ho � comprehensive analysis hoti hai. Yeh approach real data projects mein bahut kaam aata hai.
import statistics
data = [85, 90, 78, 92, 88, 76, 95, 89]
# Comprehensive statistics
print(f"Count: {len(data)}")
print(f"Mean: {statistics.mean(data)}")
print(f"Median: {statistics.median(data)}")
print(f"Mode: {statistics.mode([85, 90, 85, 78, 90, 85])}")
print(f"Std Dev: {statistics.stdev(data):.2f}")
print(f"Variance: {statistics.variance(data):.2f}")
print(f"Min: {min(data)}")
print(f"Max: {max(data)}")
print(f"Range: {max(data) - min(data)}")Quick check
[10, 20, 30, 40, 50] ke liye mean aur median nikalo. Dono ka answer alag-alag line mein likho.
statistics.mean() aur statistics.median() use karo. Dono ka answer 30 aayega kyunki data symmetric hai.
Common beginner mistakes
- Outliers se mean gerna: Agar data mein bahut extreme values hain (jaise 0 ya 1000), toh mean misleading ho sakta hai. Median zyada reliable hota hai.
- Mode bhoolna: Har data mein mode hota hai. Agar sab values alag hain toh mode meaningful nahi hoga � isliye pehle check karo ki koi repeated value hai ya nahi.
- Std dev aur variance confuse karna: Std dev original unit mein hota hai (marks), variance squared unit mein (marks�). Std dev zyada interpret hota hai.
- Sorted data nahi karna: Median nikalne ke liye data sort karna zaroori hai. Python ka
statistics.median()automatically sort karta hai, lekin manually nikalte waqt yaad rakhna.
Ab Probability par chalo � chances aur likelihood seekho. Statistics aur probability milkar Data Science ki foundation banate hain.