Lesson 02 � Data Science

DATA KI
LANGUAGE SEEKHO.

Statistics data ki language hai � mean, median, mode sab statistics ke concepts hain. Data Science without statistics possible nahi hai. Yeh lesson aapko basic statistical measures seekhayega jo har data analysis mein use hote hain.

? 20 min✓ Beginner✓ Prerequisite: Introduction

WHY: Statistics kyun zaroori hai?

Data aata hai raw form mein � numbers, names, dates. Isme se meaning nikalne ke liye statistics chahiye. "Average marks kitne hain?" � mean se pata chalega. "Sabse zyada kisne score kiya?" � mode batayega. "Marks kitne spread hain?" � standard deviation dikhaayega. Statistics ke bina data sirf numbers ka hai, insights nahi.

MEAN

Sab values ka average � total sum divided by count. Data ka central tendency dikhata hai.

MEDIAN

Middle value jab data sorted ho. Outliers se affect nahi hota � robust measure hai.

MODE

Sabse frequently aane wali value. Categorical data mein sabse useful measure.

STD DEV

Data kitna spread hai mean se. Kam standard deviation = data tightly packed, zyada = data scattered.

HOW: mean kaise nikalein

Mean sabse basic statistical measure hai. Sab numbers ko add karo aur count se divide karo � bas. Python mein statistics.mean() se directly mil jaata hai.

python
import statistics

data = [85, 90, 78, 92, 88, 76, 95, 89]

# Mean - sab marks ka average
mean = statistics.mean(data)
print(f"Mean: {mean}") # 86.625
Mental model: Mean jaise 8 students ke marks ka total nikalna aur 8 se divide karna. Agar sab marks 86 ke aas-paas hain toh mean bhi kareeb hoga.

MEDIAN: middle value

Median tab useful hota hai jab data mein outliers hon � bahut chhote ya bahut bade values. Pehle data sort karo, phir middle value nikalo. Agar even count hai toh dono middle values ka average lo.

python
import statistics

data = [85, 90, 78, 92, 88, 76, 95, 89]

# Median - middle value
median = statistics.median(data)
print(f"Median: {median}") # 88.5

# Odd count mein seedha middle value
odd_data = [85, 90, 78, 92, 88]
print(f"Median: {statistics.median(odd_data)}") # 88
Pro tip: Agar data mein 100 ke upar marks hain aur ek student ne 0 liya hai, toh mean gir jaayega lekin median✓ nahi hoga. Isliye salary data mein median zyada use hota hai.

MODE: most frequent value

Mode sabse zyada baar aane wali value hai. Exam mein sabse common marks kaunse hain, ya shop mein sabse zyada bikne wali cheez kaunsi hai � mode se pata chalta hai.

python
import statistics

scores = [85, 90, 85, 78, 90, 85]

# Mode - sabse frequent value
mode = statistics.mode(scores)
print(f"Mode: {mode}") # 85

STD DEV & VARIANCE: data kitna spread hai

Standard deviation batata hai ki data mean se kitna door hai. Kam standard deviation ka matlab hai data tightly packed hai. Variance standard deviation ka square hai � spread ka squared measure.

python
import statistics

data = [85, 90, 78, 92, 88, 76, 95, 89]

# Standard Deviation - spread kitna hai
stdev = statistics.stdev(data)
print(f"Std Dev: {stdev:.2f}") # 6.30

# Variance - spread ka square
variance = statistics.variance(data)
print(f"Variance: {variance:.2f}") # 39.70
Mental model: Standard deviation jaise batana ki students ke marks kitne scattered hain. Agar sabke marks 85-88 ke beech hain toh std dev chhota hoga. Agar kisi ke 50 aur kisi ke 100 hain toh std dev bada hoga.

Try it: statistics calculate karo

Neeche ka editor Python jaisa hai. Yahan apna code likho aur "Run Python" dabao. Screen par results dikhenge � yeh browser-based simulation hai, real server nahi.

Python playgroundFirst run download kar sakta hai
Run Python dabayein

Sab statistics ek saath

Ek script mein saare basic statistics nikal sakte ho � comprehensive analysis hoti hai. Yeh approach real data projects mein bahut kaam aata hai.

python
import statistics

data = [85, 90, 78, 92, 88, 76, 95, 89]

# Comprehensive statistics
print(f"Count: {len(data)}")
print(f"Mean: {statistics.mean(data)}")
print(f"Median: {statistics.median(data)}")
print(f"Mode: {statistics.mode([85, 90, 85, 78, 90, 85])}")
print(f"Std Dev: {statistics.stdev(data):.2f}")
print(f"Variance: {statistics.variance(data):.2f}")
print(f"Min: {min(data)}")
print(f"Max: {max(data)}")
print(f"Range: {max(data) - min(data)}")

Quick check

[10, 20, 30, 40, 50] ke liye mean aur median nikalo. Dono ka answer alag-alag line mein likho.

statistics.mean() aur statistics.median() use karo. Dono ka answer 30 aayega kyunki data symmetric hai.

Common beginner mistakes

Statistics Basics complete?

Ab Probability par chalo � chances aur likelihood seekho. Statistics aur probability milkar Data Science ki foundation banate hain.