기술 통계: 평균, 중앙값, 최솟값, 최댓값, 분산
12강. 기술 통계: 평균, 중앙값, 최솟값, 최댓값, 분산
1. 이번 강의에서 해결할 문제
평균 점수가 같아도 대부분 비슷한 집단과 극단적으로 흩어진 집단은 플레이 경험이 다릅니다. 중심과 퍼짐을 함께 요약해야 합니다.
2. 학습 목표
3. 핵심 개념
평균은 모든 값의 합을 개수로 나눈 중심이고 중앙값은 정렬했을 때 가운데 값이라 극단값에 덜 민감합니다. 분산은 평균에서 떨어진 거리의 제곱 평균이며 표준편차는 원래 단위로 돌아온 퍼짐입니다. pandas var와 std의 기본값은 표본 보정 ddof=1이므로 모집단 전체를 요약할 때는 목적에 맞는 ddof를 명시합니다.
4. 단계별 실습
1. 예제 파일 작성
실행 환경: 코드 편집기
실행 위치: C:\dev\game-data-lab
실행 전 확인: 기존 파일이 있으면 내용을 덮어쓰지 말고 Git diff로 이번 강의 변경 범위를 확인합니다. 실제 개인정보·API Key·토큰은 사용하지 않습니다.
대상 파일: src/descriptive_stats.py
import pandas as pd
df = pd.read_csv("data/processed/analysis_sessions.csv")
for column in ["play_minutes", "score"]:
values = df[column]
print(f"[{column}]")
print({
"count": int(values.count()),
"mean": round(values.mean(), 2),
"median": round(values.median(), 2),
"min": float(values.min()),
"max": float(values.max()),
"sample_variance": round(values.var(ddof=1), 2),
"sample_std": round(values.std(ddof=1), 2),
})
2. 실행과 결과 확인
실행 환경: Windows PowerShell
실행 위치: C:\dev\game-data-lab
실행 전 확인: Python 코드는 프로젝트의 .venv 인터프리터를 사용하고 입력 파일 경로가 존재하는지 확인합니다.
대상: src/descriptive_stats.py과 이 강의가 만드는 출력
Set-Location C:\dev\game-data-lab
.\.venv\Scripts\python.exe .\src\descriptive_stats.py
예상 결과: 플레이 시간과 점수에 대해 중심, 범위와 표본 분산·표준편차가 출력됩니다.
5. 분석 또는 모델이 동작하는 이유
평균은 모든 값을 사용해 극단값의 영향을 받고 중앙값은 순서만 사용합니다. 분산은 제곱 단위이므로 실제 해석에는 같은 단위의 표준편차가 더 직관적입니다.
6. 자주 하는 실수와 해결법
7. 직접 실습
8. 이해 점검 질문 3개
9. 핵심 요약
기술 통계: 평균, 중앙값, 최솟값, 최댓값, 분산 미니 퀴즈
선택 즉시 정답과 해설을 확인할 수 있습니다. 결과는 이 브라우저에만 저장됩니다.
학습을 마쳤나요?
직접 실습과 점검 질문까지 확인한 뒤 완료로 표시하세요.