데이터 분석 전체 흐름: 질문 설정부터 결과 공유까지
2강. 데이터 분석 전체 흐름: 질문 설정부터 결과 공유까지
1. 이번 강의에서 해결할 문제
도구부터 실행하면 멋진 그래프를 만들고도 어떤 결정을 위한 결과인지 설명하지 못합니다. 분석 전에 성공 기준과 검증 순서를 정해야 합니다.
2. 학습 목표
3. 핵심 개념
분석 흐름은 질문 정의 → 데이터 이해 → 품질 검사 → 정제 → 탐색·집계 → 시각화 → 필요할 때 모델링 → 평가 → 해석·공유 순서입니다. 결과가 예상과 다르면 이전 단계로 돌아가는 반복 과정입니다. 원본은 수정하지 않고 processed와 reports를 분리해야 처리 근거를 추적할 수 있습니다.
4. 단계별 실습
1. 예제 파일 작성
실행 환경: 코드 편집기
실행 위치: C:\dev\game-data-lab
실행 전 확인: 기존 파일이 있으면 내용을 덮어쓰지 말고 Git diff로 이번 강의 변경 범위를 확인합니다. 실제 개인정보·API Key·토큰은 사용하지 않습니다.
대상 파일: docs/analysis-plan.md
# 분석 계획
- 결정: 초보 구간에서 조정할 캐릭터 한 개를 제안한다.
- 1차 지표: 캐릭터별 승률
- 보조 지표: 경기 수, 중앙 점수, 중앙 플레이 시간
- 비교: 게임 모드와 플레이 시간 구간
- 품질 기준: 중복 ID 없음, 필수 열 결측 없음, 플레이 시간 1~180분
- 공유: 집계 CSV, 그래프 PNG, 해석과 한계가 담긴 Markdown 보고서
2. 실행과 결과 확인
실행 환경: Windows PowerShell
실행 위치: C:\dev\game-data-lab
실행 전 확인: Python 코드는 프로젝트의 .venv 인터프리터를 사용하고 입력 파일 경로가 존재하는지 확인합니다.
대상: docs/analysis-plan.md과 이 강의가 만드는 출력
Set-Location C:\dev\game-data-lab
New-Item -ItemType Directory -Force data\raw,data\processed,src,reports\tables,reports\figures
Get-ChildItem -Recurse -Directory
예상 결과: 원본·정제 데이터, 코드, 표·그래프·보고서가 분리된 프로젝트 구조가 생성됩니다.
5. 분석 또는 모델이 동작하는 이유
성공 기준은 분석을 끝낼 조건을 제공하고, 원본과 파생 산출물 분리는 같은 입력에서 결과를 다시 만드는 재현성을 지킵니다.
6. 자주 하는 실수와 해결법
7. 직접 실습
8. 이해 점검 질문 3개
9. 핵심 요약
데이터 분석 전체 흐름: 질문 설정부터 결과 공유까지 미니 퀴즈
선택 즉시 정답과 해설을 확인할 수 있습니다. 결과는 이 브라우저에만 저장됩니다.
학습을 마쳤나요?
직접 실습과 점검 질문까지 확인한 뒤 완료로 표시하세요.