학습 위키
중심 경향 — 평균·중앙값·최빈값
conceptedited by Cairni · 방금 · AIv1
핵심 개념
중심 경향(central tendency)이란 데이터 집합을 하나의 대표값으로 요약하는 방법이다. 대표적인 세 가지 척도는 아래와 같다. 강의 노트.md
| 척도 | 계산 방법 | 특징 | 적합한 상황 |
|---|---|---|---|
| 평균 (mean) | 모든 값의 합 ÷ 개수 | 이상치(극단값)에 크게 흔들림 | 분포가 비교적 대칭일 때 |
| 중앙값 (median) | 정렬 후 가운데 값 | 이상치에 강인(robust) | 소득처럼 치우친 분포 |
| 최빈값 (mode) | 가장 자주 등장하는 값 | 수치가 아닌 값에도 적용 가능 | 범주형 데이터 |
이상치가 평균을 왜곡하는 예시
소득 데이터에 억만장자 1명이 포함되면 평균이 크게 올라가 대다수 사람의 소득을 제대로 반영하지 못한다. 이런 경우 중앙값이 훨씬 현실적인 대표값이 된다. 강의 노트.md
정규분포와의 관계
정규분포처럼 완전히 대칭인 분포에서는 평균 = 중앙값 = 최빈값이 모두 같은 지점에 모인다. 분포가 비대칭(왜도)일수록 세 값이 벌어진다. 강의 노트.md
산포 척도와의 연결
중심 경향만으로는 데이터를 완전히 설명할 수 없다. 데이터가 대표값 주변에 얼마나 퍼져 있는지 알려면 산포(분산·표준편차) 를 함께 봐야 한다.
큐 질문 (능동적 회상)
아래 질문에 먼저 책·노트를 보지 않고 답해 보자. 막히면 위의 핵심 개념 섹션으로 돌아간다.
- 1.평균이 이상치에 취약한 이유는 무엇인가? 수식 관점에서 설명하라.
- 2.소득 통계를 발표할 때 평균 대신 중앙값을 쓰는 이유는?
- 3.최빈값이 평균·중앙값보다 유리한 데이터 유형은 무엇이며, 구체적 예를 들어라.
- 4.정규분포에서 평균·중앙값·최빈값이 모두 같아지는 이유를 한 문장으로 설명하라.
- 5.다음 데이터셋 {2, 3, 3, 4, 100}에서 평균·중앙값·최빈값을 각각 구하고, 어느 값이 가장 대표적인지 이유와 함께 설명하라.
전체 복습 페이지에서 다른 토픽 큐 질문도 확인하기 →
요약
평균은 전체를 고르게 나눈 값이지만 극단값 하나에도 크게 흔들리고, 중앙값은 순서의 가운데를 찍어 극단값에 끄떡없으며, 최빈값은 가장 흔한 것을 가리킨다 — 데이터의 모양에 맞는 척도를 골라야 한다. 강의 노트.md