평균이라는 착시
안녕하세요, 탑에듀프렙입니다. 지난 글에서 "표본조사의 함정"을 다뤘다면, 오늘은 한 단계 더 들어가서 평균, 중앙값, 표준편차가 서로 어떻게 다른 이야기를 하는지 살펴볼게요. 이 네 문제를 풀다 보면, "평균만 알면 다 안다"고 생각했던 게 얼마나 위험한 착각인지 깨닫게 되실 거예요.
문제 1: 평균은 "더하기"의 결과다
데이터 A는 6개 값, 평균 92. 데이터 B는 4개 값. A와 B를 합쳤더니 전체 평균이 94가 됐어요. B의 평균은?
이 문제는 사실 개념이 아니라 습관의 문제예요. 평균을 볼 때 바로 "합계"로 바꿔서 생각하는 습관이요. A의 합은 92×6=552, 합친 10개의 합은 94×10=940. 그럼 B의 합은 940−552=388이고, B의 평균은 388÷4=97이에요.
학생들이 여기서 자꾸 헤매는 이유는 평균을 "평균끼리 어떻게든 섞으면 되겠지"라는 감으로 접근하기 때문이에요. (92+94)÷2 같은 걸 시도하다가 틀리는 경우가 정말 많아요. 평균은 절대 평균끼리 더하고 나누는 게 아니에요. 반드시 합계로 바꿔서 계산해야 해요. 이 습관 하나만 잡아도 SAT 평균 문제는 거의 다 풀립니다.
문제 2: 평균이 다르다고 해서, 다른 것도 다 다를까?
호수 A와 B의 물 81개씩을 조사했더니, A의 평균 pH는 7.3, B는 6.8이었어요. 그럼 A의 중앙값이 B의 중앙값보다 크다고 할 수 있을까요? A에서 측정된 가장 높은 pH가 B에서 측정된 가장 높은 pH보다 크다고 할 수 있을까요?
정답은 "둘 다 아니다(Neither I nor II)"예요. 이게 SAT 통계에서 학생들이 제일 자주 걸려 넘어지는 함정이에요. 평균이 높다고 해서 중앙값이 높으리란 보장은 없어요. 극단적으로 낮은 값 몇 개가 평균을 끌어내릴 수도 있고, 반대로 몇 개의 아주 높은 값이 평균을 끌어올릴 수도 있거든요. 최댓값도 마찬가지예요. 평균이 낮은 데이터셋 안에도 극단적으로 높은 값 하나가 숨어있을 수 있어요.
결국 "평균"이라는 숫자 하나로는 데이터의 생김새를 절대 다 설명할 수 없다는 게 이 문제의 핵심이에요.
문제 3: 박스플롯이 알려주는 것과 알려주지 않는 것
박스플롯 두 개, Data set 1과 Data set 2가 있어요. Data set 2의 중앙값 선이 Data set 1보다 오른쪽(더 큰 값)에 있어요. 그렇다면 "Data set 2의 평균이 Data set 1의 평균보다 크다"고 반드시 말할 수 있을까요? "Data set 2의 범위(range)가 Data set 1의 범위보다 크다"고 할 수 있을까요?
정답은 "둘 다 아니다"예요. 박스플롯은 중앙값과 사분위수, 그리고 최댓값·최솟값(범위)을 보여주지, 평균을 직접 보여주지 않아요. 중앙값이 크다고 평균도 크다는 보장은 없어요 (데이터가 한쪽으로 치우쳐 있으면 평균과 중앙값이 크게 벌어질 수 있거든요). 그리고 그림을 자세히 보면 Data set 1의 수염(whisker)이 오히려 더 넓게 뻗어 있어서, 범위는 Data set 1 쪽이 더 클 수도 있어요.
박스플롯 문제를 풀 때 가장 조심해야 할 태도는 이거예요. "중앙값이 커 보인다고 평균도 클 거라고 넘겨짚지 않기." 박스플롯이 그려주지 않는 정보(평균)에 대해서는 절대 확답할 수 없다는 걸 기억하세요.
문제 4: 모양은 다른데, 평균은 같을 수 있다
두 개의 점도표(dot plot), Data set A와 Data set B가 있어요. A는 가운데(22, 24 부근)에 점들이 몰려 있는 종 모양이고, B는 양 끝(20과 25)에 점들이 몰려 있는 모양이에요. 겉보기엔 완전히 다르게 생겼죠. 그런데 "A와 B의 평균이 같다"는 말은 참일 수 있고, "A와 B의 표준편차가 같다"는 말은 참이 아니에요. 정답은 "I만 참(I only)"이에요.
이 문제가 진짜 가르쳐주고 싶은 개념은 바로 이거예요. 평균은 데이터가 어디에 "중심"을 두고 있는지를 말해주고, 표준편차는 데이터가 그 중심에서 얼마나 "퍼져" 있는지를 말해줘요. 두 데이터가 같은 중심을 가지고 있어도, 하나는 중심에 옹기종기 모여 있고 다른 하나는 양 끝으로 쫙 퍼져 있을 수 있어요. 이럴 때 평균은 같지만 표준편차는 완전히 다르게 나와요. B처럼 극단값 쪽에 데이터가 몰려 있으면 표준편차(퍼짐 정도)는 훨씬 커지죠.
결론: 평균 하나로 데이터를 다 안다고 생각하지 말 것
오늘 다룬 네 문제를 관통하는 메시지는 하나예요. 평균, 중앙값, 최댓값, 범위, 표준편차는 서로 다른 질문에 답하는 서로 다른 도구라는 것. 평균이 같다고 모양이 같은 것도 아니고, 평균이 다르다고 중앙값까지 다른 것도 아니에요. 이 다섯 가지 통계량이 각각 무엇을 말해주는지 정확히 구분할 수 있으면, SAT 통계 파트에서 "그럴듯한 오답"에 더 이상 속지 않게 됩니다.
탑에듀프렙에서는 이런 개념들을 단순 암기가 아니라, 그래프와 실제 숫자를 직접 비교해보며 "왜 이게 함정인지" 체감하도록 지도하고 있어요. 통계 파트에서 자꾸 감으로 찍고 있다면, 지금이 바로 이 다섯 가지 통계량의 차이를 다시 정리해볼 타이밍이에요.