구성동 고등수학과외







구성동 고등수학과외에서는 확률분포를 계산하는 속도보다 기대값과 실제 관측값을 구별하는 과정부터 살핀다. 북일고등학교와 천안중앙고등학교를 오가는 생활권에서도 표본 문제를 풀 때 학생이 숫자 하나를 구한 뒤 그것을 곧바로 ‘실제로 나온 값’이라고 부르는 장면이 자주 나타난다. 구성동 주변 극동늘푸른아파트와 청수지구에서 학습하는 학생의 풀이도 이 지점에서 갈린다.
표본 17개를 읽는 순간 생긴 혼동
한 학생에게 어떤 확률변수의 분포가 제시되고 표본 크기가 17이라고 하자. 학생은 표에 있는 값과 확률을 곱해 더한 뒤 계산 결과를 적었다. 여기까지는 기대값을 구하는 절차에 가깝다. 그런데 답안에는 “17회 시행에서 실제로 이 값이 나온다”라고 적혀 있었다. 계산한 값은 반복 시행을 충분히 했을 때의 평균적인 중심을 뜻할 뿐, 특정 표본 17개에서 반드시 관측되는 결과를 뜻하지 않는다.
첫 오류는 계산식의 마지막 줄이 아니었다. 학생이 표본 크기 17이라는 조건만 보고 확률분포의 조건을 확인하지 않은 채 풀이를 진행한 순간이었다. 어떤 확률변수인지, 각 값의 확률 합이 1인지, 구하려는 것이 분포의 평균인지 표본에서 얻은 실제 평균인지 구분하지 않았다. 그래서 기대값과 실제값의 설명이 서로 뒤집혔다.
오류가 시작된 줄을 남겨 두고 고치기
풀이를 전부 지우게 하지 않고 첫 문장 옆에 두 질문을 적었다. “지금 구하는 값은 분포가 예측하는 평균인가?” “17번 시행 뒤 관측된 자료가 주어졌는가?” 분포표만 있고 실제 관측 목록이 없다면 먼저 기대값을 계산한다. 확률변수의 값이 x이고 확률이 p(x)일 때 평균은 Σxp(x)로 정리된다. 반대로 17개의 실제 결과가 주어졌다면 각 관측값을 더해 17로 나눈 표본평균을 구한다.
학생은 기존 답안의 ‘17회에서 이 값이 나온다’라는 문장을 지우지 않고, 그 아래에 “분포의 장기 평균이며 한 번의 표본 결과를 확정하지 않는다”라고 대조해 적었다. 이어 확률의 합이 1인지, 단위가 횟수인지 점수인지 확인했다. 이 과정에서 기대값은 가능한 값 중 하나가 아닐 수도 있다는 점도 확인했다. 예를 들어 기대값이 4.6이라면 한 번의 결과가 4.6이라고 말할 수 없고, 여러 번 반복했을 때 평균이 그 주변으로 가까워진다는 뜻이다.
조건을 하나 가린 새 문제
다음 연습에서는 표본 크기 17이라는 숫자만 남기고 ‘확률분포표’라는 단서를 가렸다. 학생은 먼저 실제 관측값 17개가 제시되었는지 확인했다. 자료가 없으므로 표본평균을 계산할 수 없고, 확률과 가능한 값이 있어야 기대값을 구할 수 있다고 답했다. 이후 평균이 18.4, 표준편차가 4.8인 32개 자료를 제시하자 이번에는 18.4를 기대값이라고 단정하지 않고, 주어진 자료의 표본평균인지 분포의 모수인지 문맥을 먼저 읽었다.
수치가 달라진 문제에서도 학생은 ‘평균’이라는 단어만 보고 같은 공식을 반복하지 않았다. 분포의 확률을 이용하는지, 실제 자료를 이용하는지에 따라 계산 대상이 달라진다는 설명을 스스로 붙였다. 표본 수가 17에서 32로 바뀌어도 구분 기준은 변하지 않는다는 점도 확인했다.
가장 자주 나오는 값과 기대값을 비교하다
마지막에는 기대값을 최빈값으로 착각하는 반례를 점검했다. 값 0이 나올 확률이 0.6, 값 10이 나올 확률이 0.4라면 가장 자주 나오는 값은 0이다. 그러나 기대값은 0×0.6+10×0.4=4이다. 실제 한 번의 관측값은 0 또는 10일 수 있고 4가 관측될 필요는 없다. 학생은 세 결과를 나란히 적었다. 최빈값은 가장 가능성이 큰 값, 기대값은 확률을 가중치로 둔 평균, 실제값은 시행에서 직접 얻은 결과다.
분포에서 계산한 평균과 17번 시행에서 기록된 자료의 평균은 같은 기호로 표현되더라도 출처와 의미를 먼저 확인해야 한다.
자주 묻는 질문
표본 크기 17이면 기대값도 17과 관련해 바뀌나요?
기대값 자체는 분포가 정해지면 표본 크기와 별개로 정의된다. 표본 크기는 실제 자료의 평균이나 추정의 안정성과 관련된다.
기대값이 실제 가능한 값이 아니어도 되나요?
된다. 기대값은 확률가중평균이므로 가능한 값 사이의 수로 나타날 수 있다.
평균이라는 말만 있으면 기대값인가요?
아니다. 확률과 가능한 값으로 계산한 평균인지, 관측된 자료를 합해 나눈 평균인지 확인해야 한다.
최빈값과 기대값이 같을 수도 있나요?
같을 수 있지만 항상 그런 것은 아니다. 두 개념은 정의가 다르므로 분포에 따라 따로 계산한다.
마지막 검산은 어떻게 하나요?
계산한 기대값을 원래 분포의 값들과 비교하고, 최빈값이나 실제 관측값과 혼동하지 않았는지 문장으로 다시 설명한다.