📐 JunoMath 🏛 수학사 연표 🇺🇸 미국 수학 🎓 대입 기출
0 / 227
← 전체 목차
데이터 사이언스 수학

03 기술통계와 추론통계

중단원 2개 · 소단원 7개

1. 기술통계

데이터, 모집단과 표본, 편향

영상

핵심 알고 싶은 전체가 모집단, 실제로 관측한 일부가 표본. 표본이 모집단을 왜곡되게 대표하면 편향이 생긴다.

역사 ‘일부로 전체를 말한다’는 표본조사는 통계학의 출발점이자 최대 함정이다. 1936년 미국 대선에서 거대 표본의 여론조사가 표본 편향 탓에 빗나간 사건은 데이터의 양보다 대표성이 중요함을 일깨웠고, 오늘날 데이터 수집 설계의 교훈으로 남았다.

평균, 중앙값, 최빈값

영상

핵심 평균 xˉ=1nxi\bar{x}=\dfrac{1}{n}\displaystyle\sum x_{i}, 크기순 가운데 값인 중앙값, 가장 자주 나오는 최빈값. 데이터의 중심을 나타내는 세 척도다.

역사 ‘대푯값 하나로 데이터를 요약’하려는 시도는 천문 관측의 평균에서 비롯됐다. 19세기 케틀레는 ‘평균인(平均人)’ 개념으로 사회 현상에 평균을 적용했다. 평균은 이상치에 휘둘리지만 중앙값은 견고하다는 차이는, 데이터 분석에서 늘 따져야 할 핵심이다.

분산과 표준편차

영상

핵심 분산 σ2=1n(xixˉ)2\sigma^{2}=\dfrac{1}{n}\displaystyle\sum(x_{i}-\bar{x})^{2}은 평균에서 흩어진 정도, 표준편차 σ=σ2\sigma=\sqrt{\sigma^{2}}는 그 제곱근으로 원자료와 같은 단위를 가진다.

역사 ‘얼마나 퍼져 있는가’를 하나의 수로 재려는 노력이 분산과 표준편차를 낳았다. 19세기 골턴·피어슨이 이를 정립했고, 표준편차는 데이터 과학에서 변동성·위험·노이즈를 재는 기본 단위이자 정규분포·Z-점수의 척도가 된다.

정규분포와 Z-점수

영상

핵심 평균 μ\mu, 표준편차 σ\sigma의 종 모양 분포. 표준화 Z=xμσZ=\dfrac{x-\mu}{\sigma}로 ‘평균에서 표준편차 몇 배 떨어졌는지’를 나타내 서로 다른 분포를 비교한다.

역사 측정 오차와 수많은 우연이 겹친 양은 종 모양 곡선을 이룬다. 드무아브르가 발견하고 가우스가 정립한 정규분포는 자연·사회에 두루 나타나 통계의 중심에 섰다. Z-점수는 단위가 다른 데이터를 같은 잣대로 비교하게 해 주는 표준화의 핵심이다.

2. 추론통계

중심극한정리와 신뢰구간

영상

핵심 표본평균은 표본 크기가 커지면 모집단 분포와 무관하게 정규분포에 가까워진다(중심극한정리). 이를 이용해 모평균이 들어갈 범위를 신뢰구간으로 추정한다.

역사 ‘무엇이든 평균 내면 정규분포가 된다’는 중심극한정리는 통계학의 기적이라 불린다. 라플라스가 일반형을 제시한 이 정리 덕분에, 표본으로 모집단을 추정하는 일이 정당화되어 여론조사·품질관리·실험 분석의 토대가 되었다.

p-값과 가설검정

영상

핵심 귀무가설이 참이라 가정했을 때 관측값 이상으로 극단적인 결과가 나올 확률이 p-값. 보통 0.050.05보다 작으면 귀무가설을 기각한다.

역사 20세기 초 피셔가 도입한 p-값과 가설검정은 ‘우연인가 진짜 효과인가’를 가르는 표준 절차가 되었다. 다만 p-값의 오용·p-해킹 논란은, 통계적 유의성이 실질적 중요성과 다름을 데이터 과학자가 늘 경계해야 함을 일깨운다.

t-분포

영상

핵심 표본이 작아 모표준편차를 모를 때 쓰는, 정규분포보다 꼬리가 두꺼운 분포. 표본이 커지면 정규분포에 가까워진다.

역사 1908년 기네스 양조장의 고셋은 적은 표본으로 맥주 품질을 검정하려고 t-분포를 고안했다. 회사 기밀 탓에 ‘스튜던트(Student)’라는 가명으로 발표했고, 소표본 추론의 표준이 된 이 분포는 데이터가 부족한 현실 분석에서 여전히 핵심이다.

📝

단원 이해도 퀴즈

개념을 응용한 4지선다 창작 문제 4문항

  1. Q1

    자료 2,4,6,8,102,\,4,\,6,\,8,\,10의 평균은?

  2. Q2

    자료 3,1,4,1,53,\,1,\,4,\,1,\,5의 중앙값은?

  3. Q3

    평균 5050, 표준편차 1010인 분포에서 x=70x=70의 Z-점수는?

  4. Q4

    유의수준 0.050.05의 가설검정에서 p-값이 0.030.03으로 나왔다면?

남은 4문항을 모두 선택해 주세요.