확률과 통계의 차이
핵심 확률은 ‘원인(모형)에서 결과(데이터)의 가능성’을 예측하고, 통계는 ‘관측된 데이터에서 원인(모형)’을 추론한다. 서로 역방향이다.
역사 확률과 통계는 동전의 양면이다. 17세기 도박 문제에서 태어난 확률은 ‘완벽히 아는 세계의 우연’을 다뤘고, 통계는 ‘불완전한 데이터로 세계를 추측’한다. 데이터 과학은 이 둘을 오가며, 확률 모형을 세우고 데이터로 그 모수를 추정한다.
중단원 2개 · 소단원 5개
핵심 확률은 ‘원인(모형)에서 결과(데이터)의 가능성’을 예측하고, 통계는 ‘관측된 데이터에서 원인(모형)’을 추론한다. 서로 역방향이다.
역사 확률과 통계는 동전의 양면이다. 17세기 도박 문제에서 태어난 확률은 ‘완벽히 아는 세계의 우연’을 다뤘고, 통계는 ‘불완전한 데이터로 세계를 추측’한다. 데이터 과학은 이 둘을 오가며, 확률 모형을 세우고 데이터로 그 모수를 추정한다.
핵심 두 사건이 함께 일어날 결합확률 , 적어도 하나가 일어날 합사건 확률 . 독립이면 .
역사 ‘그리고(AND)’는 곱하고 ‘또는(OR)’은 더한다는 규칙은 17세기 파스칼·페르마의 확률론에서 정립되었다. 데이터 과학에서 여러 특성을 결합해 확률을 계산하는 모든 모형(나이브 베이즈 등)이 이 기본 규칙 위에 서 있다.
핵심 가 일어났을 때 의 확률 . 베이즈 정리 로 원인의 확률을 거꾸로 구한다.
역사 18세기 베이즈 목사의 정리는 ‘관측으로 믿음을 갱신’하는 법을 알려 준다. 사전확률을 데이터로 사후확률로 바꾸는 이 발상은 스팸 필터·의료 진단·추천 시스템의 심장으로, 현대 데이터 과학에서 가장 널리 쓰이는 정리 중 하나다.
핵심 성공확률 인 시행을 번 독립 반복할 때 성공 횟수 의 분포 .
역사 같은 시행을 거듭할 때의 성공 횟수를 다루는 이항분포는 야코프 베르누이가 정립했다. ‘번 중 번 성공’의 확률을 주는 이 분포는, A/B 테스트의 전환율처럼 예·아니오로 나뉘는 데이터를 모형화하는 출발점이다.
핵심 구간에서 정의되는 연속분포로, 두 모수 로 모양이 정해진다. ‘성공확률 자체의 분포’를 나타내 베이즈 추론에 쓴다.
역사 베타분포는 ‘확률에 대한 확률’을 다룬다. 8번 시도해 6번 성공했을 때 ‘진짜 성공률이 얼마일지’의 분포를 베타분포로 표현한다. 이항분포와 짝(켤레사전분포)을 이뤄, 데이터로 믿음을 갱신하는 베이즈 추론을 매끄럽게 만든다.
개념을 응용한 4지선다 창작 문제 4문항
서로 독립인 두 사건 에 대하여 , 일 때 는?
, , 일 때 는?
, 일 때 조건부확률 는?
이항분포 를 따르는 에 대하여 는?