정규분포(Normal Distribution)는 데이터가 평균을 중심으로 좌우 대칭인 종 모양의 분포를 의미합니다.
평균 ± 1σ 에 약 68.3%의 데이터가 분포하고 있으며,
평균 ± 2σ에는 약 95%의 데이터가 분포하고 있고,
평균 ± 3σ에는 약 99.7%의 데이터가 분포하고 있습니다.
정규분포는 평균(μ; 데이터의 중심)와 표준편차(σ; 데이터의 퍼져있는 정도)로 형태가 결정됩니다.
주로 아래와 같은 통계 분석에서 정규분포를 활용합니다.
데이터의 분포 확인
이상치 분석
가설검정
신뢰구간 확인
회귀분석
A/B 테스트
SASHELP라이브러리의 Class 데이터는 19명의 학생이름, 성별, 나이, 키, 몸무게에 대한 정보를 담고 있는 테이블입니다.
해당 데이터 중 키가 정규분포를 따르닌지 확인하기 위해 아래와 같이 코드를 통해서 확인할 수 있습니다.
PROC UNIVARIATE DATA=SASHELP.CLASS NORMAL;
VAR HEIGHT;
HISTOGRAM HEIGHT / NORMAL;
RUN;
PROC UNIVARIATE 는 숫자 변수의 분포를 다양한 통계량과 그래프로 확인하고 분석하려는 변수가 정규분포를 따르는지 검정하는 Statement 입니다.
PROC UNIVARIATE의 NORMAL 옵션은 정규성 검정(Normality Test)를 수행하라는 옵션입니다.
"Height가 정규분포인지 검증"하기 위해 다양한 통계량을 출력하고, P값을 통해서 해당 변수가 정규성을 따르는지 확인할 수 있다.
P-value ≥ 0.5
귀무가설을 기각하지 못하고, 정규분포를 따른다라고 할 수 있습니다.
P-value < 0.5
귀무가설을 기각하고 정규분포를 따르지 않는다라고 판단합니다.
정규성 검정에 계산되는 검정통계량은 여러가지 이지만, P-value가 모두 0.05보다 크기 때문에 귀무가설을 기각하지 못합니다.
즉, Height 변수는 정규분포를 따른다라고 볼 수 있습니다.
It's your turn to help shape SAS Innovate 2027. Share your expertise and inspire the SAS community.