탐색적 데이터 분석의 개념과 이상치 검출, 상관관계 분석, 중심화 경향·산포도·분포형태 같은 기초통계량과 모멘트, 시각적 데이터 탐색 기법을 정리한 문서.
aistatisticsedadata-analysis
탐색적 데이터 분석, EDA
수집한 데이터가 들어왔을 때, 다양항 방법을 통해서 자료를 관찰하고 이해하는 과정을 의미하는 것으로 데이터 분석 전에 자료를 직관적인 방법으로 통찰하는 과정이다.
탐색적 데이터 분석의 필요성
데이터 분포 및 값을 검토함으로써 데이터가 표현하는 현상을 이해하며 내제된 잠재적 문제에 대해 인식하고 해결안을 도출할 수 있다.
다양한 각도에서 데이터를 살펴보는 과정을 통해 문제정의 단계에서 인지 못한 새로운 양상, 패턴을 발견할 수 있다.
분석과정 및 절차
분석의 목적과 변수가 무엇인지, 개별변수의 이름이나 설명을 가지는지 확인한다.
데이터의 문제성(즉, 데이터의 결측치의 유무, 이상치의 유무)을 확인한다.
데이터의 개별 속성값이 예상한 범위 분포를 가지는지 확인한다
관계속성 확인 절차를 가진다.
이상치가 왜 발생했는지 의미를 파악하는 것이 중요하다. 그리고 그러한 의미를 파악했으면 어떻게 대처해야 할지 판단한다.
이상치의 검출
1. 개별 데이터 관찰
데이터 값을 눈으로 살펴보면서 전체적인 추세와 특이사항을 관찰할 수 있다. 데이터가 많아도 앞만 보면 안되고 무작위로 표본을 추출해서 관찰한다. 단 이상치는 표본이 작은 경우 나타나지 않을 수 있다.
2. 통계값 활용
데이터의 중심을 알기 위해서는 평균(mean), 중앙값(median), 최빈값(mode)을 사용할 수 있다.
데이터의 분산도를 알기 위해서는 범위, 분산(variance)을 사용할 수 있다.
통계지표를 이용할 때는 데이터의 특성에 주의해야 한다. 평균에는 집합 내 모든 데이터 값이 반영되기 때문에 이상값이 영향을 줄 수 있기 때문이다.
3. 시각화 활용
시각적인 표현은 분석에 많은 도움을 준다. 확률밀도 함수, 히스토그램 등이 있다.
상관관계 분석
1. 변수 간의 상관성 분석
두 변수 간에 어떤 선형적 관계를 갖고 있는지를 분석하는 방법이다. 두 변수는 서로 독립적인 관계이거나 상관된 관계일 수 있으며 이 때 두 변수 간의 관계의 강도를 상관관계라 한다.
단순상관분석 : 단순히 두 개의 변수가 어느정도 강한 관계가 있는가를 측정한다.
다중상관분석 : 3개 이상의 변수 간의 관계강도를 측정한다.
편상관관계분석 : 다중상관분석에서 다른 변수와의 관계를 고정하고 두 변수의 관계강도를 측정하는 것을 말한다.
2. 상관 분석의 기본 가정
선형성 : X와 Y의 관계가 직선적인지를 알아보는것
동변량성 : X의 값에 관계없이 Y의 흩어진 정도가 같은 것을 의미한다.
두 변인의 정규 분포성 : 두 변인의 측정치 분포가 모두 정규 분포
무선독립표본 : 모집단에서 표본을 뽑을 때 표본대상이 확률적으로 선정된다는 것이다.
3. 상관분석 방법
1. 피어슨 상관계수
두 변수 X와 Y간의 선형관계를 계량화한 수치이다.
피어슨 상관계수는 +1과 -1 사이의 값을 가지며, +1은 완벽한 양의 선형 상관관계, 0은 선형 상관관계 없음, -1은 완벽한 음의 선형 상관관계를 의미한다. p는 분석한 상관계수를 의미한다.
상관계수는 두 변량, xy사이의 상관관계의 정도를 나타내는 수치
2. 스피어만 상관계수
데이터가 순위를 이용하는 경우의 상관계수로서, 데이터를 작은 것부터 차례로 순위를 매겨 서열 순서로 바꾼 뒤 순위를 이용해 상관계수를 구한다.
두 변수 간의 연관 관계가 있는지 없는지를 밝혀주며 자료에 이상점이 있거나 표본크기가 작을때 유용하다.
두 변수 간의 단조 관계를 파악하는데 사용된다. 단조관계는 두 변수가 동일한 방향으로 변화는 하지만 직선의 형태로 모형화가 가능하지 않은 것을 의미합니다.
기초통계량의 추출 및 이해
자료를 수집하여 요약 정리하는 기초통계는 자료의 특성을 정량적인 수치에 의해서 나타내는 방법이다. 자료의 특성을 중심화 경향, 퍼짐 정도(산포도, 분산도), 자료의 분포형태등의 수치적 결과로 나타낼 수 있다.
1. 중심화 경향 기초 통계량
산술평균 : 모든 자료들을 합한 후 전체 자료수로 나누어 계산하는 일반적인 평균
모평균 : 모집단 전체 자료의 산술평균
표본평균: 모집단의 부분집합인 추출된 표본 전체의 산술
기하평균 : n 개의 자료에 대해서 관측치를 곱한 후 n 의 제곱근으로 표현한다.
조화평균 : 각 요소의 역수의 산술평균을 구한 후 다시 역수를 취하는 형태로 표현한다. 변화율등의 평균을 구할때 사용한다.
각 자료가 동일한 경우 자료에 대한 산술평균, 기하평균, 조화평균의 값은 같다. 다만 자료가 서로 다를 경우 조화평균 <= 기하평균 <= 산술평균의 부등식 관계를 같는다.
중앙값, Median
최빈값, Mode : 가장 노출 빈도가 높은 자료를 최빈 값이라 한다. 최빈값은 질적자료나 양적자료 모두에 사용된다.
분위수, Quantile : 분위수는 자료의 위치를 표현하는 수치이다. 자료를 크기 순서대로 배열을 한 후 그 자료를 분할하는 역할을 하는 위치의 수치를 계산한것이다.
ex) 자료를 몇등분하느냐에 따라서 사분위수, 오분위수, 십분위수, 백분위수로 나뉜다.
2. 산포도, 분산도, Degree Dispersion
자료의 퍼짐 정도를 나타내는 기초 통계량이다. 중심 위치의 측도만으로 자료의 분표에 대한 충분한 정보를 얻을 수 없으므로 중심 경향도 수치에서 자료가 얼마나 떨어져 있는지를 측정하는 척도도 필요하다.
분산(Variance), 표준편차(Standard Deviation)
분산은 평균을 중심으로 밀집되거나 퍼짐 정도를 나타내는 척도
표준편차는 분산의 제곱근으로 표현한다.
분산은 개개의 자료값과 평균과의 편차의 제곱을 이용하여 표현되므로 분산으로 얻은 수치를 해석하기가 곤란하다는 단점을 보완하기 위하여 표준편차는 제곱근을 취한 척도가 표준이다.
개개의 자료값에 대한 정보를 반영한다
수리적으로 다루기 쉽다.
특이점에 매우 큰 영향을 받는다.
분산이 클수록 각 자료값이 평균으로부터 넓게 흩어진 형태를 갖는다.
미지의 모분산을 추론할 때 많이 사용한다.
범위
데이터 간의 최댓값과 최솟값의 차이를 나타내는 것으로 동일한 범위를 갖더라도 자료의 분표모양은 다를 수가 있음에 유의해야 한다.
평균 절대 편차, MAD
각 자료값과 표준 평균과의 편차의 절댓값에 대한 산술 평균을 의미한다.
개개의 자료값에 대한 정보를 반영
이상치에 대한 영향을 범위보다 적게 받는다.
절댓값을 사용하므로 수리적으로 다루기 부적절하다
결과가 클수록 자료는 폭넓게 분포한다.
사분범위
자료의 1/4에 해당하는 1사분위수(Q1)를 구하고 3/4에 해당하는 3사분위수(Q3)를 구한다. 사분범위는 Q3-Q1으로 정의되며 자료의 50% 범위내에 위치하기 된다.
사분범위는 주로 이상치의 판단 시에 사용되는 것으로 결정된 최대값보다 크거나 최소값보다 작은 값을 이상치로 간주한다.
변동계수, CV
평균을 중심으로 한 상대적인 산포의 척도를 나타내는 수치이다. 측정 단위가 동일하지만 평균이 큰 차이를 보이는 두 자료집단 또는 측정단위가 서로 다른 두 자료집단에 대한 산포의 척도를 비교할 때 많이 사용한다.
변동계수가 클수록 상대적으로 넓게 분포를 이룬다.
자료의 분포형태
1. 왜도
왜도는 분포의 비대칭 정도를 나타내는 측도이다. 왜도의 값은 -3과+3의 사이의 범위에 있다.
2. 첨도, Kurtosis
분표의 뾰족한 정도를 나타내는 통계적 척도이다. 첨도의 값이 3미만인 경우는 평평한 분포이고 3이면 정규분포, 3이 넘는 경우는 뾰족한 분포의 형태를 갖는다.
모멘트, 적률
확률분포의 형태를 수치적으로 표현하기 위한 통계량이다. 데이터가 특정 값 주변에 어떻게 분포하고 있는지, 얼마나 퍼져 있는지, 그리고 분포가 어느 방향으로 치우쳐 있는지를 설명하는 데 사용된다.
모멘트의 정의
원점 모멘트, Raw Moment
기준점을 0으로 두고 계산한 모멘트이다. 이론적으로 의미가 있다.
중심 모멘트, Central Moment
데이터의 평균 μ 을 기준으로 계산한 모멘트로 실제 통계에서 가장 널리 사용된다.
주요 모멘트와 기술 통계량의 의미
1차 원점 모멘트 - 평균, Mean
2차 중심 모멘트 - 분산, Variance
3차 중심 모멘트 - 왜도, Skewness
4차 중심 모멘트 - 첨도, Kurtosis
모멘트의 주요 활동
모멘트는 단순한 이론적 개념을 넘어, 실제 데이터 분석과 통계 모델링에서 매우 중요한 역할을 한다. 특히 데이터의 분포 특성을 정량적으로 파악하고, 모델의 가정이 적절한지를 검증하며, 이상치 탐지 및 데이터 전처리 과정에서도 핵심적으로 활용된다.
1. 정규성 검정 및 전처리 연계
데이터가 정규분포를 따르는 지 판단하는 직관적인 기준이 된다. 왜도와 첨도가 조건을 벗어나 분포가 비대칭인 경우 로그 변환이나 Box-Cox 변환과 같은 전처리 기법을 적용하기도 한다.
2. 이상치 탐지
첨도가 극단적 이상치 존재 가능성을 판단하는 중요한 지표이다. 첨도가 높은 경우 극단적 이상치가 많다는 의미이고 첨도가 낮은 경우 이상치가 적고 고르게 분포되어 있다는 것이다.
3. 통계 모델링에서의 활용(가설검정 및 추정)
4.머신러닝 스케일링 전략
시각적 데이터 탐색
도수분포표
히스토그램
히스토그램은 가로축에 반드시 수량을 표시하지만 막대그래프는 그렇지 않다.
막대그래프
산점도 Scatter Plot
Box Plot, 상자 수염 그림
5가지 요약 수치를 가지고 그린다. 사분위수를 계산하고 제1사분위와 제3분위를 밑변으로 하는 직사각형을 그리고 제2사분위에 해당하는 위치에 선분을 긋는다. 25%~75%