ADsP 완벽 해부
출제 빈도가 높은 핵심 이론부터 복잡한 3과목 통계/마이닝 모델까지.
합격을 위한 모든 개념을 압축 요약했습니다.
데이터 이해
데이터와 정보 (DIKW)
-
데이터의 특성 & 유형
- 정성적 데이터: 언어, 문자 (주관적, 저장/검색 비용 높음)
- 정량적 데이터: 수치, 기호 (객관적, 저장/분석 용이) -
지식창조 메커니즘 (SECI) ★
- 공통화(Socialization): 암묵지 → 암묵지 (경험 공유)
- 표출화(Externalization): 암묵지 → 형식지 (문서화, 매뉴얼화)
- 연결화(Combination): 형식지 → 형식지 (DB 구축, 시스템화)
- 내면화(Internalization): 형식지 → 암묵지 (학습, 체화) - DIKW 피라미드 D(데이터: 순수 사실) → I(정보: 의미 도출) → K(지식: 규칙/경험 내재화) → W(지혜: 창의적 아이디어)
데이터베이스 체계
- 데이터베이스(DB) 특징 통합된(Integrated), 저장된(Stored), 공용(Shared), 변화하는(Operational) 데이터.
-
데이터 웨어하우스(DW) 4대 특성 ★
주제지향성 목적별 구조화통합성 일관된 형식시계열성 과거 기록(시간)비휘발성 읽기 전용(갱신X)
-
- 데이터 마트(DM): 특정 부서/사용자 목적의 소규모 DW.
- 데이터 레이크: 가공되지 않은 원시 데이터(Raw) 보관소.
빅데이터의 이해
-
빅데이터의 3V (+2V)
Volume(규모), Variety(다양성), Velocity(속도)
+ Value(가치), Veracity(정확성/진실성) -
빅데이터의 역할 비유 ★
- 석탄/철도: 산업혁명의 원동력, 제조업 인프라
- 렌즈(현미경): N그램 등 보이지 않던 패턴 발견
- 플랫폼: 비즈니스가 파생되는 생태계 -
본질적 변화 4가지
사전처리 → 사후처리
표본조사 → 전수조사
질(Quality) → 양(Quantity)
인과관계 → 상관관계
빅데이터 활용 기본 테크닉 (기출 빈출) ★
위기요인 & 비식별화 기술
- 위기요인 및 통제
- 사생활 침해 → 명시적 거부(Opt-out) 전환
- 책임 원칙 훼손 → '결과' 기반 책임 추궁
- 데이터 오용 → 알고리즈미스트(전문가) 허용
개인정보 비식별 기술 ★
- - 가명처리: 홍길동 → 임꺽정
- - 총계처리: 나이 합계 150 (개별 파악 불가)
- - 데이터 삭제: 주민번호 삭제
- - 데이터 범주화: 35세 → 30대
- - 데이터 마스킹: 010-1234-****
데이터 분석 기획
분석 기획의 4가지 방향성 (Target vs Method) ★
데이터 분석 방법론 ★
선택 → 전처리 → 변환 → 데이터마이닝 → 평가
- 데이터 전처리: 잡음(Noise), 이상치(Outlier), 결측치 식별 및 정제.
- 데이터 변환: 분석 목적에 맞게 변수 생성 및 차원 축소 (분석용 데이터셋 생성).
업무이해 → 데이터이해 → 데이터준비 → 모델링 → 평가 → 전개
- 업무 이해: 비즈니스 목적 파악, 목표 설정.
- 데이터 준비: KDD의 선택~변환 포괄. 가장 많은 시간이 소요됨.
- 모델링: 모델 구축 및 파라미터 최적화 (평가 단계와 지속적 피드백 반복).
분석 과제 발굴
-
하향식 (Top-Down)
문제가 명확할 때 사용 (순차적)
- 단계: 문제탐색 → 문제정의 → 해결방안탐색 → 타당성검토.
- 비즈니스 모델 캔버스: 업무, 제품, 고객, 규제/거시환경, 시장/경쟁자. -
상향식 (Bottom-Up)
문제를 모를 때 데이터에서 통찰 발견.
- 디자인 씽킹: 발산(상향식) 후 수렴(하향식) 반복.
- 주로 비지도 학습(군집화 등) 활용.
마스터플랜 (우선순위 평가) ★
ROI(투자대비효과) 관점에서 과제 우선순위를 평가합니다.
- 시급성 (Value): 비즈니스 효과, 전략적 중요도
- 난이도 (3V): 규모(Volume), 다양성(Variety), 속도(Velocity) 등 비용
- 적용 우선순위: 3사분면 → 4사분면 → 2사분면
- Quick Win: 1사분면 (난이도 낮고 시급성 높음, 즉각 실행)
분석 수준 진단 (사분면) ★
- - 준비형: 준비도 낮음, 성숙도 낮음
- - 도입형: 준비도 높음, 성숙도 낮음 (환경은 마련됨)
- - 정착형: 준비도 낮음, 성숙도 높음 (일부 부서 주도)
- - 확산형: 준비도 높음, 성숙도 높음 (전사적 체계화)
데이터 거버넌스 & 조직
- 분석 거버넌스 5대 요소 Data, Organization, Process, System, Human Resource(분석 인력 육성)
- 데이터 분석 조직 구조
- 집중형: 전담 조직(CoE)이 모든 부서 전담.
- 기능중심형: 별도 조직 없이 현업 부서에서 진행.
- 분산형: 전담 조직 인력을 현업에 파견/배치. (현업 밀착, 신속 대응)
데이터 분석 (핵심 마스터)
1. 통계학 기초 & 표본 추출
- 데이터 척도
- 명목척도: 구분 목적 (성별, 혈액형)
- 순서척도: 서열 존재 (직급, 만족도)
- 등간척도: 간격 동일, 절대 0점 없음 (온도, 지수)
- 비율척도: 사칙연산 가능, 절대 0점 존재 (무게, 키) - 확률 표본 추출 ★
- 단순랜덤: 무작위 동일 확률 추출
- 계통(체계적): K번째 간격마다 추출 (예: 5, 15, 25번)
- 층화(Stratified): 이질적 집단을 나누고(층), 층 내에서 랜덤 비례 추출
- 군집(Cluster): 동질적 집단(군집)을 통째로 랜덤 추출 - 베이즈 정리 (Bayes' Theorem)
사전확률을 통해 사후확률(조건부 확률)을 추정.P(A|B) = P(B|A)P(A) / P(B)
2. 가설 검정 & 통계적 추정
- 가설 검정 오류 ★
- 제1종 오류 (α): 귀무가설이 참인데 기각 (유의수준).
- 제2종 오류 (β): 귀무가설이 거짓인데 채택.
* p-value < 유의수준(α=0.05) 이면 대립가설 채택! - 모수 검정 vs 비모수 검정
- 모수 검정: 정규분포 가정 (표본평균, 분산 사용 - Z검정, t검정, ANOVA)
- 비모수 검정: 정규성 가정 X. 순위데이터 또는 표본 30개 미만 (평균 대신 부호, 순위 사용)
* 종류: 부호검정, 윌콕슨 순위합, 만위트니(Mann-Whitney) U, 런(Run) 검정, 스피어만 상관계수.
3. 기초 통계량 & 상관분석
- 비대칭도 (왜도/첨도)
- 왜도(Skewness): 양수(+)면 오른쪽 꼬리가 긺 (최빈값 < 중앙값 < 평균). 0이면 정규분포.
- 첨도(Kurtosis): 양수(+)면 정규분포보다 뾰족함. - 공분산 vs 상관계수
- 공분산: 두 변수의 방향성만 확인 (단위 영향 받음).
- 피어슨: 등간/비율 척도. 선형 관계, 모수적 (-1 ~ +1).
- 스피어만: 서열 척도. 비선형(단조) 관계, 비모수적 순위 기반.
4. 회귀분석 (Regression Analysis) 종합 ★★★
- 선형성: 독립/종속 변수 간 선형 관계.
- 독립성: 잔차 간 상관 없음 (더빈-왓슨 수치 2 근처면 정상).
- 등분산성: 오차의 분산이 일정함.
- 정규성: 잔차가 정규분포를 따름.
- 모형 유의성: F-통계량 (p < 0.05 유의).
- 회귀계수 유의성: t-통계량.
- 결정계수 (R²): 모형의 설명력 (0~1). 다중회귀는 조정된 R² 사용.
- AIC, BIC: 모형 복잡도 평가 (값이 작을수록 우수).
- 변수 선택: 전진선택, 후진제거, 단계적(Stepwise).
다중공선성(VIF > 10) 및 과적합 해결을 위해 계수에 벌점 부여.
- Ridge (릿지): L2 규제 (제곱합). 계수를 0 근처로 축소 (0은 안 됨).
- Lasso (라쏘): L1 규제 (절대값 합). 불필요 변수의 계수를 0으로 만들어 변수 선택 효과.
- Elastic Net: 릿지 + 라쏘 결합.
5. 시계열 분석 (Time Series)
- 정상성 (Stationarity)
평균과 분산이 시간에 따라 일정.
- 차분(Difference): 평균 일정치 않을 때 (현시점-전시점).
- 로그 변환: 분산이 일정하지 않을 때. - 시계열 모형
- AR (자기회귀): 과거 데이터가 영향. PACF 절단.
- MA (이동평균): 과거 오차가 영향. ACF 절단.
- ARIMA: 비정상 시계열을 차분(d) 후 AR(p), MA(q) 적용.
6. 다변량 분석 (차원 축소)
- 평가지표: 스트레스 값 (Stress). 0에 가까울수록 적합 (0.05 미만 우수, 0.15 이상 나쁨).
- 고유값(Eigenvalue): 1 이상인 성분 선택.
- 누적기여율: 통상 전체 분산의 85% 이상 설명.
- Scree Plot: 기울기 완만해지기 직전까지 선택.
7. 데이터 분할 & 분류 모형 평가 ★★★
- K-fold 교차검증: K개 분할 후 1개씩 번갈아 검증.
- 부트스트랩: 복원 추출 샘플링 (미추출 OOB 데이터로 검증).
- 향상도 곡선 (Lift Chart): 무작위 대비 모형의 등급별 성과 향상도 측정.
- 카파(Kappa) 통계량: 두 관찰자(예측-실제) 간 일치도 (1에 가까울수록 완벽 일치).
| 실제 클래스 | 예측 클래스 (Model) | |
|---|---|---|
| True 예측 | False 예측 | |
| 실제 True (Positive) | TP (True Positive) | FN (False Negative) |
| 실제 False (Negative) | FP (False Positive) | TN (True Negative) |
정확도 (TP+TN) / Total. 전체 맞춘 비율.
정밀도 TP / (TP+FP). 모델이 True라 한 것 중 실제 True.
재현율 TP / (TP+FN). 실제 True 중 맞춘 비율 (민감도 동일. 암 진단, 불량 탐지 핵심!).
특이도 TN / (FP+TN). 실제 False 중 맞춘 비율.
F1 Score 정밀도와 재현율의 조화평균. 2*(Pre*Rec)/(Pre+Rec)
8. 데이터 마이닝 : 분류 (지도학습 - 정답 O) ★★★
로지스틱 회귀 & SVM
- 로지스틱 회귀: 종속변수가 범주형(0, 1). 승산비(Odds)에 자연로그를 취해 선형성을 확보하고 시그모이드(Sigmoid) 함수로 확률 도출.
- SVM: 데이터를 분리하는 초평면(Hyperplane)을 탐색. 거리인 '마진(Margin)'을 최대화하여 일반화. 커널 트릭으로 비선형 분리 지원.
의사결정나무 (Decision Tree)
분석 과정 시각화로 '설명력' 우수. 이상치에 덜 민감.
- CART: 지니지수 (Gini) 사용. 이진 분리.
- C4.5 / C5.0: 엔트로피 지수 사용. 다항 분리.
- CHAID: 카이제곱 통계량, F-검정.
* 가지치기(Pruning): 과적합 방지를 위해 분기 제한.
앙상블 (Ensemble) & 기타
- 배깅(Bagging): 부트스트랩 샘플별 모델 학습 후 다수결 투표.
- 랜덤 포레스트: 배깅 + 독립변수 무작위 선택 결합. 성능 우수.
- 부스팅(Boosting): 오분류 데이터에 가중치 부여 순차 학습 (XGBoost, LightGBM).
- KNN: 가장 가까운 K개 이웃 기준 분류 (게으른 학습).
9. 데이터 마이닝 : 군집 & 연관 (비지도학습 - 정답 X) ★★★
군집 분석 (Clustering)
- 계층적 군집: 가까운 객체부터 병합 (덴드로그램).
- 거리측정: 최단, 최장, 평균, 와드연결법 (군집 내 오차제곱합 최소화). - K-means (비계층적): K개 중심 지정 후 거리 기반 할당. 계산 빠르나 이상치에 매우 민감.
- DBSCAN (밀도 기반): 반경 내 최소 개수로 군집 형성. 불규칙한 형태 및 이상치 처리에 탁월.
- 혼합분포 군집 (EM): k개 정규분포 혼합 모형 기반 추정.
- SOM (자기조직화지도): 신경망 기반 저차원 격자 매핑 (위상 보존).
- 1에 가까울수록 완벽한 군집 (0.5 이상 타당, 음수면 잘못 분류).
연관 분석 (장바구니 분석 / Association Rules)
"기저귀를 산 고객이 맥주도 사는가?" - 품목 간 교집합 분석 (Apriori 활용).
-
1) 지지도 (Support)
전체 거래 중 품목 A와 B를 '동시에' 구매한 확률.
P(A∩B) = (A와 B 동시 포함 거래수) / 전체 거래수 -
2) 신뢰도 (Confidence)
품목 A를 구매한 거래 중 B도 함께 구매한 조건부 확률.
P(B|A) = P(A∩B) / P(A) -
3) 향상도 (Lift) ★
A 구매 시 B 구매 확률이 '전체 B 구매 확률'에 비해 몇 배 증가하는가.
Lift = P(B|A) / P(B) = P(A∩B) / (P(A)*P(B))- Lift > 1 : 양의 상관관계 (A 사면 B도 구매)
- Lift = 1 : 독립 (서로 영향 없음)
- Lift < 1 : 음의 상관관계 (A 사면 B 안 삼)