ADsP Master
1과목 2과목 3과목 기출 50제
Certification Master Guide

ADsP 완벽 해부

출제 빈도가 높은 핵심 이론부터 복잡한 3과목 통계/마이닝 모델까지. 합격을 위한 모든 개념을 압축 요약했습니다.

데이터와 정보 (DIKW)

  • 데이터의 특성 & 유형 - 정성적 데이터: 언어, 문자 (주관적, 저장/검색 비용 높음)
    - 정량적 데이터: 수치, 기호 (객관적, 저장/분석 용이)

  • 지식창조 메커니즘 (SECI) ★ - 공통화(Socialization): 암묵지 → 암묵지 (경험 공유)
    - 표출화(Externalization): 암묵지 → 형식지 (문서화, 매뉴얼화)
    - 연결화(Combination): 형식지 → 형식지 (DB 구축, 시스템화)
    - 내면화(Internalization): 형식지 → 암묵지 (학습, 체화)

  • DIKW 피라미드 D(데이터: 순수 사실) → I(정보: 의미 도출) → K(지식: 규칙/경험 내재화) → W(지혜: 창의적 아이디어)

데이터베이스 체계

  • 데이터베이스(DB) 특징 통합된(Integrated), 저장된(Stored), 공용(Shared), 변화하는(Operational) 데이터.
  • 데이터 웨어하우스(DW) 4대 특성 ★
    주제지향성 목적별 구조화
    통합성 일관된 형식
    시계열성 과거 기록(시간)
    비휘발성 읽기 전용(갱신X)
  • - 데이터 마트(DM): 특정 부서/사용자 목적의 소규모 DW.
    - 데이터 레이크: 가공되지 않은 원시 데이터(Raw) 보관소.

빅데이터의 이해

  • 빅데이터의 3V (+2V) Volume(규모), Variety(다양성), Velocity(속도)
    + Value(가치), Veracity(정확성/진실성)
  • 빅데이터의 역할 비유 ★ - 석탄/철도: 산업혁명의 원동력, 제조업 인프라
    - 렌즈(현미경): N그램 등 보이지 않던 패턴 발견
    - 플랫폼: 비즈니스가 파생되는 생태계
  • 본질적 변화 4가지 사전처리 → 사후처리
    표본조사 → 전수조사
    질(Quality) → 양(Quantity)
    인과관계 → 상관관계

빅데이터 활용 기본 테크닉 (기출 빈출) ★

연관규칙 학습 (Association) "커피를 사는 사람이 탄산음료도 사는가?" (장바구니 분석, 교집합)
유형 분석 (Classification) "이 사용자는 어떤 특성을 가진 집단에 속하는가?" (문서 분류)
유전자 알고리즘 (Genetic) "최대 시청률을 위해 어떤 시간대에 방송해야 하는가?" (최적화 메커니즘)
기계학습 (Machine Learning) "기존 시청 기록을 바탕으로 어떤 영화를 추천할까?" (예측)
회귀 분석 (Regression) "나이(독립)가 소득(종속)에 미치는 영향은?" (수치 예측)
소셜 네트워크 분석 (SNA) "이 커뮤니티에서 가장 영향력 있는 오피니언 리더는?"

위기요인 & 비식별화 기술

  • 위기요인 및 통제 - 사생활 침해 → 명시적 거부(Opt-out) 전환
    - 책임 원칙 훼손 → '결과' 기반 책임 추궁
    - 데이터 오용 → 알고리즈미스트(전문가) 허용

개인정보 비식별 기술 ★
  • - 가명처리: 홍길동 → 임꺽정
  • - 총계처리: 나이 합계 150 (개별 파악 불가)
  • - 데이터 삭제: 주민번호 삭제
  • - 데이터 범주화: 35세 → 30대
  • - 데이터 마스킹: 010-1234-****
02

데이터 분석 기획

1, 2과목 요약 강의 보기

분석 기획의 4가지 방향성 (Target vs Method) ★

대상(O) / 방법(O)
Optimization
(최적화)
대상(O) / 방법(X)
Solution
(솔루션 도출)
대상(X) / 방법(O)
Insight
(통찰 도출)
대상(X) / 방법(X)
Discovery
(새로운 발견)

데이터 분석 방법론 ★

기본 방법론 모델: 폭포수(순차적 하향), 프로토타입(일부 개발 후 피드백), 나선형(점진적 위험요소 제거, 복잡도 상승), 애자일(반복적, 유연함).
1) KDD (Knowledge Discovery in Databases)

선택 → 전처리 → 변환 → 데이터마이닝 → 평가

  • 데이터 전처리: 잡음(Noise), 이상치(Outlier), 결측치 식별 및 정제.
  • 데이터 변환: 분석 목적에 맞게 변수 생성 및 차원 축소 (분석용 데이터셋 생성).

2) CRISP-DM (크리스프 디엠)

업무이해 → 데이터이해 → 데이터준비 → 모델링 → 평가 → 전개

  • 업무 이해: 비즈니스 목적 파악, 목표 설정.
  • 데이터 준비: KDD의 선택~변환 포괄. 가장 많은 시간이 소요됨.
  • 모델링: 모델 구축 및 파라미터 최적화 (평가 단계와 지속적 피드백 반복).

분석 과제 발굴

  • 하향식 (Top-Down) 문제가 명확할 때 사용 (순차적)
    - 단계: 문제탐색 → 문제정의 → 해결방안탐색 → 타당성검토.
    - 비즈니스 모델 캔버스: 업무, 제품, 고객, 규제/거시환경, 시장/경쟁자.

  • 상향식 (Bottom-Up) 문제를 모를 때 데이터에서 통찰 발견.
    - 디자인 씽킹: 발산(상향식)수렴(하향식) 반복.
    - 주로 비지도 학습(군집화 등) 활용.

마스터플랜 (우선순위 평가) ★

ROI(투자대비효과) 관점에서 과제 우선순위를 평가합니다.

  • 시급성 (Value): 비즈니스 효과, 전략적 중요도
  • 난이도 (3V): 규모(Volume), 다양성(Variety), 속도(Velocity) 등 비용
  • 적용 우선순위: 3사분면 → 4사분면 → 2사분면
  • Quick Win: 1사분면 (난이도 낮고 시급성 높음, 즉각 실행)

분석 수준 진단 (사분면) ★

기업의 현재 수준 파악을 위해 준비도(6개 영역)성숙도(CMMI 4단계: 도입-활용-확산-최적화)를 진단합니다.
  • - 준비형: 준비도 낮음, 성숙도 낮음
  • - 도입형: 준비도 높음, 성숙도 낮음 (환경은 마련됨)
  • - 정착형: 준비도 낮음, 성숙도 높음 (일부 부서 주도)
  • - 확산형: 준비도 높음, 성숙도 높음 (전사적 체계화)

데이터 거버넌스 & 조직

  • 분석 거버넌스 5대 요소 Data, Organization, Process, System, Human Resource(분석 인력 육성)
  • 데이터 분석 조직 구조 - 집중형: 전담 조직(CoE)이 모든 부서 전담.
    - 기능중심형: 별도 조직 없이 현업 부서에서 진행.
    - 분산형: 전담 조직 인력을 현업에 파견/배치. (현업 밀착, 신속 대응)
03

데이터 분석 (핵심 마스터)

3과목 요약 강의 보기

1. 통계학 기초 & 표본 추출

  • 데이터 척도
    - 명목척도: 구분 목적 (성별, 혈액형)
    - 순서척도: 서열 존재 (직급, 만족도)
    - 등간척도: 간격 동일, 절대 0점 없음 (온도, 지수)
    - 비율척도: 사칙연산 가능, 절대 0점 존재 (무게, 키)

  • 확률 표본 추출 ★
    - 단순랜덤: 무작위 동일 확률 추출
    - 계통(체계적): K번째 간격마다 추출 (예: 5, 15, 25번)
    - 층화(Stratified): 이질적 집단을 나누고(층), 층 내에서 랜덤 비례 추출
    - 군집(Cluster): 동질적 집단(군집)을 통째로 랜덤 추출

  • 베이즈 정리 (Bayes' Theorem)
    사전확률을 통해 사후확률(조건부 확률)을 추정.
    P(A|B) = P(B|A)P(A) / P(B)

2. 가설 검정 & 통계적 추정

  • 가설 검정 오류 ★
    - 제1종 오류 (α): 귀무가설이 참인데 기각 (유의수준).
    - 제2종 오류 (β): 귀무가설이 거짓인데 채택.
    * p-value < 유의수준(α=0.05) 이면 대립가설 채택!

  • 모수 검정 vs 비모수 검정
    - 모수 검정: 정규분포 가정 (표본평균, 분산 사용 - Z검정, t검정, ANOVA)
    - 비모수 검정: 정규성 가정 X. 순위데이터 또는 표본 30개 미만 (평균 대신 부호, 순위 사용)
    * 종류: 부호검정, 윌콕슨 순위합, 만위트니(Mann-Whitney) U, 런(Run) 검정, 스피어만 상관계수.

3. 기초 통계량 & 상관분석

  • 비대칭도 (왜도/첨도)
    - 왜도(Skewness): 양수(+)면 오른쪽 꼬리가 긺 (최빈값 < 중앙값 < 평균). 0이면 정규분포.
    - 첨도(Kurtosis): 양수(+)면 정규분포보다 뾰족함.

  • 공분산 vs 상관계수
    - 공분산: 두 변수의 방향성만 확인 (단위 영향 받음).
    - 피어슨: 등간/비율 척도. 선형 관계, 모수적 (-1 ~ +1).
    - 스피어만: 서열 척도. 비선형(단조) 관계, 비모수적 순위 기반.

4. 회귀분석 (Regression Analysis) 종합 ★★★

기본 가정 (잔차의 LINE)

- 선형성: 독립/종속 변수 간 선형 관계.

- 독립성: 잔차 간 상관 없음 (더빈-왓슨 수치 2 근처면 정상).

- 등분산성: 오차의 분산이 일정함.

- 정규성: 잔차가 정규분포를 따름.

모형 검정 & 변수 선택

- 모형 유의성: F-통계량 (p < 0.05 유의).

- 회귀계수 유의성: t-통계량.

- 결정계수 (R²): 모형의 설명력 (0~1). 다중회귀는 조정된 R² 사용.

- AIC, BIC: 모형 복잡도 평가 (값이 작을수록 우수).

- 변수 선택: 전진선택, 후진제거, 단계적(Stepwise).

정규화(벌점화) 회귀분석 ★

다중공선성(VIF > 10) 및 과적합 해결을 위해 계수에 벌점 부여.

  • Ridge (릿지): L2 규제 (제곱합). 계수를 0 근처로 축소 (0은 안 됨).
  • Lasso (라쏘): L1 규제 (절대값 합). 불필요 변수의 계수를 0으로 만들어 변수 선택 효과.
  • Elastic Net: 릿지 + 라쏘 결합.

5. 시계열 분석 (Time Series)

  • 정상성 (Stationarity)
    평균과 분산이 시간에 따라 일정.
    - 차분(Difference): 평균 일정치 않을 때 (현시점-전시점).
    - 로그 변환: 분산이 일정하지 않을 때.
  • 시계열 모형
    - AR (자기회귀): 과거 데이터가 영향. PACF 절단.
    - MA (이동평균): 과거 오차가 영향. ACF 절단.
    - ARIMA: 비정상 시계열을 차분(d) 후 AR(p), MA(q) 적용.

6. 다변량 분석 (차원 축소)

다차원척도법 (MDS) 객체 간 거리나 유사성을 2차원/3차원 공간의 점으로 시각화하여 군집 파악.
- 평가지표: 스트레스 값 (Stress). 0에 가까울수록 적합 (0.05 미만 우수, 0.15 이상 나쁨).
주성분분석 (PCA) ★ 상관성 높은 변수들을 선형 결합하여 적은 수의 주성분(차원)으로 축약.
- 고유값(Eigenvalue): 1 이상인 성분 선택.
- 누적기여율: 통상 전체 분산의 85% 이상 설명.
- Scree Plot: 기울기 완만해지기 직전까지 선택.

7. 데이터 분할 & 분류 모형 평가 ★★★

데이터 분할 기법 (과적합 방지) - Hold-out: Train / Test 분할 (보통 7:3).
- K-fold 교차검증: K개 분할 후 1개씩 번갈아 검증.
- 부트스트랩: 복원 추출 샘플링 (미추출 OOB 데이터로 검증).
기타 평가 지표 - ROC Curve / AUC: X축 FPR (1-특이도), Y축 TPR (민감도=재현율). 면적(AUC) 1에 가까울수록 우수.
- 향상도 곡선 (Lift Chart): 무작위 대비 모형의 등급별 성과 향상도 측정.
- 카파(Kappa) 통계량: 두 관찰자(예측-실제) 간 일치도 (1에 가까울수록 완벽 일치).
실제 클래스 예측 클래스 (Model)
True 예측 False 예측
실제 True (Positive) TP (True Positive) FN (False Negative)
실제 False (Negative) FP (False Positive) TN (True Negative)

정확도 (TP+TN) / Total. 전체 맞춘 비율.

정밀도 TP / (TP+FP). 모델이 True라 한 것 중 실제 True.

재현율 TP / (TP+FN). 실제 True 중 맞춘 비율 (민감도 동일. 암 진단, 불량 탐지 핵심!).

특이도 TN / (FP+TN). 실제 False 중 맞춘 비율.

F1 Score 정밀도와 재현율의 조화평균. 2*(Pre*Rec)/(Pre+Rec)

8. 데이터 마이닝 : 분류 (지도학습 - 정답 O) ★★★

로지스틱 회귀 & SVM

  • 로지스틱 회귀: 종속변수가 범주형(0, 1). 승산비(Odds)에 자연로그를 취해 선형성을 확보하고 시그모이드(Sigmoid) 함수로 확률 도출.
  • SVM: 데이터를 분리하는 초평면(Hyperplane)을 탐색. 거리인 '마진(Margin)'을 최대화하여 일반화. 커널 트릭으로 비선형 분리 지원.

의사결정나무 (Decision Tree)

분석 과정 시각화로 '설명력' 우수. 이상치에 덜 민감.

  • CART: 지니지수 (Gini) 사용. 이진 분리.
  • C4.5 / C5.0: 엔트로피 지수 사용. 다항 분리.
  • CHAID: 카이제곱 통계량, F-검정.

* 가지치기(Pruning): 과적합 방지를 위해 분기 제한.

앙상블 (Ensemble) & 기타

  • 배깅(Bagging): 부트스트랩 샘플별 모델 학습 후 다수결 투표.
  • 랜덤 포레스트: 배깅 + 독립변수 무작위 선택 결합. 성능 우수.
  • 부스팅(Boosting): 오분류 데이터에 가중치 부여 순차 학습 (XGBoost, LightGBM).
  • KNN: 가장 가까운 K개 이웃 기준 분류 (게으른 학습).

9. 데이터 마이닝 : 군집 & 연관 (비지도학습 - 정답 X) ★★★

Clustering

군집 분석 (Clustering)

  • 계층적 군집: 가까운 객체부터 병합 (덴드로그램).
    - 거리측정: 최단, 최장, 평균, 와드연결법 (군집 내 오차제곱합 최소화).
  • K-means (비계층적): K개 중심 지정 후 거리 기반 할당. 계산 빠르나 이상치에 매우 민감.
  • DBSCAN (밀도 기반): 반경 내 최소 개수로 군집 형성. 불규칙한 형태 및 이상치 처리에 탁월.
  • 혼합분포 군집 (EM): k개 정규분포 혼합 모형 기반 추정.
  • SOM (자기조직화지도): 신경망 기반 저차원 격자 매핑 (위상 보존).
★ 실루엣 계수 (Silhouette Coefficient) - 군집 내 응집도와 군집 간 분리도 수치화 (-1 ~ 1).
- 1에 가까울수록 완벽한 군집 (0.5 이상 타당, 음수면 잘못 분류).
Association

연관 분석 (장바구니 분석 / Association Rules)

"기저귀를 산 고객이 맥주도 사는가?" - 품목 간 교집합 분석 (Apriori 활용).

  • 1) 지지도 (Support)

    전체 거래 중 품목 A와 B를 '동시에' 구매한 확률.

    P(A∩B) = (A와 B 동시 포함 거래수) / 전체 거래수
  • 2) 신뢰도 (Confidence)

    품목 A를 구매한 거래 중 B도 함께 구매한 조건부 확률.

    P(B|A) = P(A∩B) / P(A)
  • 3) 향상도 (Lift) ★

    A 구매 시 B 구매 확률이 '전체 B 구매 확률'에 비해 몇 배 증가하는가.

    Lift = P(B|A) / P(B) = P(A∩B) / (P(A)*P(B))

    - Lift > 1 : 양의 상관관계 (A 사면 B도 구매)
    - Lift = 1 : 독립 (서로 영향 없음)
    - Lift < 1 : 음의 상관관계 (A 사면 B 안 삼)

04
PRACTICE EXAM50 QUESTIONS

실전 기출문제 50제

10문항 단위 페이지네이션 • 꺽쇠 클릭 시 정답/해설 공개
현재 페이지: 1 / 5 (문항 1 ~ 10)
전체 50문항 중 1 ~ 10번 문제 진행 중