📌 개요
🔑 학습 키워드
┗ 데이터 분석의 이해: 데이터, 정보, 데이터 분석
┗ 데이터 분석 4단계: 설명적 분석, 진단적 분석, 예측적 분석, 처방적 분석
┗ 데이터 분석 과정 4단계: 데이터 수집 및 저장, 데이터 전처리, 데이터 분석, 데이터 시각화
┗ 데이터 속성에 따른 분류: 질적 데이터(범주), 양적 데이터(수치)
┗ 질적 데이터: 명목형 데이터, 순서형 데이터
┗ 양적 데이터: 이산형 데이터, 연속형 데이터
┗ 데이터 형태에 따른 분류: 정형 데이터, 비정형 데이터, 반정형 데이터
┗ 오픈소스 개념: 누구나 자유롭게 "접근", "사용", "복제", "수정", "재배포" 가능
💡 1. 데이터 분석의 이해
[ 데이터와 정보의 개념 및 차이 ]
┗ 데이터: 관찰이나 측정을 통해 얻은 사실이나 기록
- 데이터 그 자체로는 의미를 지니지 않는 원재료
┗ 정보: 데이터를 특정 목적에 맞게 "가공"하고 "해석"하여 의미를 부여한 결과물
- 의사결정이나 문제 해결에 활용될 수 있는 지식임
[ 데이터 분석 정의 ]
- 수집된 데이터를 '정리', '처리', '변환'하여 의미 있는 '정보'를 도출하고
-> 이를 통해 '의사결정'을 지원하는 체계적인 과정을 의미
- 쉽게말해, 데이터에 숨겨진 의미를 발견하며, 이를 바탕으로 '의사결정'에 활용할 수 있는 '인사이트'를 도출
- 데이터에서 의사결정에 도움이 되는 의미를 찾아내는 것에 가까움
[ 데이터 분석 4단계 ]
┗ 분석 목적, 깊이에 따라 4단계로 구분
┗ 설명적 분석 (1단계): 어떤일이 일어난 것인가?
- 과거 및 현재 데이터 요약 -> 무엇이 발생했는지 파악하는것이 목표
- 즉, "어떤 일이 일어났는가?" 에 대한 분석임
┗ 진단적 분석 (2단계): 왜 발생했는가?
- 특정 현상에 대한 원인을 규명하는데 초점을 둔 분석
- 즉, "왜 발생했는지" 를 찾는 분석임
┗ 예측적 분석 (3단계): 무엇이 발생할 것인가? (앞으로)
- 과거 데이터와 현재 데이터 기반 무엇이 발생할 것인지 예측하는 과정
- 즉, "무엇이 발생할 것인지" 에 대한 예측적인 분석
┗ 처방적 분석(4단계):
- 어떻게 하면 원하는 결과를 얻을 수 있는지에 대한 해답을 얻는 분석
- 예측적 분석을 통해 얻어낸 예측 결과를 의사결정에 활용한 사례로 볼 수 있음
-> 예: '예측적분석'(배달 주문 30% 증가 예정) -> '처방적분석'(주문 증가 대응을 위해 라이더 투입)
[ 데이터 분석의 중요성 ]
┗ 미래 예측과 전략 수립, 프로세스 개선, 사회 문제 해결등 다양한 분야에서 핵심 도구로 활용
┗ PHM: 대표적 데이터 분석 적용 사례
PHM: 장비나 시스템의 상태 실시간 감시, 고장 가능성 예측 -> 최적의 유지보수 및 관리 방안 제공
-> 계측 -> 모니터링 -> 진단 -> 예측 -> 개선 (5가지 STEP)
┗ 금융, 의료, 마케팅, 제조업, 공공 정책 등 여러 분야에서 데이터 분석이 사용됨
💡 2. 데이터 분석 과정
[ 데이터 분석 과정 ]
┗ 데이터 "수집", "정제", "패턴 탐색" , "모델링"을 수행 후 결과를 해석하는 체계적 접근 과정
┗ 데이터 분석 과정 4단계:
(1) '데이터 수집 및 저장'
- 수집 대상 데이터 정의:
- 데이터 수집 경로 선정: 내부 데이터(기업), 외부 데이터(공공 데이터)
- 데이터 수집 자동화
- 데이터 저장 방식 선택: CSV, JSON, text, 클라우드 기반(Amazon S3, Hadoop,...)
(2) '데이터 전처리'
- 결측치와 이상치 처리
- 중복 데이터 제거 및 필터링
- 데이터 축소 및 변환
(3) '데이터 분석'
- 탐색적 데이터 분석 수행
- 통계분석, 머신러닝, 딥러닝 분석 포함
- 데이터 분석 기법 선택
- 데이터 분석 결과 도출
(4) '데이터 시각화'
- 데이터 탐색과 패턴 발견: 이상치 탐색에 유용하게 사용됨
- 복잡한 데이터의 요약: 시각화로 한눈에 파악할 수 있게 요약 가능
- 데이터 분석 결과 전달: 전달력 향상 및 의사결정 지원
💡 3. 데이터의 분류
[ 데이터 속성에 따른 분류 ]
┗ 질적 데이터(범주형 데이터): 수치화 불가능 -> 계산 보단 범주별로 집계 분류 할 때 주로 사용
- '명목형 데이터': 단순한 범주 구분 데이터 -> 범주 사이 순서나 계층적 관계가 없는 데이터
-> 예: 성별(남성, 여성), 혈액형(A, B, O, AB), 지역명 등
- '순서형 데이터': 명목 데이터와 유사하나 순서가 존재하는 데이터
-> 예: 만족도 조사(매우 불만족, 불만족, 보통, ..)와 같은 데이터가 이에 해당
┗ 양적 데이터(수치형 데이터): 수치화 가능 -> 숫자 형태로 표현되며, 측정과 계량이 가능한 데이터
- '이산형 데이터': 특정 정수값을 가지는 데이터 의미 -> 주로 셀 수 있는 형태로 나타남
-> 예: 학생 수, 제품 수, 차량 대수 등과 같이 명확히 구분된 개수를 나타냄.
- '연속형 데이터': 특정 범위 내의 모든 값을 가질 수 있는 데이터를 의미
-> 예: 신장, 몸무게, 온도, 시간 등과 같이 특정 구간 내에서 무한한 값을 가질 수 있는 데이터 해당
[ 데이터 형태에 따른 분류 ]
┗ 정형 데이터: 일정한 규칙과 구조를 갖춘 데이터
- '행'과 '열'로 구성된 '표' 형태로 관계형 데이터베이스에 저장
-> 예: RDB(SQL), Excel
┗ 비정형 데이터: 정해진 구조 없이 자유로운 형태로 존재하는 데이터
- '문장', '이미지', '영상', '음성' 등 다양한 형식
- 분석이 어려운 반면 '소비자 감정' 및 '행동 패턴' 등 많은 정보량
┗ 반정형 데이터: 정형 데이터와 비정형 데이터의 중간 형태
- 데이터 항목 간 일정한 규칙이나 구조가 존재하나, 완전히 테이블 형태로 고정 불가능
-> 예: JSON, XML
💡 4. 오픈소스 환경
[ 오픈소스의 개념 ]
┗ 소스코드와 데이터 개방함으로써 더 많은 사람들과 함께 공유하고 협력하겠다는 철학
┗ 소스코드가 공개되어 누구나 자유롭게 "접근", "사용", "복제", "수정", "재배포"할 수 있음
'방송통신대학교 > 📊 오픈소스기반 데이터분석' 카테고리의 다른 글
| [오픈소스기반 데이터분석] 3강 - 데이터 분석을 위한 파이썬 프로그래밍(2) (0) | 2026.09.25 |
|---|---|
| [오픈소스기반 데이터분석] 2강 - 데이터 분석을 위한 파이썬 프로그래밍(1) (0) | 2026.09.18 |
