141 Pandas_기초
Pandas 기초는 DataFrame 구조, 인덱싱, 정제, 결합, 집계, 파일 입출력을 실전 데이터 처리 흐름으로 익히는 과정이다.
0. 교육을 하는 이유와 궁극적인 목표
Pandas 기초 교육의 궁극적인 목표는 학습자가 엑셀식 표 데이터를 Python DataFrame으로 다루고, 반복적인 데이터 정리 업무를 재현 가능한 코드로 전환할 수 있게 하는 것이다. 민간 데이터 분석 과정의 흐름처럼 단순 문법 암기보다 실제 CSV·Excel 파일을 읽고, 결측·중복·형식 오류를 고치며, groupby·merge·pivot으로 분석 가능한 테이블을 만드는 능력을 중심으로 구성한다.
참고한 유료형 교육 흐름
- DataCamp식 DataFrame 추출·필터·변환 중심 실습 흐름
- Udemy형 다수 데이터셋 기반 pandas 반복 코딩 훈련
- 엑셀 업무를 Python 자동화로 전환하는 실무형 데이터 클리닝 과정
- 분석 리포트 전 단계로 데이터 품질 로그와 정제 전후 비교표를 요구하는 포트폴리오 방식
입문 · 1일
DataFrame 첫 조작 과정
표 데이터를 불러오고 행·열·기본 통계를 이해한다.



| 구분 | 세부 내용 | 실천·실습 방법 |
|---|---|---|
| 목표 1 | DataFrame 구조를 이해한다 | CSV와 Excel 파일을 read_csv, read_excel로 불러오고 index, columns, dtype을 확인한다. head, tail, info, describe 결과를 비교해 데이터의 크기·형식·결측 여부를 진단한다. |
| 목표 2 | 행과 열을 선택한다 | loc, iloc, boolean indexing으로 조건에 맞는 행과 필요한 열만 추출한다. 여러 조건 필터를 사용해 고객, 상품, 날짜별 샘플 데이터를 분석 목적에 맞게 분리한다. |
| 목표 3 | 기초 통계를 작성한다 | mean, median, sum, value_counts로 핵심 지표를 계산한다. 계산 결과를 Excel 검산표와 비교해 코드 결과의 신뢰성을 확인한다. |
| 사용 플랫폼 | Python, pandas, Jupyter Notebook, Google Colab, openpyxl, Excel |
|---|---|
| 강사 스펙 | pandas 입문, Excel 데이터 전환, 비전공자 코드 실습 지도 경험 3년 이상 |
| 수업대상 | 데이터분석 입문자, 사무직 실무자, 중고등 데이터 프로젝트반 |
| 소요시간 | 4-6시간 |
| 준비물 | 노트북, Google 계정, CSV/Excel 샘플, pandas 실습 노트북 |
| 산출물 | DataFrame 기초 조작 노트북, 필터링 실습표, 기본 통계 요약표 |
| 평가방법 | 구조이해 25%, 선택실습 30%, 통계계산 25%, 검산 10%, 참여도 10% |
초급 · 3일
데이터 정제 집중 과정
현실 데이터의 오류를 찾고 정제 규칙을 코드화한다.


| 구분 | 세부 내용 | 실천·실습 방법 |
|---|---|---|
| 목표 1 | 품질 문제를 탐색한다 | isna, duplicated, unique, value_counts로 결측치·중복·범주 오류를 찾는다. 날짜, 숫자, 문자열 컬럼에서 잘못 입력된 값을 탐지하는 검사표를 만든다. |
| 목표 2 | 정제 규칙을 적용한다 | fillna, dropna, drop_duplicates, replace, str 메서드로 데이터 오류를 수정한다. to_datetime, astype, apply를 활용해 날짜·금액·카테고리 형식을 통일한다. |
| 목표 3 | 정제 과정을 문서화한다 | 정제 전후 행 수와 주요 지표 변화를 비교하는 품질 로그를 작성한다. 오류 행을 별도 CSV로 저장해 데이터 제공자에게 재확인 요청하는 절차를 만든다. |
| 사용 플랫폼 | Python, pandas, NumPy, Jupyter Notebook, openpyxl, Google Sheets |
|---|---|
| 강사 스펙 | 데이터 클리닝, pandas 문자열·날짜 처리, 업무 데이터 품질관리 지도 경험 3년 이상 |
| 수업대상 | Python 기초 가능자, 업무 자동화 학습자, 데이터 분석 초급자 |
| 소요시간 | 12-18시간 |
| 준비물 | 오류 포함 CSV/Excel, 정제 체크리스트, Jupyter 환경 |
| 산출물 | 정제된 데이터셋, 품질 로그, 오류 행 리포트 |
| 평가방법 | 문제진단 25%, 정제코드 30%, 로그작성 20%, 재현성 15%, 발표 10% |
초급 · 1주
집계·결합·피벗 실무 과정
여러 테이블을 결합하고 분석용 요약 테이블을 만든다.



| 구분 | 세부 내용 | 실천·실습 방법 |
|---|---|---|
| 목표 1 | 그룹 집계를 수행한다 | groupby, agg, transform을 사용해 고객별·월별·상품별 지표를 계산한다. 집계 기준을 바꿔 같은 데이터에서 다른 비즈니스 질문에 답하는 요약표를 만든다. |
| 목표 2 | 테이블을 결합한다 | merge, concat, join으로 주문·고객·상품 테이블을 연결한다. inner, left, outer join 결과 차이를 행 수와 누락값 중심으로 비교한다. |
| 목표 3 | 피벗 분석표를 만든다 | pivot_table과 crosstab으로 월별 매출, 지역별 분포, 설문 응답 교차표를 만든다. Excel 피벗테이블 결과와 pandas 결과를 비교해 자동화 장점을 정리한다. |
| 사용 플랫폼 | Python, pandas, NumPy, Jupyter Notebook, Excel, Google Sheets |
|---|---|
| 강사 스펙 | 관계형 데이터 결합, groupby/merge/pivot 실무 지도 경험 4년 이상 |
| 수업대상 | 데이터 분석 취업 준비생, 사무 자동화 실무자, 기업 교육생 |
| 소요시간 | 20-30시간 |
| 준비물 | 주문·고객·상품 샘플 데이터, Excel 검산 파일, 분석 설계표 |
| 산출물 | 결합 데이터셋, 집계 테이블 묶음, 피벗 분석 리포트 |
| 평가방법 | 집계 25%, 결합 30%, 피벗 25%, 검산 10%, 발표 10% |
중급 · 4주
Pandas 업무 자동화 과정
반복 분석을 함수와 파이프라인으로 자동화한다.



| 구분 | 세부 내용 | 실천·실습 방법 |
|---|---|---|
| 목표 1 | 반복 작업을 함수화한다 | 여러 파일을 순회해 읽고 정제하는 함수를 작성한다. pipe와 method chaining으로 정제 절차를 단계별로 연결한다. |
| 목표 2 | 파일 입출력을 자동화한다 | 여러 시트 Excel을 읽고 분석 결과를 시트별로 저장한다. openpyxl로 셀 너비, 숫자 형식, 조건부 서식을 적용한 보고서를 만든다. |
| 목표 3 | 검증 가능한 파이프라인을 만든다 | 입력 파일명, 처리 시간, 오류 행 수를 로그 파일로 남긴다. pytest 또는 간단한 assert로 컬럼 존재 여부와 행 수 조건을 검사한다. |
| 사용 플랫폼 | Python, pandas, openpyxl, pathlib, logging, pytest, Jupyter Notebook |
|---|---|
| 강사 스펙 | pandas 자동화, Excel 리포팅, 데이터 파이프라인 검증 경험 4년 이상 |
| 수업대상 | 업무 자동화 담당자, Python 중급자, 데이터 운영 실무자 |
| 소요시간 | 40-60시간 |
| 준비물 | 복수 CSV/Excel 파일, 보고서 템플릿, GitHub 저장소 |
| 산출물 | 자동 정제 스크립트, Excel 보고서 자동생성기, 처리 로그 |
| 평가방법 | 함수화 25%, 입출력 25%, 검증 25%, 보고서 15%, 발표 10% |
심화 · 8주
Pandas 실무 포트폴리오 과정
데이터 수집부터 정제·분석·보고서 자동화까지 완성한다.



| 구분 | 세부 내용 | 실천·실습 방법 |
|---|---|---|
| 목표 1 | 현업 데이터 처리 시나리오를 설계한다 | 교육성과, 매출, 재고, 고객 이탈 중 하나를 선택해 원본 데이터 구조와 문제를 정의한다. 데이터 사전, 컬럼 설명, 품질 기준, 산출 보고서 형식을 프로젝트 문서로 작성한다. |
| 목표 2 | 대용량 처리 전략을 적용한다 | chunksize, category dtype, 필요한 컬럼만 읽기 등 메모리 절감 기법을 실험한다. Polars 또는 DuckDB와 pandas 처리 속도를 비교해 도구 선택 기준을 만든다. |
| 목표 3 | 최종 자동 보고 체계를 만든다 | 정제, 집계, 시각화, Excel 저장을 하나의 실행 스크립트로 연결한다. README, 실행 방법, 오류 대응표, 결과 샘플을 포함한 포트폴리오 저장소를 완성한다. |
| 사용 플랫폼 | Python, pandas, Polars, DuckDB, openpyxl, Matplotlib, GitHub Actions |
|---|---|
| 강사 스펙 | 대용량 표 데이터 처리, pandas 성능 최적화, 실무 포트폴리오 멘토링 경험 5년 이상 |
| 수업대상 | 데이터 분석 포트폴리오 준비생, 기업 데이터 담당자, 강사 양성과정 |
| 소요시간 | 80-120시간 |
| 준비물 | 대용량 CSV, GitHub 저장소, 보고서 템플릿, 성능 측정표 |
| 산출물 | Pandas 실무 포트폴리오, 자동 보고 스크립트, 성능 비교 리포트 |
| 평가방법 | 문제정의 20%, 처리성능 25%, 자동화 25%, 문서화 20%, 발표 10% |