147 RAG_기초
RAG 기초는 LangChain·LlamaIndex·벡터DB를 활용해 문서에서 근거를 검색하고 신뢰도 높은 답변을 생성하는 기본 파이프라인을 구현하는 과정이다.
0. 교육을 하는 이유와 궁극적인 목표
RAG 기초 교육의 궁극적인 목표는 학습자가 LLM의 환각 문제를 줄이기 위해 조직 문서, 교육자료, 매뉴얼을 검색 가능한 지식원으로 변환하고, 검색 결과를 근거로 답변하는 문서 QA 시스템을 구현·평가할 수 있게 하는 것이다. 유료 생성형 AI 앱 제작 과정처럼 문서 전처리, 임베딩, 벡터DB, 검색 튜닝, 출처 표시, 품질평가를 프로젝트 중심으로 다룬다.
참고한 유료형 교육 흐름
- LangChain·Ollama 기반 챗봇, RAG, AI Agent를 통합 구축하는 실무형 유료 과정 흐름
- RAG 프로세스, 임베딩, FAISS, prompt template을 다루는 AI agent 교육 흐름
- LlamaIndex와 LangChain을 비교하며 문서 색인과 검색 품질 개선을 다루는 개발자 과정
- 기업 문서 QA 챗봇에서 출처 표시, 권한, 평가 질문셋을 강조하는 전문 컨설팅 교육 방식
입문 · 1일
RAG 개념과 검색 기반 답변 입문
LLM이 문서를 검색해 근거 있는 답변을 만드는 과정을 이해한다.


| 구분 | 세부 내용 | 실천·실습 방법 |
|---|---|---|
| 목표 1 | RAG 흐름을 설명한다 | 질문, 문서 분할, 임베딩, 벡터검색, 프롬프트 결합, 답변 생성 단계를 순서도로 그린다. 일반 LLM 답변과 문서 근거 포함 답변을 비교해 환각 감소 원리를 토론한다. |
| 목표 2 | 문서를 작은 조각으로 나눈다 | PDF와 TXT 문서를 문단, 제목, 페이지 기준으로 chunking하고 chunk size 차이를 비교한다. 문서 구조가 깨진 사례를 찾아 표, 목록, 머리말을 보존하는 전처리 규칙을 만든다. |
| 목표 3 | 검색 결과를 확인한다 | 간단한 임베딩 모델로 문서를 벡터화하고 질문과 가까운 문단을 출력한다. 검색된 문단이 실제 답변 근거가 되는지 체크리스트로 검수한다. |
| 사용 플랫폼 | Python, Google Colab, LangChain, sentence-transformers, FAISS, Chroma, PyPDF |
|---|---|
| 강사 스펙 | RAG 기본 구조, 문서 전처리, 임베딩 검색 지도 경험 3년 이상 |
| 수업대상 | 생성형 AI 입문자, 문서 QA 챗봇을 만들고 싶은 교사·실무자 |
| 소요시간 | 4-6시간 |
| 준비물 | 샘플 PDF/TXT 문서, Colab 계정, RAG 순서도 템플릿, 질문 예시 |
| 산출물 | RAG 구조도, 문서 chunking 비교표, 검색 근거 검수표 |
| 평가방법 | 구조이해 30%, 전처리 25%, 검색실습 25%, 검수표 10%, 참여도 10% |
초급 · 3일
LangChain 기반 RAG 구현 과정
LangChain으로 문서 업로드형 질의응답 파이프라인을 만든다.



| 구분 | 세부 내용 | 실천·실습 방법 |
|---|---|---|
| 목표 1 | 문서 로더를 구성한다 | PyPDFLoader, TextLoader, CSVLoader를 사용해 자료 유형별 로딩 코드를 작성한다. RecursiveCharacterTextSplitter로 chunk size와 overlap을 바꿔 검색 품질 차이를 확인한다. |
| 목표 2 | 벡터DB를 구축한다 | FAISS와 Chroma에 임베딩을 저장하고 persist directory를 설정한다. 질문별 top-k 검색 결과를 표로 출력해 검색 누락과 중복을 분석한다. |
| 목표 3 | 답변 체인을 만든다 | retriever와 prompt template을 연결해 근거 문단 기반 답변을 생성한다. 답변에 출처 문서명, 페이지, chunk 번호가 표시되도록 출력 형식을 설계한다. |
| 사용 플랫폼 | Python, LangChain, FAISS, Chroma, Hugging Face Embeddings, OpenAI 또는 Ollama, Streamlit |
|---|---|
| 강사 스펙 | LangChain RAG 체인, 벡터DB 저장, 출처 표시형 QA 구현 경험 3년 이상 |
| 수업대상 | Python 기초 가능자, 챗봇 개발 입문자, 기업 문서 자동화 담당자 |
| 소요시간 | 12-18시간 |
| 준비물 | PDF/CSV/TXT 문서 묶음, API 키 또는 Ollama 환경, VS Code, Streamlit 기본 템플릿 |
| 산출물 | LangChain RAG 노트북, 벡터DB 폴더, 출처 표시형 QA 화면 |
| 평가방법 | 문서로딩 25%, 벡터DB 30%, 답변체인 25%, 출처표시 10%, 발표 10% |
초급 · 1주
RAG 품질평가와 개선 과정
검색 정확도와 답변 신뢰도를 측정하고 개선한다.


| 구분 | 세부 내용 | 실천·실습 방법 |
|---|---|---|
| 목표 1 | 평가 질문 세트를 만든다 | 정답이 문서에 있는 질문, 없는 질문, 여러 문서가 필요한 질문을 분리해 30문항을 설계한다. 질문별 기대 근거 문단과 허용 답변 기준을 평가표에 작성한다. |
| 목표 2 | 검색 품질을 개선한다 | chunk size, overlap, top-k, embedding model을 바꿔 검색 성공률을 비교한다. BM25 키워드 검색과 벡터검색을 결합한 hybrid retrieval 개념을 실험한다. |
| 목표 3 | 답변 신뢰도를 높인다 | 문서에 없으면 모른다고 답하게 하는 프롬프트와 출처 강제 템플릿을 만든다. 잘못된 답변 사례를 수집해 검색 실패, 프롬프트 실패, 원문 품질 문제로 분류한다. |
| 사용 플랫폼 | Python, LangChain, LlamaIndex, Chroma, FAISS, Ragas 또는 DeepEval, pandas |
|---|---|
| 강사 스펙 | RAG 평가, retrieval 튜닝, hallucination 분석 및 개선 지도 경험 4년 이상 |
| 수업대상 | RAG 기본 구현 경험자, AI 챗봇 품질관리 담당자, 프로젝트형 학습자 |
| 소요시간 | 20-30시간 |
| 준비물 | 평가용 문서셋, 질문/정답 엑셀표, 벡터DB 실험환경, 품질평가 템플릿 |
| 산출물 | RAG 평가 질문셋, 검색 튜닝 리포트, 실패사례 분석표 |
| 평가방법 | 평가설계 25%, 검색개선 30%, 답변검증 25%, 분석표 10%, 발표 10% |
중급 · 4주
업무문서 RAG 서비스 과정
사내 문서 검색과 답변 기능을 갖춘 업무형 RAG 서비스를 만든다.



| 구분 | 세부 내용 | 실천·실습 방법 |
|---|---|---|
| 목표 1 | 문서 수집 파이프라인을 만든다 | 폴더 감시 또는 업로드 방식으로 PDF, DOCX, XLSX를 수집하고 메타데이터를 부여한다. 문서명, 작성일, 부서, 권한등급을 metadata로 저장해 필터 검색을 실습한다. |
| 목표 2 | 서비스 UI를 구축한다 | Streamlit 또는 FastAPI 웹화면에서 문서 업로드, 질문, 답변, 근거 확인 기능을 만든다. 사용자가 근거 문단을 클릭하면 원문 위치를 확인할 수 있도록 출처 링크 구조를 설계한다. |
| 목표 3 | 운영 기준을 문서화한다 | 문서 업데이트 주기, 재색인 조건, 삭제 처리, 권한 제한, 로그 보관 정책을 정한다. 실제 운영 상황을 가정해 오래된 문서와 충돌 문서가 있을 때의 답변 정책을 만든다. |
| 사용 플랫폼 | Python, FastAPI, Streamlit, LangChain, Chroma, PostgreSQL, Docker, unstructured, python-docx, openpyxl |
|---|---|
| 강사 스펙 | 업무문서 RAG, 파일 파이프라인, 권한 메타데이터 설계 경험 4년 이상 |
| 수업대상 | 기업 문서관리팀, 교육자료 챗봇 제작팀, 공공·민간 내부 QA 프로젝트팀 |
| 소요시간 | 40-60시간 |
| 준비물 | 부서별 샘플 문서, 테스트 사용자 권한표, 서버 또는 Docker 환경, 운영정책 양식 |
| 산출물 | 업무문서 RAG 서비스, 문서 색인 파이프라인, 운영정책 문서 |
| 평가방법 | 파이프라인 25%, 서비스UI 30%, 메타데이터 20%, 운영정책 15%, 발표 10% |
심화 · 8주
RAG 실무 포트폴리오·배포 과정
평가·보안·배포 기준을 갖춘 RAG 프로젝트를 완성한다.



| 구분 | 세부 내용 | 실천·실습 방법 |
|---|---|---|
| 목표 1 | 고급 검색 구조를 설계한다 | query rewrite, multi-query retrieval, reranker, metadata filtering을 조합한 검색 구조를 설계한다. 일반 검색과 고급 검색의 정확도, 응답시간, 비용을 비교하는 실험표를 만든다. |
| 목표 2 | 보안형 RAG를 구현한다 | 사용자 권한에 따라 검색 가능한 문서가 달라지도록 metadata 필터를 적용한다. 민감정보가 답변에 노출되지 않도록 마스킹, 금칙어, 로그 비식별화 절차를 만든다. |
| 목표 3 | 최종 배포 제안서를 작성한다 | Docker Compose 기반 배포, 백업, 모니터링, 재색인, 장애 대응 흐름을 문서화한다. 최종 발표에서 품질평가 결과, 보안정책, 운영비, 확장 계획을 포함해 제안한다. |
| 사용 플랫폼 | Python, LangChain, LlamaIndex, Chroma 또는 Qdrant, rerankers, FastAPI, Docker Compose, PostgreSQL |
|---|---|
| 강사 스펙 | 고급 RAG 아키텍처, 권한 기반 검색, Docker 배포 및 품질평가 경험 5년 이상 |
| 수업대상 | AI 개발자, 기업 AI 리더, RAG 서비스 구축팀, 취업 포트폴리오 심화반 |
| 소요시간 | 80-120시간 |
| 준비물 | 권한별 문서셋, 테스트 계정, GPU/CPU 서버, 배포 템플릿, 품질평가 기준표 |
| 산출물 | 배포형 RAG 서비스, 품질평가 리포트, 보안 설계서, 도입 제안서 |
| 평가방법 | 고급검색 25%, 보안구현 25%, 배포설계 25%, 품질평가 15%, 발표 10% |