AI 기반 수면·운동·식단 종합 건강 리포트 생성 1기
- 강의레벨
- 초급
- 제공기관
- 건양대학교
- 카테고리
- -
- 이수시간
- 10시간
로그인
프로젝트 / 문서·지식베이스 자동화
교범·규정·업무 지침 문서를 근거로 질문에 답하는 챗봇을 만든다. LLM 을 그냥 부르는 것이 아니라, 우리 문서에서 찾아 그 문서를 인용해 답하게 하는 RAG(검색 증강 생성) 구조다. 일반 LLM 에 "군수품 청…
교범·규정·업무 지침 문서를 근거로 질문에 답하는 챗봇을 만든다. LLM 을 그냥 부르는 것이 아니라, 우리 문서에서 찾아 그 문서를 인용해 답하게 하는 RAG(검색 증강 생성) 구조다.
일반 LLM 에 "군수품 청구 절차가 어떻게 되나"를 물으면 그럴듯한 문장이 나오지만 우리 규정과는 다르다. 이 차이를 메우는 것이 RAG 이고, 실무에서 LLM 을 쓸 수 있게 만드는 거의 유일한 방법이다.
프로젝트는 문서 수집·청킹 → 임베딩·벡터 검색 → 프롬프트 설계 → 근거 인용 → 평가셋 측정 → 서비스화 순서로 진행된다. 특히 "환각을 어떻게 줄이고, 줄었다는 것을 어떻게 증명하는가"에 가장 많은 시간을 쓴다. 데모는 누구나 만들지만 신뢰할 수 있는 답변율을 숫자로 제시할 수 있는 사람은 드물다.
2인 1팀으로 수행한다. 검색 품질과 생성 품질을 나눠 맡고 합쳐 측정하는 방식을 권장한다.
· 선수 : 파이썬 중급(클래스·비동기 기초·API 호출 경험). 「재물조사 데이터 정제 파이프라인」 수준의 데이터 처리 경험.
· 선수 스킬 : 「프롬프트 설계 Level 2」, 「AI 도구 활용 Level 2」 진단 통과.
· 준비물 : 파이썬 3.11+, 실습용 LLM API 키(교육 환경 제공), 로컬 벡터DB(Chroma 또는 FAISS).
· 사전 학습 : 임베딩과 코사인 유사도의 개념을 설명할 수 있어야 한다. 수식 유도는 필요 없다.
· 실습 문서는 제공되는 공개 교범·훈령 발췌본과 더미 지침만 사용한다. 대외비 문서를 넣지 않는다.
· 외부 LLM API 는 교육용으로 제공된 계정만 사용한다. 개인 계정 사용 금지.
· 답변에는 반드시 근거 문서명과 조·항이 붙어야 한다. 근거 없는 답변은 미완성으로 본다.
· 파인튜닝은 이 프로젝트 범위가 아니다. 검색과 프롬프트로 해결하는 것이 과제다.
· 평가셋의 정답은 사람이 문서를 보고 만든다. LLM 이 만든 정답으로 LLM 을 평가하지 않는다.
1. RAG 챗봇 애플리케이션 — 질문 입력, 근거 인용이 붙은 답변 출력
2. 문서 처리 파이프라인 — 원문 → 정제 → 청킹 → 임베딩 → 색인
3. 평가셋 — 질문 50문항 이상(정답 근거 위치 포함) + 답변 불가 질문 10문항
4. 측정 리포트 — 검색 적합률, 인용 정확도, 거부율, 응답 시간
5. 프롬프트 설계서 — 버전별 변경 내역과 각 버전의 측정 결과
6. 한계 및 운영 위험 보고서
· 실습 문서셋 : 공개 훈령·교범 발췌 12종(약 900쪽) + 더미 부대 지침 8종
· 임베딩 모델 : 교육 환경 제공 한국어 임베딩 모델 + 비교용 다국어 모델
· 참고 : 「LLM 서비스 개발 가이드」(사내), RAG 평가 지표 정리 자료
· 벡터DB : Chroma / FAISS 중 선택
이 프로젝트를 수료하면 아래 역량을 기를 수 있습니다.
댓글 0
로그인 후 댓글을 남길 수 있습니다.