AI 기반 수면·운동·식단 종합 건강 리포트 생성 1기
- 강의레벨
- 초급
- 제공기관
- 건양대학교
- 카테고리
- -
- 이수시간
- 10시간
로그인
프로젝트 / 예측 성능 평가
과거 정비 이력으로 다음 달 정비 수요를 예측하는 모델을 만든다. 예측 자체보다, 예측을 믿어도 되는지 판단하는 방법을 배우는 데 무게를 둔다. 정비 수요 예측은 흔한 함정이 많다. 데이터가 시간순으로 되어 있는데…
과거 정비 이력으로 다음 달 정비 수요를 예측하는 모델을 만든다. 예측 자체보다, 예측을 믿어도 되는지 판단하는 방법을 배우는 데 무게를 둔다.
정비 수요 예측은 흔한 함정이 많다. 데이터가 시간순으로 되어 있는데 무작위로 나눠 검증하면 성능이 실제보다 훨씬 좋게 나온다. 예측 시점에 알 수 없는 정보를 특성으로 넣으면 더 좋게 나온다. 둘 다 실무에 올리면 바로 무너진다.
이 프로젝트에서는 시계열 데이터를 제대로 나누는 법, 기준선 모델과 비교하는 법, 오차가 큰 구간의 원인을 찾는 법을 익힌다. 마지막에는 "이 예측으로 무엇을 결정할 수 있고 무엇은 결정할 수 없는가"를 문서로 정리한다.
2인 1팀 수행. 데이터 준비와 모델링을 나눠 맡되 평가는 함께 한다.
· 선수 : pandas 로 표를 다룰 수 있어야 한다(「재물조사 데이터 정제 파이프라인」 수준).
· 선수 스킬 : 「업무 분석 Level 2」, 「AI 도구 활용 Level 2」 진단 통과.
· 기초 통계 : 평균·분산·상관을 해석할 수 있어야 한다. 검정 통계량 유도는 필요 없다.
· 준비물 : 파이썬 3.11+, pandas / scikit-learn / matplotlib. 부스팅 계열 라이브러리는 선택.
· 제공된 더미 정비 이력(3년, 월 단위 집계 가능)만 사용한다.
· 검증 데이터는 항상 학습 데이터보다 미래여야 한다. 무작위 분할 금지.
· 예측 시점에 알 수 없는 값을 특성으로 쓰지 않는다(예: 해당 월의 실제 가동시간).
· 딥러닝 모델은 이 프로젝트 필수 범위가 아니다. 쓰고 싶다면 기준선·전통 모델과의 비교가 선행되어야 한다.
· 성능 수치는 반드시 코드 실행 결과로 제시한다.
1. 예측 모델 코드 — 학습·검증·예측이 분리된 구조
2. 데이터 준비 노트 — 집계 단위, 결측 처리, 특성 정의
3. 검증 설계서 — 분할 방식, 누수 차단 근거
4. 성능 비교 리포트 — 기준선 대비 지표(MAE/RMSE/MAPE)
5. 오차 분석 — 크게 틀린 구간과 원인
6. 활용 한계 문서 — 이 예측으로 결정할 수 있는 것과 없는 것
· 실습 데이터 : 더미 장비 정비 이력 3년치(장비 300대, 정비 유형 8종, 월별 가동시간 포함)
· scikit-learn User Guide — Cross validation for time series data (TimeSeriesSplit)
· 참고 : 「예측 모델 성능 평가 지표 정리」(사내), 수요 예측 사례 자료
이 프로젝트를 수료하면 아래 역량을 기를 수 있습니다.
댓글 0
로그인 후 댓글을 남길 수 있습니다.