공정 데이터 기반 예측 모델 개념
- 예측 모델:
- 과거의 공정 입력 데이터(X)와 품질/설비 결과 데이터(Y) 사이의 복잡한 비선형적 관계를 수학적 함수 f(X)로 찾아내는 데이터 통합 과정
- 우리가 알고 싶은 것:
- 우리가 가진 공정 데이터(X)로 무엇(Y)을 예측할 수 있는가?
- 어떤 알고리즘을 골라야 하는가?
1. 제조 예측 모델의 핵심 기본 방정식
- AI 예측 모델의 본질을 가장 직관적으로 전달하는 핵심 수식
- \(X\) (독립변수 / Feature / Cause):
- 우리가 공정 현장에서 조절하거나 측정할 수 있는 원인 데이터
- 4M 데이터:
- 작업자 조(Man), 설비 ID(Machine), 원자재 Batch/Lot(Material), 작업 표준 레시피(Method)
- 시계열 센서 데이터:
- 노즐 온도, 사출 압력, 금형 냉각수 흐름 속도, 진동 주파수 등
- \(Y\) (종속변수 / Target / Effect):
- 우리가 미리 알고 싶거나 최적화하고자 하는 결과 데이터
- 제품 품질 결과(수축률, 두께, 치수, 불량 여부), 설비 고장 시점, 에너지 소비량
- \(f(\cdot)\) (AI 모델 / Function): 입력(X)과 결과(Y) 사이의 복잡한 규칙과 패턴을 찾아내는 알고리즘
- 사람의 머리로는 \(X_1\)부터 \(X_{50}\)까지 50개 변수가 동시에 복잡하게 얽힌 관계를 계산할 수 없음
- 바로 이 매우 복잡한 50차원 함수 \(f(\cdot)\) 를 대신 계산해 주는 계산기가 바로 AI 모델
2. 제조 현장의 3대 예측 모델 유형 (세부 예시)
제조 현장에서 다루는 예측 문제는 \(Y\) 값의 형태에 따라 크게 3가지로 나뉨
- 회귀 모델 (Regression - 연속형 수치 예측)
- 개념:
- 예측하고자 하는 결과값 \(Y\)가 연속적인 숫자(Real Value)일 때 사용
- 현장 예시:
- 사출성형 수축률 예측:
- 노즐 온도(\(X_1\))와 보압 시간(\(X_2\)) 데이터를 기반으로
- 사출 후 제품의 치수 오차(\(-0.03\text{ mm}\))를 연속 수치로 예측
- 베어링 잔여 수명(RUL) 예측:
- 진동 수치(\(X\))가 증가하는 추세를 분석하여
- “이 베어링의 남은 수명은 42시간입니다”라고 예측
- 사출성형 수축률 예측:
- 개념:
- 분류 모델 (Classification - 범주/상태 예측)
- 개념:
- 예측하고자 하는 결과값 \(Y\)가 정해진 그룹이나 라벨(Category)일 때 사용
- 현장 예시:
- 이진 분류 (Binary):
- 해당 Lot 제품의 검사 결과가
양품(0)일지불량(1)일지 사전 예측
- 해당 Lot 제품의 검사 결과가
- 다중 분류 (Multi-class):
- 불량이 발생한다면 그것이
미성형(Short Shot),수축(Sink Mark),변색(Discoloration)중 어떤 유형일지 예측
- 불량이 발생한다면 그것이
- 이진 분류 (Binary):
- 개념:
- 이상 탐지 모델 (Anomaly Detection - 정상 이탈도 예측)
- 개념:
- 결과값 \(Y\)에 대한 정답(라벨)이 없거나 불량이 극히 희소할 때,
- 양품/정상 상태의 통계적 패턴(Anomalous Score)을 기준으로 이탈 정도를 계산
- 현장 예시:
- 설비 고장 사전 경보:
- 가공 스핀들 모터의 전류/진동 파형을 실시간으로 추적하여,
- 정상 범위를 벗어나는 이상 징후 발생 시 “설비 이상 지수 $85\%$ 감지” 알람 발송
- 설비 고장 사전 경보:
- 개념:
3. 예측 알고리즘의 선택 가이드
- Tabular Data (표 형태의 공정/MES 데이터) 🡪 Tree 기반 Ensemble 모델
- 데이터 형태:
- 엑셀이나 RDBMS처럼
Timestamp,온도,압력,작업자,불량여부가 가로/세로 테이블 형태로 정돈된 데이터
- 엑셀이나 RDBMS처럼
- 추천 알고리즘:
- XGBoost, LightGBM, Random Forest
- 선택 이유:
- 제조 현장 데이터 분석의 80\% 이상에서 딥러닝보다 압도적으로 뛰어난 성능과 빠른 학습 속도를 보임
- 데이터 전처리(스케일링 등)의 영향을 덜 받음
- 변수 중요도(Feature Importance) 분석이 용이함
- 데이터 형태:
- Continuous Time-Series Data (고주파 파형 센서) 🡪 시계열 딥러닝 모델
- 데이터 형태:
- 초당 수백~수천 번 수집되는 진동, 전류, 음향 파형 데이터
- 추천 알고리즘:
- LSTM (Long Short-Term Memory), GRU, TCN (Temporal Convolutional Network)
- 선택 이유:
- 단순 단일 시점의 수치 데이터가 아니라,
- “시간의 흐름과 순서(Sequence)”에 따른 패턴 변화를 메모리에 기억하며 학습해야 하기 때문
- 데이터 형태:
- 공정 예측 모델을 만드는 첫걸음
- 복잡한 공식을 외우는 것이 아님
- ‘우리 공장에서 풀고자 하는 문제의 \(Y\)(목적)가 무엇인가?’를 명확히 정의하는 것
- \(Y\)가 불량 유무라면 분류
- \(Y\)가 치수 오차라면 회귀
- \(Y\)가 고장 징후라면 이상 탐지
- 엑셀 형태의 일반 공정 데이터라면
- 굳이 복잡한 딥러닝을 찾지 말고 XGBoost 같은 Tree 기반 알고리즘을 활용