공정 데이터 기반 예측 모델 개념

  • 예측 모델:
    • 과거의 공정 입력 데이터(X)와 품질/설비 결과 데이터(Y) 사이의 복잡한 비선형적 관계를 수학적 함수 f(X)로 찾아내는 데이터 통합 과정

  • 우리가 알고 싶은 것:
    • 우리가 가진 공정 데이터(X)로 무엇(Y)을 예측할 수 있는가?
    • 어떤 알고리즘을 골라야 하는가?

1. 제조 예측 모델의 핵심 기본 방정식

  • AI 예측 모델의 본질을 가장 직관적으로 전달하는 핵심 수식
\[\mathbf{Y = f(X_1, X_2, X_3, \dots, X_n)}\]
  • \(X\) (독립변수 / Feature / Cause):
    • 우리가 공정 현장에서 조절하거나 측정할 수 있는 원인 데이터
  • 4M 데이터:
    • 작업자 조(Man), 설비 ID(Machine), 원자재 Batch/Lot(Material), 작업 표준 레시피(Method)
  • 시계열 센서 데이터:
    • 노즐 온도, 사출 압력, 금형 냉각수 흐름 속도, 진동 주파수 등
  • \(Y\) (종속변수 / Target / Effect):
    • 우리가 미리 알고 싶거나 최적화하고자 하는 결과 데이터
    • 제품 품질 결과(수축률, 두께, 치수, 불량 여부), 설비 고장 시점, 에너지 소비량
  • \(f(\cdot)\) (AI 모델 / Function): 입력(X)과 결과(Y) 사이의 복잡한 규칙과 패턴을 찾아내는 알고리즘
    • 사람의 머리로는 \(X_1\)부터 \(X_{50}\)까지 50개 변수가 동시에 복잡하게 얽힌 관계를 계산할 수 없음
    • 바로 이 매우 복잡한 50차원 함수 \(f(\cdot)\) 를 대신 계산해 주는 계산기가 바로 AI 모델

2. 제조 현장의 3대 예측 모델 유형 (세부 예시)

  • 제조 현장에서 다루는 예측 문제는 \(Y\) 값의 형태에 따라 크게 3가지로 나뉨

  • 회귀 모델 (Regression - 연속형 수치 예측)
    • 개념:
      • 예측하고자 하는 결과값 \(Y\)가 연속적인 숫자(Real Value)일 때 사용
    • 현장 예시:
      • 사출성형 수축률 예측:
        • 노즐 온도(\(X_1\))와 보압 시간(\(X_2\)) 데이터를 기반으로
        • 사출 후 제품의 치수 오차(\(-0.03\text{ mm}\))를 연속 수치로 예측
      • 베어링 잔여 수명(RUL) 예측:
        • 진동 수치(\(X\))가 증가하는 추세를 분석하여
        • “이 베어링의 남은 수명은 42시간입니다”라고 예측
  • 분류 모델 (Classification - 범주/상태 예측)
    • 개념:
      • 예측하고자 하는 결과값 \(Y\)가 정해진 그룹이나 라벨(Category)일 때 사용
    • 현장 예시:
      • 이진 분류 (Binary):
        • 해당 Lot 제품의 검사 결과가 양품(0)일지 불량(1)일지 사전 예측
      • 다중 분류 (Multi-class):
        • 불량이 발생한다면 그것이 미성형(Short Shot), 수축(Sink Mark), 변색(Discoloration) 중 어떤 유형일지 예측
  • 이상 탐지 모델 (Anomaly Detection - 정상 이탈도 예측)
    • 개념:
      • 결과값 \(Y\)에 대한 정답(라벨)이 없거나 불량이 극히 희소할 때,
      • 양품/정상 상태의 통계적 패턴(Anomalous Score)을 기준으로 이탈 정도를 계산
    • 현장 예시:
      • 설비 고장 사전 경보:
        • 가공 스핀들 모터의 전류/진동 파형을 실시간으로 추적하여,
        • 정상 범위를 벗어나는 이상 징후 발생 시 “설비 이상 지수 $85\%$ 감지” 알람 발송

3. 예측 알고리즘의 선택 가이드

  • Tabular Data (표 형태의 공정/MES 데이터) 🡪 Tree 기반 Ensemble 모델
    • 데이터 형태:
      • 엑셀이나 RDBMS처럼 Timestamp, 온도, 압력, 작업자, 불량여부가 가로/세로 테이블 형태로 정돈된 데이터
    • 추천 알고리즘:
      • XGBoost, LightGBM, Random Forest
    • 선택 이유:
      • 제조 현장 데이터 분석의 80\% 이상에서 딥러닝보다 압도적으로 뛰어난 성능과 빠른 학습 속도를 보임
      • 데이터 전처리(스케일링 등)의 영향을 덜 받음
      • 변수 중요도(Feature Importance) 분석이 용이함
  • Continuous Time-Series Data (고주파 파형 센서) 🡪 시계열 딥러닝 모델
    • 데이터 형태:
      • 초당 수백~수천 번 수집되는 진동, 전류, 음향 파형 데이터
    • 추천 알고리즘:
      • LSTM (Long Short-Term Memory), GRU, TCN (Temporal Convolutional Network)
    • 선택 이유:
      • 단순 단일 시점의 수치 데이터가 아니라,
      • “시간의 흐름과 순서(Sequence)”에 따른 패턴 변화를 메모리에 기억하며 학습해야 하기 때문


  • 공정 예측 모델을 만드는 첫걸음
    • 복잡한 공식을 외우는 것이 아님

    • ‘우리 공장에서 풀고자 하는 문제의 \(Y\)(목적)가 무엇인가?’를 명확히 정의하는 것
      • \(Y\)가 불량 유무라면 분류
      • \(Y\)가 치수 오차라면 회귀
      • \(Y\)가 고장 징후라면 이상 탐지

    • 엑셀 형태의 일반 공정 데이터라면
      • 굳이 복잡한 딥러닝을 찾지 말고 XGBoost 같은 Tree 기반 알고리즘을 활용

© 2020. AiDALab Co. All rights reserved.

Powered by Hydejack v9.2.1