시뮬레이션 엔지니어를 위한 AI/ML 가상검증 전략
산업을 위한 AI와 버추얼 트윈 기술 (5)
엔지니어링 시뮬레이션 분야에서 AI/ML 서로게이트 모델(surrogate model)에 대한 관심이 높아지고 있지만, 막상 현장에 적용하면 기대와 다른 결과에 마주치는 경우가 많다. 좋은 알고리즘을 선택했음에도 예측 성능이 기대에 못 미치는 원인은 대부분 알고리즘이 아닌 데이터에 있다.
이번 호에서는 아이사이트 파이썬-ML(Isight PythonML)을 중심으로, 시뮬레이션 데이터의 유형에 따른 적합한 ML 기법 선택 전략과, 간단한 데이터 전처리만으로 모델 성능이 극적으로 향상되는 실제 사례를 소개한다. 아울러 파이썬-ML의 ONNX 기반 파이프라인 구조, 아이사이트 최적화 워크플로 연동 방법, K-Fold 교차검증을 통한 일반화 성능 확보 전략을 실무 관점에서 다루며, 시뮬레이션 엔지니어가 AI/ML을 현장에서 즉시 활용할 수 있는 실전 원칙과 개발 프로세스를 제안한다.
■ 김문성
다쏘시스템코리아의 SIMULIA 인더스트리 프로세스 컨설턴트 시니어 스페셜리스트이다. Isight 워크플로 자동화, 최적화 및 AI/ML 기반 시뮬레이션 서로게이트 모델 개발 등이 전문 분야이며, 기계·전자·자동차·항공 분야 FEA 기반 DOE 및 최적화 프로젝트를 다수 수행한 경험을 갖고 있다.
홈페이지 | www.3ds.com/ko
시뮬레이션과 AI/ML, 왜 지금인가
해석 비용의 딜레마
배터리 팩의 구조 안전성, 자동차 충돌 거동, 항공기 피로 수명 등에서 FEA 해석은 이제 설계 검증의 표준이다. 그러나 DOE를 통한 설계 최적화는 반복 해석 횟수를 수십 배로 늘려놓는다. 설계 파라미터 10개라면 100회 이상의 해석이 필요하고, 해석 1회에 30분이면 전체 DOE에 50시간이 소요된다. 더 많이 탐색하고 싶지만 해석 비용이 탐색의 폭을 제한하는 것이 현장의 딜레마다.
서로게이트 모델과 파이썬-ML
서로게이트 모델은 제한된 해석 데이터로 입출력 관계를 학습한 수학적 예측 모델이다. 아이사이트는 전통적으로 RSM, RBF, Kriging같은 근사 기법을 제공해 왔으나, 예측 대상이 3D 응력 분포나 시계열 FD 곡선으로 확장되면서 전통 기법의 한계가 드러났다.
파이썬-ML은 이 한계를 돌파한다. 사용자가 파이썬으로 개발한 ML 알고리즘을 아이사이트의 Approximation 워크플로에 완전히 통합할 수 있는 신규 기능이다. RF, XGBoost , LightGBM, CatBoost, MLP(PyTorch), GPR 등 최신 ML 기법을 아이사이트 DOE·최적화 루프와 동일하게 연동하며, ONNX 기반 런타임 독립적 추론으로 학습과 배포 환경을 분리할 수 있다.
성공의 3가지 전제조건
그렇다면 머신러닝 서로게이트를 도입하면 누구나 바로 좋은 결과를 얻을 수 있을까? 현장의 경험은 그렇지 않다고 말한다. 실 제 프로젝트에서 머신러닝 모델을 처음 적용해 본 엔지니어들이 공통적으로 겪는 상황이 있다. XGBoost를 썼는데 R²가 0.4에 머물고, MLP로 바꿔봤지만 크게 나아지지 않는다. 하이퍼파라미터를 이리저리 조정해봐도 성능이 제자리걸음이다. 문제는 알고리즘이 아니었다. 데이터가 문제였다.
성공적인 ML 서로게이트 모델을 만들기 위해서는 세 가지 전제 조건이 반드시 갖춰져야 한다.
첫째, 데이터에 대한 이해다. 학습에 사용할 데이터가 어떤 분포를 가지고 있는지, 입력과 출력 사이에 어떤 관계가 있는지, 이상치나 편향은 없는지를 먼저 파악해야 한다. 데이터 분포 하나를 확인하는 것이 알고리즘 교체보다 훨씬 효과적인 경우가 많다.
둘째, 데이터 유형에 맞는 기법 선택이다. 시뮬레이션 데이터는 크게 DOE 스칼라 데이터, 3D 필드 데이터, 시계열 이력 데이터로 나눌 수 있으며, 각각에 적합한 ML 기법이 다르다. 시계열 데이터에 일반 회귀 모델을 적용하거나, 고차원 필드 데이터에 RF나 XGBoost를 들이미는 것은 처음부터 실패를 예약하는 것과 같다.
셋째, 반복적인 검증 프로세스다. 좋은 ML 모델은 한 번에 완성되지 않는다. 데이터를 분석하고, 전처리하고, 모델을 학습시키고, K-Fold 교차검증으로 일반화 성능을 확인하고, 다시 데이터로 돌아가는 이 순환 과정이 곧 ML 모델 개발의 본질이다. 훈련 데이터에서 높은 정확도를 보이더라도 새로운 데이터에서 무너지는 과적합 함정을 피하려면, 검증 프로세스를 처음부터 워크플로에 포함시켜야 한다.
그림 1. 시뮬레이션 데이터 유형별 AI/ML 기법 분류 체계
시뮬레이션 데이터를 알아야 기법이 보인다
세 가지 데이터 유형과 권장 기법
시뮬레이션 데이터는 구조적 특성에 따라 세 유형으로 분류된 다. 이 분류가 ML 기법 선택의 출발점이다.
DOE 스칼라 데이터(Scalar Table Data)
가장 일반적인 형태의 시뮬레이션 데이터다. 아이사이트의 DOE 컴포넌트를 통해 설계 변수를 조합하고, 각 해석 결과를 단일 숫자값으로 추출한 형태다. 행은 각각의 DOE 실험 케이스이고, 열은 입력 변수와 출력 변수로 구성된 전형적인 테이블 구조를 가진다.
3D 필드 데이터(Field Output Data)
해석 결과를 단일 숫자가 아닌 메시(mesh)의 모든 노드 또는 요소에 걸쳐 분포로 추출한 데이터다. 응력 분포(stress field), 변형률 분포(strain field), 변위 분포(displacement field), 온도 분포(temperature distribution) 등이 대표적이다. 이 유형은 단순히 데이터 크기가 크다는 문제를 넘어, 공간적 상관관계라는 구조적 특성을 가진다. 인접한 노드의 응력값은 서로 독립적이지 않고 물리적으로 연결되어 있다. 이 공간적 연속성을 무시하고 단순히 데이터를 1차원으로 펼쳐서 학습하면, 모델이 공간 구조를 전혀 이해하지 못하는 결과를 낳는다.
시계열 이력 데이터(History Output Data)
시간의 흐름에 따라 변화하는 순차적(sequential) 데이터다. FD 곡선(force-displacement curve), 시간 가속도 이력(time acceleration history), 주파수 응답 함수(FRF) 등이 이에 해당한다. 이 유형의 핵심 특성은 이전 상태가 이후 상태에 영향을 미치는 시간적 의존성이다. 일반적인 MLP나 트리 기반 모델은 이 순서 정보를 처리할 수 없다. 시계열 데이터에는 시퀀스를 이해하는 구조, 즉 RNN(LSTM) 계열이나 트랜스포머(transformer) 계열의 모델이 필요하다.
■ 자세한 기사 내용은 PDF로 제공됩니다.
작성일 : 2026-07-03