Skip to main content
금속 유통업체를 위한 AI 기반 MTC 검증: 작동 방식과 탐지 항목
블로그·23분 읽기·

금속 유통업체를 위한 AI 기반 MTC 검증: 작동 방식과 탐지 항목

산업 인사이트

금속 유통업체가 대규모로 MTC 문서를 AI 검증하는 시스템을 도입할 때, 자연스럽게 처음 떠오르는 질문은 "실제로 어떻게 작동하는가?"입니다. 이 질문이 중요한 이유는 시스템의 역량이 유통업체가 마주하는 실제 문서 다양성을 처리할 수 있는지를 결정하기 때문입니다 — 주요 국내 제철소의 깨끗한 디지털 PDF뿐만 아니라, 스캔 사본, 독일어 인증서, 회전된 화학 성분표, 그리고 더 이상 존재하지 않는 제철소의 수십 년 된 문서까지 포함해서 말입니다.

이 가이드는 AI 기반 MTC 검증의 기술 아키텍처를 다룹니다: 문서가 어떻게 수집되고 추출되는지, 추출이 형식 다양성을 어떻게 처리하는지, 검증 규칙이 어떻게 적용되는지, 사기 탐지가 어떻게 작동하는지, 그리고 수동 검토가 지속적으로 놓치는 것을 시스템이 무엇을 잡아내는지.


레이어 1: 문서 수집 및 사전 처리

자동화된 MTC 검증의 첫 번째 과제는 입력 형식 문제입니다. 금속 유통업체는 상상할 수 있는 모든 형식으로 문서를 받습니다:

  • 제철소 품질 관리 시스템에서 직접 생성된 디지털 PDF(잘 구조화되어 있고 정확도가 높음)
  • 다양한 해상도와 방향으로 스캔된 종이 인증서(부분적으로 손상되어 OCR이 필요)
  • 화학 성분표가 제철소 헤더 및 서명과 별도 페이지에 나타나는 다중 페이지 문서
  • 입고 담당 직원이 부두에서 휴대폰으로 촬영한 사진
  • 연속 스캔마다 이미지 품질이 저하되는 다세대 사본
  • 독일어, 프랑스어, 이탈리아어, 일본어, 한국어, 중국어 등 다양한 언어로 작성된 문서
  • 같은 표 안에 SI 단위와 야드파운드법 단위가 혼합된 문서

표준 PDF 라이브러리를 사용해 텍스트를 추출하고 필드 매칭 패턴을 적용하는 단순한 접근 방식은 익숙한 제철소의 디지털 PDF에는 적절히 작동하지만, 실제 변동성의 대부분에서는 실패합니다. AI 기반 시스템의 사전 처리 레이어는 데이터 추출이 시작되기 전에 이 문제를 해결합니다.

견고한 MTC 검증 시스템을 위한 사전 처리 단계:

이미지 정규화: 회전 보정(90° 또는 180°로 스캔된 문서를 똑바로 회전), 흐리거나 과도하게 노출된 스캔을 위한 밝기 및 대비 정규화, 저해상도 모바일 카메라 입력을 위한 해상도 향상.

레이아웃 분석: MTC의 뚜렷한 구역 — 헤더(제철소 식별, 인증서 번호, 날짜), 자재 식별 섹션(등급, 열 번호, 치수), 화학 성분표, 기계적 특성표, NDE/열처리 섹션, 서명란 — 을 식별하기 위한 문서 세분화. 이 세분화는 정확한 필드 추출의 전제 조건인데, 동일한 레이블("C" 또는 "Carbon")이 여러 문맥에서 나타날 수 있기 때문입니다.

언어 식별: 인증서 언어의 자동 감지를 통해 이후의 필드 추출이 올바른 레이블 사전을 적용할 수 있습니다(독일어 "Kohlenstoff" = 영어 "Carbon"; 프랑스어 "Carbone"; 일본어 炭素).


Digital dashboard showing AI-powered MTC data processing

레이어 2: AI/OCR 모델을 사용한 필드 추출

사전 처리 후, 추출 레이어는 식별된 각 문서 구역에서 구조화된 데이터를 가져옵니다. 템플릿 기반 OCR과 AI 기반 추출 간의 기술적 차이는 하나는 다양한 제철소 인증서 형식을 처리할 수 있고 다른 하나는 그렇지 못한 이유를 이해하는 데 매우 중요합니다.

템플릿 기반 OCR은 고정된 필드 위치 패턴을 사용합니다: "탄소 함량은 항상 화학 성분표의 3번째 열, 5번째 행에 있다." 새로운 제철소가 다른 표 구조를 사용하거나, 동일한 제철소가 인증서 템플릿을 변경하면, 템플릿이 깨지고 추출이 조용히 실패합니다 — 오류를 발생시키거나 잘못된 값을 생성합니다.

AI 추출은 다양한 실제 MTC 코퍼스로 훈련된 모델을 사용하여 문서의 의미론적 구조를 이해합니다. 이 모델은 화학 성분표 문맥에서 "Carbon"과 의미상 동등한 레이블 뒤에 오는 숫자가 탄소 함량이라는 것을 알고 있습니다 — 위치, 표 방향, 문서 언어와 무관하게 말입니다. 추출은 위치 인식이 아니라 문맥 인식 방식입니다.

변동성이 큰 필드 — 단위(% 대 ppm 대 mg/kg), 소수점 표기법(유럽식 쉼표 대 영어식 소수점), 결합된 셀(예: "Nb+Ta"와 같이 쌍으로 보고되는 원소), 같은 표 안에 혼합된 단위 — 의 경우, AI 추출은 명시적 규칙 코딩이 아니라 학습된 패턴 인식을 통해 이러한 변동을 처리합니다.

신뢰도 점수는 추출 레이어의 핵심 출력입니다. 추출된 모든 필드에는 모델이 값을 올바르게 읽었다고 확신하는 정도를 반영하는 신뢰도 점수가 함께 부여됩니다. 신뢰도가 낮은 필드(일반적으로 0.90 미만)는 조용히 통과되거나 조용히 실패 처리되는 대신 사람의 검토를 위해 플래그가 지정됩니다. 이것이 시스템이 값을 잘못 추출하고도 이를 올바른 것으로 통과시키는 위양성(false negative)을 방지하는 메커니즘입니다.


레이어 3: 사양 비교 및 검증 규칙

추출이 완료되고 신뢰도 점수가 평가되면, 추출된 모든 값은 해당 자재 등급에 적용되는 사양 한계와 비교됩니다.

사양 비교 엔진에는 다음이 필요합니다:

유지 관리되는 자재 사양 데이터베이스로, ASTM A 시리즈(A36, A106, A240, A276, A516 등), EN 자재 규격(EN 10025, EN 10088, EN 10028 등), AMS 항공우주 사양, API 5L 제품 사양 등급 및 기타를 포함합니다. 이 데이터베이스의 한계값은 최신 개정판으로 유지 관리되어야 합니다 — 오래된 사양표는 잘못된 검증 결과를 만들어냅니다.

추출된 MTC로부터의 등급 식별. 시스템은 인증서에서 발견된 등급 지정을 기반으로 어떤 사양 행이 적용되는지 결정해야 합니다. 복잡한 지정(API 5L X65 PSL2 Sour Service)의 경우, 시스템은 복합 지정을 파싱하여 등급별 추가 요건(사워 서비스 황 한계, CVN 온도 요건 포함)을 포함한 올바른 화학적, 기계적 한계를 적용해야 합니다.

올바른 연산자를 사용한 원소별 비교. 일부 사양 한계는 최댓값(C ≤ 0.030%)이고, 일부는 최솟값(Cr ≥ 22.0%)이며, 일부는 범위(Mo: 3.0–3.5%)이고, 일부는 계산값(CE = C + Mn/6 + ..., 한계값과 비교)입니다. 비교 엔진은 원소별, 사양별로 올바른 연산자를 적용해야 합니다.

추가 요구 사항 교차 참조. 추가 요구 사항이 있는 사양(ASTM S 시리즈, API PSL2 추가 사항)의 경우, 엔진은 발주서(PO) 요구 사항을 MTC 내용과 비교해야 합니다. 발주서에서 S5 샤르피 충격 시험이 지정되었다면, 인증서에는 충격 시험 결과가 표시되어야 합니다 — 이것이 없으면 화학 성분과 기계적 특성이 한계 내에 있는지 여부와 관계없이 플래그가 발생합니다.


레이어 4: 교차 필드 일관성 및 사기 탐지

단일 필드 검증은 사양 위반을 잡아냅니다. 교차 필드 일관성 분석은 단일 필드 검사가 놓치는 사기와 필사 오류를 잡아냅니다.

열 번호 교차 검사. 많은 인증서에는 열 번호가 여러 곳에 나타납니다: 헤더, 자재 식별 섹션, 화학 성분표 헤더, 결과 확인란. AI 추출은 모든 인스턴스를 읽고, 일관성 검사는 이들 사이의 불일치를 플래그합니다. 정당한 인증서는 열 번호가 일관되지만, 사기로 변조된 인증서는 편집자가 하나의 인스턴스는 변경하고 다른 하나는 놓쳤기 때문에 종종 불일치가 나타납니다.

기계적 특성 범위의 타당성. 진짜 시험 결과는 자연스러운 통계적 분포를 따릅니다: 인장 강도 값은 현실적인 편차를 가지며 해당 등급의 일반적인 값 주변에 모입니다. 사기로 생성되거나 필사된 값은 종종 자연스러운 편차 없이 사양 최솟값이나 최댓값에 정확히 위치합니다. 2205 듀플렉스 인증서에서 배치의 모든 조각에 걸쳐 항복 강도가 편차 없이 정확히 ASTM 최솟값에 위치한다면, 이는 값이 측정된 것이 아니라 사양표에서 복사되었음을 시사하는 통계적 이상입니다.

화학 성분 합계 일관성. 강철 인증서에 보고된 모든 원소의 합은 100%에 가까워야 하며, 나머지는 명시적으로 언급되지 않는 철(iron)입니다. 명시된 값들의 합이 100%보다 현저히 높거나 낮은 화학 성분표 — 또는 암시된 철 잔량이 타당하지 않은 경우 — 는 필사 오류나 값 조작을 시사합니다.

날짜 논리. 인증서 발급일은 마지막 시험 수행일 이후이거나 같아야 합니다. 제철소 검사일은 인증서 날짜 이전이거나 같아야 합니다. 검사일이 발급일 이후이거나, 날짜 형식이 미래 날짜의 문서를 시사하는 인증서는 이상 플래그를 발생시킵니다.

제철소 출처 타당성. 알려진 신뢰할 수 있는 제철소 출처로 시스템을 구성한 유통업체의 경우, 인증서의 제철소 식별 정보를 검증된 제철소 등록부와 비교할 수 있습니다. 잘 알려진 유럽 제철소라고 주장하지만 그 제철소의 알려진 정보와 일치하지 않는 연락처 정보를 가진 인증서는 검증 플래그를 발생시킵니다.


AI 검증이 잡아내지만 수동 검토가 놓치는 것

숙련된 품질 엔지니어의 수동 검토는 다음을 잡아냅니다: 명백한 등급 불일치, 사양을 명확히 벗어난 값, 엔지니어가 이 등급에 필요하다는 것을 우연히 알고 있는 누락된 필수 필드. 그러나 지속적으로 다음을 놓칩니다:

저변동 화학 성분 이상. 인(P) 함량이 0.030% 이하여야 하는 자재의 인증서에서 인 값이 0.028%인 경우, 이는 한계에 근접해 있습니다. 스무 개의 화학 성분 행을 훑어보는 수동 검토자는 이를 알아차리겠지만, 오전 9시 이후 마흔 개의 인증서를 처리하여 지친 검토자는 알아차리지 못할 수도 있습니다. AI 검증은 매번 이를 잡아냅니다.

배치 간 통계적 이상. 한 번에 하나의 인증서를 검토할 때, 수동 검토자는 동일한 공급업체의 최근 여덟 개 인증서 모두가 동일한 항복 강도 값을 보인다는 것을 탐지할 수 없습니다. AI 분석은 배치 전체에 걸쳐 이 패턴을 즉시 탐지합니다.

언어별 단위 함정. 인장 강도를 "N/mm²"로 보고하는 독일어 인증서와 내부 시스템이 "MPa"를 기대하는 경우, 명백한 단위 불일치가 발생합니다 — 1 N/mm² = 1 MPa이므로 실제 불일치는 없지만, 값을 확인하면서 동시에 단위를 변환하는 수동 검토자는 두 개의 인지 작업을 동시에 수행하는 셈입니다. AI는 단위 정규화를 자동으로 처리합니다.

다중 페이지 참조 단절. 화학 성분이 2페이지에 있고 열 번호가 1페이지에 있을 때, 수동 검토자는 두 페이지가 동일한 배송 로트를 가리키는지 시각적으로 확인해야 합니다. 2페이지의 화학 성분을 잘못된 1페이지 헤더와 연결하는 추출 오류는 수동 처리에서 드물지 않게 발생합니다. AI 추출은 전체 문서를 하나의 의미론적 단위로 읽습니다.

듀플렉스의 최솟값 미만 PREN. Cr, Mo, N으로부터 계산되는 PREN 계산은 수동 검토자가 명시적으로 수행해야 하는 3개 필드 계산입니다. 많은 검토자가 이를 정기적으로 수행하지 않습니다. AI 검증은 이를 자동으로 수행하며, 검토자가 계산해야 한다는 것을 기억할 필요 없이 2205에 대해 PREN < 35를 플래그합니다.


금속 유통업체를 위한 도입 고려 사항

AI 기반 MTC 검증 시스템을 평가할 때 핵심 기술적 질문은 다음과 같습니다:

귀사의 특정 인증서 집합에 대한 추출 정확도는 얼마인가? 평가 데모가 벤더가 엄선한 라이브러리가 아니라 귀사 자체의 샘플 인증서로 실행되도록 요청하십시오. 가장 까다로운 인증서를 가져가십시오: 최악의 품질 스캔, 비영어 문서, 2차 시장 자재의 다세대 사본. 시스템이 귀사의 실제 입력에서 어려움을 겪는다면, 실제 운영 환경에서도 어려움을 겪을 것입니다.

낮은 신뢰도 추출은 어떻게 처리되는가? 낮은 신뢰도의 추출을 조용히 통과시키는 시스템은 위험합니다. 올바른 동작은 어떤 필드가 불확실한지 명확히 표시하여 낮은 신뢰도 필드를 사람의 검토를 위해 플래그하는 것입니다. 시스템에 구성 가능한 신뢰도 임계값이 있는지 확인하십시오.

사양 데이터베이스는 어떻게 유지 관리되는가? ASTM 표준은 정기적인 주기로 개정되며, EN 표준은 주기적으로 업데이트되고, API 사양은 때때로 개정됩니다. 유지 관리되지 않는 사양 데이터베이스는 최근 개정된 표준에 대해 잘못된 검증 결과를 생성합니다. 벤더의 업데이트 프로세스와 빈도를 확인하십시오.

사기 탐지 역량은 무엇인가? 통계적 이상 탐지, 열 번호 교차 필드 일관성, 날짜 논리 검증에 대해 구체적으로 문의하십시오. 이는 보편적인 역량이 아닙니다 — 일부 시스템은 교차 필드 분석 없이 개별 필드 값을 한계와 비교하는 것에 그칩니다.


TestCert이 AI MTC 검증을 구현하는 방식

TestCert은 이 가이드에서 설명한 네 가지 검증 레이어를 모두 구현합니다: 사전 처리를 포함한 다중 형식 문서 수집, 신뢰도 점수 산정 및 낮은 신뢰도 필드에 대한 사람 검토 라우팅을 포함한 AI 추출, ASTM, EN, AMS, API 등급을 포함하며 원소 수준의 한계 비교를 수행하는 유지 관리되는 사양 데이터베이스, 그리고 통계적 이상 탐지를 포함한 교차 필드 일관성 분석.

이 시스템은 금속 유통업체가 마주하는 실제 문서 다양성을 위해 설계되었습니다: 추출 엔진은 템플릿 기반 시스템이 처리할 수 없는 형식 변동을 처리하기 위해 특별히 다양한 글로벌 제철소 인증서 코퍼스로 훈련되었습니다. 사양 데이터베이스는 ASTM 및 EN 개정 일정에 맞춰 순환 업데이트 주기로 유지 관리됩니다. PREN 계산은 듀플렉스 등급에 대해 자동으로 수행됩니다. 통계적 이상 탐지는 배치 전체에서 동일 값 패턴을 플래그합니다.

데모는 귀사의 실제 인증서를 사용합니다. 그것이 유일한 의미 있는 평가입니다: 시스템이 귀사가 실제로 받는 인증서에서 정확하게 추출하고 검증한다면, 귀사의 운영 환경에서도 작동할 것입니다. testcert.io에서 평가 데모를 예약하세요 — 가장 까다로운 인증서를 가져오세요.