빠른 답변
Quick Answer
PDF 인증서에서 재료 사양을 추출하려면: 일회성 조회의 경우 PDF 텍스트 선택 또는 복사-붙여넣기를 사용합니다. 반복적인 대량 추출의 경우 화학, 기계적 특성, 열 번호 및 표준 참조를 구조화된 스키마에 매핑하는 AI 추출 도구를 사용합니다. 네이티브 PDF가 스캔된 PDF보다 더 높은 정확도를 제공합니다.
PDF 제철소 시험 증명서는 재료 배치에 대한 완전한 재료 사양 증거를 포함합니다: 화학 구성, 기계 시험 결과, 테스트된 표준 및 등급, 그리고 인정된 제철소의 진술. 이러한 값을 PDF에서 추출하여 사용 가능한 시스템에 입력하면—수동 재입력 없이—이것이 이 가이드가 해결하는 실질적인 문제입니다.
재료 사양 PDF의 내용 이해
추출하기 전에 찾는 항목을 알아야 합니다. 일반적인 MTC에는 다음이 포함됩니다:
헤더/신원 필드
- 열 번호(때때로 주조 번호, 용융 번호 또는 로트 번호라고 함)
- 증명서 번호 및 날짜
- 주문/PO 참조
- 인정된 제철소의 이름 및 주소
- 서명인 및 직책
재료 사양 필드
- 적용 가능한 표준(예: ASTM A106, EN 10210-1, API 5L)
- 등급(예: B급, S355J2H, X52)
- 제품 형태(심리스 파이프, 열간 압연 판, 봉)
- 공칭 치수(외경, 벽 두께, 길이)
- 열처리 상태(정규화, 담금질 및 뜨임, 압연 상태)
화학 구성 표
- 최소한 탄소(C), 망간(Mn), 규소(Si), 인(P), 황(S)
- 등급에 따른 추가 원소: 크롬, 몰리브덴, 니켈, 바나듐, 니오브, 붕소, 질소 등
- 값은 일반적으로 2-4 소수 자리의 무게 백분율로 보고됨
기계 시험 결과
- 인장 강도(UTS), 항복 강도(YS/Rp0.2), 연신율(%)
- 충격 테스트 등급의 경우: 지정된 온도에서 샤르피 흡수 에너지(줄)
- 경도(HB, HV, HRC)(해당하는 경우)
보충 데이터(해당하는 경우)
- 비파괴 검사 결과
- 용접 와이어/충진 금속 데이터(용접 제품의 경우)
- 용접 후 열처리 기록
- 정수압 시험 결과
방법 1: 수동 복사-붙여넣기(단일 문서)
가끔 낮은 용량의 조회의 경우:
- 모든 PDF 리더에서 PDF를 엽니다
- 네이티브 PDF(기계 생성)의 경우: 텍스트 선택 도구를 사용하여 값을 강조 표시하고 직접 복사합니다. 참고: 표는 깔끔하게 복사되지 않을 수 있습니다. PDF 생성 방식에 따라 값이 잘못된 순서로 도착할 수 있습니다.
- 스캔된 PDF의 경우: 텍스트 레이어는 선택 가능한 텍스트가 아닌 이미지입니다. 값을 시각적으로 읽고 입력해야 합니다.
제한 사항: 느리고 화학 테이블에서 오류가 발생하기 쉽고, 구조화된 출력이 없으며, 감사 추적이 없습니다.
방법 2: Python을 이용한 PDF 텍스트 추출(프로그래밍 방식, 네이티브 PDF)
네이티브 PDF 배치를 프로그래밍 방식으로 처리해야 하는 개발자용:
import pdfplumber
with pdfplumber.open("milling_cert.pdf") as pdf:
for page in pdf.pages:
# Extract all text
text = page.extract_text()
# Extract tables as lists
tables = page.extract_tables()
for table in tables:
for row in table:
print(row)
이것이 제공하는 것: 네이티브 PDF에서 원본 텍스트 및 테이블 배열. 어떤 테이블이 화학 테이블인지, 어느 행이 헤더인지, 값을 원소 레이블과 어떻게 연결할 것인지 식별하기 위해 후처리 로직이 여전히 필요합니다.
제한 사항:
- 네이티브 PDF에서만 작동(스캔된 것이 아님)
- 복잡한 레이아웃(병합된 셀, 다중 행 헤더)의 경우 테이블 구조가 손실됨
- 필드 식별 없음—각 값을 찾기 위해 규칙을 작성해야 함
- 여러 제철소 간 레이아웃 변형을 처리하지 못함
이 접근 방식은 단일 공급업체, 높은 용량의 시나리오에서 안정적인 PDF 형식으로 실행 가능합니다. 범용 인증서 파서가 아닙니다.
방법 3: AI 기반 추출(일반 용도)
여러 공급업체 및 문서 유형에 걸친 프로덕션 사용:
AI 추출 도구는 PDF를 수신하고 문서 유형을 분류하고 적용 가능한 추출 스키마를 식별하고 필드별 신뢰도 점수가 있는 값을 추출하고 구조화된 JSON 레코드를 반환합니다. 프로세스는 네이티브 PDF와 스캔된 문서의 경우 동일하지만 네이티브 PDF의 경우 정확도가 더 높습니다.
출력의 모양 (간소화):
{
"heat_number": "A87234",
"applicable_standard": "ASTM A106",
"grade": "Grade B",
"chemical_composition": {
"carbon": { "value": 0.18, "unit": "wt%", "confidence": 0.97 },
"manganese": { "value": 1.06, "unit": "wt%", "confidence": 0.96 },
"phosphorus": { "value": 0.012, "unit": "wt%", "confidence": 0.94 },
"sulfur": { "value": 0.008, "unit": "wt%", "confidence": 0.95 }
},
"mechanical_properties": {
"tensile_strength": { "value": 415, "unit": "MPa", "confidence": 0.98 },
"yield_strength": { "value": 240, "unit": "MPa", "confidence": 0.97 },
"elongation": { "value": 28.5, "unit": "%", "confidence": 0.95 }
}
}
각 필드에는 값, 단위 및 신뢰도 점수가 포함됩니다. 신뢰도가 낮은 필드는 수동 검토로 라우팅됩니다.
필드 유형별 일반적인 추출 과제
열 번호: 형식이 광범위하게 다릅니다. 일부 제철소는 순수 숫자 코드를 사용하고 다른 제철소는 하이픈이 있는 영숫자 조합을 사용하고 다른 제철소는 로트 또는 시험편 참조를 포함합니다. 추출기는 문자를 자르거나 바꾸지 않고 형식 변용성을 처리해야 합니다.
단위: 기계적 특성은 제철소의 국가 및 적용 가능한 표준에 따라 MPa, N/mm², ksi 또는 tf/in²로 보고될 수 있습니다. 인증서 간 비교를 위해서는 단위 감지 및 정규화가 필요합니다. "60 ksi"와 "414 MPa"의 인장 강도는 동등하지만 단위 인식 정규화 없이는 다르게 나타납니다.
검출 한계 근처의 화학 값: 일부 제철소는 특정 값이 아닌 "<0.005"(검출 한계 미만)로 원소를 보고합니다. 추출기는 이를 텍스트 문자열 또는 null이 아닌 경계 값으로 처리해야 합니다.
이중 인증: 두 표준을 동시에 포함하는 인증서(예: ASTM A106 Gr.B / ASME SA-106 Gr.B)는 두 참조를 모두 기록해야 합니다. 단일 표준 추출기는 두 번째 참조를 자동으로 삭제합니다.
제품 치수 표: 파이프 인증서의 경우 항목 번호별로 외경, 벽 두께 및 길이를 나열하는 치수 표가 일반적입니다. 이 표는 화학 및 기계 데이터와 별도로 분석되어야 하며 항목 번호별로 연결되어야 합니다.
추출 후: 사양에 대한 검증
추출된 값은 규격을 준수하는지 알 때만 유용합니다. 검증에는 각 추출된 값을 적용 가능한 표준의 한계와 비교해야 합니다:
| 필드 | 추출된 값 | 표준 한계 | 결과 |
|---|---|---|---|
| 탄소 | 0.18 wt% | ≤ 0.30 wt% | 통과 |
| 인장 강도 | 415 MPa | ≥ 415 MPa | 통과(최소값) |
| 항복 강도 | 240 MPa | ≥ 240 MPa | 통과(최소값) |
| 연신율 | 28.5% | ≥ 30% | 실패 |
저장된 버전이 지정된 표준 데이터베이스 없이 이 검증은 검토자가 수동으로 한계를 찾아야 합니다. 자동화 이점의 많은 부분을 무효화합니다. TestCert와 같은 플랫폼은 추출 시간에 추출된 값을 표준 검증 엔진과 통합하므로 모든 추출된 필드에 대해 통과/실패가 자동으로 결정됩니다.
FAQ
인증서 PDF에서 텍스트를 복사하면 왜 손상된 결과가 나옵니까?
두 가지 일반적인 원인: (1) PDF는 비표준 문자 인코딩의 포함된 글꼴을 사용하여 복사-붙여넣기가 잘못된 유니코드 문자로 바뀝니다. (2) 화학 표는 선택 가능한 텍스트가 아닌 이미지로 만들어졌습니다. 경우 1에서 인코딩을 올바르게 처리하는 PDF 라이브러리는 단순 복사-붙여넣기보다 더 나은 결과를 제공합니다. 경우 2에서는 OCR 또는 AI 추출이 필요합니다.
PDF에 텍스트 레이어가 있는지 순수 스캔 이미지인지 어떻게 알 수 있습니까?
페이지에서 텍스트를 선택하려고 시도합니다. 개별 단어를 강조 표시할 수 있으면 PDF에 텍스트 레이어가 있습니다. 선택이 전체 페이지를 강조 표시하거나 아무것도 아니면 이미지 전용 PDF입니다. Python에서 pdfplumber 또는 PyMuPDF는 이미지 전용 페이지에 대해 빈 또는 매우 짧은 텍스트 문자열을 반환하며 프로그래밍 방식 감지 휴리스틱으로 사용할 수 있습니다.
더 큰 문서 패키지에 포함된 인증서에서 재료 사양을 추출할 수 있습니까?
예, 하지만 먼저 문서 분할 단계가 필요합니다. 프로젝트 문서 패키지는 종종 MTC, 검사 보고서 및 포장 목록을 단일 PDF로 묶습니다. 추출기는 각 섹션에 적절한 추출 스키마를 적용하기 전에 어느 페이지가 어느 문서 유형에 속하는지 식별해야 합니다.
비표준 테이블 레이아웃이 있는 인증서에서 화학을 추출하는 가장 좋은 방법은 무엇입니까?
비정상 레이아웃의 경우(페이지 전체에 분할된 두 테이블, 회전된 테이블 또는 비표준 헤더가 있는 테이블) 비전 언어 모델은 OCR 기반 접근 방식을 능가합니다. 레이아웃을 시각적으로 해석하기 때문입니다. 규칙 기반 또는 OCR 기반 도구를 사용 중인 경우 해당 제철소의 레이아웃에 대한 사용자 지정 템플릿을 추가해야 합니다.
기계 결과가 데이터베이스가 예상하는 것과 다른 단위로 보고되는 인증서를 어떻게 처리해야 합니까?
추출 레이어에서 단위 정규화를 구현하고 데이터베이스 레이어는 아닙니다. 표준 단위(강도의 경우 MPa, 연신율의 경우 %)를 저장하고 인증서에서 감지된 단위를 사용하여 추출 시 변환합니다. 원래 값 및 단위를 규범화된 값과 함께 감사 추적에 기록하여 변환을 추적할 수 있도록 합니다.
Ready to automate your certificate workflow?
Try TestCert free