Skip to main content
Panduan·7 menit baca·

Cara Mengekstrak Spesifikasi Material dari Sertifikat PDF

Jawaban Cepat

Quick Answer

Untuk mengekstrak spesifikasi material dari sertifikat PDF: untuk pencarian sekali jalan, gunakan pemilihan teks PDF atau salin-tempel. Untuk ekstraksi berulang dalam skala besar, gunakan alat ekstraksi berbasis AI yang memetakan komposisi kimia, properti mekanik, nomor laur, dan referensi standar ke skema terstruktur. PDF asli memberikan akurasi lebih baik daripada PDF yang dipindai.

Sertifikat uji pabrik PDF berisi bukti spesifikasi material yang lengkap untuk batch material: komposisi kimia, hasil uji mekanik, standar dan grade yang diuji terhadap, dan pernyataan pabrik penyertifikat. Mengekstrak nilai-nilai ini dari PDF dan memasukkannya ke sistem yang dapat digunakan—tanpa penulisan ulang manual—adalah tantangan praktis yang ditangani panduan ini.


Memahami Isi PDF Spesifikasi Material

Sebelum mengekstrak, ketahui apa yang Anda cari. MTC khas berisi:

Kolom header/identitas

  • Nomor laur (kadang-kadang disebut nomor pengecoran, nomor peleburan, atau nomor lot)
  • Nomor sertifikat dan tanggal
  • Referensi pesanan/PO
  • Nama dan alamat pabrik penyertifikat
  • Penandatangan dan jabatan

Kolom spesifikasi material

  • Standar yang berlaku (misalnya ASTM A106, EN 10210-1, API 5L)
  • Grade (misalnya Grade B, S355J2H, X52)
  • Bentuk produk (pipa tanpa jahitan, pelat laminasi panas, batang)
  • Dimensi nominal (OD, ketebalan dinding, panjang)
  • Kondisi perlakuan panas (annealed, quenched and tempered, as-rolled)

Tabel komposisi kimia

  • Karbon (C), Mangan (Mn), Silikon (Si), Fosfor (P), Belerang (S) minimum
  • Elemen tambahan tergantung grade: Kromium, Molibden, Nikel, Vanadium, Niobium, Boron, Nitrogen, dll.
  • Nilai biasanya dilaporkan sebagai persentase berat dengan 2-4 tempat desimal

Hasil uji mekanik

  • Kekuatan tarik (UTS), batas luluh (YS/Rp0.2), perpanjangan (%)
  • Untuk grade yang diuji dampak: energi terserap Charpy (Joule) pada suhu yang ditentukan
  • Kekerasan (HB, HV, HRC) jika berlaku

Data tambahan (jika berlaku)

  • Hasil pemeriksaan nondestruktif
  • Data kawat las / logam pengisi (untuk produk las)
  • Catatan perlakuan panas pasca-pengelasan
  • Hasil uji hidrostatis

Metode 1: Salin-Tempel Manual (Dokumen Tunggal)

Untuk pencarian sesekali, volume rendah:

  1. Buka PDF di pembaca PDF mana pun
  2. Untuk PDF asli (dihasilkan mesin): gunakan alat pemilihan teks untuk menyoroti dan menyalin nilai secara langsung. Catatan: tabel mungkin tidak disalin dengan bersih—nilai mungkin tiba dalam urutan yang salah tergantung cara PDF dihasilkan.
  3. Untuk PDF yang dipindai: lapisan teks adalah gambar, bukan teks yang dapat dipilih. Anda harus membaca nilai secara visual dan mengetiknya.

Keterbatasan: Lambat, rentan terhadap kesalahan untuk tabel kimia, tidak ada output terstruktur, tidak ada jejak audit.


Metode 2: Ekstraksi Teks PDF dengan Python (Pemrograman, PDF Asli)

Untuk pengembang yang perlu memproses batch PDF asli secara terprogram:

import pdfplumber

with pdfplumber.open("milling_cert.pdf") as pdf:
    for page in pdf.pages:
        # Extract all text
        text = page.extract_text()
        
        # Extract tables as lists
        tables = page.extract_tables()
        for table in tables:
            for row in table:
                print(row)

Yang ini memberikan kepada Anda: Teks mentah dan larik tabel dari PDF asli. Anda masih memerlukan logika pemrosesan pascaproduksi untuk mengidentifikasi tabel mana yang merupakan tabel kimia, baris mana yang merupakan header, dan cara menghubungkan nilai dengan label elemen.

Keterbatasan:

  • Hanya berfungsi dengan PDF asli (bukan yang dipindai)
  • Struktur tabel hilang untuk tata letak kompleks (sel gabungan, header multi-baris)
  • Tidak ada identifikasi bidang—Anda harus menulis aturan untuk menemukan setiap nilai
  • Tidak menangani variasi tata letak di antara pabrik yang berbeda

Pendekatan ini viable untuk skenario pabrik tunggal, volume tinggi dengan format PDF stabil. Itu bukan pengurai sertifikat tujuan umum.


Metode 3: Ekstraksi Berbasis AI (Tujuan Umum)

Untuk penggunaan produksi di beberapa pemasok dan jenis dokumen:

Alat ekstraksi AI menerima PDF, mengklasifikasikan jenis dokumen, mengidentifikasi skema ekstraksi yang berlaku, mengekstrak nilai dengan skor kepercayaan per-bidang, dan mengembalikan rekam JSON terstruktur. Prosesnya sama untuk PDF asli dan dokumen yang dipindai, meskipun akurasi lebih tinggi untuk PDF asli.

Seperti apa output (disederhanakan):

{
  "heat_number": "A87234",
  "applicable_standard": "ASTM A106",
  "grade": "Grade B",
  "chemical_composition": {
    "carbon": { "value": 0.18, "unit": "wt%", "confidence": 0.97 },
    "manganese": { "value": 1.06, "unit": "wt%", "confidence": 0.96 },
    "phosphorus": { "value": 0.012, "unit": "wt%", "confidence": 0.94 },
    "sulfur": { "value": 0.008, "unit": "wt%", "confidence": 0.95 }
  },
  "mechanical_properties": {
    "tensile_strength": { "value": 415, "unit": "MPa", "confidence": 0.98 },
    "yield_strength": { "value": 240, "unit": "MPa", "confidence": 0.97 },
    "elongation": { "value": 28.5, "unit": "%", "confidence": 0.95 }
  }
}

Setiap bidang membawa nilai, unit, dan skor kepercayaannya. Bidang kepercayaan rendah dirutekan ke tinjauan manual.


Tantangan Ekstraksi Umum Menurut Jenis Bidang

Nomor laur: Format sangat bervariasi—beberapa pabrik menggunakan kode murni numerik, yang lain menggunakan kombinasi alfanumerik dengan tanda hubung, yang lain menyertakan referensi lot atau spesimen uji. Ekstrak harus menangani variabilitas format tanpa pemotongan atau transposisi karakter.

Unit: Properti mekanik dapat dilaporkan dalam MPa, N/mm², ksi, atau kgf/cm² tergantung negara pabrik dan standar yang berlaku. Deteksi unit dan normalisasi diperlukan untuk perbandingan lintas sertifikat. Kekuatan tarik "60 ksi" dan "414 MPa" setara tetapi akan terlihat berbeda tanpa normalisasi yang sadar unit.

Nilai kimia di dekat batas deteksi: Beberapa pabrik melaporkan elemen sebagai "<0.005" (di bawah batas deteksi) daripada nilai spesifik. Ekstrak harus menangani ini sebagai nilai yang dibatasi, bukan string teks atau null.

Sertifikasi ganda: Sertifikat yang mencakup dua standar simultan (misalnya ASTM A106 Gr.B / ASME SA-106 Gr.B) harus mencatat kedua referensi. Ekstrak standar tunggal diam-diam menghapus referensi kedua.

Tabel dimensi produk: Untuk sertifikat pipa, tabel dimensi yang mencantumkan OD, ketebalan dinding, dan panjang menurut nomor item umum. Tabel ini harus dianalisis terpisah dari data kimia dan mekanik dan ditautkan berdasarkan nomor item.


Setelah Ekstraksi: Validasi Terhadap Spesifikasi

Nilai yang diekstrak hanya berguna jika Anda tahu apakah mereka mematuhi. Validasi memerlukan perbandingan setiap nilai yang diekstrak dengan batas-batas standar yang berlaku:

BidangNilai yang diekstrakBatas standarHasil
Karbon0.18 wt%≤ 0.30 wt%Lulus
Kekuatan tarik415 MPa≥ 415 MPaLulus (di minimum)
Batas luluh240 MPa≥ 240 MPaLulus (di minimum)
Perpanjangan28.5%≥ 30%Gagal

Tanpa database standar yang disimpan dan diversi, validasi ini memerlukan reviewer untuk mencari batas secara manual—meniadakan banyak manfaat otomasi. Platform seperti TestCert mengintegrasikan nilai yang diekstrak dengan mesin validasi standar pada waktu ekstraksi, sehingga lulus/gagal ditentukan secara otomatis untuk setiap bidang yang diekstrak.


Tanya Jawab

Mengapa menyalin teks dari sertifikat PDF menghasilkan hasil yang rusak?

Dua penyebab umum: (1) PDF menggunakan font tertanam dengan penyandian karakter non-standar, menyebabkan salin-tempel mengganti karakter Unicode yang salah. (2) Tabel kimia dibuat sebagai gambar daripada teks yang dapat dipilih. Dalam kasus 1, perpustakaan PDF yang menangani penyandian dengan benar akan menghasilkan hasil yang lebih baik daripada salin-tempel sederhana. Dalam kasus 2, OCR atau ekstraksi AI diperlukan.

Bagaimana saya tahu apakah PDF memiliki lapisan teks atau hanya gambar yang dipindai?

Coba pilih teks pada halaman. Jika Anda dapat menyoroti kata-kata individual, PDF memiliki lapisan teks. Jika pemilihan menyoroti seluruh halaman atau tidak ada yang menyoroti, itu adalah PDF gambar saja. Di Python, pdfplumber atau PyMuPDF akan mengembalikan string teks kosong atau sangat pendek untuk halaman gambar saja, yang dapat Anda gunakan sebagai heuristik deteksi pemrograman.

Dapatkah saya mengekstrak spesifikasi material dari sertifikat yang tertanam dalam paket dokumen yang lebih besar?

Ya, tetapi memerlukan langkah segmentasi dokumen terlebih dahulu. Paket dokumentasi proyek sering kali menggabungkan MTC, laporan inspeksi, dan daftar pengemasan ke dalam satu PDF. Ekstrak harus mengidentifikasi halaman mana yang termasuk dalam jenis dokumen apa sebelum menerapkan skema ekstraksi yang sesuai ke setiap bagian.

Apa cara terbaik untuk mengekstrak kimia dari sertifikat dengan tata letak tabel non-standar?

Untuk tata letak yang tidak biasa—dua tabel terpisah di halaman, tabel putar, atau tabel dengan header non-standar—model bahasa visi mengungguli pendekatan berbasis OCR karena menafsirkan tata letak secara visual daripada mengandalkan struktur teks. Jika Anda menggunakan alat berbasis aturan atau OCR, Anda perlu menambahkan template khusus untuk tata letak pabrik itu.

Bagaimana saya menangani sertifikat di mana hasil mekanik dilaporkan dalam unit yang berbeda dari yang diharapkan database saya?

Terapkan normalisasi unit pada lapisan ekstraksi, bukan lapisan database. Simpan unit kanonik (MPa untuk kekuatan, % untuk perpanjangan) dan konversi pada waktu ekstraksi menggunakan unit yang terdeteksi dari sertifikat. Catat nilai asli dan unit bersama dengan nilai yang dinormalisasi dalam jejak audit, sehingga konversi dapat dilacak.

Ready to automate your certificate workflow?

Try TestCert free

Panduan Terkait