Kurzantwort
Quick Answer
Um Werkstoffspezifikationen aus einem PDF-Zertifikat zu extrahieren: Verwenden Sie für gelegentliche Einzelabfragen die PDF-Textauswahl oder Kopieren und Einfügen. Für wiederkehrende Extraktion in großem Umfang verwenden Sie ein KI-Extraktionstool, das Chemie, mechanische Eigenschaften, Schmelzennummer und Normreferenzen einem strukturierten Schema zuordnet. Native PDFs liefern eine höhere Genauigkeit als gescannte.
Ein PDF-Werkszeugnis enthält den vollständigen Werkstoffspezifikationsnachweis für eine Werkstoffschmelze: chemische Zusammensetzung, mechanische Prüfergebnisse, der Standard und die Güte, gegen die geprüft wurde, sowie die Erklärung des zertifizierenden Werks. Diese Werte aus dem PDF herauszuholen und in ein nutzbares System einzupflegen – ohne manuelle Neueingabe – ist die praktische Herausforderung, die dieser Leitfaden angeht.
Inhalt eines Werkstoffspezifikations-PDFs verstehen
Bevor Sie extrahieren, sollten Sie wissen, wonach Sie suchen. Ein typisches MTC enthält:
Kopfzeilen-/Identitätsfelder
- Schmelzennummer (manchmal auch Chargennummer, Schmelzenummer oder Losnummer genannt)
- Zertifikatnummer und -datum
- Bestell-/PO-Referenz
- Name und Adresse des zertifizierenden Werks
- Unterzeichner und Titel
Werkstoffspezifikationsfelder
- Anwendbarer Standard (z. B. ASTM A106, EN 10210-1, API 5L)
- Güte (z. B. Güte B, S355J2H, X52)
- Produktform (nahtloses Rohr, warmgewalztes Blech, Stab)
- Nennabmessungen (AD, Wanddicke, Länge)
- Wärmebehandlungszustand (normalisiert, abgeschreckt und angelassen, warmgewalzt)
Chemische Zusammensetzungstabelle
- Kohlenstoff (C), Mangan (Mn), Silizium (Si), Phosphor (P), Schwefel (S) mindestens
- Weitere Elemente je nach Güte: Chrom, Molybdän, Nickel, Vanadium, Niob, Bor, Stickstoff usw.
- Werte typischerweise als Gewichtsprozent mit 2–4 Dezimalstellen berichtet
Mechanische Prüfergebnisse
- Zugfestigkeit (Rm), Streckgrenze (Rp0,2), Dehnung (%)
- Für kerbschlaggeprüfte Güten: Charpy-Kerbschlagarbeit (Joule) bei angegebener Temperatur
- Härte (HB, HV, HRC) wo zutreffend
Ergänzende Daten (wo zutreffend)
- Zerstörungsfreie Prüfergebnisse
- Schweißzusatz-/Fülldaten (für geschweißte Produkte)
- Spannungsarm-Glühaufzeichnungen
- Hydrostatische Prüfergebnisse
Methode 1: Manuelles Kopieren und Einfügen (Einzeldokumente)
Für gelegentliche Einzelabfragen:
- PDF in einem beliebigen PDF-Leseprogramm öffnen
- Bei nativen PDFs (maschinell generiert): Textauswahl verwenden, um Werte direkt zu markieren und zu kopieren. Hinweis: Tabellen können möglicherweise nicht sauber kopiert werden – Werte können je nach PDF-Generierung in falscher Reihenfolge ankommen.
- Bei gescannten PDFs: Die Textebene ist ein Bild, kein auswählbarer Text. Sie müssen Werte visuell lesen und eingeben.
Einschränkungen: Langsam, fehleranfällig für Chemietabellen, keine strukturierte Ausgabe, kein Prüfpfad.
Methode 2: PDF-Textextraktion mit Python (Programmatisch, native PDFs)
Für Entwickler, die einen Stapel nativer PDFs programmatisch verarbeiten müssen:
import pdfplumber
with pdfplumber.open("milling_cert.pdf") as pdf:
for page in pdf.pages:
# Gesamten Text extrahieren
text = page.extract_text()
# Tabellen als Listen extrahieren
tables = page.extract_tables()
for table in tables:
for row in table:
print(row)
Was dies liefert: Roher Text und Tabellen-Arrays aus einem nativen PDF. Sie benötigen immer noch Nachbearbeitungslogik, um zu identifizieren, welche Tabelle die Chemietabelle ist, welche Zeile die Kopfzeile ist und wie Werte mit Elementbezeichnungen verknüpft werden.
Einschränkungen:
- Funktioniert nur für native PDFs (nicht gescannt)
- Tabellenstruktur geht bei komplexen Layouts verloren (verbundene Zellen, mehrzeilige Kopfzeilen)
- Keine Feldidentifikation – Sie müssen Regeln schreiben, um jeden Wert zu finden
- Behandelt keine Layoutvariationen über verschiedene Werke hinweg
Dieser Ansatz ist für ein Einzellieferanten-, Hochvolumen-Szenario mit stabilem PDF-Format geeignet. Er ist kein Allzweck-Zertifikatsparser.
Methode 3: KI-basierte Extraktion (Allgemeine Verwendung)
Für den Produktionseinsatz über mehrere Lieferanten und Dokumenttypen hinweg:
Ein KI-Extraktionstool empfängt das PDF, klassifiziert den Dokumenttyp, identifiziert das anwendbare Extraktionsschema, extrahiert Werte mit Konfidenzwerten pro Feld und gibt einen strukturierten JSON-Datensatz zurück. Der Prozess ist für native PDFs und gescannte Dokumente gleich, obwohl die Genauigkeit für native PDFs höher ist.
Wie die Ausgabe aussieht (vereinfacht):
{
"heat_number": "A87234",
"applicable_standard": "ASTM A106",
"grade": "Grade B",
"chemical_composition": {
"carbon": { "value": 0.18, "unit": "wt%", "confidence": 0.97 },
"manganese": { "value": 1.06, "unit": "wt%", "confidence": 0.96 },
"phosphorus": { "value": 0.012, "unit": "wt%", "confidence": 0.94 },
"sulfur": { "value": 0.008, "unit": "wt%", "confidence": 0.95 }
},
"mechanical_properties": {
"tensile_strength": { "value": 415, "unit": "MPa", "confidence": 0.98 },
"yield_strength": { "value": 240, "unit": "MPa", "confidence": 0.97 },
"elongation": { "value": 28.5, "unit": "%", "confidence": 0.95 }
}
}
Jedes Feld enthält seinen Wert, seine Einheit und seinen Konfidenzwert. Felder mit niedriger Konfidenz werden zur menschlichen Überprüfung weitergeleitet.
Häufige Extraktionsherausforderungen nach Feldtyp
Schmelzennummern: Das Format variiert stark – einige Werke verwenden rein numerische Codes, andere alphanumerische Kombinationen mit Bindestrichen, wieder andere enthalten Chargen- oder Probekörperreferenzen. Extraktoren müssen Formatvariabilität behandeln, ohne Zeichen abzuschneiden oder umzustellen.
Einheiten: Mechanische Eigenschaften können je nach Land des Werks und anwendbarem Standard in MPa, N/mm², ksi oder tf/in² berichtet werden. Einheitenerkennung und -normalisierung ist für den zertifikatsübergreifenden Vergleich erforderlich. Eine Zugfestigkeit von „60 ksi" und „414 MPa" sind gleichwertig, erscheinen jedoch ohne einheitsbewusste Normalisierung unterschiedlich.
Chemiewerte nahe der Nachweisgrenze: Einige Werke berichten Elemente als „<0,005" (unter der Nachweisgrenze) anstelle eines spezifischen Wertes. Der Extraktor muss dies als begrenzten Wert behandeln, nicht als Textzeichenkette oder Nullwert.
Doppelzertifizierung: Ein Zertifikat, das zwei gleichzeitige Standards abdeckt (z. B. ASTM A106 Gr.B / ASME SA-106 Gr.B), muss beide Referenzen aufzeichnen. Einzelstandard-Extraktoren lassen die zweite Referenz stillschweigend fallen.
Produktabmessungstabellen: Für Rohrzertifikate ist eine Abmessungstabelle, die AD, Wanddicke und Länge nach Positionsnummer auflistet, üblich. Diese Tabelle muss separat von den Chemie- und Mechanikdaten analysiert und nach Positionsnummer verknüpft werden.
Nach der Extraktion: Validierung gegen die Spezifikation
Extrahierte Werte sind nur nützlich, wenn Sie wissen, ob sie konform sind. Die Validierung erfordert den Vergleich jedes extrahierten Wertes gegen die Grenzwerte des anwendbaren Standards:
| Feld | Extrahierter Wert | Normgrenzwert | Ergebnis |
|---|---|---|---|
| Kohlenstoff | 0,18 Gew.-% | ≤ 0,30 Gew.-% | Bestanden |
| Zugfestigkeit | 415 MPa | ≥ 415 MPa | Bestanden (am Minimum) |
| Streckgrenze | 240 MPa | ≥ 240 MPa | Bestanden (am Minimum) |
| Dehnung | 28,5 % | ≥ 30 % | Nicht bestanden |
Ohne eine gespeicherte, versionierte Normdatenbank erfordert diese Validierung, dass der Prüfer Grenzwerte manuell nachschlägt – was einen Großteil des Automatisierungsvorteils zunichte macht. Plattformen wie TestCert integrieren extrahierte Werte mit einer Normsvalidierungsmaschine zum Extraktionszeitpunkt, sodass Bestanden/Nicht bestanden automatisch für jedes extrahierte Feld ermittelt wird.
FAQs
Warum erhalte ich beim Kopieren von Text aus einem Zertifikats-PDF verstümmelte Ergebnisse?
Zwei häufige Ursachen: (1) Das PDF verwendet eine eingebettete Schriftart mit nicht standardmäßiger Zeichenkodierung, die beim Kopieren und Einfügen falsche Unicode-Zeichen einsetzt. (2) Die Chemietabelle wurde als Bild statt als auswählbarer Text erstellt. In Fall 1 liefert eine PDF-Bibliothek, die die Kodierung korrekt behandelt, bessere Ergebnisse als einfaches Kopieren und Einfügen. In Fall 2 ist OCR oder KI-Extraktion erforderlich.
Wie erkenne ich, ob ein PDF eine Textebene hat oder nur ein gescanntes Bild ist?
Versuchen Sie, Text auf der Seite auszuwählen. Wenn Sie einzelne Wörter markieren können, hat das PDF eine Textebene. Wenn die Auswahl die gesamte Seite oder nichts hervorhebt, ist es ein nur-Bild-PDF. In Python gibt pdfplumber oder PyMuPDF eine leere oder sehr kurze Textzeichenkette für nur-Bild-Seiten zurück, die Sie als programmatischen Erkennungshinweis verwenden können.
Kann ich Werkstoffspezifikationen aus einem Zertifikat extrahieren, das in ein größeres Dokumentenpaket eingebettet ist?
Ja, aber dies erfordert zunächst einen Dokumentensegmentierungsschritt. Projektdokumentationspakete bündeln häufig MTCs, Prüfberichte und Packlisten in einer einzigen PDF-Datei. Der Extraktor muss identifizieren, welche Seiten zu welchem Dokumenttyp gehören, bevor er das geeignete Extraktionsschema auf jeden Abschnitt anwendet.
Was ist der beste Weg, Chemie aus einem Zertifikat mit einem nicht standardmäßigen Tabellenlayout zu extrahieren?
Für ungewöhnliche Layouts – zwei Tabellen, die auf der Seite geteilt sind, gedrehte Tabellen oder Tabellen mit nicht standardmäßigen Kopfzeilen – übertrifft ein Bild-Sprach-Modell OCR-basierte Ansätze, da es das Layout visuell interpretiert, anstatt sich auf die Textstruktur zu verlassen. Wenn Sie ein regelbasiertes oder OCR-basiertes Tool verwenden, müssen Sie eine benutzerdefinierte Vorlage für das Layout dieses Werks hinzufügen.
Wie soll ich ein Zertifikat behandeln, bei dem mechanische Ergebnisse in einer anderen Einheit als meine Datenbank erwartet berichtet werden?
Implementieren Sie die Einheitennormalisierung auf der Extraktionsebene, nicht auf der Datenbankebene. Speichern Sie eine kanonische Einheit (MPa für Festigkeit, % für Dehnung) und konvertieren Sie zum Extraktionszeitpunkt unter Verwendung der aus dem Zertifikat erkannten Einheit. Erfassen Sie sowohl den Originalwert und die Einheit neben dem normalisierten Wert im Prüfpfad, damit die Konvertierung nachvollziehbar ist.
Ready to automate your certificate workflow?
Try TestCert free