クイックアンサー
Quick Answer
PDFまたは証明書から材料仕様を抽出するには:単一の検索の場合、PDFテキスト選択またはコピー貼り付けを使用してください。反復的な大量抽出の場合、化学成分、機械的性質、熱番号、標準参照を構造化スキーマにマップするAI抽出ツールを使用してください。ネイティブPDFはスキャンされたPDFより高い精度を提供します。
PDF製鋼所テスト証明書には、材料バッチの完全な材料仕様証拠が含まれています:化学組成、機械テスト結果、テストされた標準とグレード、および認定製鋼所の陳述。これらの値をPDFから抽出して使用可能なシステムに入力すること—手動の再入力なしに—このガイドが対処する実際的な課題です。
材料仕様PDFの内容を理解する
抽出する前に、探しているものを知ってください。典型的なMTCには以下が含まれます:
ヘッダー/識別フィールド
- 熱番号(時々鋳造番号、溶融番号、またはロット番号と呼ばれる)
- 証明書番号と日付
- 注文/PO参照
- 認定製鋼所の名前と住所
- 署名者と職位
材料仕様フィールド
- 適用規格(例:ASTM A106、EN 10210-1、API 5L)
- グレード(例:グレードB、S355J2H、X52)
- 製品形状(シームレスパイプ、熱間圧延板、棒)
- 公称寸法(外径、壁厚、長さ)
- 熱処理状態(焼ならし、焼入れ焼戻し、圧延状態)
化学成分表
- 炭素(C)、マンガン(Mn)、ケイ素(Si)、リン(P)、硫黄(S)は最小限必要
- グレードに応じた追加元素:クロム、モリブデン、ニッケル、バナジウム、ニオブ、ホウ素、窒素など
- 値は通常、重量百分率で2~4小数位で報告されます
機械試験結果
- 引張強さ(UTS)、降伏強さ(YS/Rp0.2)、伸び(%)
- 衝撃テスト等級の場合:指定温度でのシャルピー衝撃値(ジュール)
- 硬さ(HB、HV、HRC)(該当する場合)
補足データ(該当する場合)
- 非破壊検査結果
- 溶接ワイヤー/フィラーメタルデータ(溶接製品の場合)
- 溶接後熱処理記録
- 静水圧試験結果
方法1:手動コピー貼り付け(単一文書)
不定期で少量の検索の場合:
- いずれかのPDFリーダーでPDFを開く
- ネイティブPDF(機械生成)の場合:テキスト選択ツールを使用して値を強調表示し、直接コピーします。注意:表は正確にコピーされない場合があります。PDFの生成方法によっては、値が間違った順序で届く場合があります。
- スキャンされたPDFの場合:テキスト層は選択可能なテキストではなく画像です。値を視覚的に読んで入力する必要があります。
制限事項:遅い、化学表でエラーが発生しやすい、構造化出力なし、監査証跡なし。
方法2:Pythonを使用したPDFテキスト抽出(プログラミング、ネイティブPDF)
ネイティブPDFのバッチをプログラムで処理する必要があるデベロッパー向け:
import pdfplumber
with pdfplumber.open("milling_cert.pdf") as pdf:
for page in pdf.pages:
# Extract all text
text = page.extract_text()
# Extract tables as lists
tables = page.extract_tables()
for table in tables:
for row in table:
print(row)
これが提供するもの:ネイティブPDFから抽出された生テキストとテーブル配列。どのテーブルが化学テーブルであるか、どの行がヘッダーであるか、値を要素ラベルに関連付ける方法を識別するために、後処理ロジックが必要です。
制限事項:
- ネイティブPDFでのみ機能(スキャン非対応)
- 複雑なレイアウト(セル結合、複数行ヘッダー)ではテーブル構造が失われる
- フィールド識別なし—各値を見つけるためにルールを書く必要がある
- 異なる製鋼所間のレイアウト変化に対応していない
このアプローチは、単一サプライヤーで高容量のシナリオであり、安定したPDF形式の場合に実行可能です。汎用証明書パーサーではありません。
方法3:AI抽出(汎用)
複数のサプライヤーおよび文書タイプ全体での本番使用:
AI抽出ツールはPDFを受け取り、文書タイプを分類し、適用可能な抽出スキーマを識別し、フィールドごとの信頼度スコア付きで値を抽出し、構造化JSONレコードを返します。プロセスはネイティブPDFとスキャンされた文書では同じですが、ネイティブPDFの場合は精度がより高くなります。
出力の外観(簡略版):
{
"heat_number": "A87234",
"applicable_standard": "ASTM A106",
"grade": "Grade B",
"chemical_composition": {
"carbon": { "value": 0.18, "unit": "wt%", "confidence": 0.97 },
"manganese": { "value": 1.06, "unit": "wt%", "confidence": 0.96 },
"phosphorus": { "value": 0.012, "unit": "wt%", "confidence": 0.94 },
"sulfur": { "value": 0.008, "unit": "wt%", "confidence": 0.95 }
},
"mechanical_properties": {
"tensile_strength": { "value": 415, "unit": "MPa", "confidence": 0.98 },
"yield_strength": { "value": 240, "unit": "MPa", "confidence": 0.97 },
"elongation": { "value": 28.5, "unit": "%", "confidence": 0.95 }
}
}
各フィールドは値、単位、信頼度スコアを持ちます。信頼度の低いフィールドは手動レビューにルーティングされます。
フィールドタイプ別の一般的な抽出課題
熱番号:形式は広く異なります—一部の製鋼所は純粋に数値コードを使用し、他は数字と字母でハイフン付きの組み合わせを使用し、さらに他はロットまたはテストピースの参照を含みます。抽出器は、文字の截断や転置なしに形式の変動性を処理する必要があります。
ユニット:機械的性質は、製鋼所の国と適用規格に応じてMPa、N/mm²、ksi、またはtf/in²で報告される場合があります。証明書間比較のためには、ユニット検出と正規化が必要です。「60 ksi」と「414 MPa」の引張強さは等価ですが、ユニット認識の正規化なしには異なります。
検出限界付近の化学値:一部の製鋼所は特定値ではなく「<0.005」(検出限界以下)として要素を報告します。抽出器はこれをテキスト文字列またはnullではなく、境界値として処理する必要があります。
二重認証:2つの同時規格(例:ASTM A106 Gr.B / ASME SA-106 Gr.B)をカバーする証明書は、両方の参照を記録する必要があります。単一規格抽出器は第2の参照を黙って削除します。
製品寸法表:パイプ証明書の場合、アイテム番号別に外径、壁厚、長さをリストする寸法表が一般的です。この表は化学データおよび機械データとは別に分析され、アイテム番号でリンクされる必要があります。
抽出後:仕様に対する検証
抽出された値は、それらが適合しているかどうかを知っている場合にのみ有用です。検証には、各抽出値を適用規格の制限と比較する必要があります:
| フィールド | 抽出値 | 規格制限 | 結果 |
|---|---|---|---|
| 炭素 | 0.18 wt% | ≤ 0.30 wt% | 合格 |
| 引張強さ | 415 MPa | ≥ 415 MPa | 合格(最小値) |
| 降伏強さ | 240 MPa | ≥ 240 MPa | 合格(最小値) |
| 伸び | 28.5% | ≥ 30% | 不合格 |
保存されたバージョン管理された規格データベースなしで、この検証では検査者が手動で制限を調べる必要があります—自動化の利点の多くを否定します。TestCertのようなプラットフォームは、抽出時に抽出値を規格検証エンジンと統合するため、すべての抽出フィールドに対して合否が自動的に決定されます。
FAQ
証明書PDFからテキストをコピーするとなぜガベージ結果が得られるのですか?
2つの一般的な原因:(1) PDFは非標準文字エンコーディングを持つ埋め込みフォントを使用しており、コピー貼り付けが不正なUnicode文字に置き換わります。(2) 化学表は選択可能なテキストではなく画像として作成されました。ケース1では、エンコーディングを正しく処理するPDFライブラリが単純なコピー貼り付けより良い結果を生じます。ケース2では、OCRまたはAI抽出が必要です。
PDFにテキスト層があるか、単なるスキャン画像であるかどうかを知るにはどうすればよいですか?
ページ上のテキストを選択してみてください。個々の単語をハイライトできるようにPDFにテキスト層があります。選択がページ全体をハイライトするか、何もない場合は、画像のみのPDFです。Pythonでは、pdfplumberまたはPyMuPDFは画像のみのページに空または非常に短いテキスト文字列を返します。プログラマティック検出のヒューリスティックとして使用できます。
より大きなドキュメントパッケージに埋め込まれた証明書から材料仕様を抽出できますか?
はい、ただし最初にドキュメント分割ステップが必要です。プロジェクトドキュメントパッケージはMTC、検査報告書、パッキングリストを1つのPDFにバンドルすることがあります。抽出器は各セクションに適切な抽出スキーマを適用する前に、どのページがどのドキュメントタイプに属しているかを識別する必要があります。
非標準テーブルレイアウトの証明書から化学を抽出する最良の方法は何ですか?
異常なレイアウト(ページ全体に分割された2つのテーブル、回転したテーブル、または非標準ヘッダーを持つテーブル)の場合、ビジョン言語モデルはOCRベースのアプローチを上回ります。視覚的にレイアウトを解釈するためです。ルールベースまたはOCRベースのツールを使用している場合、その製鋼所のレイアウト用にカスタムテンプレートを追加する必要があります。
機械結果がデータベースが期待する異なるユニットで報告される証明書をどのように処理すべきですか?
抽出レイヤーでユニット正規化を実装し、データベースレイヤーではありません。標準ユニット(強さの場合はMPa、伸びの場合は%)を保存し、証明書から検出されたユニットを使用して抽出時に変換します。監査証跡に元の値とユニットを正規化値と一緒に記録して、変換がトレース可能になるようにします。
Ready to automate your certificate workflow?
Try TestCert free