
KI-System · Metallurgie, normative Dokumentation
GOST-Graph und RAG für Stahlanforderungen
EVRAZ · 2025 · KI-System · Python 3.11, LangChain
Von einer Sammlung von PDF-Normen zu einer verknüpften Wissensdatenbank: Verweise zwischen GOST-Normen, Suche mit Quellen, Export der Anforderungen an Stahlfestigkeitsklassen als JSON
Eine Reihe von Prototypen für EVRAZ, dessen GOST-Bibliothek aus einer Sammlung von PDFs ohne Verknüpfungen zwischen den Dokumenten besteht. Normen (PDF/DOC) werden in Markdown mit Tabellen und Bildern umgewandelt, Verweise auf andere GOST-Normen (normativ und informativ) automatisch erkannt, „untergeordnete“ Normen heruntergeladen, und darauf bauen eine RAG-Suche mit Quellen und die Extraktion strukturierter Daten auf. Die Testaufgabe ist die Festigkeitsklasse C235 nach GOST 27772-2021: Chemische Zusammensetzung und mechanische Eigenschaften werden als JSON exportiert. Innerhalb einer Woche (30. Oktober – 6. November 2025) wurden fünf Umsetzungsvarianten parallel erprobt.
Die Aufgabe
Verweise auf andere GOST-Normen in den Dokumenten sind nicht anklickbar. Um alle Anforderungen an Stahl C235 zusammenzutragen, muss ein Fachmann die Hauptnorm von Hand finden und dann jede darin erwähnte Norm einzeln durchgehen – das dauert lange, und es rutscht leicht etwas durch.
Was drinsteckt
- Umwandlung von GOST-Normen aus DOC/DOCX/PDF in Markdown, Tabellen (XLSX) und Bilder
- Automatische Extraktion von Verweisen mit Klassifizierung „normativ / informativ“; in GOST 27772-2021 wurden 95 eindeutige Verweise gefunden (71 normative, 24 informative) und 232 anklickbare Hyperlinks eingefügt
- Automatische Suche und Download „untergeordneter“ GOST-Normen (allgosts.ru, mit der Yandex XML API als Ausweichlösung): Das Korpus umfasst 60 .doc-Dokumente
- RAG-Antworten mit Quellen (Claude 4.5 Sonnet / Gemini 2.5 Pro über OpenRouter, FAISS-Vektorindex)
- Extraktion strukturierter Daten für die Festigkeitsklasse C235 (8 Elemente der chemischen Zusammensetzung, 3 mechanische Eigenschaften) als JSON mit Validierung
- Varianten: eine Web-Wissensdatenbank auf React/tRPC, ein Normengraph in Neo4j mit graphbasierten Antworten, RAGFlow + OpenSearch mit k-NN ohne Docker, ein Webdienst mit FastAPI + HTMX und Crawler, eine Spezifikation für ein hochpräzises OCR-Modul
Maschinelle Übersetzung – das Lektorat läuft.