Système d’IA · secteur public : normalisation et métrologie
Base de connaissances RAG et stratégies IA
Rosstandart · 2025 · Système d’IA · Python 3.11, LangChain
Une démo RAG sur les documents de Rosstandart et le projet « RST 2.0 », l’analyse de cinq organismes sous tutelle et un cahier des charges pour extraire les exigences des normes GOST
Deux axes de travail liés. Le premier est un système RAG de démonstration sur les documents de Rosstandart et le projet de transformation numérique « RST 2.0 » (15 documents, 954 fragments) : des réponses en langage naturel avec des liens vers les sources ; il a connu trois itérations (FAISS local, puis gestion incrémentale de la base vectorielle, puis migration vers Milvus) et une revue de code. Le second est un dossier d’analyse sur cinq organismes sous tutelle (30+ documents, environ 600 pages) avec des stratégies d’optimisation par l’IA, ainsi que l’examen du cahier des charges d’un institut de normalisation pour un système qui extrait des normes GOST des exigences lisibles par machine et les transmet aux systèmes du client.
Le besoin
Une information éparpillée sur l’agence et ses organismes sous tutelle, et le besoin d’une stratégie d’adoption de l’IA ; pour l’institut de normalisation, transformer les documents réglementaires en exigences exploitables par machine et intégrables dans des systèmes d’IA, MDM et MES.
Sous le capot
- RAG sur Claude 4.5 Sonnet (via OpenRouter) avec des embeddings multilingues paraphrase-multilingual-MiniLM-L12-v2 ; sources citées dans chaque réponse
- Edition A : ajout et suppression incrémentaux de fichiers dans la base vectorielle sans réindexation complète, gestion en CLI et validation de l’intégrité
- Edition B : Milvus à la place de FAISS, protection contre l’injection de prompt et le DoS, délai d’expiration de 60 secondes sur toutes les requêtes au modèle
- Dossier d’analyse pour chacune des 5 organisations : un rapport complet, une stratégie IA (8 axes, une feuille de route 2026–2028), une synthèse avec SWOT, un rapport d’activité
- Le cahier des charges de l’institut de normalisation : un modèle ontologique (OWL 2, SHACL, Apache Jena), l’extraction d’entités et de relations (ruRoBERTa-large), une API REST en Java Spring Boot, des convertisseurs vers AI/MDM/MES, une phase de « démarrage autonome »
Traduction automatique — relecture en cours.