sallani/elisar-aiguard-compliance-sft
ELISAR AIGuardian — Compliance & AI Security SFT Jeu d’instructions synthétique, bilingue et sourcé destiné au supervised fine-tuning (SFT/LoRA) de petits modèles pour l’assistance en gouvernance, conformité et sécurité de l’IA. Projet initié et publié par Dr Sabri ALLANI dans le cadre d’ELISAR AIGuardian. Ce dataset ne constitue ni un avis juridique, ni une copie des normes ISO, ni une preuve de conformité ou de certification. Statistiques Indicateur… See the full description on the dataset page: https://huggingface.co/datasets/sallani/elisar-aiguard-compliance-sft.
ELISAR AIGuardian — Compliance & AI Security SFT
Jeu d’instructions synthétique, bilingue et sourcé destiné au supervised fine-tuning (SFT/LoRA) de petits modèles pour l’assistance en gouvernance, conformité et sécurité de l’IA.
Projet initié et publié par Dr Sabri ALLANI dans le cadre d’ELISAR AIGuardian.
Ce dataset ne constitue ni un avis juridique, ni une copie des normes ISO, ni une preuve de conformité ou de certification.
Statistiques
Format
Chaque ligne JSONL contient :
{
"domain": "eu_ai_act",
"language": "fr",
"synthetic": true,
"source_url": "https://...",
"source_title": "...",
"messages": [
{"role": "system", "content": "..."},
{"role": "user", "content": "..."},
{"role": "assistant", "content": "..."}
]
}Les colonnes de provenance peuvent être retirées avant entraînement ; messages est directement compatible avec les pipelines chat SFT après application du chat template du modèle cible.
Chargement
from datasets import load_dataset
dataset = load_dataset("sallani/elisar-aiguard-compliance-sft")
print(dataset["train"][0]["messages"])Méthode de construction
- Sélection de sources publiques officielles ou principales : EUR-Lex, Commission européenne, ISO, OWASP, NIST, MITRE, UNECE, ENISA, CNIL, Hugging Face et llama.cpp.
- Génération de scénarios synthétiques en français et en anglais.
- Exclusion du verbatim long des normes ISO payantes ; seules des synthèses originales fondées sur les descriptions publiques sont admises.
- Validation mécanique du JSONL, du schéma, des rôles, des langues, des URLs, de la longueur des réponses et de l’unicité des questions.
- Détection des réponses quasi dupliquées par similarité Jaccard sur les 5-grammes, avec rejet à partir de
0,70au sein d’un domaine. - Split déterministe et stratifié par domaine : 90 % entraînement, 10 % validation.
Le script reproductible se trouve dans scripts/validate_and_build.py. Les références principales sont listées dans `SOURCES.md`, et chaque exemple conserve sa source précise.
Usages prévus
- LoRA/QLoRA d’un petit modèle instruct ;
- expérimentation pédagogique sur l’assistance GRC et AI Security ;
- génération de réponses structurées, prudentes et opérationnelles ;
- base initiale pour construire un corpus expert validé humainement.
Usages déconseillés
- décision juridique ou réglementaire autonome ;
- certification ISO ou audit sans accès au texte normatif officiel ;
- conseil de sécurité critique sans validation humaine ;
- évaluation de personnes, recrutement, crédit, santé ou autre décision à fort impact ;
- affirmation marketing qu’un modèle est « expert », « certifié » ou « conforme » sur la seule base de ce dataset.
Limites
- Les données sont synthétiques : les validations automatiques ne remplacent pas une revue experte ligne par ligne.
- Les lois, lignes directrices, référentiels et calendriers peuvent évoluer. Vérifier la date et le statut de la source avant utilisation.
- Les normes ISO complètes sont protégées et payantes. Ce corpus ne permet pas de reconstruire leur texte.
- Le split de validation mesure surtout la généralisation interne au style du corpus ; il ne constitue pas un benchmark indépendant.
- Un fine-tuning sur 500 exemples oriente le comportement et le vocabulaire, mais ne garantit ni exactitude factuelle ni conformité.
Licence et attribution
Les exemples synthétiques originaux sont publiés sous Apache-2.0. Les documents externes référencés restent soumis à leurs propres droits et ne sont pas relicenciés par ce dépôt.
Si vous utilisez ce corpus dans une publication, un modèle ou une démonstration publique, attribuez-le à Dr Sabri ALLANI — ELISAR AIGuardian et référencez cette page Hugging Face.
