CoolFace
Datasetpublic

sallani/elisar-aiguard-compliance-sft

ELISAR AIGuardian — Compliance & AI Security SFT Jeu d’instructions synthétique, bilingue et sourcé destiné au supervised fine-tuning (SFT/LoRA) de petits modèles pour l’assistance en gouvernance, conformité et sécurité de l’IA. Projet initié et publié par Dr Sabri ALLANI dans le cadre d’ELISAR AIGuardian. Ce dataset ne constitue ni un avis juridique, ni une copie des normes ISO, ni une preuve de conformité ou de certification. Statistiques Indicateur… See the full description on the dataset page: https://huggingface.co/datasets/sallani/elisar-aiguard-compliance-sft.

sourceHugging Faceapache-2.0updated 29d agoView on Hugging Face
0likes70downloads
Dataset Card

ELISAR AIGuardian — Compliance & AI Security SFT

Jeu d’instructions synthétique, bilingue et sourcé destiné au supervised fine-tuning (SFT/LoRA) de petits modèles pour l’assistance en gouvernance, conformité et sécurité de l’IA.

Projet initié et publié par Dr Sabri ALLANI dans le cadre d’ELISAR AIGuardian.

Ce dataset ne constitue ni un avis juridique, ni une copie des normes ISO, ni une preuve de conformité ou de certification.

Statistiques

IndicateurValeur
Exemples500
Split entraînement450
Split validation50
Français395
Anglais105
Sources uniques33
DomaineExemples
EU AI Act130
ISO/IEC 42001, 42005 et 23894100
OWASP LLM Top 1050
OWASP Agentic Security30
NIST AI RMF20
MITRE ATLAS10
TARA adaptée méthodologiquement à l’IA80
IA locale souveraine et opérations sécurisées80

Format

Chaque ligne JSONL contient :

json
{
  "domain": "eu_ai_act",
  "language": "fr",
  "synthetic": true,
  "source_url": "https://...",
  "source_title": "...",
  "messages": [
    {"role": "system", "content": "..."},
    {"role": "user", "content": "..."},
    {"role": "assistant", "content": "..."}
  ]
}

Les colonnes de provenance peuvent être retirées avant entraînement ; messages est directement compatible avec les pipelines chat SFT après application du chat template du modèle cible.

Chargement

python
from datasets import load_dataset

dataset = load_dataset("sallani/elisar-aiguard-compliance-sft")
print(dataset["train"][0]["messages"])

Méthode de construction

  1. 1.Sélection de sources publiques officielles ou principales : EUR-Lex, Commission européenne, ISO, OWASP, NIST, MITRE, UNECE, ENISA, CNIL, Hugging Face et llama.cpp.
  2. 2.Génération de scénarios synthétiques en français et en anglais.
  3. 3.Exclusion du verbatim long des normes ISO payantes ; seules des synthèses originales fondées sur les descriptions publiques sont admises.
  4. 4.Validation mécanique du JSONL, du schéma, des rôles, des langues, des URLs, de la longueur des réponses et de l’unicité des questions.
  5. 5.Détection des réponses quasi dupliquées par similarité Jaccard sur les 5-grammes, avec rejet à partir de 0,70 au sein d’un domaine.
  6. 6.Split déterministe et stratifié par domaine : 90 % entraînement, 10 % validation.

Le script reproductible se trouve dans scripts/validate_and_build.py. Les références principales sont listées dans `SOURCES.md`, et chaque exemple conserve sa source précise.

Usages prévus

  • —LoRA/QLoRA d’un petit modèle instruct ;
  • —expérimentation pédagogique sur l’assistance GRC et AI Security ;
  • —génération de réponses structurées, prudentes et opérationnelles ;
  • —base initiale pour construire un corpus expert validé humainement.

Usages déconseillés

  • —décision juridique ou réglementaire autonome ;
  • —certification ISO ou audit sans accès au texte normatif officiel ;
  • —conseil de sécurité critique sans validation humaine ;
  • —évaluation de personnes, recrutement, crédit, santé ou autre décision à fort impact ;
  • —affirmation marketing qu’un modèle est « expert », « certifié » ou « conforme » sur la seule base de ce dataset.

Limites

  • —Les données sont synthétiques : les validations automatiques ne remplacent pas une revue experte ligne par ligne.
  • —Les lois, lignes directrices, référentiels et calendriers peuvent évoluer. Vérifier la date et le statut de la source avant utilisation.
  • —Les normes ISO complètes sont protégées et payantes. Ce corpus ne permet pas de reconstruire leur texte.
  • —Le split de validation mesure surtout la généralisation interne au style du corpus ; il ne constitue pas un benchmark indépendant.
  • —Un fine-tuning sur 500 exemples oriente le comportement et le vocabulaire, mais ne garantit ni exactitude factuelle ni conformité.

Licence et attribution

Les exemples synthétiques originaux sont publiés sous Apache-2.0. Les documents externes référencés restent soumis à leurs propres droits et ne sont pas relicenciés par ce dépôt.

Si vous utilisez ce corpus dans une publication, un modèle ou une démonstration publique, attribuez-le à Dr Sabri ALLANI — ELISAR AIGuardian et référencez cette page Hugging Face.