CoolFace
Datasetpublic

thuaannn/prewise-security-adapter-training-v5

Prewise Security Adapter Training V5 Bộ dữ liệu và công cụ Kaggle hoàn chỉnh để fine-tune ba LoRA trên cùng base model Qwen/Qwen3.5-4B: message-context-adapter web-context-adapter explanation-adapter phone-intelligence là HTTP provider bên ngoài, không phải LoRA. Packager tạo entry này ở trạng thái enabled: false để backend vẫn có đủ bốn runtime contract. Quy mô Adapter Train Validation Test Tổng Message Context 32.767 3.196 3.992 39.955 Web Context… See the full description on the dataset page: https://huggingface.co/datasets/thuaannn/prewise-security-adapter-training-v5.

sourceHugging Faceotherupdated 2mo agoView on Hugging Face
0likes62downloads
Dataset Card

Prewise Security Adapter Training V5

Bộ dữ liệu và công cụ Kaggle hoàn chỉnh để fine-tune ba LoRA trên cùng base model Qwen/Qwen3.5-4B:

  1. 1.message-context-adapter
  2. 2.web-context-adapter
  3. 3.explanation-adapter

phone-intelligence là HTTP provider bên ngoài, không phải LoRA. Packager tạo entry này ở trạng thái enabled: false để backend vẫn có đủ bốn runtime contract.

Quy mô

AdapterTrainValidationTestTổng
Message Context32.7673.1963.99239.955
Web Context8.0631.01697810.057
Explanation32.7673.1963.99239.955
Tổng73.5977.4088.96289.967

Message Context V4

  • 100% tiếng Việt.
  • 100% có metadata.user_context.
  • 100% có metadata.user_question.
  • Khoảng 58% có hội thoại nhiều lượt.
  • Evidence trỏ chính xác tới content, user context hoặc lượt hội thoại.
  • Message Adapter không được tạo quyết định ALLOW/WARN/BLOCK.

Web Context

Nguồn web được trích xuất thành visible text và các thuộc tính cấu trúc bất hoạt. Bundle không giữ raw HTML, URL hoạt động, email, số điện thoại hoặc tài khoản thật.

Bản V5 đã loại 56 mẫu chứa HTML/code được hiển thị như nội dung tài liệu:

  • Train: 42 mẫu.
  • Validation: 8 mẫu.
  • Test: 6 mẫu.

Mỗi Web input gồm:

  • visible content đã làm sạch;
  • forms và tên trường;
  • action descriptors;
  • stated purpose;
  • Layer-1 snapshot;
  • metadata cấu trúc.

Explanation

Explanation chỉ nhận evidence và assessment đã khóa. Output phải:

  • trả lời câu hỏi người dùng bằng tiếng Việt;
  • không thay đổi quyết định;
  • không bịa evidence;
  • chỉ cite evidence_id có trong input.

Kiểm tra local hoặc Kaggle

bash
python validate_complete_bundle_v5.py --bundle-root .

Giải nén dữ liệu:

bash
python prepare_kaggle_data_v5.py \
  --bundle-root . \
  --output-root ./prepared-data

Kiểm tra trainer mà không cần GPU:

bash
python train_qwen35_4b_context_kaggle.py \
  --train-file ./prepared-data/message_context/train.jsonl \
  --validation-file ./prepared-data/message_context/validation.jsonl \
  --expect-json \
  --validate-only

Lặp lại lệnh trên cho web_contextexplanation.

Huấn luyện trên Kaggle

  1. 1.Tạo Kaggle Notebook.
  2. 2.Chọn Accelerator GPU T4 x2.
  3. 3.Bật Internet.
  4. 4.Add data từ repository/dataset snapshot này.
  5. 5.Mở prewise_security_full_v5_kaggle.ipynb.
  6. 6.Chạy Run All.

Luồng train:

  • Stage 1: Message Context trên GPU 0 và Explanation trên GPU 1.
  • Stage 2: Web Context trên GPU 0.
  • Cuối cùng tạo /kaggle/working/prewise-adapters-v5.zip.

Cấu trúc output

text
server-adapters/
├── manifest.json
├── message-context-adapter/current/
├── web-context-adapter/current/
└── explanation-adapter/current/

Manifest gồm bốn entry:

  • ba openai_lora đang bật;
  • một phone-intelligence dạng http_json, mặc định tắt.

Phương pháp train mặc định

  • Base model: Qwen/Qwen3.5-4B.
  • 16-bit LoRA, không dùng QLoRA 4-bit.
  • LoRA rank 16, alpha 16.
  • Target modules: q/k/v/o, gate/up/down projection.
  • Max sequence length 2048.
  • Batch size 1.
  • Gradient accumulation 8.
  • Một epoch.
  • Chỉ tính loss trên phần trả lời assistant.

Giấy phép và nguồn

Đây là bundle tổng hợp. Các nguồn upstream giữ nguyên giấy phép riêng, được liệt kê trong SOURCE_LICENSES.md:

  • MIT.
  • CC BY 4.0.
  • Apache-2.0.
  • Dữ liệu tiếng Việt synthetic do dự án tạo.

Không áp một giấy phép duy nhất lên lại toàn bộ nội dung upstream. Người sử dụng phải tuân thủ giấy phép của từng nguồn.

Giới hạn

  • Chưa fine-tune GPU thực tế trong bundle này.
  • Web Context chủ yếu là corpus đa ngôn ngữ/tiếng Anh; cần bổ sung benchmark website tiếng Việt do con người kiểm duyệt.
  • Dữ liệu tiếng Việt là synthetic để bootstrap, không thay thế test set thực tế được ẩn danh và có sự đồng ý.
  • Cần đo calibration, false positive, schema-valid rate và end-to-end policy behavior trước production.