thuaannn/prewise-security-adapter-training-v5
Prewise Security Adapter Training V5 Bộ dữ liệu và công cụ Kaggle hoàn chỉnh để fine-tune ba LoRA trên cùng base model Qwen/Qwen3.5-4B: message-context-adapter web-context-adapter explanation-adapter phone-intelligence là HTTP provider bên ngoài, không phải LoRA. Packager tạo entry này ở trạng thái enabled: false để backend vẫn có đủ bốn runtime contract. Quy mô Adapter Train Validation Test Tổng Message Context 32.767 3.196 3.992 39.955 Web Context… See the full description on the dataset page: https://huggingface.co/datasets/thuaannn/prewise-security-adapter-training-v5.
Prewise Security Adapter Training V5
Bộ dữ liệu và công cụ Kaggle hoàn chỉnh để fine-tune ba LoRA trên cùng base model Qwen/Qwen3.5-4B:
message-context-adapterweb-context-adapterexplanation-adapter
phone-intelligence là HTTP provider bên ngoài, không phải LoRA. Packager tạo entry này ở trạng thái enabled: false để backend vẫn có đủ bốn runtime contract.
Quy mô
Message Context V4
- 100% tiếng Việt.
- 100% có
metadata.user_context. - 100% có
metadata.user_question. - Khoảng 58% có hội thoại nhiều lượt.
- Evidence trỏ chính xác tới content, user context hoặc lượt hội thoại.
- Message Adapter không được tạo quyết định
ALLOW/WARN/BLOCK.
Web Context
Nguồn web được trích xuất thành visible text và các thuộc tính cấu trúc bất hoạt. Bundle không giữ raw HTML, URL hoạt động, email, số điện thoại hoặc tài khoản thật.
Bản V5 đã loại 56 mẫu chứa HTML/code được hiển thị như nội dung tài liệu:
- Train: 42 mẫu.
- Validation: 8 mẫu.
- Test: 6 mẫu.
Mỗi Web input gồm:
- visible content đã làm sạch;
- forms và tên trường;
- action descriptors;
- stated purpose;
- Layer-1 snapshot;
- metadata cấu trúc.
Explanation
Explanation chỉ nhận evidence và assessment đã khóa. Output phải:
- trả lời câu hỏi người dùng bằng tiếng Việt;
- không thay đổi quyết định;
- không bịa evidence;
- chỉ cite
evidence_idcó trong input.
Kiểm tra local hoặc Kaggle
python validate_complete_bundle_v5.py --bundle-root .Giải nén dữ liệu:
python prepare_kaggle_data_v5.py \
--bundle-root . \
--output-root ./prepared-dataKiểm tra trainer mà không cần GPU:
python train_qwen35_4b_context_kaggle.py \
--train-file ./prepared-data/message_context/train.jsonl \
--validation-file ./prepared-data/message_context/validation.jsonl \
--expect-json \
--validate-onlyLặp lại lệnh trên cho web_context và explanation.
Huấn luyện trên Kaggle
- Tạo Kaggle Notebook.
- Chọn Accelerator
GPU T4 x2. - Bật Internet.
- Add data từ repository/dataset snapshot này.
- Mở
prewise_security_full_v5_kaggle.ipynb. - Chạy
Run All.
Luồng train:
- Stage 1: Message Context trên GPU 0 và Explanation trên GPU 1.
- Stage 2: Web Context trên GPU 0.
- Cuối cùng tạo
/kaggle/working/prewise-adapters-v5.zip.
Cấu trúc output
server-adapters/
├── manifest.json
├── message-context-adapter/current/
├── web-context-adapter/current/
└── explanation-adapter/current/Manifest gồm bốn entry:
- ba
openai_lorađang bật; - một
phone-intelligencedạnghttp_json, mặc định tắt.
Phương pháp train mặc định
- Base model:
Qwen/Qwen3.5-4B. - 16-bit LoRA, không dùng QLoRA 4-bit.
- LoRA rank 16, alpha 16.
- Target modules: q/k/v/o, gate/up/down projection.
- Max sequence length 2048.
- Batch size 1.
- Gradient accumulation 8.
- Một epoch.
- Chỉ tính loss trên phần trả lời assistant.
Giấy phép và nguồn
Đây là bundle tổng hợp. Các nguồn upstream giữ nguyên giấy phép riêng, được liệt kê trong SOURCE_LICENSES.md:
- MIT.
- CC BY 4.0.
- Apache-2.0.
- Dữ liệu tiếng Việt synthetic do dự án tạo.
Không áp một giấy phép duy nhất lên lại toàn bộ nội dung upstream. Người sử dụng phải tuân thủ giấy phép của từng nguồn.
Giới hạn
- Chưa fine-tune GPU thực tế trong bundle này.
- Web Context chủ yếu là corpus đa ngôn ngữ/tiếng Anh; cần bổ sung benchmark website tiếng Việt do con người kiểm duyệt.
- Dữ liệu tiếng Việt là synthetic để bootstrap, không thay thế test set thực tế được ẩn danh và có sự đồng ý.
- Cần đo calibration, false positive, schema-valid rate và end-to-end policy behavior trước production.
