anhalu/vncompress-vi-v2
VNCompress-VI v2 — query-conditioned context compression for Vietnamese ⚠️ BẢN CHƯA HOÀN CHỈNH — WORK IN PROGRESS. Config compression mới sinh được 973 / ~18.000 cặp (≈ 5%). Quá trình sinh đang tạm dừng để review. Chưa qua stage 4 (independent verification), nên trường verification_method của phần lớn row vẫn là none. Đừng dùng bản này để báo cáo kết quả benchmark. Bộ dữ liệu cho bài toán nén ngữ cảnh có điều kiện truy vấn tiếng Việt: cho một câu hỏi và một tài liệu dài, sinh… See the full description on the dataset page: https://huggingface.co/datasets/anhalu/vncompress-vi-v2.
VNCompress-VI v2 — query-conditioned context compression for Vietnamese
⚠️ BẢN CHƯA HOÀN CHỈNH — WORK IN PROGRESS. Configcompressionmới sinh được 973 / ~18.000 cặp (≈ 5%). Quá trình sinh đang tạm dừng để review. Chưa qua stage 4 (independent verification), nên trườngverification_methodcủa phần lớn row vẫn lànone. Đừng dùng bản này để báo cáo kết quả benchmark.
Bộ dữ liệu cho bài toán nén ngữ cảnh có điều kiện truy vấn tiếng Việt: cho một câu hỏi và một tài liệu dài, sinh ra bản nén ngắn hơn N lần mà vẫn đủ thông tin để trả lời đúng câu hỏi đó.
Nguồn dữ liệu
Các config
compression.jsonl — sinh như thế nào
Teacher GLM-5.2, temperature 0, tối đa 2 lần re-prompt nếu trượt budget. Mỗi câu hỏi được yêu cầu nén ở 3 mức: 2×, 4×, 8×.
Một cặp chỉ được giữ khi thoả cả hai:
- Budget compliance —
|realized − target| / target ≤ 0.15, đo trên độ dài thực tế của bản nén chứ không phải trên yêu cầu gửi cho model. - Answerability — một lượt judge riêng phải trả lời đúng câu hỏi khi chỉ được nhìn bản nén.
Cặp trượt điều kiện 2 nhưng vẫn hợp lệ về hình thức thì chuyển sang extras/.
Thống kê bản hiện tại
budget_compliance: 973/973 = 100%requested_ratio: 2× → 249 · 4× → 336 · 8× → 388realized_ratio: median 4.30 (min 1.74 · max 9.46)- split: train 894 · validation 79
- phủ 602 câu hỏi gốc trên 143 tài liệu
Hạn chế đã biết
Nêu thẳng để người dùng khỏi phát hiện muộn:
- Chỉ một nguồn QA. Toàn bộ phần QA là UIT-ViQuAD 2.0,
question_type100%extractive. Không có abstractive, không có multi-hop. - Domain gần như không phân loại — 89% số row mang nhãn
other. - Lệch theo độ dài ngữ cảnh. Tỷ lệ sống sót giảm mạnh khi ngữ cảnh dài ra (<5k ký tự: 96% · 5–10k: 91% · 10–20k: 76% · >20k: 62%), nên bản nén thu được lệch về tài liệu ngắn — ngược hướng mong muốn của một benchmark long-context. Lý do loại lớn nhất là teacher không trúng budget trên ngữ cảnh dài.
- Chưa verify độc lập. Stage 4 (judge model khác teacher + human review + Cohen's κ) chưa chạy.
- Bản nén là do model sinh, không phải người viết.
gold_compressionlà "gold" theo nghĩa đã qua hai cổng kiểm tra tự động, không phải theo nghĩa người chú thích.
Trích dẫn
Trích dẫn kèm cả hai nguồn upstream (UIT-ViQuAD 2.0 và UVW-2026). Bộ này kế thừa điều khoản CC-BY-SA-4.0 từ chúng — bản phái sinh phải giữ cùng license.
