Zenng2812/bctc-md-domain-corpus
Vietnamese Financial Reports Markdown Domain Corpus Dataset này được tạo từ các báo cáo tài chính dạng Markdown trong thư mục BCTC_MD. Mục đích Dataset dùng cho continued pretraining / domain-adaptive pretraining mô hình ngôn ngữ trên miền báo cáo tài chính tiếng Việt. Cấu trúc dữ liệu Mỗi dòng trong train.jsonl hoặc validation.jsonl là một JSON object: { "text": "...", "source_file": "AAA_BCTC_2020.md", "document_id": "AAA_BCTC_2020"… See the full description on the dataset page: https://huggingface.co/datasets/Zenng2812/bctc-md-domain-corpus.
Vietnamese Financial Reports Markdown Domain Corpus
Dataset này được tạo từ các báo cáo tài chính dạng Markdown trong thư mục BCTC_MD.
Mục đích
Dataset dùng cho continued pretraining / domain-adaptive pretraining mô hình ngôn ngữ trên miền báo cáo tài chính tiếng Việt.
Cấu trúc dữ liệu
Mỗi dòng trong train.jsonl hoặc validation.jsonl là một JSON object:
{
"text": "...",
"source_file": "AAA_BCTC_2020.md",
"document_id": "AAA_BCTC_2020",
"company": "AAA",
"year": "2020",
"chunk_id": 0,
"num_chars": 5231,
"has_image": true,
"image_paths": ["assets_unconverted/...jpeg"]
}Ghi chú
Các ảnh trong Markdown được chuyển thành placeholder dạng:
<IMAGE path="..." alt="..." />Dataset này chưa phải instruction dataset. Nó dùng để model học ngôn ngữ, cấu trúc và thuật ngữ báo cáo tài chính.
