CoolFace
Datasetpublic

Zenng2812/bctc-md-domain-corpus

Vietnamese Financial Reports Markdown Domain Corpus Dataset này được tạo từ các báo cáo tài chính dạng Markdown trong thư mục BCTC_MD. Mục đích Dataset dùng cho continued pretraining / domain-adaptive pretraining mô hình ngôn ngữ trên miền báo cáo tài chính tiếng Việt. Cấu trúc dữ liệu Mỗi dòng trong train.jsonl hoặc validation.jsonl là một JSON object: { "text": "...", "source_file": "AAA_BCTC_2020.md", "document_id": "AAA_BCTC_2020"… See the full description on the dataset page: https://huggingface.co/datasets/Zenng2812/bctc-md-domain-corpus.

sourceHugging Facecc-by-nc-sa-4.0updated 5mo agoView on Hugging Face
0likes9downloads
Dataset Card

Vietnamese Financial Reports Markdown Domain Corpus

Dataset này được tạo từ các báo cáo tài chính dạng Markdown trong thư mục BCTC_MD.

Mục đích

Dataset dùng cho continued pretraining / domain-adaptive pretraining mô hình ngôn ngữ trên miền báo cáo tài chính tiếng Việt.

Cấu trúc dữ liệu

Mỗi dòng trong train.jsonl hoặc validation.jsonl là một JSON object:

json
{
  "text": "...",
  "source_file": "AAA_BCTC_2020.md",
  "document_id": "AAA_BCTC_2020",
  "company": "AAA",
  "year": "2020",
  "chunk_id": 0,
  "num_chars": 5231,
  "has_image": true,
  "image_paths": ["assets_unconverted/...jpeg"]
}

Ghi chú

Các ảnh trong Markdown được chuyển thành placeholder dạng:

<IMAGE path="..." alt="..." />

Dataset này chưa phải instruction dataset. Nó dùng để model học ngôn ngữ, cấu trúc và thuật ngữ báo cáo tài chính.