HoangTrungNguyen/academic-electric-forecasting-r
Academic Building Electricity Forecasting (R) Project phân tích khám phá dữ liệu và dự báo điện năng cho tòa nhà Academic. Toàn bộ EDA, feature engineering và training được viết bằng R; dữ liệu nguồn và kết quả tái lập được lưu cùng repository. Nội dung repository academic_electric_forecasting_R/ ├── data/ # energy, occupancy và calendar dùng chung ├── eda/ # script và notebook EDA ├── train/ # feature engineering… See the full description on the dataset page: https://huggingface.co/datasets/HoangTrungNguyen/academic-electric-forecasting-r.
Academic Building Electricity Forecasting (R)
Project phân tích khám phá dữ liệu và dự báo điện năng cho tòa nhà Academic. Toàn bộ EDA, feature engineering và training được viết bằng R; dữ liệu nguồn và kết quả tái lập được lưu cùng repository.
Nội dung repository
academic_electric_forecasting_R/
├── data/ # energy, occupancy và calendar dùng chung
├── eda/ # script và notebook EDA
├── train/ # feature engineering, models và verification
├── outputs/
│ ├── eda/ # báo cáo, 14 bảng và 11 biểu đồ
│ └── train/ # train-ready data, metrics và diagnostics
├── start_jupyter.sh
└── README.mdDữ liệu
data/energy/all_buildings_power.csv: timestamp và công suất của tòa Academic.data/occupancy/ACB.csv: số người hiện diện theo thời gian.data/calendar/: working day và activity trong giai đoạn 2013–2017.
Các file trong outputs/ là kết quả đã sinh từ dữ liệu trên. Trong đó, outputs/train/processed/Academic_train_ready.csv là bảng đặc trưng sẵn sàng cho huấn luyện và các file academic_results_horizon_*.csv chứa metric theo từng khoảng dự báo. Các dòng mô hình bị skip/lỗi và không có metric không được giữ trong kết quả cuối.
Chạy EDA
Từ thư mục project:
Rscript eda/run_eda.RKết quả được ghi vào outputs/eda/. Notebook có thể mở bằng:
./start_jupyter.shChạy training
Cài các package R cần thiết:
Rscript train/requirements.RHuấn luyện và kiểm tra kết quả:
Rscript train/train.R
Rscript train/verify_results.RKết quả được ghi vào outputs/train/. Các tham số tùy chọn được trình bày tại train/README.md. Có thể thay thư mục dữ liệu bằng biến môi trường IBLEND_DATA_ROOT.
Ghi chú tái lập
- Múi giờ xử lý dữ liệu:
Asia/Kolkata. - Pipeline mặc định dùng seed cố định khi mô hình hỗ trợ.
train/expected_results/results_reference.csvlà kết quả tham chiếu để kiểm tra các mô hình chính có tạo metric hữu hạn; metric R không bắt buộc trùng bit-for-bit với implementation Python trước đây.- Notebook đã được xóa output thực thi để không lưu đường dẫn máy cá nhân.
Quyền sử dụng dữ liệu
Repository không tự tuyên bố giấy phép mới cho dữ liệu nguồn. Người sử dụng cần tuân thủ điều khoản của bộ dữ liệu gốc và ghi nguồn phù hợp khi công bố kết quả.
