CoolFace
Datasetpublic

cedwyh/jinjing-shared-data

JinJing Shared Data - Unified OHLCV Datasets Version: 2.0.0 | Updated: 2026-04-13 Dataset Overview File Market Rows Period Notes cn_unified.parquet CN (A-shares) 8,502,401 2018-2026 Full coverage, 4987 stocks cn_2010_2017_lite.parquet CN (A-shares) 19,440 2010-2017 LIMITED: only 10 stocks us_unified.parquet US 905,803 2010-2026 US stocks hk_unified.parquet HK 499,076 2010-2026 OHLC/zero-vol filtered delisted_unified.parquet Delisted 1,207,970… See the full description on the dataset page: https://huggingface.co/datasets/cedwyh/jinjing-shared-data.

sourceHugging Faceupdated 23d agoView on Hugging Face
1likes647downloads
Dataset Card

JinJing Shared Data - Unified OHLCV Datasets

Version: 2.0.0 | Updated: 2026-04-13

Dataset Overview

FileMarketRowsPeriodNotes
cn_unified.parquetCN (A-shares)8,502,4012018-2026Full coverage, 4987 stocks
cn_2010_2017_lite.parquetCN (A-shares)19,4402010-2017LIMITED: only 10 stocks
us_unified.parquetUS905,8032010-2026US stocks
hk_unified.parquetHK499,0762010-2026OHLC/zero-vol filtered
delisted_unified.parquetDelisted1,207,970VariousDelisted stocks

Schema (All Files)

date, symbol, open, high, low, close, adj_close, volume, market

⚠️ Data Quality Notes

adj_close Risk (US/HK)

  • —US/HK `adj_close`: For recent data, adj_close ≈ close (dividend/adjustment factors may be stale or unavailable)
  • —If you need accurate adjusted close, recalculate using dividend data from a financial API
  • —CN `adj_close`: Set equal to close (no adjustment applied)

CN 2010-2017 Lite Data

  • —Only 10 Shanghai stocks (sh.600000-sh.600015 range)
  • —Not representative of full market - use for historical research only
  • —Full A-share coverage starts 2018

HK Data

  • —OHLC consistency filter applied: removed rows where high < low or high < max(open,close) or low > min(open,close)
  • —Zero-volume rows removed (were 9.6% of raw data)

Fixes Applied (v2.0.0)

SeverityIssueRows AffectedFix
P0CN 2010-2017 only 10 stocks (misleading)19,440Separated to cn_2010_2017_lite.parquet
P1HK OHLC inconsistency5,073OHLC filter applied
P1HK zero-volume rows53,552Zero-vol filter applied
P1Schema column order not unifiedAll 4 datasetsNormalized to date,symbol,open,high,low,close,adj_close,volume,market
P1DELISTED spurious amount column552,070Column dropped
P2CN 3 rows open=03Rows removed

Usage

python
import pandas as pd

# Load any unified dataset
df = pd.read_parquet("cn_unified.parquet")
df['date'] = pd.to_datetime(df['date'])