sammyliu/synthetic-sp500-ticks-v1
Synthetic Multi-Asset Millisecond Tick Data v1 Fully synthetic, event-sparse limit-order-book data for source-separation research. The realized corpus contains 12,119,284,975 public exact-millisecond events across 1,726 sessions and 1,100 instruments (1,050 equities plus 50 futures). The first 1,082 sessions are deterministic sampled dates across 2005–2025; 644 additional sessions are explicitly labeled calendar replicas. No row is historical market data. Public tables: ticks… See the full description on the dataset page: https://huggingface.co/datasets/sammyliu/synthetic-sp500-ticks-v1.
Synthetic Multi-Asset Millisecond Tick Data v1
Fully synthetic, event-sparse limit-order-book data for source-separation research. The realized corpus contains 12,119,284,975 public exact-millisecond events across 1,726 sessions and 1,100 instruments (1,050 equities plus 50 futures). The first 1,082 sessions are deterministic sampled dates across 2005–2025; 644 additional sessions are explicitly labeled calendar replicas. No row is historical market data.
Public tables: ticks, instruments, session_calendar, scenes, mom_pairs. Oracle tables are separately named oracle_* and must never be joined into training inputs.
See DATA_METHODOLOGY.md for the complete reproduction contract, seed hierarchy, universe, era conditioning, checkpoint/resume design, schemas, split semantics, MixIT scene recipe, validation, and limitations. Validate with python scripts/validate_release.py --release ..
