jeremycochoy/wikimedia-pageview-timeseries
Wikimedia Pageview Time Series Preprocessed time series dataset derived from Wikimedia pageview statistics. Contains fixed-length windows of Wikipedia article pageview counts at hourly and daily resolution, plus STL seasonal-trend decomposition components. Dataset Summary Subset Series Count Series Length Size Description wiki_hourly 3,715,121 1025 2.5 GB Hourly pageview counts wiki_daily 1,990,244 1025 2.5 GB Daily aggregated pageview counts… See the full description on the dataset page: https://huggingface.co/datasets/jeremycochoy/wikimedia-pageview-timeseries.
Wikimedia Pageview Time Series
Preprocessed time series dataset derived from Wikimedia pageview statistics. Contains fixed-length windows of Wikipedia article pageview counts at hourly and daily resolution, plus STL seasonal-trend decomposition components.
Dataset Summary
Total: ~6.77M time series, ~9 GB
Schema
Each parquet file contains three columns:
Source IDs
Data Origin
- Source: Wikimedia pageview complete dumps
- Date range: December 2011 — October 2016
- Filtering: Pages with fewer than 10 daily views are excluded
- Processing pipeline:
- Raw hourly
.bz2dumps downloaded from Wikimedia - Parsed and aggregated into weekly parquet files
- Stitched into fixed-length windows of T=1025 time steps (1024 + 1)
- STL seasonal-trend decomposition applied to extract trend, seasonal, and residual components
- Daily aggregation computed from hourly data
Usage
from datasets import load_dataset
# Load a specific subset
ds = load_dataset("jeremycochoy/wikimedia-pageview-timeseries", "wiki_daily")
# Access a time series
series = ds["train"][0]["series"] # list of 1025 floatsOr load directly with PyArrow:
import pyarrow.parquet as pq
table = pq.read_table("wiki_daily/wiki_daily_file000_00000.parquet")
df = table.to_pandas()
series = df["series"].iloc[0] # numpy array of shape (1025,)Data Characteristics
- Patterns present: viral spikes, seasonal cycles (holidays, sports events, school calendars), slow decays, flat/stable pages, multi-language diversity (all Wikimedia projects)
- Languages: All Wikimedia language editions included (English, German, French, Japanese, Russian, etc.)
- Use cases: Time series foundation model pretraining, forecasting benchmarks, transfer learning
License
The underlying Wikimedia pageview data is released under CC0 1.0 (Public Domain). This preprocessed dataset inherits that license.
