CoolFace
Datasetpublic

jeremycochoy/wikimedia-pageview-timeseries

Wikimedia Pageview Time Series Preprocessed time series dataset derived from Wikimedia pageview statistics. Contains fixed-length windows of Wikipedia article pageview counts at hourly and daily resolution, plus STL seasonal-trend decomposition components. Dataset Summary Subset Series Count Series Length Size Description wiki_hourly 3,715,121 1025 2.5 GB Hourly pageview counts wiki_daily 1,990,244 1025 2.5 GB Daily aggregated pageview counts… See the full description on the dataset page: https://huggingface.co/datasets/jeremycochoy/wikimedia-pageview-timeseries.

sourceHugging Facecc0-1.0updated 5mo agoView on Hugging Face
0likes204downloads
Dataset Card

Wikimedia Pageview Time Series

Preprocessed time series dataset derived from Wikimedia pageview statistics. Contains fixed-length windows of Wikipedia article pageview counts at hourly and daily resolution, plus STL seasonal-trend decomposition components.

Dataset Summary

SubsetSeries CountSeries LengthSizeDescription
wiki_hourly3,715,12110252.5 GBHourly pageview counts
wiki_daily1,990,24410252.5 GBDaily aggregated pageview counts
wiki_stl_residual530,73110252.0 GBSTL decomposition — residual component
wiki_stl_seasonal371,51210251.4 GBSTL decomposition — seasonal component
wiki_stl_trend159,2191025587 MBSTL decomposition — trend component

Total: ~6.77M time series, ~9 GB

Schema

Each parquet file contains three columns:

ColumnTypeDescription
seriesfixed_size_list<float32>[1025]The time series values (1024 input steps + 1 target)
source_iduint8Numeric identifier for the data source/component
metastringHuman-readable component name

Source IDs

`source_id``meta` valueDescription
1wiki_hourlyRaw hourly pageview counts
2wiki_dailyDaily aggregated pageview counts
3wiki_stl_residualResidual after STL decomposition
4wiki_stl_seasonalSeasonal component from STL decomposition
5wiki_stl_trendTrend component from STL decomposition

Data Origin

  • —Source: Wikimedia pageview complete dumps
  • —Date range: December 2011 — October 2016
  • —Filtering: Pages with fewer than 10 daily views are excluded
  • —Processing pipeline:
  • —Raw hourly .bz2 dumps downloaded from Wikimedia
  • —Parsed and aggregated into weekly parquet files
  • —Stitched into fixed-length windows of T=1025 time steps (1024 + 1)
  • —STL seasonal-trend decomposition applied to extract trend, seasonal, and residual components
  • —Daily aggregation computed from hourly data

Usage

python
from datasets import load_dataset

# Load a specific subset
ds = load_dataset("jeremycochoy/wikimedia-pageview-timeseries", "wiki_daily")

# Access a time series
series = ds["train"][0]["series"]  # list of 1025 floats

Or load directly with PyArrow:

python
import pyarrow.parquet as pq

table = pq.read_table("wiki_daily/wiki_daily_file000_00000.parquet")
df = table.to_pandas()
series = df["series"].iloc[0]  # numpy array of shape (1025,)

Data Characteristics

  • —Patterns present: viral spikes, seasonal cycles (holidays, sports events, school calendars), slow decays, flat/stable pages, multi-language diversity (all Wikimedia projects)
  • —Languages: All Wikimedia language editions included (English, German, French, Japanese, Russian, etc.)
  • —Use cases: Time series foundation model pretraining, forecasting benchmarks, transfer learning

License

The underlying Wikimedia pageview data is released under CC0 1.0 (Public Domain). This preprocessed dataset inherits that license.