CoolFace
Datasetpublic

JJoy333/nicu-vitalsigns-ts-description

NICU Vitalsigns Time Series with Text Descriptions This dataset provides multimodal samples consisting of NICU patient vital sign time series paired with natural language descriptions. It is designed to support research on language-time series multimodal modeling in clinical settings. The dataset contains two physiological signals — heart rate (hr/) and oxygen saturation (sp/) — and is split into train, test, and left sets for each signal. Each sample contains a time series… See the full description on the dataset page: https://huggingface.co/datasets/JJoy333/nicu-vitalsigns-ts-description.

sourceHugging Facemitupdated 1y agoView on Hugging Face
0likes50downloads
Dataset Card

NICU Vitalsigns Time Series with Text Descriptions

This dataset provides multimodal samples consisting of NICU patient vital sign time series paired with natural language descriptions. It is designed to support research on language-time series multimodal modeling in clinical settings.

The dataset contains two physiological signals — heart rate (hr/) and oxygen saturation (sp/) — and is split into train, test, and left sets for each signal.

Each sample contains a time series segment and an associated text instruction or description, enabling studies that combine time series analysis with text-driven tasks.

Intended Use

This dataset is clinically relevant for simulating and evaluating natural language based tasks on infant physiological signals. It supports AI research in areas such as:

  • —Multimodal modeling of time series and language
  • —Instruction-based time series generation and editing
  • —Clinical decision support and what-if analysis using LLMs or diffusion models
  • —Adaptation in medical time series tasks

It was developed alongside the InstructTime model for instruction-based time series editing.

Usage

python
from datasets import load_dataset

repo = "JJoy333/nicu-vitalsigns-ts-description"

# Load HR (heart rate) splits
hr = load_dataset(repo, data_files={
    "train": "hr/train.parquet",
    "test":  "hr/test.parquet",
    "left":  "hr/left.parquet",
})

# Load SP (oxygen saturation) splits
sp = load_dataset(repo, data_files={
    "train": "sp/train.parquet",
    "test":  "sp/test.parquet",
    "left":  "sp/left.parquet",
})

# Convert to Pandas if needed
df_hr_train = hr["train"].to_pandas()
df_sp_test  = sp["test"].to_pandas()

Paper

This dataset accompanies the following paper:

Instruction-based Time Series Editing arXiv: 2508.01504 DOI: 10.48550/arXiv.2508.01504

Citation

If you use this dataset, please cite:

bibtex
@misc{qiu2025instruction,
  title         = {Instruction-based Time Series Editing},
  author        = {Qiu, Jiaxing and Guo, Dongliang and Sullivan, Brynne and Henry, Teague R. and Hartvigsen, Tom},
  year          = {2025},
  eprint        = {2508.01504},
  archivePrefix = {arXiv},
  primaryClass  = {cs.LG},
  doi           = {10.48550/arXiv.2508.01504},
  url           = {https://arxiv.org/abs/2508.01504}
}