CoolFace
Datasetpublic

deepearth/central-florida-native-plants

DeepEarth Central Florida Native Plants Dataset v0.2.0 🌿 Dataset Summary A comprehensive multimodal dataset featuring 33,665 observations of 232 native plant species from Central Florida. This dataset combines citizen science observations with state-of-the-art vision and language embeddings for advancing multimodal self-supervised ecological intelligence research. Key Features 🌍 Spatiotemporal Coverage: Complete GPS coordinates and timestamps for… See the full description on the dataset page: https://huggingface.co/datasets/deepearth/central-florida-native-plants.

sourceHugging Facemitupdated 1y agoView on Hugging Face
0likes292downloads
Dataset Card

DeepEarth Central Florida Native Plants Dataset v0.2.0

🌿 Dataset Summary

A comprehensive multimodal dataset featuring 33,665 observations of 232 native plant species from Central Florida. This dataset combines citizen science observations with state-of-the-art vision and language embeddings for advancing multimodal self-supervised ecological intelligence research.

Key Features

  • β€”πŸŒ Spatiotemporal Coverage: Complete GPS coordinates and timestamps for all observations
  • β€”πŸ–ΌοΈ Multimodal: 31,136 observations with images, 7,113 with vision embeddings
  • β€”πŸ§¬ Language Embeddings: DeepSeek-V3 embeddings for all 232 species
  • β€”πŸ‘οΈ Vision Embeddings: V-JEPA-2 self-supervised features (6.5M dimensions)
  • β€”πŸ“Š Rigorous Splits: Spatiotemporal train/test splits for robust evaluation

πŸ“¦ Dataset Structure

observations.parquet         # Main dataset (500MB)
vision_index.parquet        # Vision embeddings index
vision_embeddings/          # Vision features (50GB total)
β”œβ”€β”€ embeddings_000000.parquet
β”œβ”€β”€ embeddings_000001.parquet
└── ... (159 files)

πŸš€ Quick Start

python
from datasets import load_dataset
import pandas as pd

# Load main dataset
dataset = load_dataset("deepearth/central-florida-plants")

# Access data
train_data = dataset['train']
print(f"Training samples: {len(train_data)}")
print(f"Features: {train_data.features}")

# Load vision embeddings (download required due to size)
vision_index = pd.read_parquet("vision_index.parquet")
vision_data = pd.read_parquet("vision_embeddings/embeddings_000000.parquet")

πŸ“Š Data Fields

Each observation contains:

FieldTypeDescription
gbif_idint64Unique GBIF occurrence ID
taxon_idstringGBIF taxon ID
taxon_namestringScientific species name
latitudefloatGPS latitude
longitudefloatGPS longitude
yearintObservation year
monthintObservation month
dayintObservation day
hourintObservation hour (nullable)
minuteintObservation minute (nullable)
secondintObservation second (nullable)
image_urlsList[string]URLs to observation images
num_imagesintRelative image number in GBIF occurrence
has_visionboolVision embeddings available
vision_file_indicesList[int]Indices to vision files
language_embeddingList[float]7,168-dim DeepSeek-V3 embedding
splitstringtrain/spatialtest/temporaltest

πŸ”„ Data Splits

The dataset uses rigorous spatiotemporal splits:

{ "train": 30935, "temporal_test": 2730 }

  • β€”Temporal Test: All 2025 observations (future generalization)
  • β€”Spatial Test: 5 non-overlapping geographic regions
  • β€”Train: Remaining observations

πŸ€– Embeddings

Language Embeddings (DeepSeek-V3)

  • β€”Dimensions: 7,168
  • β€”Source: Scientific species descriptions
  • β€”Coverage: All 232 species

Vision Embeddings (V-JEPA-2)

  • β€”Dimensions: 6,488,064 values per embedding
  • β€”Structure: 8 temporal frames Γ— 24Γ—24 spatial patches Γ— 1408 features
  • β€”Model: Vision Transformer Giant with self-supervised pretraining
  • β€”Coverage: 7,113 images
  • β€”Storage: Flattened arrays in parquet files (use provided utilities to reshape)

πŸ’‘ Usage Examples

Working with V-JEPA 2 Embeddings

python
import numpy as np
import ast

# Load vision embedding
vision_df = pd.read_parquet("vision_embeddings/embeddings_000000.parquet")
row = vision_df.iloc[0]

# Reshape from flattened to 4D structure
embedding = row['embedding']
original_shape = ast.literal_eval(row['original_shape'])  # [4608, 1408]

# First to 2D: (4608 patches, 1408 features)
embedding_2d = embedding.reshape(original_shape)

# Then to 4D: (8 temporal, 24 height, 24 width, 1408 features)
embedding_4d = embedding_2d.reshape(8, 24, 24, 1408)

# Get specific temporal frame (0-7)
frame_0 = embedding_4d[0]  # Shape: (24, 24, 1408)

# Get mean embedding for image-level tasks
image_embedding = embedding_4d.mean(axis=(0, 1, 2))  # Shape: (1408,)

Species Distribution Modeling

python
# Filter observations for a specific species
species_data = dataset.filter(lambda x: x['taxon_name'] == 'Quercus virginiana')

# Use spatiotemporal data for distribution modeling
coords = [(d['latitude'], d['longitude']) for d in species_data]

Multimodal Learning

python
# Combine vision and language embeddings
for sample in dataset:
    if sample['has_vision']:
        lang_emb = sample['language_embedding']
        vision_idx = sample['vision_file_indices'][0]
        # Load corresponding vision embedding
        vision_emb = load_vision_embedding(vision_idx)

Zero-shot Species Classification

python
# Use language embeddings for zero-shot classification
species_embeddings = {
    species['taxon_name']: species['language_embedding']
    for species in dataset.unique('taxon_name')
}

πŸ“„ License

This dataset is released under the MIT License.

πŸ“š Citation

If you use this dataset, please cite:

bibtex
@dataset{deepearth_cf_plants_2024,
  title={DeepEarth Central Florida Native Plants: A Multimodal Biodiversity Dataset},
  author={DeepEarth Team},
  year={2024},
  version={0.2.0},
  publisher={Hugging Face},
  url={https://huggingface.co/datasets/deepearth/central-florida-plants}
}

🌟 Acknowledgments

We thank all citizen scientists who contributed observations through iNaturalist and GBIF. This dataset was created as part of the DeepEarth initiative for multimodal self-supervised ecological intelligence research.

πŸ”— Related Resources

πŸ“ˆ Dataset Statistics

  • β€”Total Size: ~51 GB
  • β€”Main Dataset: 500 MB
  • β€”Vision Embeddings: 50 GB
  • β€”Image URLs: 31,136 total images referenced
  • β€”Temporal Range: 2019-2025
  • β€”Geographic Scope: Central Florida, USA

Dataset prepared by the DeepEarth team for advancing multimodal self-supervised ecological intelligence research.