CoolFace
Datasetpublic

falcontreatred/synthetic-gpt-10M-general-50MB

datasets # dataset from datasets import load_dataset ds = load_dataset("falcontreatred/synthetic-gpt-10M-general-50MB") pandas # pandas import pandas as pd df = pd.read_json("hf://datasets/falcontreatred/synthetic-gpt-10M-general-50MB/synthetic-gpt-10M-general-50MB-v1.jsonl", lines=True) polars # polars import dask.dataframe as dd df = pl.read_ndjson("hf://datasets/falcontreatred/synthetic-gpt-10M-general-50MB/synthetic-gpt-10M-general-50MB-v1.jsonl") croissant # croissant from… See the full description on the dataset page: https://huggingface.co/datasets/falcontreatred/synthetic-gpt-10M-general-50MB.

sourceHugging Facecc-by-nc-4.0updated 8mo agoView on Hugging Face
1likes1downloads
Dataset Card

How to use the dataset ---

  • —datasets
bash
# dataset
from datasets import load_dataset

ds = load_dataset("falcontreatred/synthetic-gpt-10M-general-50MB")
  • —pandas
bash
# pandas
import pandas as pd

df = pd.read_json("hf://datasets/falcontreatred/synthetic-gpt-10M-general-50MB/synthetic-gpt-10M-general-50MB-v1.jsonl", lines=True)
  • —polars
bash
# polars
import dask.dataframe as dd

df = pl.read_ndjson("hf://datasets/falcontreatred/synthetic-gpt-10M-general-50MB/synthetic-gpt-10M-general-50MB-v1.jsonl")
  • —croissant
bash
# croissant
from mlcroissant import Dataset

ds = Dataset(jsonld="https://huggingface.co/api/datasets/falcontreatred/synthetic-gpt-10M-general-50MB/croissant")
records = ds.records("default")