falcontreatred/synthetic-gpt-10M-general-50MB
datasets # dataset from datasets import load_dataset ds = load_dataset("falcontreatred/synthetic-gpt-10M-general-50MB") pandas # pandas import pandas as pd df = pd.read_json("hf://datasets/falcontreatred/synthetic-gpt-10M-general-50MB/synthetic-gpt-10M-general-50MB-v1.jsonl", lines=True) polars # polars import dask.dataframe as dd df = pl.read_ndjson("hf://datasets/falcontreatred/synthetic-gpt-10M-general-50MB/synthetic-gpt-10M-general-50MB-v1.jsonl") croissant # croissant from… See the full description on the dataset page: https://huggingface.co/datasets/falcontreatred/synthetic-gpt-10M-general-50MB.
11
How to use the dataset ---
- datasets
# dataset
from datasets import load_dataset
ds = load_dataset("falcontreatred/synthetic-gpt-10M-general-50MB")- pandas
# pandas
import pandas as pd
df = pd.read_json("hf://datasets/falcontreatred/synthetic-gpt-10M-general-50MB/synthetic-gpt-10M-general-50MB-v1.jsonl", lines=True)- polars
# polars
import dask.dataframe as dd
df = pl.read_ndjson("hf://datasets/falcontreatred/synthetic-gpt-10M-general-50MB/synthetic-gpt-10M-general-50MB-v1.jsonl")- croissant
# croissant
from mlcroissant import Dataset
ds = Dataset(jsonld="https://huggingface.co/api/datasets/falcontreatred/synthetic-gpt-10M-general-50MB/croissant")
records = ds.records("default")