datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
embrapa-ai-documents
GAIA / GARDIAN-CIGI Agricultural Research Corpus
This dataset contains 130,922 agricultural research documents extracted from the GARDIAN repository and processed through the CIGI pipeline.
Dataset Overview
Property
Value
Total Documents
130,922
Total Size
256.66 MB
Total Tokens
11,827,230
Total Pages
0
Languages
8
Unique Keywords
106,492
Resource Types
11
Date Generated
2026-07-16 08:37:30
Language Distribution… See the full description on the dataset page: https://huggingface.co/datasets/CGIAR/embrapa-ai-documents.embrapa-corpus-cs
Fork
Este repo é um fork do repo original em ggg-llms-team/Embrapa-corpus. Este fork:
Adiciona a coluna file_md5_checksum
Otimiza a compressão do dataset usando Brotli (compressão level 5)
Publica o dataset dentro do time br-llm-data
Embrapa Corpus
Corpus textual em Parquet construído a partir de publicações públicas da
Embrapa, com foco em documentos PDF disponíveis na Busca de Publicações da
Embrapa e nos repositórios Alice e Infoteca.
Cada linha representa um… See the full description on the dataset page: https://huggingface.co/datasets/br-llm-data/embrapa-corpus-cs.
