AETHER-LAB/akie-pretrain-corpus
AKIE Pretrain Corpus Corpus de pré-treino para a família de modelos AKIE, organizado em 4 eixos com proporções fixas, tokenizado com o AkieTokenizer (SentencePiece BPE, 32k vocabulário). Composição Eixo Proporção Tokens Código 40% ~2,40B Instruções 20% ~1,20B Diálogo 25% ~1,50B Raciocínio 15% ~0,90B Total 100% ~6,00B Fontes: código-fonte de repositórios públicos (várias linguagens), diálogos e instruções em português (traduções e coleções… See the full description on the dataset page: https://huggingface.co/datasets/AETHER-LAB/akie-pretrain-corpus.
Conversations for this repository live on Hugging Face.
CoolFace shows imported repositories read-only. Posting into someone else’s repository from here would need an authorised integration and the account holder’s consent, so the link goes to the source instead.
Open discussions on Hugging Face