AETHER-LAB/akie-pretrain-corpus
AKIE Pretrain Corpus Corpus de pré-treino para a família de modelos AKIE, organizado em 4 eixos com proporções fixas, tokenizado com o AkieTokenizer (SentencePiece BPE, 32k vocabulário). Composição Eixo Proporção Tokens Código 40% ~2,40B Instruções 20% ~1,20B Diálogo 25% ~1,50B Raciocínio 15% ~0,90B Total 100% ~6,00B Fontes: código-fonte de repositórios públicos (várias linguagens), diálogos e instruções em português (traduções e coleções… See the full description on the dataset page: https://huggingface.co/datasets/AETHER-LAB/akie-pretrain-corpus.
AKIE Pretrain Corpus
Corpus de pré-treino para a família de modelos AKIE, organizado em 4 eixos com proporções fixas, tokenizado com o AkieTokenizer (SentencePiece BPE, 32k vocabulário).
Composição
Fontes: código-fonte de repositórios públicos (várias linguagens), diálogos e instruções em português (traduções e coleções da comunidade), e datasets de raciocínio passo a passo (matemática e lógica geral, em português e inglês).
Controle de qualidade
O eixo de raciocínio passou por um filtro de alinhamento antes da montagem final: uma das fontes usadas (dataset de raciocínio traduzido, ~98% do eixo em volume) tinha uma fração real de exemplos com pergunta/resposta de assuntos sem relação entre si (achado por amostragem e verificação direta do conteúdo, não só do card da fonte). Exemplos identificados como desalinhados (heurística de sobreposição lexical entre pergunta e resposta) foram descartados antes da tokenização. Os outros 3 eixos foram verificados por amostragem e não apresentaram o mesmo padrão.
Formato
Parquet, 64 shards (data/shard-00000.parquet ... data/shard-00063.parquet), schema:
input_ids(list<int32>): sequência de tokens, já com token de início e fim de documento (BOS/EOS) do AkieTokenizer.eixo(string): um decodigo,instrucoes,dialogo,raciocinio.
Documentos embaralhados entre os 4 eixos em todos os shards (não há blocos contíguos de um único eixo).
Uso pretendido
Pré-treino de modelos causais de linguagem de pequeno porte (~350M parâmetros) com o AkieTokenizer. Cada linha é um documento completo, pronto para ser empacotado em blocos de treino do tamanho de contexto desejado.
Licença
Corpus derivado de múltiplas fontes com licenças variadas (código open-source, datasets públicos da comunidade Hugging Face). Verifique a licença da fonte original antes de uso comercial de subconjuntos específicos.
