BaixuW/aviation-domain-pretrain-corpus
Aviation Domain Pretrain Corpus Dataset Summary The Aviation Domain Pretrain Corpus is an early-stage domain-specific dataset designed for continued pretraining (PT) of large language models in the aviation field. This dataset is currently in a very early stage.It is intended primarily for research exploration and method validation rather than production use. The dataset focuses on injecting basic aviation knowledge into LLMs, including: Air Traffic Control (ATC)… See the full description on the dataset page: https://huggingface.co/datasets/BaixuW/aviation-domain-pretrain-corpus.
Aviation Domain Pretrain Corpus
Dataset Summary
The Aviation Domain Pretrain Corpus is an early-stage domain-specific dataset designed for continued pretraining (PT) of large language models in the aviation field.
This dataset is currently in a very early stage. It is intended primarily for research exploration and method validation rather than production use.
The dataset focuses on injecting basic aviation knowledge into LLMs, including:
- Air Traffic Control (ATC)
- Aviation Meteorology
- Flight Performance
- Aeronautical Information
Intended Use
This dataset is intended for:
- Domain adaptation of large language models
- Preliminary research on aviation-related LLM applications
- Supporting downstream tasks such as:
- Flight path planning
- Air traffic decision modeling
- Weather-aware reasoning
Dataset Structure
The dataset consists of cleaned text samples:
{
"text": "Example aviation-related knowledge text..."
}Data Construction
The dataset is constructed from:
- Aviation textbooks
- Manuals and guidelines
- Publicly available aviation-related materials
Processing steps include:
- Basic text cleaning
- Segmentation
- Simple structuring
Due to the early-stage nature, the processing pipeline is still evolving.
Limitations
- Early-stage dataset with limited scale
- Coverage is incomplete
- Possible noise and inconsistency
- Not suitable for safety-critical applications
Future Work
Future improvements may include:
- Expanding dataset size
- Improving data quality and consistency
- Adding more structured annotations
- Enhancing domain coverage
Citation
@dataset{aviation_domain_corpus,
title={Aviation Domain Pretrain Corpus},
author={BaixuW},
year={2026}
}Author
BaixuW
