CoolFace
Datasetpublic

BaixuW/aviation-domain-pretrain-corpus

Aviation Domain Pretrain Corpus Dataset Summary The Aviation Domain Pretrain Corpus is an early-stage domain-specific dataset designed for continued pretraining (PT) of large language models in the aviation field. This dataset is currently in a very early stage.It is intended primarily for research exploration and method validation rather than production use. The dataset focuses on injecting basic aviation knowledge into LLMs, including: Air Traffic Control (ATC)… See the full description on the dataset page: https://huggingface.co/datasets/BaixuW/aviation-domain-pretrain-corpus.

sourceHugging Faceapache-2.0updated 5mo agoView on Hugging Face
0likes20downloads
Dataset Card

Aviation Domain Pretrain Corpus

Dataset Summary

The Aviation Domain Pretrain Corpus is an early-stage domain-specific dataset designed for continued pretraining (PT) of large language models in the aviation field.

This dataset is currently in a very early stage. It is intended primarily for research exploration and method validation rather than production use.

The dataset focuses on injecting basic aviation knowledge into LLMs, including:

  • —Air Traffic Control (ATC)
  • —Aviation Meteorology
  • —Flight Performance
  • —Aeronautical Information

Intended Use

This dataset is intended for:

  • —Domain adaptation of large language models
  • —Preliminary research on aviation-related LLM applications
  • —Supporting downstream tasks such as:
  • —Flight path planning
  • —Air traffic decision modeling
  • —Weather-aware reasoning

Dataset Structure

The dataset consists of cleaned text samples:

json
{
  "text": "Example aviation-related knowledge text..."
}

Data Construction

The dataset is constructed from:

  • —Aviation textbooks
  • —Manuals and guidelines
  • —Publicly available aviation-related materials

Processing steps include:

  1. 1.Basic text cleaning
  2. 2.Segmentation
  3. 3.Simple structuring

Due to the early-stage nature, the processing pipeline is still evolving.

Limitations

  • —Early-stage dataset with limited scale
  • —Coverage is incomplete
  • —Possible noise and inconsistency
  • —Not suitable for safety-critical applications

Future Work

Future improvements may include:

  • —Expanding dataset size
  • —Improving data quality and consistency
  • —Adding more structured annotations
  • —Enhancing domain coverage

Citation

bibtex
@dataset{aviation_domain_corpus,
  title={Aviation Domain Pretrain Corpus},
  author={BaixuW},
  year={2026}
}

Author

BaixuW