CoolFace
Datasetpublic

fatih-can/nutuk

Nutuk (Söylev) — OCR Tam Metin Özet Büyük Önder Mustafa Kemal Atatürk'ün Büyük Nutuk (Söylev) eserinin OCR ile çıkarılmış tam metni. Nutuk, Atatürk'ün 1927 yılında Cumhuriyet Halk Partisi'nin İkinci Büyük Kongresi'nde yaptığı büyük konuşmadır ve Türk Tarih Kurumu (TTK) tarafından yayımlanmıştır. Taranan sayfalar bir belge-OCR iş akışıyla işlenerek sayfa hizalı, temiz Türkçe metin elde edilmiştir. Veri Kümesi Özeti 4 ciltlik külliyat, her ciltten… See the full description on the dataset page: https://huggingface.co/datasets/fatih-can/nutuk.

sourceHugging Facecc0-1.0updated 20d agoView on Hugging Face
1likes112downloads
Dataset Card

Nutuk (Söylev) — OCR Tam Metin

Özet

Büyük Önder Mustafa Kemal Atatürk'ün Büyük Nutuk (Söylev) eserinin OCR ile çıkarılmış tam metni. Nutuk, Atatürk'ün 1927 yılında Cumhuriyet Halk Partisi'nin İkinci Büyük Kongresi'nde yaptığı büyük konuşmadır ve Türk Tarih Kurumu (TTK) tarafından yayımlanmıştır. Taranan sayfalar bir belge-OCR iş akışıyla işlenerek sayfa hizalı, temiz Türkçe metin elde edilmiştir.

Veri Kümesi Özeti

4 ciltlik külliyat, her ciltten OCR ile çıkarılmış sayfalardan oluşur.

CiltSayfa
i (1919–1920)596
ii646
iii759
iv378
Toplam2379

Veri Yapısı

Tek yapılandırma (default) ve tek bölüm (train). 2379 satır, 3 sütun:

SütunTürAçıklama
volumestringCilt kimliği (i, ii, iii, iv)
pageintCilt içinde sayfa numarası (1'den başlar)
textstringSayfanın OCR metni

Yükleme

python
from datasets import load_dataset

ds = load_dataset("fatih-can/nutuk")
print(ds["train"])

Kaynak ve Köken

  • Dil: Türkçe (tr)
  • Türk Tarih Kurumu tarafından basılmış baskıdan üretilmiştir.
  • Konuşma 1927'de Büyük Önder Mustafa Kemal Atatürk (ö. 1938) tarafından yapılmıştır.
  • Bu metin kamu malı (CC0) olarak yayımlanır.

Uyarılar

  • Metin, bir OCR iş akışının çıktısıdır; özellikle karmaşık düzenlerde (dipnotlar, tablolar, başlıklar, görseller) tanıma hataları içerebilir.
  • İmla ve aksan, kaynak baskıdaki gibidir.

Lisans

Kamu malı / CC0 (cc0-1.0).


Nutuk (Söylev) — OCR Full Text

Summary

Full OCR-extracted text of Great Leader Mustafa Kemal Atatürk's Nutuk (Söylev), the great speech he delivered to the Grand National Assembly of Turkey's Second Grand Congress in October 1927, published by the Türk Tarih Kurumu (Turkish Historical Society). Scanned pages were processed with a document-OCR pipeline to produce page-aligned, clean Turkish text.

Dataset Summary

A 4-volume corpus of OCR-extracted pages.

VolumePages
i (1919–1920)596
ii646
iii759
iv378
Total2379

Dataset Structure

Single config (default) with one split (train). 2379 rows, 3 columns:

ColumnTypeDescription
volumestringVolume id (i, ii, iii, iv)
pageintPage number within the volume (1-based)
textstringOCR-extracted text of the page

Loading

python
from datasets import load_dataset

ds = load_dataset("fatih-can/nutuk")
print(ds["train"])

Source & Provenance

  • Language: Turkish (tr)
  • Based on the printed edition published by Türk Tarih Kurumu.
  • Original speech delivered 1927 by Great Leader Mustafa Kemal Atatürk (d. 1938).
  • This text is released as public domain / CC0 (`cc0-1.0`).

Caveats

  • The text is the output of an OCR pipeline and may contain recognition errors, particularly on complex layouts (footnotes, tables, headers, image plates).
  • Diacritics and orthography follow the source printing.

License

Public domain / CC0 (cc0-1.0).