Taklaxbr/finance-reasoning-turkish
Not: Bu veri setinin dokümantasyonu Türk yapay zeka topluluğuna katkı sağlamak amacıyla VeriPazarı tarafından Türkçeye çevrilmiştir. Orijinal veri seti emre (Davut Emre Tasar, Enes Bulut) tarafından geliştirilmiş olup, VeriPazarı tarafından Türk AI ekosistemi için arşivlenmiştir. 🔗 Orijinal Kaynak: emre/finance-reasoning-turkish 🔗 Derleyen Platform: VeriPazarı Türkçe Gelişmiş Akıl Yürütme Veri Seti (Finans Soru-Cevap) Lisans Bu veri seti Sadece Akademik… See the full description on the dataset page: https://huggingface.co/datasets/Taklaxbr/finance-reasoning-turkish.
Not: Bu veri setinin dokümantasyonu Türk yapay zeka topluluğuna katkı sağlamak amacıyla VeriPazarı tarafından Türkçeye çevrilmiştir. Orijinal veri seti emre (Davut Emre Tasar, Enes Bulut) tarafından geliştirilmiş olup, VeriPazarı tarafından Türk AI ekosistemi için arşivlenmiştir. 🔗 Orijinal Kaynak: emre/finance-reasoning-turkish 🔗 Derleyen Platform: VeriPazarı
Türkçe Gelişmiş Akıl Yürütme Veri Seti (Finans Soru-Cevap)
Lisans
Bu veri seti Sadece Akademik Kullanım Lisansı (Academic Use Only License) altında lisanslanmıştır. Yalnızca akademik ve araştırma amaçlı kullanılması amaçlanmıştır. Ticari kullanımı kesinlikle yasaktır.
Görev Kategorileri (Task Categories)
- Metin Üretimi (Text Generation)
- Soru Cevaplama (Question Answering)
- Akıl Yürütme (Reasoning)
Dil (Language)
- Türkçe (`tr`): Soru (
Question), RAG İçeriği (RAG Content) ve Yanıt (<response>) bileşenleri için kullanılmıştır. - İngilizce (`en`): Düşünme (
<thinking>), Öz Değerlendirme (<self_reflection>), Simülasyon (<simulation>), Simülasyon Değerlendirmesi (<simulation_reflection>), Zihin Haritası ve Mantık Akışı (<mindmap and logic flow>) ile Ontoloji Üretimi (<ontology_generation>) bileşenleri için kullanılmıştır.
Boyut (Size)
- 1870 Örnek (Samples)
Veri Seti Açıklaması
Bu veri seti, özellikle finans alanında Türkçe gelişmiş akıl yürütme (reasoning) yeteneklerini göstermek amacıyla tasarlanmış bir Kavram Kanıtlama (Proof-of-Concept - PoC) çalışmasıdır. Türkçeye çevrilmiş mevcut bir finans Soru-Cevap veri setinden (kaynak belirtilmemiştir) türetilmiştir. Veri seti, özel bir sistem istemi (system prompt) izlenerek Google Gemma2 Flash Thinking modeli tarafından üretilen gelişmiş akıl yürütme bileşenleriyle daha da zenginleştirilmiştir. Amaç, NLP araştırmalarında nispeten düşük kaynaklı bir dil olan Türkçede, yapılandırılmış, çok adımlı akıl yürütme yapabilen modellerin eğitilmesi ve değerlendirilmesi için bir kaynak sağlamaktır.
Veri setindeki her bir giriş (entry), aşağıdaki anahtarları (keys) içeren tek satırlık bir JSONL nesnesidir:
- `Question`: Orijinal finans odaklı Türkçe soru.
- `RAG Content`: Konunun anlaşılmasını zenginleştirmek için soru ve cevaba dayalı olarak üretilen ek Türkçe bağlam (context).
- `<thinking>`: Yalnızca
QuestionveRAG Contentkullanılarak soruya nasıl yaklaşılacağını özetleyen, İngilizce olarak yazılmış ayrıntılı, adım adım akıl yürütme süreci. - `<self_reflection>`: Akıl yürütme sürecinin mantıksal tutarlılığını ve bütünlüğünü değerlendiren İngilizce eleştirel bir öz değerlendirme.
- `<simulation>`: Konunun etkilerini veya uygulamalarını inceleyen İngilizce varsayımsal (hypothetical) bir senaryo.
- `<simulation_reflection>`: Simülasyonun uygunluğunun ve geçerliliğinin İngilizce olarak değerlendirilmesi.
- `<mindmap and logic flow>`: Kavramları ve ilişkilerini düzenleyen, hiyerarşik İngilizce zihin haritası ve mantık akışı.
- `<ontology_generation>`: Temel varlıkları (entities) ve ilişkileri temsil etmek için RDF üçlülerini (RDF triples) kullanan, İngilizce yapılandırılmış ontoloji (kavram ağı).
- `<response>`: Akıl yürütme bileşenlerindeki içgörüleri sentezleyen kapsamlı, nihai Türkçe yanıt.
Bu veri seti, finans alanında Soru-Cevap, bilgi temsili (knowledge representation) ve metin üretimi gibi, Türkçede ileri düzeyde akıl yürütme gerektiren NLP görevleri üzerinde çalışan araştırmacılar ve geliştiriciler için özellikle değerlidir.
Kullanım Amacı (Intended Uses)
Bu veri seti aşağıdaki amaçlar için tasarlanmıştır:
- NLP Modellerini Eğitmek ve Değerlendirmek: Finans odaklı Türkçe gelişmiş akıl yürütme, soru cevaplama ve metin üretimi görevleri için.
- Çok Dilli Akıl Yürütme Araştırmaları: Türkçe gibi düşük kaynaklı dillerde (low-resource languages) akıl yürütme yeteneklerini keşfetmek ve geliştirmek.
- Kıyaslama (Benchmarking): Ontoloji üretimi ve çok adımlı mantık akışları da dahil olmak üzere, yapılandırılmış akıl yürütme görevlerinde modellerin performansını değerlendirmek.
- Kavram Kanıtlama (PoC) Geliştirme: Google Gemma2 Flash Thinking gibi son teknoloji modeller kullanılarak yetersiz temsil edilen diller (underrepresented languages) için gelişmiş akıl yürütme veri setleri oluşturmanın uygulanabilirliğini göstermek.
Veri Seti Yapısı
Veri seti JSONL formatında saklanır; her satır aşağıdaki anahtarlara sahip bir JSON nesnesidir:
Örnek Veri (JSON)
{
"Question": "Makine öğrenmesinde supervised learning ve unsupervised learning arasındaki fark nedir?",
"RAG Content": "Makine öğrenmesi, verilerden öğrenen algoritmaların geliştirilmesini kapsar. Supervised learning, girdi ve çıktı çiftleri ile çalışır; model, etiketli verilerden öğrenerek tahmin yapar (örneğin, sınıflandırma veya regresyon). Unsupervised learning ise etiketsiz verilerle çalışır ve verilerdeki gizli yapıları veya desenleri bulmaya odaklanır (örneğin, kümeleme veya boyut indirgeme). Her iki öğrenme türü de farklı problem türlerine uygulanır ve veri setinin yapısına bağlı olarak seçilir.",
"<thinking>": "The question asks for the difference between supervised and unsupervised learning. The RAG content provides a clear distinction: supervised learning uses labeled data for training, while unsupervised learning works with unlabeled data to find patterns. I should elaborate on this by explaining what labeled and unlabeled data mean, and perhaps give examples of each. For supervised learning, classification (e.g., spam detection) and regression (e.g., price prediction) are typical tasks. For unsupervised learning, clustering (e.g., customer segmentation) and dimensionality reduction (e.g., PCA) are common. This will make the distinction clearer.",
"<self_reflection>": "My approach covers the core difference and provides examples, which is essential for understanding. I could also mention semi-supervised learning as a hybrid, but since the question focuses on the two main types, it’s not necessary. The explanation is concise and accurate, with no major gaps.",
"<simulation>": "Suppose a company has a dataset of customer purchases without any labels. If they want to group customers based on buying behavior, they would use unsupervised learning (clustering). If, however, they had labeled data indicating whether customers are ‘high-value’ or ‘low-value,’ they could use supervised learning to predict future customer value. This illustrates how the presence or absence of labels determines the learning type.",
"<simulation_reflection>": "The simulation effectively demonstrates the practical application of both learning types. It’s relevant and helps clarify when to use each method. The scenario is realistic and aligns with common machine learning use cases. No issues here.",
"<mindmap and logic flow>": "- **Central Node**: Machine Learning Types\n - **Supervised Learning**\n - Uses labeled data\n - Tasks: Classification, Regression\n - **Unsupervised Learning**\n - Uses unlabeled data\n - Tasks: Clustering, Dimensionality Reduction\n\n**Logic Flow**:\n1. Machine learning involves learning from data.\n2. Supervised learning requires labeled data for training.\n3. Unsupervised learning finds patterns in unlabeled data.\n4. The choice depends on data availability and problem type.",
"<ontology_generation>": "**RDF Triples**:\n- (Machine Learning, has_type, Supervised Learning)\n- (Machine Learning, has_type, Unsupervised Learning)\n- (Supervised Learning, uses, Labeled Data)\n- (Unsupervised Learning, uses, Unlabeled Data)\n- (Supervised Learning, performs_task, Classification)\n- (Supervised Learning, performs_task, Regression)\n- (Unsupervised Learning, performs_task, Clustering)\n- (Unsupervised Learning, performs_task, Dimensionality Reduction)\n\n**Classes**:\n- Fields: Machine Learning\n- Learning Types: Supervised Learning, Unsupervised Learning\n- Data Types: Labeled Data, Unlabeled Data\n- Tasks: Classification, Regression, Clustering, Dimensionality Reduction\n\n**Properties**:\n- has_type, uses, performs_task",
"<response>": "Makine öğrenmesinde supervised learning, etiketli verilerle model eğiterek belirli bir çıktı (örneğin, sınıflandırma veya regresyon) üretmeyi amaçlar. Örneğin, e-posta spam tespiti supervised learning ile yapılır. Unsupervised learning ise etiketsiz verilerle çalışır ve verilerdeki gizli desenleri veya yapıları bulmaya çalışır, örneğin müşteri segmentasyonu için kümeleme. Temel fark, supervised learning’in etiketli verilerle çalışması, unsupervised learning’in ise etiketsiz verilerle desen bulmasıdır."
}Atıf (Citation)
Bu veri setini araştırmalarınızda kullanırsanız, lütfen aşağıdaki şekilde atıfta bulunun:
@dataset{turkish_advanced_reasoning_finance_qa,
title = {Turkish Advanced Reasoning Dataset for Finance Q\&A},
author = {Davut Emre Tasar, Enes Bulut},
year = {2025},
url = {https://huggingface.co/emre/finance-reasoning-turkish},
note = {Licensed for academic use only}
}Bu dosya veripazari.com.tr topluluğu tarafından Hugging Face altyapısında barındırılmaktadır. Orijinal emeğe saygı kuralımız gereği lisans ve model isimleri korunmuştur.
