CoolFace
Datasetpublic

Ashray27/Medical-Reasoning-SFT-Trinity-Mini

Medical-Reasoning-SFT-Trinity-Mini A large-scale medical reasoning dataset generated using arcee-ai/Trinity-Mini, containing over 810,000 samples with detailed chain-of-thought reasoning for medical and healthcare questions. Dataset Overview Metric Value Model arcee-ai/Trinity-Mini Total Samples ~810,374 Estimated Tokens ~1.52 Billion Content Tokens ~542 Million Reasoning Tokens ~977 Million Language English Schema Each… See the full description on the dataset page: https://huggingface.co/datasets/Ashray27/Medical-Reasoning-SFT-Trinity-Mini.

sourceHugging Faceapache-2.0updated 8mo agoView on Hugging Face
1likes63downloads
Dataset Card

Medical-Reasoning-SFT-Trinity-Mini

A large-scale medical reasoning dataset generated using arcee-ai/Trinity-Mini, containing over 810,000 samples with detailed chain-of-thought reasoning for medical and healthcare questions.

Dataset Overview

MetricValue
Modelarcee-ai/Trinity-Mini
Total Samples~810,374
Estimated Tokens~1.52 Billion
Content Tokens~542 Million
Reasoning Tokens~977 Million
LanguageEnglish

Schema

Each sample follows the conversational messages format with reasoning content:

json
{
  "messages": [
    {
      "role": "user",
      "content": "What are the symptoms of diabetes?",
      "reasoning_content": null
    },
    {
      "role": "assistant",
      "content": "The main symptoms of diabetes include...",
      "reasoning_content": "Let me think through this systematically. Diabetes affects blood sugar regulation, so I should consider symptoms related to hyperglycemia..."
    }
  ]
}

Fields

FieldTypeDescription
messageslistArray of message objects in the conversation
messages[].rolestringEither "user" or "assistant"
messages[].contentstringThe main message content
messages[].reasoning_contentstring or nullChain-of-thought reasoning (assistant messages only)

Usage

Loading with Datasets Library

python
from datasets import load_dataset

dataset = load_dataset("OpenMed/Medical-Reasoning-SFT-Trinity-Mini")

Accessing Samples

python
# Get a sample
sample = dataset['train'][0]

# Access messages
for msg in sample['messages']:
    print(f"Role: {msg['role']}")
    print(f"Content: {msg['content'][:100]}...")
    if msg['reasoning_content']:
        print(f"Reasoning: {msg['reasoning_content'][:100]}...")

Filtering by Reasoning

python
# Get samples with reasoning content
samples_with_reasoning = dataset['train'].filter(
    lambda x: x['messages'][-1]['reasoning_content'] is not None
)

Intended Use

This dataset is designed for:

  • Fine-tuning medical reasoning models: Train LLMs to provide detailed, step-by-step medical reasoning
  • Chain-of-thought training: Develop models that show their thinking process
  • Medical QA systems: Build question-answering systems for healthcare applications
  • Research: Study reasoning patterns in medical domain AI

Limitations and Considerations

  • This dataset is generated by an AI model and should not be used as a substitute for professional medical advice
  • Responses may contain inaccuracies and should be validated by medical professionals
  • Not intended for clinical decision-making without expert review
  • The reasoning traces reflect the model's approach, not necessarily optimal clinical reasoning

Citation

If you use this dataset, please cite:

bibtex
@dataset{medical_reasoning_sft_trinity_mini,
  title={Medical-Reasoning-SFT-Trinity-Mini},
  author={OpenMed},
  year={2025},
  publisher={Hugging Face},
  url={https://huggingface.co/datasets/OpenMed/Medical-Reasoning-SFT-Trinity-Mini}
}

License

Apache 2.0