Self Driving
self-driving-GTA-V
Self Driving GTA V Dataset
Dataset Varients
Mini : Link
Training Data(1-100) : Link
Training Data(101-200) : Link
Info
Image Resolution : 270, 480
Mode : RGB
Dimension : (270, 480, 3)
File Count : 100
Size : 1.81 GB/file
Total Data Size : 362 GB
Total Frames : 1 Million
Data Set sizes
Mini :
Folder Name : mini
Files : 01
Total Size : 1.81 GB
Total Frames : 5000
First Half
Folder Name : Training Data(1-100)
Files :… See the full description on the dataset page: https://huggingface.co/datasets/sartajbhuvaji/self-driving-GTA-V.KR-Self-Driving-Legal-QA
📚 KR-Self-Driving-Legal-QA
대한민국 자율주행자동차 법령 및 가이드라인 기반 Q&A 데이터셋
이 데이터셋은 한국의 자율주행자동차 관련 법령, 규칙, 가이드라인(총 13개 핵심 문서)을 기반으로 생성된 고품질 질의응답(Q&A) 데이터셋입니다.
LLM Fine-Tuning 및 RAG(Retrieval-Augmented Generation) 시스템 구축을 위해 최적화되었습니다.
📌 데이터셋 개요 (Overview)
출처: 대한민국 법령정보센터, 국토교통부 (공식 문서)
생성 도구: Google NotebookLM + Custom Python Parser
포맷: Alpaca Clean Format (instruction, input, output)
규모: 720개 Q&A 쌍 (엄선된 고품질 데이터)
특징:
법적 근거 명시: 각 질문에 출처 문서(예: 레벨3 안전기준, 사이버보안 가이드라인)가 명시됨.
RAG 최적화:… See the full description on the dataset page: https://huggingface.co/datasets/bluejude10/KR-Self-Driving-Legal-QA.smoothie-qwen3-8b-kr-self-driving-legal-dataset-v5-cot
🇰🇷 자율주행법령 CoT 파인튜닝 데이터셋 v5
왜 이 데이터셋을 새로 만들었는가?
기존 dataset-v3 는 단순 질문-답변(Direct To Response, DTRO Style) 포맷으로 구성되어 있었습니다.
// v3 포맷 (기존)
{
"instruction": "자율주행자동차란 무엇인가요?",
"output": "자율주행자동차란 ..."
}
이 방식으로 파인튜닝한 모델(v3)을 RAG 파이프라인과 결합하여 평가한 결과, 정답률 43% 로 순정 모델(90%)에 크게 뒤처지는 것이 확인되었습니다. 실패의 핵심 원인은 다음과 같습니다:
실패 원인
설명
템플릿 과적합
모델이 논리가 아닌 답변 패턴(아닙니다 + 설명)을 암기
RAG 컨텍스트 무시
학습된 내부 패턴이 외부 검색 문서를 압도
<think> 태그 미사용
Qwen3의 추론(Chain-of-Thought) 능력이 전혀 활성화되지 않음… See the full description on the dataset page: https://huggingface.co/datasets/bluejude10/smoothie-qwen3-8b-kr-self-driving-legal-dataset-v5-cot.smoothie-qwen3-8b-kr-self-driving-legal-dataset-v3
📚 Smoothie-Qwen3-8B-KR-Self-Driving-Legal Dataset v3 (DTRO Style)
대한민국 자율주행자동차법 파인튜닝을 위한 750건의 한국어 특화 데이터셋입니다.본 데이터셋은 기존 v1, v2 데이터셋 치명적인 "컨텍스트 소실(Context Forgetting)" 문제를 해결하기 위해 DTRO (Direct-To-Response Output) 스타일로 완전히 재구축되었습니다.
⚠️ 이전 데이터셋(v1, v2)의 문제점과 한계
기존 Alpaca 양식의 데이터셋은 모델 학습 시 다음과 같은 심각한 부작용을 낳았습니다.
1. 시스템 프롬프트 포이즈닝 (System Prompt Poisoning)
// 과거 데이터셋 (문제)
{
"instruction": "당신은 대한민국의 자율주행자동차법 전문가입니다. 정확한 법적 근거를...",
"input": "자율주행자동차의 정의는 무엇입니까? [출처: 관련… See the full description on the dataset page: https://huggingface.co/datasets/bluejude10/smoothie-qwen3-8b-kr-self-driving-legal-dataset-v3.smoothie-qwen3-8b-kr-self-driving-legal-dataset-v2asia-owid-views-safety-self-driving-car
Views Safety Self Driving Car | Asia (Our World in Data)
🌏 35 observations · 35 Asia countries · 2021–2021 · Repackaged by Electric Sheep Asia
TL;DR
This dataset contains 35 observations of Views Safety Self Driving Car data across 35 Asia countries, spanning 2021–2021.
About the source
Source: Our World in Data
Publisher: Our World in Data
License: cc-by-4.0
Topic: Views Safety Self Driving Car
Geographic coverage
35 Asia… See the full description on the dataset page: https://huggingface.co/datasets/electricsheepasia/asia-owid-views-safety-self-driving-car.
