ai-colombia/job-searcher-data
AI Job Searcher Training Data (V3) Fine-tuning dataset for a career advisor AI specializing in Nordic and European job markets. V3 (March 2026): Added 150 freeform/narrative-style Analyze examples modeled after real job postings from finn.no and arbeidsplassen.nav.no. Now includes startup-style, agency, generalist, and narrative formats alongside V2 rigid-template examples. Dataset Description This dataset contains 1,190 training examples across 9 languages and… See the full description on the dataset page: https://huggingface.co/datasets/ai-colombia/job-searcher-data.
AI Job Searcher Training Data (V3)
Fine-tuning dataset for a career advisor AI specializing in Nordic and European job markets.
V3 (March 2026): Added 150 freeform/narrative-style Analyze examples modeled after real job postings from finn.no and arbeidsplassen.nav.no. Now includes startup-style, agency, generalist, and narrative formats alongside V2 rigid-template examples.
Dataset Description
This dataset contains 1,190 training examples across 9 languages and 5 task categories, formatted as chat conversations (system/user/assistant) suitable for fine-tuning LLMs.
Task Categories
Languages
Industries Covered
IT/Technology, Healthcare, Engineering, Finance, Education, Energy, Marketing, UX Design, Project Management, Proptech, Cleantech, Fintech, AI/ML, Consulting
V3 Analyze Improvements (on top of V2)
- 150 freeform/narrative-style postings modeled after real finn.no + arbeidsplassen.nav.no listings
- Startup-style (storytelling intro, equity, culture-forward, "About us / About you / What we offer")
- Finn.no-style (Norwegian marketing copy: "Hva du vil jobbe med", "Vi ser etter deg som", "Hva vi tilbyr")
- Recruitment agency (third-person: "On behalf of our client...")
- Narrative/paragraph (no rigid sections, flowing paragraphs)
- Real Nordic companies (Vander, Chargitect, Cognite, Klarna, Northvolt, Wolt, etc.)
- Mixed employment types (60-100%, flexible)
V2 Analyze Features (retained)
- Full-length job descriptions (800-1,700 chars vs. old 200-340 chars)
- Structured sections per country (e.g. NO: Arbeidsoppgaver / Kvalifikasjoner / Vi tilbyr)
- 13 job profiles across 10+ industries
- Varied match scores (20-95%, not clustered at 60-75%)
- Role levels: Junior 20%, Mid 40%, Senior 30%, Lead 10%
Format
Each example follows the OpenAI/HuggingFace chat format:
{
"messages": [
{"role": "system", "content": "You are a professional career advisor..."},
{"role": "user", "content": "Analyze this job posting:\n\nEquinor — Programvareutvikler\nOslo\n\nEquinor er en ledende aktør innen IT/teknologi..."},
{"role": "assistant", "content": "**Påkrevde ferdigheter:** Python, Docker...\n**Match-score:** 72%"}
]
}System Prompt
You are a professional career advisor specializing in Nordic and European job markets. You help job seekers with cover letters, job analysis, interview preparation, and career guidance. Respond in the same language as the user's query.
Files
train_combined.jsonl— All 1,190 examples combined (shuffled)train_{lang}.jsonl— Per-language splits (no, sv, da, en, es, pt, fr, de, fi)
Usage
from datasets import load_dataset
# Load all data
dataset = load_dataset("ai-colombia/job-searcher-data", data_files="train_combined.jsonl")
# Load specific language
dataset_no = load_dataset("ai-colombia/job-searcher-data", data_files="train_no.jsonl")Realistic Nordic Content
Includes authentic company names (Equinor, Spotify, Novo Nordisk, Nokia, Wolt, Klarna, Chargitect, Vander, Cognite, Northvolt, etc.), job titles, cities, salary ranges, and job portals across Nordic and European countries.
License
Apache 2.0
