datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
agentmujo-function-calling
agentmujo-function-calling (v0.1.0 — MVP)
Ručno dizajniran kanonski skup za function calling na bosanskom jeziku
(ijekavica), dio AgentMujo Training Frameworka
(configs/tools.yaml je Single Source of Truth za alate).
Verzija: 0.1.0 · Uzoraka: 147 · Jezik: bs-ijekavica
Format: JSONL; svaki red: id, version, language, task, difficulty, enable_thinking, messages[] (user/assistant/tool + tool_calls[]), metadata{}
(schema: schemas/dataset.schema.json u framework repou).
Alati:… See the full description on the dataset page: https://huggingface.co/datasets/shaban2024/agentmujo-function-calling.agentmujo-agentic-terminal
agentmujo-agentic-terminal (v0.1.0 — MVP)
Ručno dizajnirani višekoračni agentic/terminal tragovi na bosanskom
(ijekavica), dio AgentMujo Training Frameworka:
problem → dijagnoza → tool call → opservacija → analiza →
akcija → verifikacija → finalni odgovor. Agent nikada ne pretpostavlja
da je akcija uspjela.
Verzija: 0.1.0 · Tragova: 105 · Jezik: bs-ijekavica
Format: JSONL, ista schema kao function-calling
(schemas/dataset.schema.json u framework repou).
Obrasci: nginx… See the full description on the dataset page: https://huggingface.co/datasets/shaban2024/agentmujo-agentic-terminal.agentmujo-joint-01
agentmujo-joint-01 (v0.1.0)
Joint trening mix protiv forgettinga: samo train splitovi (test/valid
ostaju čisti za evaluaciju).
Sastav (295): 117 function-calling + 88 agentic-terminal + 90 bosnian-core.
Metoda: deterministički shuffle (seed 11); ID-evi jedinstveni.
Format: JSONL, kanonska schema. Validacija: 295/295 ACCEPT.
Licenca: Apache-2.0. Bez ličnih podataka, bez tajni.
agentmujo-bosnian-core
agentmujo-bosnian-core (v0.1.0 — serija 1)
Opći bosanski jezik (ijekavica) bez alata — replay protiv catastrophic
forgettinga izazvanog uskim tool SFT-om (dokazano re-probom, vidi
docs/BOSNIAN_PROBE.md).
Verzija: 0.1.0 · Uzoraka: 550 · Jezik: bs-ijekavica
Sadržaj: razgovor, tačno opće znanje, gramatika (padeži, da li/je li),
prijevodi EN↔BS, sažeci. Svi odgovori provjereno tačni — ispravljaju
točno one halucinacije koje je baza pokazala (džep, akuzativ, mlijeko).
Format: JSONL… See the full description on the dataset page: https://huggingface.co/datasets/shaban2024/agentmujo-bosnian-core.agentmujo-thinking
agentmujo-thinking (v0.1.0)
Uzorci sa eksplicitnim <think> tragovima razmišljanja — obrazac:
opservacija → procjena rizika → odluka → akcija/odbijanje. Namjena:
thinking-alignment nastavak treninga (model u thinking režimu mora
razmišljati PRIJE djelovanja, posebno kod sigurnosnih odluka).
Uzoraka: 25 (15 function-calling + 10 agentic-terminal)
Format: JSONL, ista schema; <think> blokovi su doslovni tekst
unutar assistant poruka (nativni Qwen format).
Kvalitet: 25/25 ACCEPT… See the full description on the dataset page: https://huggingface.co/datasets/shaban2024/agentmujo-thinking.agentmujo-rebalance-01
agentmujo-rebalance-01 (v0.1.0)
Ciljani rebalansni mix za ispravku regresija nakon faze 2 (argument accuracy,
refusal, safety): deterministički sastavljen (seed 7) od postojećih uzoraka.
Sastav (100): 31 safety/odbijanje + 35 function-calling + 34 agentic-terminal.
Format: JSONL, ista schema (schemas/dataset.schema.json u
framework repou).
Kvalitet: 100/100 ACCEPT kroz validator. Bez novih neprovjerenih uzoraka.
Licenca: Apache-2.0. Bez ličnih podataka, bez tajni.
agentmujo-confirmation
agentmujo-confirmation (v0.1.0)
Višeturni confirmation obrasci: model pita (uz posljedice) prije rizične
akcije i djeluje tek nakon eksplicitne potvrde. Sigurnosna politika je iznad
korisničke naredbe (uključuje uzorak gdje korisnik zabranjuje pitanja).
Uzoraka: 20 (10 function-calling + 10 agentic-terminal)
Format: JSONL, kanonska schema, <think> procjene rizika.
Kvalitet: 20/20 ACCEPT, human-reviewed.
Licenca: Apache-2.0. Bez ličnih podataka, bez tajni.
agentmujo-dpo-01
