ablation
gemma-3-12b-it-orthogonal-rotation-bounded-ablation-v1-12B-i1-GGUFGigaKriya-ablation-NonEDU-1.5B-i1-GGUFablation-196-finalsft2-shisa-v2-gemma3-27b-i1-GGUFmlfoundations-dev_-_hp_ablations_llama3_epoch3_dcftv1.2-ggufmlfoundations-dev_-_hp_ablations_llama3_epoch3-ggufmlfoundations-dev_-_hp_ablations_llama3_epoch4-ggufDeepSeek-R1-Distill-Llama-8B-Ablation-i1-GGUFablation-195-finalsft2-shisa-v2-mistral-small-24b-i1-GGUF
Datasets
All datasets matching “ablation”rlpinn-ablation-runs
RLPINN ablation runs
Логи и результаты запусков абляции DQN-стека RL-агента (PINNacle).
Буферы для этих запусков лежат в
danil-e/rlpinn-ablation-buffers.
Структура
runs/<pde>/<ablation>/<run_tag>/
params.json # гиперпараметры запуска
metrics.jsonl # по строке на лог метрик (шаг + ~30 метрик агента)
others.json
log.txt # полный stdout/stderr запуска
rl_model_snapshots/ # веса агента по шагам… See the full description on the dataset page: https://huggingface.co/datasets/danil-e/rlpinn-ablation-runs.severity_ablation_logicseverity_ablation_sciencerlpinn-ablation-buffers
RLPINN ablation replay buffers
Оффлайн-буферы транзишенов RL-агента (выбор оптимизаторов для обучения PINN)
для абляции DQN-стека (PER / soft-Watkins / trust-region) в PINNacle.
Транзишены экспортированы из Comet-проектов rlpinn-<pde>-tolerance
скриптом experiments/optimization_multi_pde/export_buffer_transitions.py
(ветка rlpinn_agent_ablation PINNacle). Поле solver_models вырезано —
буфер его не использует.
Доступные буферы
подпапка
экспериментов… See the full description on the dataset page: https://huggingface.co/datasets/danil-e/rlpinn-ablation-buffers.naylis_ablation_300Mablation_exploration_in_rl
Reinforcement Learning Improves Agentic Software Engineering
An ablation study of reinforcement-learning (RL) fine-tuning for agentic software-engineering (SWE) models. Starting from an 8B SFT model, we fine-tune with RL across ~20 configurations — varying the objective, loss normalization, sampling, and training dataset — and evaluate each on agentic SWE benchmarks.
Result
RL reliably and substantially improves agentic SWE performance, and the improvement is… See the full description on the dataset page: https://huggingface.co/datasets/penfever/ablation_exploration_in_rl.
