miletcxl/looplm
LoopLM:大模型内生安全增强系统 1. 为什么需要做这套系统 本地大模型部署后通常是静态的,而真实用户的提问与场景持续变化。模型在使用过程中会暴露新的错误与幻觉,但这些问题往往不会被自动记录或修复。久而久之,模型只能“越来越差”,缺少自我升级的机制。 因此,我们需要一套系统,让本地大模型在部署之后具备持续纠错、理解真实使用场景、并逐步改善自身表现的能力。 2. 系统整体做的事情 实时监测模型输出中的错误与幻觉包括逐步推理过程、中间步骤、多模态理解等。 自动记录错误样本,形成结构化数据将问题样本与模型输出整理成可追踪的训练数据。 自动清洗、筛选样本,构建持续增长的安全数据集形成可用于训练的高质量样本池。 使用数据对安全模块进行轻量微调主模型参数保持冻结,仅更新 probe 或 LoRA adapter 等小模块。 最终形成自进化闭环:模型使用 → 发现错误 → 记录样本 → 训练安全模块 → 模型持续优化。 3. 技术创新点… See the full description on the dataset page: https://huggingface.co/datasets/miletcxl/looplm.
LoopLM:大模型内生安全增强系统
1. 为什么需要做这套系统
本地大模型部署后通常是静态的,而真实用户的提问与场景持续变化。模型在使用过程中会暴露新的错误与幻觉,但这些问题往往不会被自动记录或修复。久而久之,模型只能“越来越差”,缺少自我升级的机制。
因此,我们需要一套系统,让本地大模型在部署之后具备持续纠错、理解真实使用场景、并逐步改善自身表现的能力。
2. 系统整体做的事情
- 实时监测模型输出中的错误与幻觉 包括逐步推理过程、中间步骤、多模态理解等。
- 自动记录错误样本,形成结构化数据 将问题样本与模型输出整理成可追踪的训练数据。
- 自动清洗、筛选样本,构建持续增长的安全数据集 形成可用于训练的高质量样本池。
- 使用数据对安全模块进行轻量微调 主模型参数保持冻结,仅更新 probe 或 LoRA adapter 等小模块。
最终形成自进化闭环: 模型使用 → 发现错误 → 记录样本 → 训练安全模块 → 模型持续优化。
3. 技术创新点
- 流式错误检测(step-level / token-level) 在生成过程中实时发现不稳定点,而非等输出完成后再判定。
- 使用模型内部信号进行判断 结合 hidden states、一致性与扰动稳定性等信号,不依赖外部知识库。
- 多模态推理稳定性监测 图文混合输入下检测视觉-文本不一致与误解。
- 自动化数据生成机制 将真实使用场景中暴露的错误直接转化为可训练样本。
- 轻量可更新的安全模块 无需重训主模型,仅更新小型模块,成本低、迭代快。
- 持续自进化闭环 形成“用得越久越稳”的特性,实现本地模型生命周期管理。
4. 数据说明
本仓库包含以下数据文件:
causal_judgement_results.json:原始推理结果与模型输出causal_judgement_results_tagged.jsonl:包含细粒度逻辑评估与纠错字段的样本(JSONL)
字段示例(JSONL 单条):
{
"id": 0,
"question": "...",
"ground_truth": "No",
"model_cot": "...",
"model_answer": "Yes",
"is_correct": false,
"is_perfect": false,
"error_category": "Logic Leap",
"critique": "...",
"refined_cot": "...",
"refined_answer": "No"
}5. 使用场景
该数据集可用于:
- 训练或微调安全模块(probe / LoRA)
- 构建逻辑错误检测器
- 基于错误样本的自监督纠错训练
