论文 / 论文
基于神经元激活的无标注自蒸馏数据选择框架
论文针对大语言模型在后训练阶段难以获取人工标注的问题,提出 Neuron-OPSD 框架。该方法利用模型内部神经元激活信号来筛选训练数据并构造教师上下文,通过在线策略蒸馏从教师分布中学习,全程无需真实标签。实验显示,在专业领域基准上,Neuron-OPSD 提升了域内任务表现,同时保持跨域泛化能力,并缓解了此前无标注方案出现的校准崩溃问题。该工作与依赖历史奖励轨迹的离线强化学习方法有本质区别。
大语言模型的后训练通常依赖真实交互反馈或人工标注数据,但在医疗、法律等垂直领域,专家标注成本极高,难以大规模获取。如何在缺乏外部监督的条件下提升模型能力,成为近期研究关注的重要方向。
此前已有无标注自演化方法尝试用模型自身输出作为监督信号,通过多数投票聚合多次采样结果生成伪标签。然而,基于监督微调和 GRPO 的方案在跨域任务上出现性能退化,而基于奖励的在线策略强化学习则导致校准误差显著上升。
论文提出的 Neuron-OPSD 是一种以数据为中心的自蒸馏框架,核心在于利用模型内部神经元激活模式同时指导训练样本的筛选和教师上下文的构造。模型最终通过在线策略蒸馏从教师分布中学习,整个流程不涉及任何真实标签。
在多个专业领域基准测试中,Neuron-OPSD 不仅提升了域内任务表现,还在跨域泛化上保持稳定,并有效抑制了此前无标注基线方法常见的校准崩溃现象。
该框架特别适用于在线交互或外部监督成本高昂甚至不可行的部署场景,其思路与依赖历史奖励轨迹的离线强化学习方法存在根本差异,更强调在无标签环境下从模型自身结构信号中挖掘监督信息。
要点
- Neuron-OPSD 是面向无标注场景的在线策略自蒸馏框架,全程无需真实标签即可完成训练
- 利用神经元激活信号驱动数据筛选与教师上下文构造,是其区别于多数投票方案的关键设计
- 在专业领域基准上兼顾域内精度与跨域泛化,缓解了此前方案的校准崩溃
- 适用于在线反馈或专家标注不可得的高成本部署环境
- 与依赖历史奖励的离线强化学习在范式上有本质区别
原始标题:Neuron-Aware Data Selection for Annotation-Free LLM Self-Distillation
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。