混合专家系统中的路由机制

现代大型语言模型多采用“混合专家”(Mixture of Experts, MoE)架构。在处理每个词元时,路由器并非激活全部参数,而是根据上下文挑选少数内部小型网络(即“专家”)进行处理。针对同一代码片段,不同的提问方式会引导模型通过不同的专家路径。

研究对比了模型在回答“恶意代码”、“道德困境”、“法律合规”、“安全漏洞”及中性控制问题时所采取的路径。结果显示,当被问及代码是否恶意时,模型主要沿“道德路径”运行,其相似度远超漏洞或法律问题。在整个代码处理过程中,模型持续维持这一路径;若强制路由器复用其他问题的专家选择,模型的最终答案将发生改变。这表明,模型在判断代码恶意性时,不仅是在分析编程逻辑,更在动用用于判断是非的道德机制进行权衡。

实验设计:一个问题,多种概念

研究测试了三个开源MoE模型:OLMoE以及DeepSeek-V2-Lite的通用版和编码版。针对240个代码样本(包含恶意/良性PyPI包,以及函数的脆弱版/修复版),研究者在代码前后插入不同性质的问题,以观察模型的路由选择和工作空间状态。

问题词汇涵盖“恶意”、“脆弱”、“道德”、“合法”、“有效”、“高效”以及作为噪声控制的“诗歌”和“早餐”。通过测量各层路由器对专家的评分及选中路径,研究定义了“道德路径”——即在道德问题上权重显著高于中性问题的专家集合。在DeepSeek-Coder-V2-Lite的1664个专家槽位中,有217个被认定属于此路径。

恶意判断与道德路径的高度重合

通过同义词单位衡量问题路线间的距离,研究发现路由器将道德、安全和正确性词汇归为一类,而将无关话题置于远处。在所有测试模型中,“恶意”问题的路由路径与“道德”路径的距离最近。

两种测量方法证实了这一结论:首先,恶意问题加载道德路径上专家的强度是正确性问题的数倍,略高于脆弱性问题,且明显高于合法性问题;其次,从整体路线距离来看,恶意问题的路径始终最接近道德路径。这种区分贯穿代码处理的整个过程,恶意问题的路由与脆弱性和道德问题保持1.2至1.5个同义词单位的距离,而与其他问题保持更远距离。

值得注意的是,模型对无关问题的反应各异。例如,聊天模型和OLMoE通常否认代码是“诗歌”,而编码模型却倾向于肯定,甚至有时认为代码是“早餐”。这暗示通用模型与编码模型在代码审美上的差异,可能大于其在道德评估上的差异。

工作空间内容与路由的分离

路由记录仅显示咨询了哪些专家,而非具体内容。为读取模型工作记忆,研究使用J-lens解码残差流。结果显示,当问题包含“道德”一词时,道德相关概念(如伦理、荣誉)在通用DeepSeek模型中出现概率为49%,在编码模型中为89%。而当问题为“恶意”时,道德概念在通用模型中降至1%,在编码模型中为7%,此时工作空间中主要出现的是“攻击者”、“攻击”和“恶意软件”等词汇。

进一步测试表明,引导路由器的信息并不位于透镜可读的工作空间部分。移除工作空间中透镜可读的部分,仍保留了0.94的依赖问题的路由分离度;而移除相同大小的随机子空间时,该数值仅为0.43至0.50。这意味着,路由决策与工作空间中的显式概念表征是分离的。

交换路由改变模型判断

研究通过“反向测试”验证因果关系:保持残差流不变,仅强制路由器在每一层选择其他问题(如脆弱性、道德、合法性等)所选的专家和权重。结果显示,安装其他问题的路由会显著改变模型对“代码是否恶意”的回答。

  • OLMoE:在脆弱性路由下,模型判定代码为恶意的概率上升10至28倍,且所有样本均向捐赠者(脆弱性问题)的答案方向移动。
  • DeepSeek Chat:在道德路由下,通用模型判定恶意的概率下降3至7倍;而在“餐点”路由下,结果出现分裂。
  • DeepSeek Coder:合法性和有效性路由使判定概率提高约四倍,但恶意样本因起始概率极高(0.98)而保持不变。

关键发现是,虽然答案发生了移动,但捐赠者问题的具体答案和概念并未转移到模型中。例如,在餐点路由下,餐点词汇极少进入工作空间透镜。此外,只有道德路由能在两个DeepSeek模型上锐化恶意与良性代码的分离度。这证明路由器并非被动读取决策,而是主动参与构建判断框架。

模型修剪对判断力的影响

研究还考察了模型修剪对道德路径和判断力的影响。针对Qwen3-Coder-30B的REAP修剪和GPT-OSS-20B的四专家修剪显示了不同结果:

  • Qwen3-Coder-30B:REAP修剪移除了部分道德路径专家,但在同等条件下,路径专家被丢弃的概率是其他专家的1.5至1.8倍。尽管路径受损,模型对恶意与良性包的区分度依然完美,仅对未修复脆弱代码的信心减弱。
  • GPT-OSS-20B:更严厉的修剪保留了部分路径单元,但流失了73%的路径额外路由权重。结果是模型丧失了对恶意代码的判断力,AUROC从1.00降至0.71,对恶意和良性包均倾向于回答“否”。

这表明,道德路径是路由器咨询的对象,而非存储判断的唯一地点。某些修剪保留了路径但失去了判断力,另一些则去除了路径专家却保留了判断能力,揭示了路由机制与最终判决之间的复杂关系。

结论:模型确实在使用道德机制

综合全深度路由移植、工作空间解码及修剪实验的结果,研究得出明确结论:当这些模型被问及代码是否恶意时,它们确实在使用道德机制进行评估。模型招募了一条与道德相关的路径,并在整个处理过程中保持加载。强制改变路由会改变答案,而工作空间仅持有问题命名的具体词汇,而非抽象的道德概念。这一发现揭示了AI安全对齐中潜在的机制黑箱,即模型可能通过隐式的道德路由来处理恶意内容检测任务。