livenerf 是一个旨在检测前沿大模型在发布后是否出现性能“悄悄变差”的长期运行基准测试项目。该项目通过构建尽可能确定性的测试环境,回答模型在交付后是否因量化、模型替换、算力投入降低或路由策略改变而导致性能下降的问题。

背景与目标

长期以来,关于 Anthropic 在模型发布后数天或数周内“削弱”性能的报道屡见不鲜。由于缺乏干净的“第0天”基线作为对比,此类争论往往陷入主观猜测。随着 Claude Opus 5.5 于 2026 年 9 月 22 日发布,livenerf 借此机会启动,从发布当天开始计时并持续运行。该项目基于英国 AI 安全研究所的开源评估框架 Inspect 构建,统计方法遵循 Anthropic《为评估添加误差棒》一文,确保方法论的严谨性。

工作原理与技术架构

由于无法完全消除大模型采样的随机性,livenerf 通过冻结其他变量来确保测试的确定性:

  • 确定性环境:使用固定的提示词、命令行界面(CLI)、精确的评分器,并永久保存原始日志。当前 v0 版本基于 Claude Max 订阅,通过无头 Claude Code(claude -p)运行,无需 API 密钥。
  • 信息最大化选题:剔除模型始终答对或始终答错的题目,仅保留模型“偶尔答对”的高信息量题目(来自 GPQA Diamond、MMLU-Pro、竞赛数学和 AIME 2025–26)。最终面板包含 78 道题目,每道题采样 4 次进行筛选。
  • 双臂对照机制:主要面板监测 Opus 5.5,控制臂每天运行旧版 Opus 5。若两者同时波动,则判定为测试 harness 或平台变化,而非模型本身退化。
  • 预注册与统计:采用逐项配对差异分析,带有聚类标准误。基线为前 10 天,后续分为两个 10 天窗口期。只有当 99% 置信区间在两个连续窗口期内均排除零,且效应至少为 3 分,同时控制臂未显示相同移动时,才判定为显著变化。

当前进展与初步数据

截至 2026 年 9 月 29 日,测试已进入第 6 天(基线期共 10 天)。所有 6 天均在相同的 harness hash 和固定 CLI 版本下完整运行了 90 个样本,无一遗漏。初步验证显示:

  • 选择偏差校正:入选面板的题目在新样本中的通过率从 54.7% 上升至 62.0%,功效计算已据此调整。
  • 可检测范围:每个 10 天窗口期可检测到约 7.5 分的准确率变化。
  • 验证结果:工具成功检测到已知退化场景:低投入力度导致输出 token 减少 62%,准确率下降 8.3 ± 4.5 分;中等投入力度导致 token 减少 26%,准确率下降 4.2 ± 3.9 分。
  • 局限性:在现有样本量下,工具尚无法在 99% 置信度下区分 Opus 5 与 Opus 5.5 的细微差异(-3.8 ± 6.3 分)。

部署与使用

livenerf 支持 Linux、macOS 和 Windows 环境,要求 Python 3.11+ 及 uv 包管理器。为防止 Claude Code 自动更新导致测试环境不一致,项目强制固定 CLI 版本,并建议用户备份固定版本的二进制文件。测试运行受预算保护,当每周或 5 小时用量计量表达到阈值时会自动跳过并重试,避免影响用户正常使用。

项目强调透明度与可复现性:所有原始结果为 Inspect 原生日志,仅追加不可修改;评分器为纯函数,不依赖 LLM 裁判;数据集文件包含唯一 CANARY GUID 以防止数据泄露。livenerf 明确声明其为独立项目,与 Anthropic 无关,旨在用数据回应社区关于模型性能波动的疑虑。