Manuscript Review · 2026-08-20

SAPA:金属氧化物气体传感器阵列长期漂移补偿 —— 同行评审反馈报告

评审对象:Source-anchored prototype adaptation (SAPA): Recalibration-free compensation for long-term drift of metal-oxide gas sensor arrays(正文 manuscript-mini-revised.docx 与补充材料 supplementary-max-revised.docx)。

基准:UCI Gas Sensor Array Drift(36 个月 / 10 批次) 附加:Twin Gas 跨设备迁移 主结果:平均准确率 79.45%
评审结论:有实质贡献,建议 大修(Major Revision) 后再投
01

核心结论

SUMMARY

论文提出以源批次锚定的类原型 + 跨历史无标签批次的逐步自训练来补偿 MOX 传感器阵列的长期漂移, 物理动机清晰(漂移作用于读出环节而非气体化学本身),主协议时间因果性设计严谨, 补充材料的可复现性细节明显高于同类论文平均水平。

最有说服力的证据不是 1.44 个点的总体平均提升,而是在仅使用历史批次的约束下, 远端批次 B8–B10 平均 74.96% vs SAD-CNN 67.60%(+7.4 点)的差距, 以及同一流水线内受控消融所揭示的机理一致性(方向旋转测量 + 类别级混淆模式)。 当前的软肋集中在:缺乏多随机种子的统计报告、单一准确率指标掩盖类别失效、 次要协议存在目标数据泄露、以及若干超出证据强度的物理与"免维护"表述

+7.4
远端批次 B8–B10 平均领先(百分点)
74.96% vs 67.60%(SAD-CNN),优势集中在漂移最深的批次
+1.44
总体平均领先(百分点)
79.45% vs 78.01% —— 无重复实验误差棒,统计显著性未知
−20.3
冻结编码器消融(最大降幅)
79.45% → 59.15%,证实跨批次适应是性能主因
≈0%
乙烯(g4)伪标签教师准确率
源批次仅 30 个样本,链式教师全阶段失效 —— 需类别均衡指标揭示
02

关键结果速览

KEY RESULTS

Setting 1 各方法总体平均准确率(B1 → Bk,UCI 36 个月漂移)

数值取自论文 Table 1。注意各方法目标数据使用协议并不一致(见主要问题 3)。
SAPA(本文)
79.45
SAD-CNN
78.01
DRCA
77.63
LDSP
76.31
M²FL-CCC
73.52
TDACNN
72.22
BDA
68.92
JDA
65.94
SVM-RBF(源归一化)
39.02
本文方法基线方法

远端批次 B8–B10 逐批次对比:SAPA vs 最强基线 SAD-CNN

SAPA 不使用当前批次;SAD-CNN 在训练与自训练中均使用当前批次。此对比对 SAPA 不利但仍占优。
B8 · SAPA
82.99
B8 · SAD-CNN
76.11
B9 · SAPA
81.74
B9 · SAD-CNN
68.44
B10 · SAPA
60.15
B10 · SAD-CNN
58.24

受控消融(Setting 1,同一前端 / 教师 / 优化器,仅改一个部件)

Table S7。降幅最大的两项:冻结编码器(−20.3)与全流水线去掉几何视图(−16.1)。
配置平均准确率相对完整模型
完整模型(SAPA)79.45
对抗对齐替换原型投影76.86−2.6
浓度坐标打乱(容量匹配控制)76.32−3.1
去掉增益不变指纹76.23−3.2
关闭 SAM(普通 Adam)76.04−3.4
单步自对齐(去掉逐步链)72.63−6.8
线性 softmax 头替换原型匹配70.83−8.6
几何视图全部替换为原始副本63.34−16.1
冻结编码器(无适应基线)59.15−20.3
03

主要问题(按优先级)

MAJOR CONCERNS
1

核心结果缺少不确定性估计致命

证据:SAPA 仅领先 SAD-CNN 1.44 点(总体平均),领先受控对抗替换仅 2.6 点。 模型包含随机初始化、伪标签与 SAM,全文只报告单次点估计,无任何种子重复、标准差或置信区间。

修订建议:对 SAPA 与全部自实现消融至少跑 5 个种子,报告均值 ± 标准差及差值置信区间; 用按批次分层的配对 bootstrap 计算差异显著性(不可将 13,910 个样本视为独立观测)。
2

单一准确率指标掩盖类别级失效致命

证据:类别与批次极不平衡 —— B1 中乙烯仅 30 个样本,B3–B5 完全没有甲苯, 而 B10 是 3,600 个均衡样本。样本级准确率会掩盖整类失效:论文自己承认两种配置下乙烯几乎全部被误判为乙醇, g4 教师准确率全阶段接近 0%。

修订建议:补充每批次的宏平均 F1 / 平衡准确率、逐类召回率与混淆矩阵; 远端批次结果同时给出批次等权平均与类别平衡平均两个口径。
3

Table 1 混合了不可比的目标数据协议重大

证据:同一张表并列纯源方法、使用当前目标批次的半监督方法与 SAPA 的历史批次协议, 且 JDA/BDA/DRCA/LDSP/SAD-CNN 等数值直接引自原文献而非同一流水线复现。 "在比较方法中平均最高"的表述容易引发不公平比较质疑。

修订建议:把受控消融升级为可信的主比较 —— 在同一前端、同一训练预算、同一时间信息下复现 源分类器、普通原型分类器、单步自训练、逐步自训练 + softmax 头、逐步对抗对齐与 SAPA 共 6 条臂; 表格按协议分组的现有做法保留,但声明中避免绝对排名措辞。
4

次要协议(相邻批次 / Twin Gas)存在目标泄露重大

证据:论文明确披露这两个设置的部分超参数是参照聚合目标准确率选择的(§4.1 与 S10.1)。 这构成测试集泄露,相关数字无法支撑无偏比较结论 —— 包括摘要中的 Twin Gas 96.67%。

修订建议:用纯源验证或留一设备/任务交叉验证重跑这两个设置; 若无法重跑,明确标记为探索性结果,并从摘要中移除 Twin Gas 数字。 披露本身值得肯定,但主文不应把带限定条件的结果作为贡献点宣传。
5

"免重标定"表述夸大了运维收益重大

证据:方法确实省去新标签,但仍需存储无标签历史、假设窗口含目标气体暴露、 并且每观测一个新批次就要离线重训一次前缀模型(结论节已承认)。 "部署仅需一次前向传播"对当前批次成立,却掩盖了面向下一批次的周期性再训练成本。

修订建议:将定位改为"无需重复带标签重标定"(label-free historical adaptation), 并明确区分推理时成本、批次间重训、批次构造与数据存储四类运维负担。
6

物理模型的因果表述超出可证范围重大

证据:"老化作用于读出环节而非气体化学"难以捍卫 —— 催化中毒与薄膜老化本身改变表面反应路径与选择性。 把这些全部归入残差项 Δy,t,使式 (1) 成为有用的现象学分解,但并不能证明 αyyl 是物理不变量。

修订建议:将式 (1) 重新定位为"在两条受控单气体数据集上得到支持的工作近似", 避免暗示仅凭观测数据即可唯一辨识物理机制。中毒主导场景已被正确排除在适用范围外,保持这一克制并推广到全节。
7

可分离性诊断 ≠ 不变量可迁移性重大

证据:最低匹配浓度 AUC ≥ 0.78 的计算使用目标批次内、用目标标签估计的判别方向(S2)。 它证明目标数据中存在判别信息,但不证明从 B1 学到的源不变量能够恢复该信息。

修订建议:明确区分两者;更强有力的诊断是将所有 B1 秩/形状判别子逐一迁移到各远端批次, 给出完整的逐气体对 AUC 矩阵与置信区间(甲苯–氨单对结果 0.03 vs 1.00 已指明方向,需系统化)。
8

历史链的鲁棒性未经压力测试重大

证据:算法依赖批次边界、历史批次的类别覆盖、0.8 置信阈值与保留历史长度, 但 g4 伪标签准确率全链接近 0%,"有效窗口必须包含目标气体暴露"只是假设而未验证敏感性。

修订建议:增加敏感性实验:伪标签阈值扫描、滑动窗口长度、历史窗口缺类、 批次边界错位/合并、历史截断、伪标签类别均衡采样。
04

呈现与可复现性问题

PRESENTATION
a

正文所有图片占位符为空次要 · 但影响评阅

manuscript-mini-revised.docx 中仅有 "Insert Fig. 1 here" 至 "Insert Fig. 6 here" 的文字占位, 文档内未嵌入任何图像(Fig. 1 机理示意、Fig. 3 结果汇总、Fig. 4 方向旋转、Fig. 5 混淆对比、Fig. 6 潜空间可视化均不可见), 补充材料仅含 Fig. S1/S2 两张。评审无法核对视觉证据。

修订建议:提交前必须补齐全部 6 张主图;Fig. 4 的旋转角度务必按 §5.1 承诺附上 95% bootstrap 置信区间。
b

可复现性资产不完整次要

Data availability 仅指向公开数据集;无代码可用性声明、环境/依赖版本、确切随机种子、源集划分定义, 以及生成各表各图的脚本。S3 的配置细节很好,但没有代码,"完整可复现"不成立。

修订建议:增加 Code availability 段(GitHub 或匿名仓库),列出种子、源集 hold-out 划分与复现命令。
c

文字与格式缺陷次要

① 第二作者单位混入了指向 Google Books 的超链接(编辑事故);
② 补充材料存在残句与乱码:"Relative to the softmax-only configuration" 后句子中断(S11)、 "At B9angles" 缺空格(S12.1)、"When selectivity αysource batch is acquired…" 整句损坏(S12.4);
③ 引言对分布对齐局限的论述重复多遍,压缩后新颖性会更清晰;
④ 参考文献 [24] 标题原文 "feature leaning" 疑为 "learning"(需核对该刊勘误)。

修订建议:投稿前做一次全文校对;引言中分布对齐批判合并为一段,把节省的篇幅给协议差异说明。
05

修订路线图

REVISION PLAN
P0 · 必做

统计可信度(约 1–2 天 GPU)

  • SAPA + 全部自实现消融 × 5 种子,报告均值 ± 标准差
  • 批次分层配对 bootstrap,给出差值的 95% CI 与显著性
  • 每批次补充宏 F1 / 平衡准确率与逐类召回
P1 · 强烈建议

比较公平性与泄露修复

  • 同流水线 6 臂受控对比取代跨协议排名声明
  • Twin Gas / 相邻批次改用源侧验证重跑,或降级为探索性结果并从摘要撤下 96.67%
  • B1 判别子迁移到全部远端批次的逐气体对 AUC 矩阵
P2 · 建议

鲁棒性与表述校准

  • 历史链敏感性:阈值 / 窗口长度 / 缺类 / 边界错位
  • "免重标定"改为"免带标签重标定",区分四类运维成本
  • 式 (1) 降级为工作近似,补全部主图、代码可用性与全文校对
06

值得保留的论文优势

STRENGTHS
时间因果协议严谨:预测 Bt 时训练只含 B1…Bt−1, 目标批次预测完成后才进入历史,每个表列对应一个时间合法的前缀模型。这是该领域常被忽视的要点。
物理动机可检验:把漂移分解为共模增益项与气体相关残差项, 并用有效秩、径向/切向位移占比等可测量量支撑,而非仅作叙事装饰。
消融设计有判断力:容量匹配的浓度打乱控制能干净地把浓度坐标的作用 定位到响应形状相近的气体(甲苯 −21.4 点、丙酮 −6.2 点),优于简单的"删掉模块看掉点"。
机理叙事自洽:判别方向旋转测量(甲苯 B1→B9 转 94° 发生符号翻转)、 类别级混淆模式与潜空间可视化三条证据相互印证,解释了为什么分布对齐在深漂移批次失效。
局限性写得诚实:明确排除中毒主导环境、混合气体、变湿度与开集条件, 承认乙烯源样本稀缺是硬约束,承认方法移除的是重复标定而非全部维护。
补充材料密度高:S2 的直接测量定义、S3 完整配置、S4 逐批次教师质量、 S8 算法伪码与损失定义 —— 审稿人需要的大部分细节都能找到。