← Back to Paper

Version History

预测编码网络在语言建模中的样本效率、机制不可达性与测量纪律:一项单卡架构研究

Version 6 (Latest)
September 21, 2026 08:50
预测编码网络在语言建模中的样本效率、机制不可达性与测量纪律:一项单卡架构研究
我们报告预测编码网络(PCN)与 Transformer 在语言建模上的一项系统性单卡研究,以及由两者构成的混合架构。本版(v6.0)以混合架构为第一叙事,核心发现六项: 规模-数据比规律:误差流变体(no_gating)相对 Transformer 的优势随 tokens/parameter 比下降呈倒 U 形——峰值 ≈1000(难域 WikiText-103 上 +60.8%),数据充裕后被反超(-64.9%),并有一次成功的带外预测。101M 对称调优终判:纯 PCN 预训练输给调优 TF 33.7%——失败机制经 bf16 对照锁定为优化动力学内禀失稳(快速学习区间与自毁区间重合),构成纯 PCN 的规模天花板。 混合架构(12TF+12PCN,96M):预训练 PPL 63.18 ± 0.22,以更少参数反超纯 Transformer 36%(配对 …
Version Notes: 新增主线:混合架构(TF 骨干 + PCN 误差流头)——以更少参数反超纯 Transformer 36%(96M,3-seed,p≈0),优势经 330-354M 外推保持(3/3 逐 seed 全胜,调优口径 +11.2%),适应侧完成诚实重述(零配置自限鲁棒性);两个机制假设(主干锚定、step50 回落成因)经消融/分解转正;第 7 起系统性测量偏差(适应方法选择)由预注册判据捕获并触发主张修正。
✓ Reviewed Latest Version
Version 5
September 16, 2026 10:19
预测编码网络在语言建模中的样本效率、机制不可达性与测量纪律:一项单卡架构研究
我们报告预测编码网络(Predictive Coding Network, PCN)在语言建模上的一项系统性单卡研究,得到六个主要发现。第一,二维不对称规律:误差流变体的优势沿减数据轴单调上升至 +84%,沿加参数轴呈倒 U 形峰值 +60.8%(≈1000 tokens/parameter)。第二,组合性质与对称不可达性:PCN 的复制能力经 13 个变体和 2×2×2 全因子双向对照证明不可分解为任何单子件;微调权重约束(ΔW ≈ TF/2)呈现同一模式,构成第二涌现性质。第三,局部学习规则边界:Whittington-Bogacz 式规则在 MLP 上等价但在 PCN 上差距 2.4-3.7×。第四,五次测量偏差被预设程序捕获并提炼为方法学条款。第五,终端适应边界:跨域冷启动成立(+58.5%),域内无空间,遗忘权衡揭示权重约束=参数经济性。第六(v4 新增),稀疏激活与冷启动完全兼容:25% Top-K 稀疏使 PPL 改善 14.4%且冷启动能力完整保留(+57.9% vs 稠密 …
Version Notes: v4:新增第六发现「稀疏激活与冷启动完全兼容」(四臂对照,修正域效应混杂);新增 CPU 端侧部署结果(8.6K tok/s / 冷启动 23s / 80MB / 全本地);新增安全框架(输入过滤/速率限制/审计回滚/所有者绑定);第五次测量偏差修正(LESSONS #10:checkpoint 域匹配);终端部署推荐更新为「稀疏 PCN 全能」。
✓ Reviewed
Version 4
September 12, 2026 14:28
预测编码网络在语言建模中的样本效率、机制不可达性与测量纪律:一项单卡架构研究
我们报告预测编码网络(Predictive Coding Network, PCN)在语言建模上的一项系统性单卡研究,得到五个主要发现。第一,规模-数据比规律:误差流变体相对 Transformer 的优势随 tokens/parameter 比下降呈倒 U 形,峰值 ≈1000(WikiText-103 上 +60.8%),数据充裕后被反超。第二,组合性质与对称不可达性:PCN 在小样本精确复制任务上的能力(5/5 vs 0/30)经 13 个变体双向对照证明不可分解为任何单子件;微调时的权重变化幅度约束(ΔW ≈ TF/2)呈现同一模式,构成第二个涌现性质。第三,局部学习规则的适用边界:Whittington-Bogacz 式局部规则在 MLP 上与反向传播完全等价,但在 PCN 结构上存在 2.4-3.7× 的结构性差距。第四,测量纪律:四次系统性测量偏差均被预设验证程序捕获并提炼为方法学条款。第五,终端适应的真实边界:误差流的适应优势属于跨域/冷启动(+58.5% vs 公平 TF …
Version Notes: v3(v2.2 内容):新增第五发现「终端适应的真实边界」——跨域冷启动适应成立(单发微调 +58.5% vs TF +5.4%),域内个性化否定(24 格校准网格双架构全负),遗忘权衡揭示权重约束重定性为参数经济性;新增权重约束=第二涌现性质(四假说双向排除);新增终端效率三问补完(能耗/CUDA Graph/int4 混合精度);新增 MQAR 否定性结果;测量纪律第四次实战(合成基准频率捷径)。
✓ Reviewed
Version 3
September 11, 2026 11:27
预测编码网络在语言建模中的样本效率、机制不可达性与测量纪律:一项单卡架构研究
我们报告预测编码网络(Predictive Coding Network, PCN)在语言建模上的一项系统性单卡研究,得到四个主要发现。第一,二维不对称规律:误差流变体相对 Transformer 的优势沿两条正交轴呈不同形态——减数据轴(固定模型、数据量递减)优势单调上升至 +84%;加参数轴(固定数据、参数递增)呈倒 U 形,峰值出现在约 1000 tokens/parameter(WikiText-103 上 +60.8%)。该规律对终端个性化场景(冻结中等模型+少量用户数据微调)具有直接部署指导意义。第二,组合性质:PCN 在小样本精确复制任务上的能力(15/15 对同规模 Transformer 的 0/30)经 13 个变体双向对照和 2×2×2 全因子设计(8 格全部成功),在我们检验的变体集与移植策略下被证明不可分解为任何单一组件。第三,局部学习规则的适用边界:Whittington-Bogacz 式局部规则在本研究的实现变体与测试条件下,于多层感知机上与反向传播完全等价,但在 PCN 结构上存在 2.4-3.7 倍的结构性差距。第四,测量纪律:四次系统性测量偏差(非因果泄露、基线超参次优、自建对照失效、评估双重移位)均被预设验证程序捕获,我们将其提炼为可复用的方法学条款。结果表明 PCN 是数据稀缺区间的优势架构;其能力为不可移植的组合性质。全部代码与数据已开源:github.com/Asaluther/PRISM-V4。
Version Notes: v2.1:开源仓库上线(github.com/Asaluther/PRISM-V4);「不可达性」措辞限定为检验范围内成立;W&B 局部规则结论限定为特定实现变体与测试条件;新增规模扩展计划(200-300M 目标,8 周)与部署建议条件限定(tokens/param ∈ [650, 1100])。
✓ Reviewed
Version 2
September 11, 2026 10:53
预测编码网络在语言建模中的样本效率、机制不可达性与测量纪律:一项单卡架构研究
我们报告预测编码网络(Predictive Coding Network, PCN)在语言建模上的一项系统性单卡研究,得到四个主要发现。第一,**二维不对称规律**:误差流变体相对 Transformer 的优势沿两条正交轴呈不同形态——减数据轴(固定模型、数据量递减)优势单调上升至 +84%;加参数轴(固定数据、参数递增)呈倒 U 形,峰值出现在约 1000 tokens/parameter(WikiText-103 上 +60.8%)。该规律对终端个性化场景(冻结中等模型+少量用户数据微调)具有直接部署指导意义。第二,组合性质与对称不可达性:PCN 在小样本精确复制任务上的能力(15/15 对同规模 Transformer 的 0/30)经 13 个变体双向对照和 2×2×2 全因子设计(8 格全部成功),被证明不可分解为任何单一组件——从标准 Transformer 块移植组件无法获得该能力。第三,局部学习规则的适用边界:Whittington-Bogacz 式局部规则在多层感知机上与反向传播完全等价,但在 PCN 结构上存在 2.4-3.7 倍的结构性差距。第四,测量纪律:四次系统性测量偏差(非因果泄露、基线超参次优、自建对照失效、评估双重移位)均被预设验证程序捕获,我们将其提炼为可复用的方法学条款。结果表明 …
Version Notes: v2:二维不对称规律修正(减数据轴单调至 +84%)、bootstrap 95% CI 全表、2×2×2 全因子设计补齐、效率反转(吞吐 16%→96%)、warmup 敏感性对照、术语表与审稿回应
✓ Reviewed
Version 1
September 10, 2026 23:01
预测编码网络在语言建模中的样本效率、机制不可达性与测量纪律:一项单卡架构研究
我们报告预测编码网络(Predictive Coding Network, PCN)在语言建模上的一项系统性单卡研究,得到四个主要发现。第一,规模-数据比规律:误差流变体相对 Transformer 的优势随 tokens/parameter 比下降呈倒 U 形,峰值出现在约 1000(WikiText-103 上 +60.8%),数据充裕后被反超;该规律成功预测了一个未测数据点。第二,组合性质与对称不可达性:PCN 在小样本精确复制任务上的能力(15/15 对同规模 Transformer 的 0/30)经 13 个变体双向对照,被证明不可分解为任何单一组件——从标准 Transformer 块移植组件无法获得该能力。第三,局部学习规则的适用边界:Whittington-Bogacz 式局部规则在多层感知机上与反向传播完全等价,但在 PCN 结构上存在 2.4-3.7 倍的结构性差距。第四,测量纪律:三次系统性测量偏差(非因果泄露、基线超参次优、自建对照失效)均被预设验证程序捕获,我们将其提炼为可复用的方法学条款。结果表明 PCN 是低数据/参数比区间的优势架构,恰好覆盖终端个性化场景;其能力是不可移植的组合性质。
✓ Reviewed