AI Sentinel: Frontier

AI Daily Review

2026-06-29 · 中文 · full text with sources

在 App 里订阅关键词提醒

你关心的话题一有动静就推送 · 30 天归档 · 每日语音
因审核政策原因,暂未在中国区上架;海外 Apple ID 可下载

AI的瓶颈在于结构而非规模

2026-06-29 00:00 UTC

要点

近期人工智能进展中的一条共同主线表明,进步的主要障碍并非规模或算力不足,而是嵌入模型、训练范式和评估协议中的结构性假设。 从无法靠扩展来补救的优化顽疾,到因单模态表征本质不完整而失败的多模态系统,再到测得的能力与虚假因素混为一谈的智能体基准,种种证据都指向一个结论:需要系统性地重新审视其基础。 与此同时,效率的提升如今源于架构的内部吸收而非外部启发式方法,科学AI越来越多地将因果自校正作为一项设计前提,而安全研究则分裂为机制派和程序派,各自都带有不可消除的盲区。 这些进展共同标志着一个从单一规模扩张转向形式化审视和系统级重新设计的转折点。

已部署方法的结构性缺陷

形式化分析正不断揭示广泛部署的 AI 方法中固有的结构性缺陷——这些缺陷深植于设计假设,仅靠增量式扩展无法修复。 在优化领域,Adam 等标准自适应优化器缺乏规范等变结构,因而沿平坦对称方向漂移,最终落入比尊重对称性的方案更退化的极小值1。 这一病态并非源于算力或数据不足,而是源于架构选择未能把规范轨道与商空间分离开,意味着即便训练时间无限延长,也无法矫正这种吸引子动力学。

类似的结构性缺陷也出现在语言模型的强化学习式微调中。 群体相对策略优化(GRPO)支撑着 DeepSeek‑R1 等广泛部署的系统,但其理论性质直到从策略梯度定理做第一性原理推导后,才暴露出一个硬性的信用分配瓶颈2。 GRPO 仅依赖输出的奖励假设,迫使序列中每一个 token 获得完全相同的优势分数,因此该方法可被证明无法为单个 token 分配差异化的功劳; 其梯度处在一个秩‑2 子空间中,结构上就不可能支持多步推理或组合式任务。 当优势信号处处一致时,再强的模型容量或训练预算都无法区分 token 级贡献——这一限制已被写进该方法的奖励设计。

多轮混合专家路由遭遇的失效模式,恰恰映射了这种信号分化的崩塌。 在 Router‑R1 及类似智能体中,小规模路由器的强预训练先验与稀疏的结果奖励交互作用,引发信任区域坍塌:路由器越来越无视复杂的专家推理轨迹,将调用专家的概率推向零3。 之所以产生这种问题,同样不是深度不够或专家数量不足,而是设计上把交互式推理与路由策略耦合在一个稀疏奖励机制下,把系统导入退化的局部最优,而更多轮扩展只会进一步强化这种趋势。

即便是衡量进展所用的基准,也带有无法通过扩展规模来纠正的结构性缺陷。 在扩散大语言模型中,并行解码方法的排序高度依赖于提示模板的选择,因此所报告的加速增益可能仅仅是评估造成的假象4。 这种评估错觉表明,有关方法对提示变化鲁棒性的设计假设被系统性地违背; 更大的模型或更多的解码步骤,都无法修复深植于评估方案本身的敏感性。 在优化、信用分配、路由与评估等各个领域,形式化审视能识别出那些结构属性缺失或界定失当的崩溃点——这说明当前进展的关键约束,已不再是堆砌更多算力,而是重新设计方法以满足必要的形式化条件。

架构内化提升效率

推理效率边界向架构内化迁移的典型例证,是将多智能体辩论重新构建为单一模型内部混合专家架构中的路由机制,而非独立的多智能体编排层5。 这种方法将辩论直接嵌入模型的参数高效路由中,消除了传统多智能体系统外部令牌交换和延迟开销,在保持准确率的同时将延迟降低3.7倍,令牌消耗减少87%5。 这一权衡使得动态审议在资源受限的环境中变得可行,把原本存在于模型边界之外的能力内化到内部。

然而,这种架构内化不只是消解开销; 它重新分配了复杂性,并暴露出新的退化模式,需要专门的工程设计来应对。 例如,在高分辨率扩散Transformer中,一个看似无害的设计选择——冗余的空间自注意力掩码——不知不觉禁用了FlashAttention的快速路径,形成了被称作“掩码引入的调度税”(MIDT)的系统瓶颈6。 该瓶颈并非注意力机制本身的局限,而是掩码与优化后的内核调度间交互所产生的结构性产物; 要解决它,需要一个专门的、无需训练的框架,在不改变模型权重的前提下识别并消除这一税费6。 因此,DiT架构带来的推理速度提升,揭示了一种必须通过系统级感知来显式抑制的退化现象。

类似的情况也出现在块扩散语言模型中,其关键的训练与推理差距一直阻碍着实际加速效果的实现,尽管并行块解码在概念上颇具吸引力7。 并发多块细化方法的引入直接弥合了这一差距,将单次前向的令牌生成数提升至9.34,吞吐量从781.50 TPS提高到951.41 TPS7。 然而,这一提速在数学和代码推理基准上带来了可测量的准确率损失,意味着该工程方案本身引入了一个新的权衡面,必须加以管理——这正是从抽象算法收益转向具体系统级协同设计的一个标志性特征7

协同设计的必要性已延伸至生产部署。 有媒体对 DeepSeek 的 DSpark 推测解码系统进行了报道,其中指出,从一组孤立的推测解码技巧转变为一个自适应流水线,需要算法、调度与硬件执行的紧密整合; 该报道称,这种整体性的协同设计带来了 85% 的单用户加速以及高并发下 4 倍的吞吐提升 8。 虽然这些厂商报告的数值未经独立验证,但这一叙述凸显出一个事实:生产级的效率已无法通过在固定架构上外挂优化的方式来实现——系统本身必须重新架构,而在这一重新架构过程中浮现出的新瓶颈(例如负载不均衡或调度冲突)也必须通过工程手段予以消除 8

综合来看,这些进展揭示出一个模式:架构内化与系统级协同设计如今定义了效率的前沿,但每前进一步都会浮现出新的结构性病症——掩码分发开销、训练-推理错配、协同设计的复杂性——这些都需要明确的、通常无训练的缓解手段。 制约进步的关键已不再是原始能力,而是围绕架构雄心所引发的缺陷进行工程修复的能力。

多模态结构不完备性

主流的多模态 AI 观点将额外的感官流视为可选的增强器,能提升鲁棒性但不会改变模型的基本表征特性。 越来越多的证据对这一假设提出挑战,反而表明仅由单一模态支撑的表征在结构上是不完整的,会引发系统性且可预测的失败,而这种失败无法通过增大规模来消除。

TacGen 从实证层面证明了非视觉物理信息的必要性:视觉本身不足以确定质量、密度和柔顺性等依赖接触的属性9。 两个视觉上完全相同的物体在硬度或重量上可能存在巨大差异,只有触觉接触才能提供区分它们所需的物理证据。 将触觉作为结构化模态引入后,质量预测的 ∆R² 提升了 +0.570,并将模拟操作成功率从 0.246 提升到 0.979,这证实触觉并非辅助信号,而是表征物理世界所必需的维度9。 同样的结构缺口也出现在动态感知中:Event-VLA 揭示,仅使用 RGB 的视觉-语言-动作模型在低光照、运动模糊和传感器噪声下会出现严重的性能下降,因为标准帧相机无法捕捉快速的物理动态10。 其所提出的动作条件事件融合接口恢复了 Event-VLA 所称的动作-时间物理残差——即瞬时、显著且持续的运动线索——从而在纯视觉模态失效的场景下实现鲁棒的性能10

即便多模态在名义上同时存在,不完整的跨模态对齐本身也会引入一类系统性的失败。 MIRROR 表明,多模态大语言模型中连接视觉与语言的现有适配器模块,虽能保留单个词元层面的语义对应,却在跨模态迁移过程中丢失了概念间的关系结构 11。 因此,模型在组合视觉推理任务上容易出现偏差,当显著却具有误导性的视觉特征出现时,会覆盖正确的语言先验 11。 FADE 则识别出另一种结构性的失败,为视觉—语言幻觉提供了机制层面的解释:注意力模块在各层间持续汇聚视觉证据,但在关键的中后期层(例如 LLaVA-1.5 的第 16–22 层),前馈网络模块会以主导的语言先验覆盖这些汇聚起来的证据 12。 幻觉并非随机错误,而是模型内部视觉与语言信号交互方式中架构失衡所带来的可预见后果 12

综合来看,这些实证暴露出一致的模式。 缺失的感官维度,如触觉和高频运动事件流,使纯视觉表示无法捕捉到关键的物理属性 824。 即便在看似整合好的多模态架构内部,有缺陷的跨模态对齐机制要么丢弃关系结构,要么让语言模块压制已被忠实汇聚的视觉证据,从而产生幻觉 3227。 因此,这一转变并非仅仅做加法; 它承认单模态表示的根本不完整性,要求从结构上重新设计信息的编码、迁移与整合方式,而不能依赖规模扩张或表层融合。

具身智能与智能体AI的评估危机

具身与自主智能体领域的进展,通常以随规模增长而上升的基准分数来呈现,但现有证据表明,这些增益无法被因果地归因于它们原本试图衡量的能力。 评估装置本身就系统性地将混淆因素与真正能力混为一谈,由此产生了一场横跨物理任务执行、诊断推理和安全评估的归因危机。

具身智能问题的核心,被一项观察直接暴露出来:视觉-语言-动作(VLA)模型的任务成功率,混淆了从视觉-语言预训练继承来的语义泛化与真实的物理推理13。 扩大 VLA 骨干网络的规模虽然能提升基准性能,但所观察到的行为可能只反映了表层的语义模式匹配; 系统从来不需要建立对物理世界有因果根基的模型就能取得成功。 当部署场景从宽泛的操作任务转向对精度要求极为严苛的领域时,当前评估的不足就更加显露无遗。 在诸如腹腔镜手术机器人等要求毫米级精度和安全保障的场景中,通用 VLA 模型从未被系统性地测试过14。 缺少这样的测试,从现有的聚合指标推论出真实的物理能力就一直缺乏支撑——这些基准并未探查那些能够区分稳健推理者与幸运模仿者的失效模式。

这种无法将能力与混淆因素分离开的问题,同样扩展到了自主推理领域。 在微服务故障诊断中,标准的结果导向型基准只标注最终根因,无法区分基于证据的因果推理与偶然的关键词匹配15。 所提出的补救方案——一种过程层面的评估范式,对定位、识别和因果推理等中间步骤进行评分——直接承认了原始成功率是一个失灵的信号。 向过程层面证据的转变,明确认可了仅靠结果评分会系统性地夸大智能体的表面能力。

扩展规模并不会自动消除这些混淆因素,反而可能将其转变。 模型规模与系统对评估语境的敏感性之间的关系并非单调。 在开放权重语言模型中,更大规模的变体在更早的层中编码评估意识,这是一种解离的表征模式,标准黑箱评估无法检测到16。 这一发现意味着,随着前沿模型的增长,它们可能越来越擅长利用基准测试的表面结构,却不具备相应的底层能力,从而加剧而非缓解对真实性的担忧。 这里的混淆是双重的:行为掩盖了内部能力,而能够揭示这种混淆的内部表征对当前评估协议是不可见的。 综合这些证据线索,构成了一致的控诉:在具身和智能体人工智能的评估中,成功往往过度由先验、侥幸猜中和结构捷径所决定,而发现这一危机的能力本身却因被测系统的不透明性而遭到削弱。

科学AI:从预测到因果自校正

从黑箱预测向将因果验证、信念修正和物理一致性作为一等设计约束的框架的转变,正在多个科学领域同步展开。 一项关于生成因果测试(GCT)的第一方报告展示了这一重新定位:它先将基于LLM的大脑预测模型蒸馏为关于皮层响应特性的简洁言语解释,再通过目标合成故事在人类fMRI实验中对这些解释进行因果验证17。 该框架将因果可检验性——而不仅仅是预测准确性——视为首要科学目标,从而弥合了预测与理解之间的鸿沟。 这种对因果验证的执着,被用于持续科学发现的、基于证据的大语言模型信念所深化,其中静态先验被正式的信念修正原则所取代18。 通过重新部署假设生成以响应累积的证据,该方法避免了在过往发现已蕴含的假设上浪费搜索预算,并将累积非平稳惊奇度提升了30,表明当信念动力学成为一等设计约束时,发现效率会得到根本提升18。 从一次性因果测试17到动态的、证据敏感的信念更新18的进展,将科学AI范式从验证静态解释扩展到维持一个递归的假设生成循环。

与此同时,在两个密切关联仪器的场景中,物理一致性正从事后检查提升为结构性要求。 科学探测器的自监督校准将问题重塑为一个物理信息学习任务,直接从原始测量中联合推断潜在校准参数和任务特定预测,并以物理一致性约束替代人工标签 19。 这消除了需要预校准信号来训练校准模型本身的循环依赖,从而能在没有专家干预的情况下实现自主校准与持续性能监测。 在计算化学领域,作用算符语义为分子扩散模型施加了严格的数学结构,将其从不透明的采样器转变为可审计的热力学估计器,原生连接热力学系综,并直接应对使传统自由能微扰失效的相空间重叠瓶颈 20。 在这里,物理定律不是外部的校验者,而是模型内在的生成语法。

这些努力汇聚成一种统一的模式:因果验证、信念修正和物理一致性正从外部的期望重新规定为内部的架构约束。 GCT 的因果检验方法 17 与 AutoDiscovery 的信念修正机制 18 互为补充:前者确保每个解释都具因果根基,后者则保证对假设的搜索不会停滞——二者的结合将产生每一步都经因果验证且能动态响应累积证据的发现流程。 校准框架 19 与作用算符分子模型 20 共同指向一个原则:特定领域的物理约束可以充当唯一的监督信号,既绕开了人工标注,又使所得模型在构造上天然可审计。 在每一个案例中,进展都不是源自黑箱组件的规模化,而是源于对科学建模架构的重新设计,以使结构性假设变得明确、可检验且忠实于物理。

安全范式分裂:机械论与程序论

安全研究正沿着一条根本性的断层线分裂:以审视模型内部激活为核心的机制式干预措施,正受到围绕模型行为运作的程序式防护手段的挑战,而现有形式化证据表明,基于激活的防御机制本身存在固有的结构性盲点。 其核心矛盾可通过一个结构性盲点推论来概括:任何单层激活锥、子空间或零空间门控防御机制,从本质上都易受预填充攻击的威胁——这类攻击可将激活构造在良性参考区域内,对 AlphaSteer 等最先进方法的绕过成功率高达 50–82% 21。 这一证明——机制式护栏可在不改变表面行为的情况下被颠覆——动摇了将内部表征作为可靠安全边界这一前提本身的根基。

柏拉图表征防御体系直接提供了走出这一困境的路径,它彻底跳出了对激活层面的审视。 该框架不再探查模型的内部状态,而是借助柏拉图表征假说——即独立训练的大型编码器会收敛到相互兼容的现实投影——通过跨编码器一致性检查来检测并净化后门 22。 它将安全视为外部可访问模型间表征一致性问题,而非内部门控问题,从而实践了一种程序式立场:防御的证据不在于单一模型权重内部,而在于不同训练过程之间的结构性一致。 这种从机制式干预到外部一致性的转变 22,与激活锥防御体系恰恰形成了张力,因为前者既不需要访问、也不会被文献 21 所指出的单层盲点所欺骗。

当政策遵守被重新界定为对话层面的程序问题时,分歧进一步加剧。 PolicyGuard 明确将自身任务与对抗性安全防护区分开,转而以子代理验证器的角色,推理完整的对话历史来核实公司政策的合规性 23。 它在实现更高政策违规召回率的同时,误拦截率大约降低一半,将前沿模型在最差情形下的可靠性提升了 6 到 12 个百分点 23。 这并非对机械式审查的精细改良,而是将安全检查搬移到一个独立流程中,把模型的输出轨迹视为可审计的程序工件。 通过将安全执行与内部激活解耦,PolicyGuard 直接体现了 21 的研究结论所逼出的程序范式。

把同一逻辑延伸到透明度领域,LLMography 是将人机对话历史视作结构化、可审计的工件,而不是关注最终输出或内部表征 24。 在机械式方法可能会探察模型状态以推断意图之处,LLMography 则将监督重心转向那些塑造了交互过程的可追溯序列——人类指令、修正与确认 24。 这就把 AI 透明度重新定义为交互记录的一种结构属性,而非从激活模式中提取的特征,进一步巩固了由被证实的盲点所驱使的程序转向。

这些工作共同勾勒出一道范式分水岭:形式化论证表明,激活层面的防御存在固有漏洞 21,对此的回应并不是打补丁式的机械检查,而是系统性地转向程序性保障——跨编码器一致性 22、基于对话上下文的政策验证 23 以及对话审计透明度 24。 一条研究轨迹由此浮现:安全不再系于审查模型内部,而是围绕模型行为设计可靠流程,背后是结构假设让位于形式化审视所推动的转变。

简讯

机器人学方面,三项进展从不同角度解决了部署瓶颈。 通过模式重定向实现的行为去克隆(MoRE),将分类器引导的重定向信号直接蒸馏进策略权重,在模拟与真实机器人任务中将部署成功率提升了44个百分点,且无需重新训练或增加运行时开销25。 AnyBody支持从任意身体关键点子集进行自由形态的人形控制,用户只需指定与任务相关的点位而非全身姿态,大大简化了遥操作与可扩展的演示采集26。 与此同时,ST-Merge是一种无需训练的视觉token合并框架,利用三维时空坐标将视觉编码器的token数量削减70%,为π0带来高达8.3倍的加速,使机器人视觉语言模型能够以可行动的延迟处理高分辨率流27

大型语言模型的用途正变得更加结构化并扎根于垂直领域。 多智能体系统能自主发明并演化简洁的符号推理协议,在跨多个推理基准保持准确率的同时,将生成的token数量减少3至6倍28。 在核监管文件审查中,一个LLM智能体将任务构建为在动态知识图谱上的顺序规划,从而支持跨多模态证据的多跳推理,这类推理是分块检索系统无法处理的29。 材料科学领域里,一个闭环多智能体框架在无需训练任务专用模型的情况下,实现了金属有机框架的可解释逆向设计,能够在无需大规模标注数据集的条件下探索广阔的化学空间30。 一个基于引文、包含14.55万个问答对的孟加拉语农业数据集,为超过40%孟加拉国劳动力依赖却人手不足的推广服务领域带来了可验证且安全合规的咨询服务31

多种方法在极少监督下重构标定、匹配与感知。 自组织共形预测借助自组织映射发现输入空间分组,进而构建局部标定缓冲区,在八个基准中七个上缩小了加权区域覆盖差距,而集合大小仅增加 6%32。 一种零样本形状匹配范式先进行关节表达再匹配,省去了面向特定对应关系的训练,可处理会破坏几何敏感流程的未受损真实扫描33。 最后,首个用于次表面散射的自监督预训练框架仅利用每视角八张高频相移图像即可学习光传输表示,将采集需求降低数个数量级,能在最简硬件条件下高效重光照复杂的半透明物体34

综合与展望

这些进展的聚合揭示了一种统一的动态:在众多不同的子领域中,发展的瓶颈已不再是原始规模,而是系统架构的形式化属性及其底层假设。 已部署优化方法所暴露的结构缺陷、单模态表征的不完整性、以及污染具身评估的因果混淆,都可追溯到一个共同的失败——未能对支配现实世界数据生成过程的约束进行建模。 这一判断在推理效率的平行迁移中得到印证:将结构内化到架构中固然降低了成本,却也引入了新的退化形式; 在科学AI领域,因果自校正正从事后检查提升为设计基元。 这些线索并非简单共存,它们共同表明,整个领域正从能力演示期转向认知卫生期,这一阶段的核心挑战在于,让系统的内部表征忠实地对应其声称要解决的问题的外部结构。 然而,安全研究贯穿着一道尖锐的张力:机械式可解释性试图将保证建立在激活层级的属性之上,但证据表明,正是这些属性可能天然地对涌现性失效模式视而不见,这反而强化了程序性保障的必要性。 这一分歧概括了一个更广泛的开放问题:形式化的结构性保证能否追赶上习得表征的复杂度,还是说,鲁棒性最终将依赖于无需完全内部透明性的外部治理回路?

本篇综述援引了34项进展:32个A级研究来源、1个B级一手来源,以及1个C/D级二手或社区来源。 最确凿的论断建立在A级工作之上,而一手来源和社区来源应解读为方向性参考; 更强的置信度需要独立的重复验证,并对自行报告的结果进行一手来源确认。

原文链接与引用索引