代理型 AI 的结构性冲突要求新原语,而非仅靠扩大规模
2026-07-14 02:00 UTC
核心要点
- 自主智能体需要结构化的风险分类、持久记忆与归因验证,仅靠模型层面的安全防护会引发系统性漏洞。
- 构建多模态智能必须将视觉基础作为预训练底座,而非语言模型的附加组件,从而找回纯文本预训练所丢弃的结构。
- 前沿模型的商业化对安全制度能力的侵蚀速度超过了技术安全的进步,导致开发者与用户之间根本性的不对称问题依然悬而未决。
从静态模型向自主智能体的演进,暴露出增量扩展无法解决的结构性冲突:高效推理与能力、视觉基础与语言抽象、商业速度与安全能力、领域特定性与通用性之间的矛盾。 以下章节将梳理这些断层线:效率前沿从模型规模向推理阶段 token 经济学的转移; 智能体自主性对新型安全与记忆原语的需求; 从视觉基础出发重建多模态能力的迫切性; 商业化速度与安全制度能力之间不断扩大的鸿沟; 以及科学基础模型中领域原生接口的兴起。 最后,对机器人技术、企业部署、治理及模型发布等进展的汇总,凸显了今日更宏观的发展脉络。
推理时 Token 经济学取代模型扩展成为效率前沿
已部署 AI 的主要效率瓶颈已明确从模型规模转向推理时的 token 生成。 视觉输入处理是主要成本驱动因素的假设正被推翻,证据表明输出 token 的消耗已远超其他因素。 对边缘视觉语言模型 (VLM) 推理的能耗分析表明,控制输出 token 长度最高可节省 97% 的能耗 1。 这一发现将效率前沿从视觉压缩转移至输出长度控制,从根本上改变了可持续具身 AI 和边缘部署助手的优化方向 1。
应对这一转变不仅需要严格的 token 预算管理,还需重新设计生成这些 token 的注意力机制架构。 STEEL 框架是针对 AMD XDNA NPU 的一种稀疏感知融合注意力实现,它通过将预填充注意力分配到 AIE 核心的三阶段流水线中,并采用稀疏感知放置策略来缓解因果掩码负载不均衡,从而实现了相比 CPU 降低 9.17 倍、相比 GPU 降低 1.75 倍的能耗 2。 该研究表明,注意力算法与芯片架构的硬件感知协同设计对边缘部署至关重要,因为它直接优化了被确认为主要能耗源的输出生成路径的能耗特征 2。 相较于先前 XDNA 最优水平实现的 9.6 倍延迟降低,进一步证实了如今在商用 SoC 上决定部署可行性的是推理计算,而非模型容量 2。
将这一逻辑从能耗延伸至任务性能,小型视觉语言模型在多语言视觉多项选择题上的测试时扩展表明,在资源受限条件下,决定成败的是推理算力分配,而非模型固有能力。 基于证据的结论指出,确保推理链获得充足的 token 以完成生成,比采用复杂的搜索或验证策略更具成本效益 3。 这一结论将输出 token 完整性视为实际控制杠杆,与 token 经济学视角高度契合,挑战了 PRM 引导搜索对多模态推理的普适性收益,并进一步巩固了 token 预算管理的核心地位 3。
当高分辨率视觉输入推高生成成本时,输出 token 所面临的压力进一步加剧。 SigLIP-HD 引入的由细到粗监督机制,将视觉感知质量与输入分辨率解耦,精准定位了更高分辨率导致延迟和 token 复杂度增加的计算瓶颈 4。 该方法在无需额外前向传播或后处理的情况下,提升了 OCR 等重细节任务的性能,直接降低了导致高分辨率推理成本过高的 token 开销,从而与脱离以输入为中心的优化这一更广泛趋势形成互补 4。 综合来看,这些进展构成了一致的范式重塑:要在现实世界的计算预算下部署强大的 AI,如今需要的是用于输出 token 控制和硬件感知注意力的基础组件,而不仅仅是更小的模型。
Agentic Autonomy 要求超越模型级护栏的新安全与记忆原语
从对话式 AI 向自主多步骤智能体的转变揭示,模型层面的安全训练无法弥合三个结构性缺口:缺乏针对智能体行为的运行风险分类、缺少选择性持久记忆,以及在输出通过所有自动化检查时无法验证证据归因。
TrustX 智能体风险分类框架(ARC)5 引入结构化分类法,为内部构建的智能体系统分层风险,填补了通用治理工具留下的空白。 与 CLI 编码智能体中记录的失效动态 6 对照时,其必要性便显得十分具体。 那里对跨七个前沿模型、超过 63 000 步的时序轨迹分析表明,单个早期错误会静默地传播到后续步骤中。 风险分层工具 5 可系统性地预见此类传播模式,将部署前的分类与静态模型级护栏无法检测的过程性失效模式 6 联系起来。 这说明,若缺失这种联结,智能体行为主要受时间盲区式的输出级安全检查支配。
即便进行了风险分类 5 并监控轨迹 6,智能体也不会跨会话累积上下文 7。 选择性持久记忆架构 7 区分了四类可重用上下文(任务规范、数据模式、工具配置和输出约束)与必须丢弃的会话特定推理轨迹,从而化解了浪费性重复指定与不安全保留之间的紧张关系。 仅持久化结构化配置可达到 96% 的任务完成率,且与注入原始数据相比,由摘要驱动的生成将每次调用的 token 成本降低了 97 倍。 模型安全机制不提供这种区分的原语; 它们作用于单轮输出,而非智能体跨调用记忆的内容。 因此,没有选择性记忆的自主智能体要么在每个会话后丢失领域规则,要么保留有害的临时推理。 这表明安全微调无法修正这些失效模式。
更隐蔽的漏洞出现在检索到的证据被正确传递但归因错误时。 临床 RAG 中的欺骗性循证 8 正是这种失效:系统把药物 Y 的真实临床试验数据作为所查询药物 X 的证据呈现出来。 自动安全和正确性检查会通过,因为证据本身是真实的——只是其实体绑定出了错。 在 740 个药物‑疾病对上的测量显示,已部署系统存在 7.8% 的欺骗性循证率,近期获批药物的这一比率升至 13.6%。 这种归因失效与模型级安全训练正交,后者针对的是有害或虚构内容,而非保持表层事实准确性却误绑实体与证据的错误。 弥合这一缺口需要一种独立于生成模型、交叉核验归因的验证原语,这是任何规模的扩展都无法提供的能力。
综合来看,风险分类 5、会话记忆 7 和归因验证 8 中的这些缺陷,构成了一类模型级护栏系统性敞开的漏洞。 编码智能体的时序失效剖析 6 证实,自主执行会加剧这些缺口:缺乏风险分类法、持久记忆和归因验证,智能体能够在通过所有面向输出的安全检查的同时,持续发生无声的级联失效。 这些并非增量的安全打磨,而是必须内建于智能体框架、而非附加到已训练模型上的架构与治理原语。
多模态能力需要从视觉根基重建,而非将视觉强行嫁接于语言之上
越来越多的证据表明,视觉感知无法在事后附加到语言模型上,而不从根本上损害其扎根理解的保真度。 将视觉预训练作为基础而非事后模块,能够保留纯文本预训练永久丢弃的几何与结构信息,不仅改善多模态推理,也提升纯语言能力 9。 这一发现挑战了“先用文本抽取的描述进行训练、再挂接视觉编码器”的普遍做法,暗示该领域正趋近于一个共识:模型需要先看见,再说话。
然而,即便视觉根基已存在于模型的内部表征中,与语言的接口也常常腐蚀这类知识。 视觉-语言模型经常在其视觉特征中编码了正确的物体数量,却给出错误答案,因为从视觉到语言的读出子空间存在错位 10。 这揭示出视觉知识虽存在,但未能忠实地传递到输出端,这一失败模式直接指向一个架构断层:语言接口并未保持底层视觉编码的精度。 如果不从第一性原理重新设计跨模态对齐,只是将视觉编码器附加到预训练语言模型上,这种读出错位就依然完好无损。
此类失败的持续存在,并非仅靠扩大规模就能解决的暂时性问题。 一项历时十年的视觉-语言模型评估表明,尽管整体准确率有所提升,特定的视觉认知错误类别——包括检测、识别、幻觉、场景理解以及空间依赖性——依然顽固地存在 11。 这一模式说明,对现有架构的增量式扩展并未解决视觉预训练理应解决的那些根本性根基缺失。 这些错误并不会随模型规模增大或数据增多而消失; 它们似乎内在于那些不以视觉处理为首要表征根基的系统之中。
进一步巩固这些模型,反而凸显了当前视觉-语言界面的脆弱性。 测试时的提示适应,通过用图像与文本原型之间的分布级对齐取代样本级置信启发法,能显著提升对抗鲁棒性 12。 需要这种适应本身就说明,视觉证据与语言输出之间的耦合浅薄且易受干扰——没有它,模型的零样本可靠性便会崩溃。 一个真正将语言立足于视觉结构的系统,不会依赖脆弱的事后重新对齐; 相反,接地性应是联合表征的不变属性。
综合来看,这些发现构成了反对模块化附加方案的连贯论据。 视觉预训练恢复了纯语言流程所抹除的信息 9,但即便在具备视觉感知的模型中,语言读出也会破坏内部的视觉知识 10,规模的扩大未能弥合由此产生的差距 11,仍需测试时干预来重新对齐跨模态对应关系 12。 合乎逻辑的回应,不是去改进分开训练的组件之间的粘合剂,而是构建将视觉接地作为初始而非最终表征层的架构——证据表明,这才是通往真正多模态智能的唯一路径。
前沿模型商业化进程正在超越安全制度能力
2026 年 7 月的一则媒体报道指出,OpenAI 安全系统负责人已辞职,这已是该公司两年内第六位安全领导层离职 13。 此次辞职恰逢 GPT-5.6 模型系列发布,并宣布安全系统团队将并入研究组织,由新任研究与安全副总裁领导 13。 同一则报道也质疑:若出现安全顾虑,安全团队的声音是否仍有足够的组织分量来叫停发布 13。 这一疑虑立刻有了现实意义,因为几乎同时,亚马逊云科技宣布 GPT-5.6 系列已在 Bedrock 平台全面上市,将最新前沿模型集成到受监管的企业环境中,并允许客户沿用已有的 AWS 承诺用量 14。 一款内部安全审查结构尚在重组中的模型就这样迅速进入企业分发,这揭示出一种时间线:商业嵌入跑在了制度检查稳定之前。
这一态势并非仅限于一家实验室。 论坛评论指出,Anthropic 暂停了 Claude Fable 5 模型原定的按使用付费转型,将 Pro、Max、Team 和 Enterprise 用户的免费访问延长至 2026 年 7 月中旬,并允许最多将每周用量限额的一半分配给它 15。 外界普遍将此次延长视为对 OpenAI GPT-5.6 日益激烈的价格竞争的回应,这表明即便是在公开强调安全的组织中,市场份额的维系也在推动放宽访问 15。 这类定价策略或许能扩大用户基础,但也同时加快了强大模型的部署速度,压缩了发布后安全评估的时间窗口。
加剧速度与监管之间紧张的,是模型训练者与用户之间尚未解决的根本性不对称。 有研究展示了如何在深度神经网络中植入后门,即便用户拥有完全白盒访问权限,在统计上也检测不到 16。 该论文揭示了一种结构性权力失衡:无论进行多少次实际检查,用户都无法区分植入后门的模型与正常模型,而训练者在生成对抗性碰撞方面保有指数级优势 16。 这一发现表明这是一种永久性的能力差距,无法通过逐步扩展或模型层面的护栏来弥合。 当这种内建的不对称置于如下环境中——安全领导层处于变动之中 13,企业渠道在模型发布的同时即被打开 14,竞争性定价又迫使采取宽松使用政策 15——管理训练者特权风险所需的制度能力似乎正在削弱,而恰在此时,这些风险的商业足迹却正在扩大。 这些证据无关任何当事方的意图,却勾勒出一种结构性错位:独立安全验证机制与安全声音的组织分量,正被商业发布的机器所超越,使得研究所记录的不对称性成为一道鸿沟,而商业接入的扩大只会将其进一步加深。
领域原生接口解锁科学基础模型
最具影响力的科学人工智能进步并非针对特定任务的预测器,而是那些暴露领域原生接口的基础模型,这些接口让从业者能够在现有的实验和临床工作流内部操作,而非绕道而行。 这种模式在基因组学中体现得最为直接:DeepDETAILS 提供了一个碱基对分辨率的反卷积接口,将廉价的批量测序检测与单细胞精度连接起来 17。 该模型并非要求研究者放弃广泛可用且经济的批量测序、转用昂贵的单细胞方法,而是直接接受实验室已在产生的数据类型,并重建出此前仅有单细胞检测才能达到的分辨率的细胞类型特异性转录调控信号 17。 这个接口决策——接受受实验经济性支配的样本类型,并输出下游生物学所需的信号类型——比任何内部架构的创新都更能决定模型的实际影响。
临床生存预测中也出现了类似的接口问题:右删失生物医学数据无法直接输入期望完全观测回归标签的标准表格基础模型 18。 当前流行的变通方法迫使研究者要么丢弃删失患者,要么构建自定义生存预测头,这两种做法都会破坏现有分析管线的连续性。 SurvFM-RMST 通过将右删失生存结局转换为限制性平均生存时间的刀切伪观测目标,创建了一个感知删失的目标接口,从而无需丢弃不完整的临床数据 18。 这种接口转换将领域原生理念从输入端(如 DeepDETAILS 接受批量数据 17)延伸至目标端:现在,基础模型能够以临床随访所产生的删失形式直接消费生存数据,而无需进行那些有损信息、违背医学工作流假设的预处理步骤。
从静态数据走向序贯临床决策,SAGEAgent 将多模态癌症生存预测构造为一个成本感知的模态获取问题——由冻结的大语言模型沿临床规定的顺序(人口统计学信息→影像学→病理学→基因组学)决定是否获取下一诊断模态 19。 这一界面将模型重新理解为主动智能体,模仿临床诊断中序列化、成本敏感的推理,而非固定特征矩阵的被动消费者 19。 大多数多模态预测研究默认所有数据需预先齐备,这一假设被替换为一种既顾及经济约束又遵循诊断工作流逻辑顺序的获取策略。 DeepDETAILS 17 和 SurvFM-RMST 18 把基础模型适配到实验室与临床数据的静态结构上,SAGEAgent 19 则将领域原生接口扩展到了临床实践的时间维度。
这一演进方向在 ALICE 中走向统一——该计算病理学基础模型将原本为单一空间尺度或单一模态设计的碎片化专用主干网络整合进一个带有多尺度接口的架构中 20。 此前,从业者不得不为不同诊断任务选用互不兼容的主干网络,这种碎片化困局并非通过堆叠更大的模型来解决,而是在同一架构内暴露跨越空间尺度和模态的接口 20。 ALICE 对专业知识的整合说明,领域原生接口不只是输入输出格式的转换器,而是决定模型会碎片化还是整合现有临床工作流的架构决策。 纵观这些案例,推动科学影响力的结构性创新在于接口设计——它接受既有的工作方式(批量测序的经济逻辑 17、删失生存数据 18、序贯诊断顺序 19 与多尺度病理工作流 20),而非停留在预测任务本身。
简讯
在核心论证之外,机器人学与具身系统的进展持续重塑表征、数据与物理交互之间的关系。 一项大规模物理三维神经细胞自动机的实现,展示了模块化砖块中涌现的自我识别与损伤恢复能力,将仿生集体智能引入了实体硬件 21。 MIT News 的一篇文章指出,SceneSmith 部署了三个协作视觉-语言模型智能体,从文本提示生成多样化、物理就绪的 3D 室内场景,减少了对昂贵真实数据采集的依赖,使工程师能在部署前对行动方案进行压力测试 22。 一种联合建模空间轨迹与接触力的单样本多模态演示学习框架被提出,用于接触密集型机器人任务 23。 为快速操作,用连续 B 样条曲线表示机器人动作,而非固定的动作块,便能自适应调整时间分辨率并实时加快执行速度,无需重新训练,从而克服传统动作分块的不连续性与均匀分辨率瓶颈 24。 在通信受限环境中,一种特权蒸馏框架训练出分布式的去噪扩散策略,可在无需运行时通信的条件下协调多机器人,有望赋能水下与远程野外机器人应用 25。
在基础设施与模型扩展方面,CNCF 发布了一份关于招商银行基于 HAMi 构建的统一异构 AI 计算平台的案例研究,媒体报道该平台硬件池利用率达 100%,GPU 综合利用率提升五至十倍,采购成本最高降低 80% 26。 一份论坛报告提到,德国 AI 联盟开源了 Soofi S——一个 31.6B 参数的混合专家模型,每个 token 仅激活 3.2B 参数,在德语和英语任务上优于更大的稠密模型,并训练于欧洲主权基础设施之上 27。 另外,一篇新闻文章介绍了 Google 的 SensorFM,该模型在来自五百万用户、超过一万亿分钟的多模态可穿戴数据上预训练,在 35 项健康任务中有 34 项超越有监督基线,且标注效率更高,指向一种通用健康智能层 28。 与此同时,可信性与安全仍是活跃的前沿。 一个专为 IoT 环境定制的自主多智能体框架,将侦察到利用的流程自动化,可在受控环境中实现可扩展的安全审计,并通过并行化显著缩短攻击时间 29。 ConceptSMILE 则将基于扰动的审计从特征层面扩展到概念层面,提供一种模型无关的方法,用于检测看似合理的概念解释是否掩盖了对伪相关或成像伪影的依赖,这在医学影像等高风险领域尤为关键 30。
综合与展望
从静态 scaling 向 agentic autonomy 的加速转变,揭示出一个被拉往相反方向的领域。 效率前沿向 inference-time token economics 和 hardware-aware attention 的迁移,强化了将 visual grounding 作为 pretraining foundation 的必要性——因为只有在早期就内化空间与关系结构的模型,才能在不牺牲能力的前提下压缩推理步骤。 然而,这种架构上的趋同直接将安全需求架在了商业速度的对立面:让 grounded agents 变得强大的多步执行,反过来使 model-level guardrails 不再够用; 而各大实验室记录到的 institutional safety capacity 削弱,意味着 agentic systems 所依赖的 structured risk classification、persistent memory 和 attribution verification,正被定义前沿的 pricing wars 与 release cadences 甩在身后。 科学模型中的 domain-native interfaces 为应对这一冲突提供了一种局部模式——一种解读是,它们将治理嵌入了 interface 而非 output——但 trainer 与 user 之间的根本性不对称依然未被解决。 证据基础涵盖 44 项进展,强度集中在 Tier A 研究来源,但在独立验证的 institutional safety metrics 方面仍然薄弱,这支持对技术趋势做出高度可信的诊断,却只能对预测的治理结果保持中等信心。 一个决定性的开放问题是:decentralized, domain-native architectures 能否在没有 centralized oversight 的情况下将 safety enforcement 规模化,还是商业化的速度会系统性地超过任何依赖外部 institutional capacity 的 interface-level controls。
原文链接与引用索引
- [1] 看是免费的,说不是:揭示边缘VLM推理中真正的能耗瓶颈 — arXiv · Tier A/research_paper
- [2] STEEL:面向AMD XDNA NPU高能效长序列推理的稀疏感知融合注意力机制 — arXiv · Tier A/research_paper
- [3] 针对多语言视觉多项选择题的小型视觉语言模型测试时缩放 — arXiv · Tier A/research_paper
- [4] SigLIP-HD:基于由细到粗监督的高分辨率视觉表征 — arXiv · Tier A/research_paper
- [5] TrustX 智能体风险分类框架(ARC):为内部构建的自主 AI 系统进行风险分级 — arXiv · Tier A/research_paper
- [6] 将失败视为过程:CLI 编码智能体轨迹的解剖分析 — arXiv · Tier A/research_paper
- [7] 面向智能体LLM系统的共享选择性持久记忆 — arXiv · Tier A/research_paper
- [8] 欺骗性接地:临床检索增强生成中的实体归因失败 — arXiv · Tier A/research_paper
- [9] 面向语言智能的可扩展视觉预训练 — arXiv · Tier A/research_paper
- [10] 计数信息存在但错位:理解与纠正视觉语言模型中的计数失败 — arXiv · Tier A/research_paper
- [11] 十年视觉-语言AI模型准确性与视觉认知错误的演变 — arXiv · Tier A/research_paper
- [12] 通过测试时提示自适应增强视觉-语言模型的鲁棒性 — arXiv · Tier A/research_paper
- [13] GPT-5.6刚发布,OpenAI安全主管就跑路了?? — 量子位 QbitAI (RSS) · Tier C/media_report
- [14] OpenAI GPT-5.6 Sol、Terra 和 Luna 模型正式在 Amazon Bedrock 上推出 — AWS Machine Learning Blog (RSS) · Tier B/official_tech_blog
- [15] Anthropic为订阅者延长Fable 5免费使用期限,OpenAI GPT-5.6 Sol加剧价格战 — The Decoder (RSS) · Tier D/other
- [16] 深度神经网络中的统计不可检测后门 — arXiv · Tier A/research_paper
- [17] 从批量测序样本中高分辨率重建细胞类型特异性转录调控过程 — Nature: Machine Learning (RSS) · Tier A/research_paper
- [18] 面向表格基础模型生存预测的删失感知目标接口 — arXiv · Tier A/research_paper
- [19] SAGEAgent:一种用于多模态生存预测中成本感知模态获取的自进化智能体 — arXiv · Tier A/research_paper
- [20] ALICE:从视觉、视觉-语言和切片级专家中学习通用病理学基础模型 — arXiv · Tier A/research_paper
- [21] 用于去中心化形状分类与损伤恢复的智能细胞砖块 — Nature: Computer Science (RSS) · Tier A/research_paper
- [22] AI智能体创建虚拟训练场,为机器人提供关键训练数据 — MIT News: Computer Science (RSS) · Tier D/other
- [23] 基于力约束弹性图的演示单样本多模态学习 — arXiv · Tier A/research_paper
- [24] B-spline策略:通过B样条动作表示加速操作策略 — arXiv · Tier A/research_paper
- [25] CoDiMAD:基于扩散模型的特权蒸馏实现无通信多机器人协同 — arXiv · Tier A/research_paper
- [26] CNCF发布招商银行AI调度平台案例 源于范式的HAMi技术获生产级验证 — 量子位 QbitAI (RSS) · Tier C/media_report
- [27] 德国人工智能联盟发布开源30B模型Soofi S,在英语和德语基准测试中均领先 — The Decoder (RSS) · Tier D/other
- [28] Google SensorFM:将杂乱的可穿戴传感器数据转化为通用健康智能层 — The Decoder (RSS) · Tier D/other
- [29] VEXAIoT:基于AI智能体的自主IoT漏洞利用框架 — arXiv · Tier A/research_paper
- [30] ConceptSMILE:审计基于概念的可解释人工智能的可信度 — arXiv · Tier A/research_paper