AI能力声明面临可验证约束 智能体经济超越监管
2026-09-23 02:00 UTC
要点
- 智能体安全正从输入过滤转向生命周期准入控制,可信的保护单元涵盖运行时准入、轨迹审计与持久状态管理,因为攻击与自我修改风险会跨时间、跨组件发生。
- 世界动作与视觉-语言-动作系统的瓶颈在于动作与状态表示,而非视觉骨干网络的规模,因为动作记法或预测状态的微小变化可能悄然决定闭环可靠性。
- 成本效率已成为决定性的竞争维度,降价与缓存降低了智能体工作负载成本,同时前沿发布与开放权重版本之间的能力差距正在缩小。
- 算力扩张的制约日益取决于本地环境审批与集中的财务风险敞口,而非单纯的加速器供应,这意味着效率指标本身无法化解部署风险。
- 主流评测如今将过程轨迹、环境独立性与可复现性视为一等证据,因为总体成功率可能掩盖能力退化、奖励黑客与不可复现的收益。
当日 AI 进展同时在两条战线上推进。 能力主张正被纳入可验证的运行时、评测与基础设施约束; 而成本效率竞争与智能体部署的步伐,已超出使这些主张具备持久性所需的治理与外部效度检验。 以下各节将依次展开这一论点。 智能体安全、世界动作与视觉-语言-动作系统以及评测,均呈现同一趋势:从端点或输入级信号,转向运行时准入、动作与状态表示,以及过程轨迹、溯源与失效归因。 成本效率竞争与基础设施扩张描述了反向压力:部署经济、本地问责与资本集中所设定的条件,无法仅凭效率指标来裁定。 高风险的临床与科学 AI 标定了外缘边界,跨站点泛化与可审计的证据链在此成为可信度的门槛。 (编辑解读:综合来看,这些线索表明能力与持久性正在分化。 )文末的简短汇总保留不属于上述各节的条目。
代理安全正从输入过滤转向生命周期准入控制
当前 LLM agent 的主流威胁模型围绕输入摄入构建。 本周期的证据则指向准入控制,体现在两个维度:时间与组件数量。
1 提出了“爆炸式提示”(explosive prompts),这是一类间接提示注入,将注入与执行时间分离——载荷在攻击者选定的触发条件满足前保持休眠,充当无需训练的推理时后门。 该论文指出,现有防御机制对这种时间分离的条件式攻击存在校准偏差,并报告生产环境 agent 的攻击成功率达 43–83%,而朴素命令式注入仅为 3% 1。 由于触发发生在摄入之后,摄入时运行的过滤器所针对的时刻与载荷实际生效的时刻并不重合; 将此视为支持生命周期监控而非一次性过滤的论据,是对所报告差距的一种解读,并非该论文对防御机制的一般性主张。 (来源:arXiv 预印本,同行评审状态未知。
2 将相同的结构性问题从外部输入转向 agent 自身的更新,将持久化 LLM agent 适配表述为针对自我修改的准入控制:agent 可以提议修改其操作指令,而由外部运行时门控决定哪些修改得以保留 2。 报告显示,在重放被拒绝的提议中,有 55% 存在附带回归,这表明仅凭局部改进不足以作为可靠的持久化标准,因为一项修改可能在修复某个失败的同时,悄然破坏此前已成功的行为 2。 与 1 并置来看,两者有一个共同特征(各自以不同方式描述):有害修改在可见之前即已生效。 两者均为预印本,同行评审状态未知,因此其量级应视为所报告的数值,而非已定论 1, 2。
3 拓宽了研究视野,将多智能体 LLM 系统中的攻击向量归纳为四大类共 14 种——直接用户输入注入、间接工具输出注入、智能体间消息传递注入以及级联编排器操纵——并指出边界过滤器和系统提示词无法覆盖工具输出与内部消息 3。 1 关注的是单一智能体的输入摄取路径,而 3 描述的注入则来自边界完全不予检查的组件; 这种对比是编辑层面将两份独立报告的发现建立的联系,并非任一文献本身所主张的关系。 (来源:arXiv 预印本,会议信息注明被 ICML 2026 AIWILD Workshop 接收,为 camera-ready 版本。
此类轨迹级风险所需的判定层由 4 予以探讨,该文将 MATE 描述为首个面向移动智能体的策略感知型轨迹级安全审计器,通过联合编码智能体轨迹与自然语言安全策略,生成附带解释的违规判定 4。 其强调的风险与部署场景紧密相关:随着阿里巴巴 Mobile-Agent 和智谱 AutoGLM 等移动智能体在真实设备上部署,它们能够执行不可逆的高影响操作,这使得轨迹级安全审计变得至关重要 4。 (来源:arXiv 预印本,会议信息注明被 USENIX Security 2026 接收。
综合来看——这一综合观点并非上述文献自身所主张——潜伏触发器 1、附带回归风险下的持久化决策 2、多组件注入渠道 3 以及限定于移动智能体的轨迹级策略判定 4 共同表明,智能体安全的有效单元在于运行时准入、轨迹审计与持久状态控制。 提示词筛查仅覆盖单一时刻与单一组件,而报告所揭示的攻击与自我修改风险则跨越时间与多个组件运作。
世界动作与VLA进展受限于动作与状态表示
视觉骨干网络规模是制约世界-动作与视觉-语言-动作系统的绑定约束,这一论断在面对以下证据时难以成立:决定性差异实际上在于动作的编写方式以及预测状态的定义方式。 5 报告指出,以绝对关节目标训练的动作条件机器人世界模型,在将相同的指令轨迹作为相对于当前状态的增量提供时可能会失效,在三个机器人数据集和两种形态上检索性能退化达 2.6–13.4 倍。 该来源进一步指出,跨动作表示的混合训练在 PushT 数据集上失败,如何最好地检测和减少潜在动力学模型中动作通道的脆弱性仍是一个开放问题 5。 由于动作表示法是常规的控制器或数据集选择,这一结果表明,学习到的机器人世界模型使用指令的能力可能被该选择悄然决定 5。 作为执行回路反馈线的延伸来解读,该失败被重新定位到去噪步骤反馈的上游,即动作通道本身 5。
6 从状态侧推进了同一论点。 它引入了动作相关预测状态(ARPS),这是一种用于无生成世界动作模型的紧凑预测接口,为动作专家提供所有视觉上下文 6。 其前提是表征层面的:用紧凑的、动作相关的瓶颈替换密集视频特征,被视为提升机器人策略效率和泛化能力的途径,而非扩大感知路径 6。
7 通过固定除选择规则之外的一切来使论点更加尖锐。 使用在 RoboCasa 中以 Cosmos Policy 构建的受控"best of K"测试平台,保持世界动作模型和采样器固定,它量化了预言动作选择与实用评分方法之间的差距,并发现预测未来的高视觉质量并不能转化为有用的动作选择 7。 在该设置中,动作成功独立地由选择规则决定,而非由生成未来的保真度决定,这将表示质量与规划而非视觉生成联系起来 7。
8 提供了方法论上的补充,展示了一项受控实证研究,该研究理清了世界动作模型中的核心设计选择。 该论文指出,这一领域被单体系统所主导,混淆因素掩盖了各个组件的单独贡献 8。 这种框架设定使得表征问题能够作为一项设计原则加以检验,而非仅仅停留在架构层面的断言 8。
综合来看,这些研究表明,实际瓶颈在于表征契约——即动作记法与动作相关的预测状态——而视觉保真度和骨干网络规模对此的代理效果很差 6, 5, 7, 8。 其中存在实质性的注意事项:这四篇均为 arXiv 预印本,同行评审状态未知,因此所报告的性能退化范围和 OOD 提升幅度应视为研究者的自述结果,而非已确证的结论 5, 6, 8, 7; 此外,关于选择规则的发现仅局限于单一受控测试环境,且模型与采样器均保持固定 7。
成本效率竞争正围绕部署经济性重塑前沿
成本效率已成为模型族系的显性设计轴,而非规模扩张的附带产物。 OpenAI 发布 GPT-6 Sol 和 Luna 时表示,其 API 价格较 GPT-5.6 促销价降低 50%,Sol 输入价格从每百万 token 4 美元降至 2 美元; 两款模型均采用与旗舰版 GPT-6 Astra 相似的训练方法,以推进成本效率,在极低成本下提供接近旗舰级的能力 9。 AWS 宣布 Claude Opus 5.5 上线 Amazon Bedrock 及 AWS 上的 Claude Platform,其每 token 成本低于 Claude Opus 5,缓存读取更便宜,并配备常驻自适应思考功能,可按任务自动调节推理力度 10。 两份均为官方发布,且在竞争轴的落点上口径一致:每 token 经济性被呈现为模型族系的固有属性,而非下游部署细节。 这些发布将成本下降作为版本本身的特性加以说明 9, 10。
成本压力从标价延伸至持续上下文开销。 OpenAI 针对 GPT-6 系列改进的 prompt caching 报告了更高的默认缓存命中率,并在 30 分钟有效窗口内对缓存输入 token 给予最高 90% 的折扣; 该发布将其与长时持久型 agent 的更低运营成本与延迟、以及多小时任务的经济可行性相关联 11。 与降价 9 和更便宜的缓存读取 10 并置来看,被重新定价的对象并非单次推理调用,而是持续性 agentic 工作负载累积的 token 支出。
开源权重的竞争从另一方向挤压同一维度。 据量子位报道,小米以约 350 万美元成本完成了 MiMo-V2.6(1.02T 参数,激活 42B)为期 6 天的直播强化学习训练; 其 Pro 模型在 Artificial Analysis Intelligence Index 上得分 46,居开源模型首位,逼近 Claude Opus 5 与 GPT-5,并将整条流水线开源,作为 agent RL 研究的可复现起点 12。 同一报道援引在未见过的 DeepSWE v1.1 基准上的提升,作为分布外泛化能力的证据 12。
综合来看,这些动态表明,成本效率正成为决定性的竞争维度:两款自研前沿模型发布降低了 token 价格或缓存成本 9, 10, 11,同时一款训练成本约 350 万美元的开源权重模型登顶开源榜单,并逼近前沿模型水平 12。 能力差距的缩小在两处均有方向性表述——以极低成本实现接近旗舰级的能力 9,以及一款被描述为接近 Claude Opus 5 和 GPT-5 的开源权重模型 12——两者均未声称已达到同等水平。 相关比较在信息来源上也存在不对称:定价与缓存数据来自厂商公告 9, 10, 11,而开源模型的排名地位则源自媒体报道,并非独立验证 12。 总体而言,前沿竞争正围绕部署经济性被重新定义,但降价的证据仍主要来自第一方的发布与报道,尚未得到外部验证。
基础设施扩张正因地方问责与资本集中而重新定价
算力扩张的硬性约束不能简单归结为加速器供应。 一篇预印本论文提出了一套针对数据中心的五类本地影响审计框架,涵盖能源效率、水资源管理、碳排放与可再生能源、法规合规性以及本地信息披露,并将其定位为填补一项具有政治影响的空白:仅在 2026 年第一季度,地方反对就导致约 1300 亿美元的美国数据中心项目被推迟或取消,其驱动因素是 PUE 类指标无法反映的水资源、电力和透明度问题 13。 需要指出的是,该来源是一篇 arXiv 预印本,同行评审状态未知,因此 1300 亿美元这一数字属于初步估算,并非最终定论 13。
媒体报道也指向了同一趋势,同时揭示了更复杂的动机。 TechCrunch 报道称,非营利组织 Data & Society 的一份报告基于 2024 至 2026 年间对 44 名宾夕法尼亚州居民的访谈,呈现了为期 18 个月的民族志田野调查结果,探讨了当地反对 AI 数据中心建设背后的动因 14。 报道还提到,民意调查表明超过 60% 的美国人支持限制新建数据中心; 而民族志调查则指出,这种抵制具有自发性和跨党派特征,企业试图通过公关或零星让步来化解担忧的做法可能无济于事 14。 综合来看,预印本的审计框架与民族志调查共同表明,地方合法性是影响部署的实际变量,而非单纯的沟通问题,后者更是将动机扩展到了单一的选址抱怨之外。 两份资料均未证明审计能促使项目推进。
与此同时,投入其中的资金规模据称正在不断攀升。 Hacker News 上的一篇社区帖子提到,摩根大通 CEO Jamie Dimon 表示,超大规模计算生态系统的 AI 支出明年可能达到 1 万亿美元,高于今年的约 7000 亿美元和去年的约 3000 亿美元; 他指出,这一激增可能使 GDP 每年增加约 1%,并略微推高通胀,但从长远来看,AI 可能会发挥通缩作用 15。 结合地方审批层面的证据来看,这一趋势表明受制于地方否决节点的资金可能不减反增——尽管该数据源自单一高管在社区帖子中的发言,应视为初步估计 15。
企业层面则显现出集中度风险。 TechCrunch 报道称,Nscale 已向纽交所提交 IPO 申请,计划融资 30 亿美元,估值据报为 350 亿美元; 招股书披露其合同总额超过 1030 亿美元,其中约 85% 集中在两笔交易中,包括一项与微软达成的、持续至 2033 年、价值 438 亿美元的计算供应协议 16。 报道还指出,招股书提及了或有条款,且 2026 年上半年净亏损扩大至 10.2 亿美元 16。 此次 IPO 被视为对公开市场投资者是否愿意支持面临极端客户集中度风险的 AI 基础设施公司的一次压力测试 16。
因此,这些资料所指出的制约因素并非吞吐量,而是审批许可与交易对手风险:预印本之所以设定相关审计类别,正是因为 PUE 类效率指标无法涵盖地方反对声浪所关注的水资源、电力和透明度问题 13,而财务风险则集中在少数几份合同上 16。 效率指标衡量的是建设扩张的一个维度,而这些资料将部署风险指向了其他方面。 鉴于四条信息源中有三条来自媒体或社区帖子,另一条是评审状态未知的预印本,关于地方问责与资本集中如今已与硬件供应并列为制约因素的说法,应被理解为对尚未定论记录的初步解读 13, 14, 15, 16。
评估正从终端分数转向过程、溯源与失败归因
这一转变最显著的标志在于:总体成功率已被视为证据不足,而非最终结论。 OSWorld-Pro 是一个面向计算机使用智能体(CUA)的基于过程的基准测试,包含 305 项长周期任务、2,814 个顺序依赖的子目标,以及 67,264 条步骤级人工标注 17。 预印本指出,这能让长周期 CUA 评估更加透明——不仅揭示智能体是否产出了最终交付物,更暴露其失败的具体环节,从而帮助开发者诊断 GUI 交互错误、奖励黑客风险及低效轨迹 17。 这一论点关乎分辨率而非效度:同一种最终交付物可经由不同轨迹达成,而这些轨迹的质量与失败模式在终端得分中均不可见。
EvoPathBench 从智能体的时间维度而非任务的内部维度提出了平行的论点。 它通过在连续的检查点冻结演化中的产物,并在留出片段上对其进行评估,来追踪智能体在产物级自我演化过程中的个体能力 18。 预印本指出,总体终端得分可能掩盖自我演化期间的能力退化 18。 OSWorld-Pro 在轨迹内部定位失败,EvoPathBench 则在检查点之间定位失败; 两者均将中间状态而非终端作为测量对象。
WorkWorlds 将同一逻辑向外延伸,从智能体的过程扩展到该过程运行的环境。 其基础设施将组织状态与任务规范分离,确保工作场所的构建独立于评估任务:它在引入任何任务之前,便固定公司版本、日期和员工席位,从而具象化一个角色可见的投影 19。 预印本指出,这弥补了智能体评估的一项空白——在信息发现本身即构成工作的现实场景中测量表现,而非在人工精心策划的环境中进行 19。 与上述两项基准工作对照来看,环境不再是背景,而是被预先固定的变量。
第四层从运行转向记录。 英国 AI 安全研究所(UK AI Security Institute)正利用 EvalEval 的基础设施公开分享评估结果,官方公告 20 指出,下一阶段的合作将借助评估卡片(Evaluation Cards)应用 Every Eval Ever 模式,该模式已采纳 AISI 的反馈意见。 公告称,通过在分数旁公开设置细节,可使前沿模型的评估结果更易于复现、比较与审计; 同时,为研究人员提供经过验证的参考点,以解读不同协议和推理算力条件下的性能表现,从而支持元研究与政策分析 20。 值得注意的是,这属于已规划的下一阶段,而非已积累的披露记录。
综合来看——这是一种解读,而非任何单一来源所断言的关系——这四项内容共同描绘了横跨四个层面的同一演进脉络:步骤级子目标 17、检查点级产物冻结 18、预设环境构建 19,以及设置披露 20。 这一演进的来源属性,决定了其能承载多大分量。 三项基准测试内容均为 arXiv 预印本,同行评审状态未知 17, 18, 19; 而可复现性相关内容则是官方公告,描述的是计划中的基础设施,而非已完成的审计 20。 尽管如此,在“仅凭报告的指标无法区分持久能力与产生该能力的协议产物”这一共同前提下,过程轨迹、环境独立性与来源属性正被提升为一等证据。
高风险临床与科学AI受限于外部有效性与可审计验证
在临床与科学基础模型领域,待检验的核心主张是:系统的可信度并不取决于某一项突出的结果,而在于它能否在跨机构部署中保持稳健,并暴露出一条从证据到输出的可审计链条。 ORION-CMR 体现了这一雄心:它作为首个经过临床评估的扫描仪原生端到端心脏 MRI 基础模型,在来自 9,258 项研究的 12,896,733 张 CMR 图像上进行预训练,单一编码器被用于序列分类、心室功能评估、晚期钆增强检测以及二分类与多分类疾病诊断 21。 其宣称的潜力在于,通过在扫描仪内部自动化序列选择、定量分析、疾病表征和报告生成来减轻 CMR 阅片负担,并在缺乏 CMR 阅片人的地区改善医疗可及性; 报告生成过程无需外部网络通信,原始文献将此与隐私保护型部署相关联 21。 该文献的底层来源是一篇 arXiv 预印本,其同行评审状态尚不明确,因此“经过临床评估”仍是一项主张而非定论 21。
当模型跨环境应用时,这一门槛便显现出来。 一项在尼日利亚临床队列上对四种预训练脑部 MRI 基础模型(BrainIAC、Neuro-JEPA、NeuroVFM 和 Primus)进行的三分类诊断评估(对照组、痴呆、帕金森病)凸显了此类模型在应用于代表性不足、异质性强且资源匮乏的临床人群时存在的严重泛化差距 22。 与 ORION-CMR 类型的扫描仪原生主张并列来看,这起到的是外部有效性检验而非反驳的作用:两篇文献并未评估相同的模型,且 22 未报告与 ORION-CMR 的直接比较。 22 所确立的是,当神经影像基础模型面对代表性不足、异质性强且资源匮乏的队列时会出现泛化差距,而这正是任何广泛临床部署主张都必须通过的一项检验 22。
架构设计正是对该关卡的一种回应。 FedMust 是一种用于多器官 CT 分割的半监督多任务师生联邦框架,允许拥有相同器官标签的客户端组成教师联邦,同时所有客户端共同训练一个共享编码器、任务特定解码器的学生模型,使其匹配由标注与未标注数据生成的教师特征 23。 其明确目标是减少每家机构标注所有器官的需求,并在本地标签集互不重叠的情况下实现协作; 据报告,各客户端平均提升约 13%,并在 AMOS 和 TotalSegmentator 上进行了评估 23。 与 ORION-CMR 的扫描端报告机制 21 类似,这种联邦设计本质上是一种部署安排,重新界定了数据与计算的位置; 23 附有会议注明,已被 MICAD 2026 接收。
可审计性要求从临床泛化延伸至科学模型构建。 在一个人在回路、物理约束的多智能体工作流中,人类专家界定物理与建模的允许边界,而专用智能体负责检索证据、推导方程、实现求解器,并独立审计从理论到代码的完整链路 24。 其愿景是为物理密集型工程中由人主导的 AI 建立可泛化的范式,将多智能体系统从任务自动化拓展为可审计的工程求解器 24; 这同样是一篇 arXiv 预印本,同行评审状态尚不明确。
综合来看,这些内容表明,在高风险临床与科学 AI 领域,可信度并非凭借单一领域结果的强度,而是通过经受外部有效性检验并产出可检视的证据链来赢得 21, 22, 23, 24。
简讯
一篇论文指出,预训练生成模型——ESM3、ProteinMPNN 和 EvoDiff——能够从头设计硫醇化结构域,这些结构域在功能上与非核糖体肽合成酶动态且依赖上下文的界面保持兼容; 在该领域,催化过程中瞬态结构域间通讯被破坏是工程化改造面临的严重瓶颈 25。 另一篇论文介绍了 TangleDiff,这是一个用于从头设计具有可编程特征的同源二聚体纠缠蛋白的深度学习框架,通过量身定制的结合能来处理链间纠缠基序; 作者将其定位为基于纠缠的生物材料的一种可能通用策略,可实现可调的机械弛豫,而人工细胞外基质在 3D 干细胞与类器官培养中的任何改进,都取决于从设计到水凝胶这一工作流程能否实现规模化 26。
在工具方面,Hugging Face 宣布其 transformers 库现已原生支持通过标准的 from_pretrained API 加载和运行 GGUF 量化模型,并通过一个新的 kernels 库复用 llama.cpp 的 ggml Metal 内核,在 Apple Silicon 上实现了接近 llama.cpp 的推理性能 27。 一篇预印本描述了 MIRAGE,一种三层智能眼镜架构,可在采集时实施全身隐私保护——在任何数据离开设备之前遮蔽完整的可见人体,而非仅对面部进行匿名化处理——同时仍能生成视觉上实用的合成替代图像; 其同行评审状态尚不清楚 28。 Hacker News 上的一篇社区帖子介绍了 aSPARK,这是一个 Claude Code 插件,将受限的敏捷交付流程封装为命名的产品团队角色,依次运行 Specify、Plan、Act、Review 和 Keep 阶段,每个阶段推进前都需要人工审批关卡,该帖子将这种安排视为使 AI 辅助编程更具可审计性 29。
部分消息通过媒体报道而非原始文档披露。 QbitAI 报道,在 2026 云栖大会上,阿里巴巴发布了全模态模型阵容,包括具备自训练能力的 Qwen3.8-Max、用于统一跨模态理解的 Qwen3.8-Omni,以及 HappyOyster 2.0 Preview 世界模型; 报道将此举定性为从孤立的内容生成向一体化生产工作流的转变 30。 The Decoder 报道,小米发布了 MiMo-V2.6 系列模型,其中包含参数量达 1.02 万亿(激活参数 42B)的 MiMo-V2.6-Pro 混合专家模型; 该模型在 Artificial Analysis 智能指数中得分 46,以输入 $0.435/M、输出 $0.87/M tokens 的价格登顶开源模型榜首,同步发布的还有开源 RL 工具包及 7000 项分级任务 31。 QbitAI 另据报道,阿里巴巴表示 Qwen4 正基于新架构进行训练,Qwen4.5 与 Qwen5 计划扩展至 5–10 万亿参数规模,递归自我改进被引入模型训练、推理及芯片-模型协同设计环节 32。 The Decoder 还报道了 OpenAI 的声明:一款新内部模型在约一个月的训练后,解决了数学大多数领域中 100 余项长期悬而未决的开放性问题,据称其中包括纳维–斯托克斯存在性与平滑性以及霍奇猜想等千禧年大奖难题 33。
以下一项内容与上文提出的治理问题直接相关。 Hacker News 的一篇社区帖子描述了亚马逊切断 Meta 旗下 Muse 个人 AI 代理在 Amazon.com 上的购物权限,理由涉及未经授权的访问、缺乏代理身份标识,以及凭据捕获可能带来的隐私与安全风险; 此前亚马逊曾要求 Meta 主动将该电商网站排除在该代理的作用范围之外 34。
这些笔记应视为初步资料。 本次汇总的大部分内容依据 QbitAI 和 The Decoder 的媒体报道以及 Hacker News 上的社区帖子,仅有 Hugging Face 的一份官方公司公告和两篇研究论文; 其中 MIRAGE 条目为 arXiv 预印本,同行评审状态未知 28。 MiMo-V2.6-Pro 的性能数据、Qwen4.5 与 Qwen5 的参数目标,以及归因于 OpenAI 内部模型的数学结果,均为相关说法,所引证据并未表明其已经过独立验证,各项的展示范围也仅限于所引条目所述内容 31, 32, 33。 此处的信号仅具方向性、属于初步阶段,尚非定论。
综合与展望
综合来看,当日各项主张共同指向可信度的一次转移:从宣称的能力与端点评分,转向运行时行为、过程轨迹与特定场景的权限控制。 从编辑解读的角度,智能体安全与评估类主张相互印证,二者均将持久状态、轨迹审计与故障归因——而非输入过滤或总体成功率——视为可信的证据单元; 而世界动作与视觉-语言-动作类主张则将同一逻辑延伸至动作与状态表示。 同样作为编辑解读,成本效率与基础设施类主张与验证类主张之间存在张力:价格竞争与智能体部署鼓励快速、低成本的规模化,而准入控制、来源核查与本地环境权限引入了效率指标无法定价的摩擦。 整体而言,信心充其量为中等,在涉及治理、外部有效性与跨场景泛化的领域最为薄弱——这些领域最依赖二手与社区来源。
综合含义(同样属编辑判断)是:部署经济正在跑赢那些使已部署主张具备持久性的机制,问责、评估与基础设施监督滞后于能力本身,而非为其设定节奏。 一个悬而未决的问题是:成本效率提升与生命周期准入控制能否纳入统一的度量体系,还是更廉价的部署与更严格的验证将继续分化,使临床、科学及高风险智能体类主张依赖于无法在原始场景之外复现的证据?
本综述涵盖 34 项进展:19 项 A 类研究来源、5 项 B 类第一方来源,以及 10 项 C/D 类二手或社区来源。 最坚实的主张依托于 A 类工作,第一方与社区来源应作为方向性参考; 若要获得更强信心,需对自报结果进行独立复现与原始来源确认。
原文链接与引用索引
- [1] 拆解爆炸性提示:理解与防范LLM智能体中基于触发器的提示注入 — arXiv · Tier A/research_paper
- [2] 自我修复框架用于智能体自我修改的运行时监督 — arXiv · Tier A/research_paper
- [3] 超越单模型注入:多智能体系统提示注入的威胁模型与防御架构 — arXiv · Tier A/research_paper
- [4] MATE:基于合成驱动轨迹学习的移动智能体策略感知安全审计 — arXiv · Tier A/research_paper
- [5] 机器人世界模型对动作书写方式不具有不变性 — arXiv · Tier A/research_paper
- [6] 动作的正确未来:在世界动作模型中学习动作相关的预测状态 — arXiv · Tier A/research_paper
- [7] 超越视觉质量:基于世界动作模型的测试时规划研究 — arXiv · Tier A/research_paper
- [8] 设计世界动作模型的关键要素:一项实证研究 — arXiv · Tier A/research_paper
- [9] 推出 GPT-6 Sol 和 Luna — OpenAI Blog · Tier B/official_tech_blog
- [10] Claude Opus 5.5 现已在 AWS 上线 — AWS Machine Learning Blog · Tier B/official_tech_blog
- [11] GPT-6的更优提示词缓存 — OpenAI Blog · Tier B/official_tech_blog
- [12] 6天烧光2000多万,拿下开源第一!小米史无前例「炼丹直播」收官 — 量子位 QbitAI · Tier C/media_report
- [13] 超越PUE:面向数据中心环境问责的本地影响审计框架 — arXiv · Tier A/research_paper
- [14] 每个人都能找到反对数据中心建设的理由 — TechCrunch: Artificial Intelligence · Tier C/media_report
- [15] 摩根大通CEO称超大规模云服务商AI支出2027年或达1万亿美元 — Hacker News: AI/LLM · Tier C/community_opinion
- [16] Nscale的IPO将再次考验华尔街对集中式AI投资的胃口 — TechCrunch: Artificial Intelligence · Tier C/media_report
- [17] OSWorld-Pro:面向计算机使用智能体的过程化评估 — arXiv · Tier A/research_paper
- [18] 超越终点性能:自进化智能体的过程级评估 — arXiv · Tier A/research_paper
- [19] WorkWorlds:用于评估AI智能体在职场任务中表现的基础设施 — arXiv · Tier A/research_paper
- [20] 英国AI安全研究所与EvalEval如何让基准测试结果可复现 — Hugging Face Blog · Tier B/official_tech_blog
- [21] ORION-CMR:基于集成基础模型的扫描仪端心脏磁共振端到端分析与解读 — arXiv · Tier A/research_paper
- [22] 评估神经影像基础模型在非洲脑部MRI上的泛化能力 — arXiv · Tier A/research_paper
- [23] FedMust:用于多器官CT分割的半监督多任务学生-教师联邦学习 — arXiv · Tier A/research_paper
- [24] 人类引导的物理约束AI智能体构建可审计的土塞演化模型 — arXiv · Tier A/research_paper
- [25] 生成式AI设计功能化硫醇化结构域以重编程非核糖体肽合成酶 — Nature Communications · Tier A/research_paper
- [26] 通过深度学习驱动的缠结设计生成具有可定制应力松弛行为的蛋白质水凝胶 — Nature Communications · Tier A/research_paper
- [27] Transformers 现已支持运行 llama.cpp 量化模型 — Hugging Face Blog · Tier B/official_tech_blog
- [28] MIRAGE:面向智能眼镜的全身体旁观者隐私保护与基于同意的恢复 — arXiv · Tier A/research_paper
- [29] HN 展示:aSPARK——面向 Claude Code 的敏捷 AI 产品团队 — Hacker News: AI/LLM · Tier C/community_opinion
- [30] 陆川手搓历史现场,王珞丹熬夜抽卡,阿里全模态开始兜底生产 — 量子位 QbitAI · Tier C/media_report
- [31] 小米高性价比旗舰AI领跑开源模型,Anthropic称Claude在其中发挥了作用 — The Decoder · Tier D/other
- [32] 阿里研究员透露Qwen4.5后模型将扩展至5-10T参数 — 量子位 QbitAI · Tier C/media_report
- [33] OpenAI称其内部模型仅训练一个月即解决逾百个长期未解数学难题 — The Decoder · Tier D/other
- [34] 亚马逊封杀Meta的Muse AI助手:智能体购物之争再起波澜 — Hacker News: AI/LLM · Tier C/community_opinion