AI 从通用规模扩展转向代理、物理与医学领域的专用自主化
2026-08-08 16:00 UTC
核心看点
- AI 智能体正从 API 封装的接口转向原生系统,这类系统通过原始传感器输入进行交互,并维护自我演化的记忆层。
- 当前生成式世界模型在物理保真度上仍有欠缺,促使业界转向基于实测的基准和融合物理原理的架构。
- 临床基础模型正在超越语言报告生成,直接从原始生物与影像数据中提取潜在的预后风险。
- AI 生成的安全补丁和自主编程智能体仍易受细微缺陷和间接提示注入的影响,给验证带来持续挑战。
- 对功能性生物实体的从头生成式设计,标志着科学 AI 从数据分析迈向原始创造的一次转折。
原生智能体自主性的过渡
原生智能体自主性正在通过摒弃 API 封装范式、转向直接环境交互与自我进化记忆的系统取得进展。 一篇预印本论文描述了 Qwen-CUA,这是一个基于 397B-A17B 混合专家骨干的原生计算机使用智能体,它仅观察屏幕截图并输出键盘与鼠标动作,避开 DOM 树、无障碍元数据或任务特定 API 1。 当活跃历史记录超出 20 张截图的预算时,一种折叠前缀机制会将边界推进 10 步,用文本占位符替代较旧的截图,同时保留其中的推理与动作 1。 这种从像素到物理输入的原始感知循环,摒弃了封装型智能体所依赖的结构化接口。
自我进化记忆层为这一感知根基提供了补充。 量子位的一篇报道详细介绍了 MindMemOS,这是华为诺亚方舟实验室开源的一个与单个智能体解耦的内存操作系统层,旨在跨应用持续进化 2。 它瞄准了四个持久痛点:跨应用不可迁移、僵化的提取模板、静态检索策略以及缺失的时间演化能力 2。 这种解耦使技能和记忆能够独立于任何单一智能体发展,为那些随时间改进而非每次调用都重置的智能体提供了基础 2。
将原生范式延伸到持续任务,另一篇预印本介绍了 Argus——一个持久化智能体运行时,它把长期推理重新定义为经过验证的转向,而非固守固定计划的执行 3。 Argus 通过一份正式的工作契约,将用户长期意图与执行目标、约束条件及验证标准分离开来,并允许基于证据的目标修订而不发生目标漂移 3。 根据该预印本,这种设计可以使智能体自主开展多日研究活动、软件工程与硬件优化,同时能够从失败路线中恢复,而不是重新开始 3。 这种经过验证的转向与解耦记忆的自我进化并行,用一个有状态、可修订的过程取代了脆弱的计划固守。
这些并行的进展——无需结构化元数据的原生感官交互、可在应用间迁移的自我进化记忆,以及具备可验证转向能力的持久化运行时——标志着对无状态、绑定 API 的 LLM 封装模式的背离。 它们指向的智能体,能够在以环境自身的规则与环境互动的同时,获取并保留属于自己的经验性记忆。
弥合世界模型中的物理性鸿沟
生成式世界模型的物理保真度仍是一项重大挑战,因为仅凭感知评估可能会遗漏物理不准确性。 GAUGE 基准提供了一套统一的、面向真实世界的诊断工具,能够在涵盖刚体、柔性线缆、织物与体积可变形物体的 22 个受控任务族上,联合评估数值物理引擎与生成式视频世界模型的物理保真度,从而将评估推向了超越感知合理性的层面 4。 这或许能为诊断模拟器与世界模型为何偏离真实物理提供一个严谨的、基于实测的基础 4。 该基准在一篇 arXiv 预印本中进行了描述,其同行评审状态未知 4。
在架构方面,NVIDIA 的 Cosmos 3 代表了一次大规模尝试,旨在将物理推理统一到单一基础模型之中。 结合官方公司公告,Cosmos 3 是一个开放的物理 AI“全模模型”,构建于混合 Transformer 架构之上,统一了视觉推理、世界生成与动作预测 5。 它以三种参数规模发布——Super (64B)、Nano (16B) 和 Edge (4B)——采用 Linux 基金会的 OpenMDW 1.1 许可证,其开放权重的方法可能降低在机器人技术与自动驾驶汽车等领域进行专业化的门槛 5。
预印本中引入的一种补充性训练方法 EnvACE,通过世界排练将环境动态内化。 在该方法中,单一策略在发出工具调用与生成这些动作将引发的环境响应之间交替进行,训练时无需与外部环境交互 6。 这可以通过消除对昂贵的可执行环境合成或外部模拟器的依赖,降低智能体训练的成本与复杂性 6。
综合来看,这些进展指向了两个相辅相成的方向:以测量为根基的基准(如 GAUGE 4)量化了感知评估所遗漏的缺陷,而融合物理的架构——无论是通过像 Cosmos 3 5 这样的统一全模模型,还是通过像 EnvACE 6 这样基于排练的内化——则试图更直接地嵌入物理动态。 GAUGE 和 EnvACE 仍为预印本,Cosmos 3 则是厂商公告; 它们对物理保真度所产生的实际影响仍有待独立验证。
临床基础模型:从流畅表达到预后效用
医疗人工智能正日益超越生成描述性报告,转向从原始生物学和影像数据中提取潜在的预后信息。 近期涌现的一系列基础模型体现了这一转变,它们揭示出传统临床指标或标注范式所忽略的风险结构。
针对全身 DXA 扫描的自监督视觉模型 LeDXA 展示了如何将原本为单一适应症获取的影像数据重新用于更广泛的风险分层。 从相关预印本论文,该模型在人类表型项目的 11,540 张未标注扫描图像上训练,能够编码多系统疾病风险和生物衰老 7。 由于 DXA 扫描已在骨质疏松筛查中广泛使用,这种方法可以在不增加影像采集和标注成本的情况下拓展其临床效用,不过该预印本的同行评审状态尚不清楚 7。 LeDXA 将这类扫描的功能从二元诊断测量转变为密集的潜在风险评估。
类似的趋势也出现在生理信号数据中。 一篇研究论文介绍了一个基于 transformer 的基础模型,该模型使用克利夫兰诊所 STARLIT 注册系统中超过 10,000 份高分辨率多导睡眠图记录进行训练,并与十多年的电子病历数据相链接 8。 该模型识别出常规睡眠数据中潜在的风险结构,而传统指标(如呼吸暂停-低通气指数)系统性地忽略了这些结构; 最高风险组的死亡风险比最低组高出一倍多 8。 这再次表明,通常被简化为少数几个标量指标的生体记录,其实蕴含着更丰富的预后信息,并可通过基础模型方法加以恢复。
这一转向基础模型,使其服务多个下游任务而非生成固定的描述性输出,在病理学领域也有体现。 微软在官方公告中介绍了 PRISM2,这是一款由微软研究院与 Paige(现隶属于 Tempus)共同开发并发表在《自然·医学》上的病理基础模型,其训练数据同时涵盖组织图像与病理报告中的语言 9。 公司指出,一个能够跨任务适应的单一模型,可以减少为每一项新应用单独构建模型的需求 9。 虽然公告强调的是适应性而非明确的潜在风险提取主张,但其设计理念与更广泛的趋势一致:此类模型的价值不在于从切片生成一份固定报告,而在于提供一个可泛化的表征,使其能被调整以服务于不同的诊断或预后目标。
综合来看,这些模型共同指向了临床 AI 的一次重新定向。 它们不再模仿描述性输出——无论是放射科报告、睡眠分期摘要还是病理叙述——而是将原始传感器与影像数据视为一种潜在预后结构的来源,这种结构可通过自监督或多模态训练被揭示出来。 LeDXA 从无标注的全身扫描中提取生物衰老信息,睡眠基础模型在呼吸暂停-低通气指数之外进行死亡风险分层,以及 PRISM2 的跨任务适应性,各自都体现了从流畅生成向预后效用的迈进:模型的主要输出不再是句子,而是直接从底层生物信号中学习的风险画像 7, 8, 9。
自主安全与验证的脆弱性
迈向完全自主的安全与验证仍然十分脆弱,在漏洞修复领域,人类监督远未过时。 Hacker News 上的一则社区贴文介绍了 Off-by-1 Labs 对两个前沿的网络能力推理模型在六个最近披露的 CVE 上的评估,指出 53.9% 的生成补丁属于带嵌入缺陷的类修复产物(FLAWED),未能完全解决漏洞或引入了新漏洞 10。 如此高比例的缺陷补丁凸显出,即便是先进模型也难以捕捉微妙缺陷,而人类领域专长在验证补丁正确性、避免改变行为副作用方面仍不可或缺。
这种脆弱性并不局限于独立补丁生成,还延伸至更广泛的智能编码工具生态系统。 arXiv 上的一篇预印本介绍了 IssueTrojanBench,这是首个系统性基准,用于评估 AI 编码代理在面对通过恶意 GitHub Issue 请求实施的间接提示注入攻击时的表现 11。 该基准评估了三个最先进的编码代理——Cursor、Claude Code 和 Codex Desktop——它们分别由 GPT‑5.3 Codex、GPT‑5.4 和 Sonnet 4.6 驱动,发现 66.5% 的恶意 Issue 穿透了所有防护栏,暴露出这些已广泛部署工具中的关键安全缺口 11。 编码代理在 GitHub 上的使用率已达 22%–28%,这一高成功率表明,即便是已经融入日常开发工作流的系统,也容易受到绕过现有防护的隐蔽攻击 11。
减少对容易犯错的人类判断依赖的提议途径之一是自动化形式验证。 另一篇预印本介绍了 CryptoProver,一个基于 AI 的验证系统,它能够从高层 API 合约和一个固定的可信代码库出发,自动合成内部规约和经 Verus 检验的证明,用于生产级密码学库 12。 在支撑 Signal 和 Shadowsocks 的代码库上进行的演示表明,CryptoProver 有望大幅缓解验证安全关键密码学代码时所面临的专家人力瓶颈 12。 然而,这种方法有其边界:它运行在一个狭窄的、经形式规约限定的领域内,且仍需要人类提供的 API 合约作为起点,通用代码和智能体行为这片更广阔的疆域仍在其能力范围之外 12。
综合来看,这些发现表明:虽然定向验证可以部分自动化,但通向自主安全的大方向仍然脆弱——大多数 AI 生成的补丁存在缺陷,代理防护机制能被精心构造的问题请求常规绕过,而形式化方法仅能覆盖代码库的一部分。
边缘部署中的效率-隐私权衡
Liquid AI 发布了 LFM2.5-2.6B,这款 26 亿参数模型据该公司称可以在笔记本电脑、手机和 CPU 上完全在端侧运行智能体工作流,明确针对高吞吐量工作负载的成本与数据隐私顾虑13。 同期一篇预印本提出以嵌入为中心的框架 ECL,旨在将少样本、持续、零样本和上下文学习统一为一个面向资源受限边缘设备的单一端侧适配系统,以填补作者所说的一个关键空缺:大多数设备仅支持一种学习范式,或依赖云端重新训练,因而带来延迟、能耗和隐私方面的代价14。 这两项工作共同体现了一种日益兴起的架构转向,即把智能体控制和模型适配都保留在本地,以消除云依赖、维护隐私。
然而,另一篇预印本警告,支撑此类端侧推理的效率技术可能滋生新型攻击面。 SparSEEty 展示了首个针对在机密虚拟机(CVM)内运行且利用稀疏性的 LLM 服务系统的端到端令牌窃取攻击15。 该攻击利用了一个事实:跳过非活跃神经元计算的优化会产生依赖输入的内存访问模式; 这些模式泄露信息,打破了可信执行环境(TEE)的机密性保证15。 论文将此视为稀疏性带来的效率增益与安全飞地的隐私承诺之间的根本性冲突,表明为追求速度而裁剪计算的选择,却在悄然侵蚀本应保护敏感令牌的隔离机制。
SparSEEty 的发现并未直接考察设备端智能体部署,但其机制——由稀疏性驱动的内存访问所产生的侧信道泄露——指向的恰恰是那些在硬件受限的边缘设备上运行高性能智能体所可能依赖的优化类别。 LFM2.5-2.6B 版本将无云智能体执行作为隐私优势进行推广 13,ECL 也出于同样的理由力图消除云端重训练 14,但两者的披露都未说明其设备端路径是否依赖于稀疏性或类似的跳过计算的策略,而这类策略完全可能制造出类似的信息泄露通道。 综合起来看,这些进展暴露出一个日益尖锐的矛盾:对隐私友好且高效的设备端自主性的追求,迫使系统接受 SparSEEty 通过令牌提取生动展演的那种效率与保密性之间的折衷 15。 随着智能体工作负载从云端迁移到边缘芯片,那些让本地执行变得可行的架构选择,也可能在一种全新的、物理上更贴近的场景中,再次撕开它们本应弥合的隐私裂痕。
生成式设计驱动的科学发现
越来越多的叙述表明,人工智能正从分析已有科学数据,转向能够对功能性生物实体进行从头生成式设计的系统。 Hacker News 上的一篇社区帖子提到,科学家利用在涵盖所有生命领域的数百万个来源基因序列上训练出的 AI 工具 Evo,生成了数千个全新的病毒基因组组合; 其中约 300 个基因组在实验室中合成并测试,有 16 个被证实是能感染大肠杆菌的可存活性噬菌体 16。 The Decoder 的一篇媒体报道印证了这一结果,指出斯坦福大学和 Arc Institute 的研究人员实现了该报道所称的“完整基因组的首次生成式设计”,且这项在实验室中制造出可杀死细菌的功能性复制病毒的工作,已通过同行评审并发表于 Science 17。 两方面的叙述都试探性地指向一个未来:AI 驱动的基因组设计将加速针对多重耐药感染的适应性噬菌体疗法的工程化,并改进用于基因治疗的病毒载体 16, 17。
LessWrong 上另一篇社区帖子则报道了生成式科学产出的另一类表现:OpenAI 未发布的模型 Astra,据称解决了十个重大的开放数学问题 18。 该模型被指向一组形式可验证的问题,据报道以大约 2,000 美元的低推理预算生成了候选解; 随后,人类合作者将模型的论证整理成手稿,模型再逐一将论证形式化为 Lean 证明证书 18。 该帖将这视为前沿模型能以低成本产出可发表质量数学研究的初步证据,暗示了一条通向自动化 AI 研发的路径 18。
综合考虑这些初步、置信度不高的叙述——它们全都不是直接来自同行评审的来源——拼凑出的是一幅尚不确定但具有提示意义的转变图景。 它们表明,生成模型在早期和有限的实例中,已不仅仅是从已有知识库中提取模式,而是在主动设计全新的功能性人工产物,无论是病毒基因组还是数学证明。 通过社区与媒体渠道转述的 Evo 结果,仍然是所谓向功能性生物实体生成设计转型的主要证据,而 Astra 的叙述则暗示形式科学中存在类似的能力。
简讯
天气预报在两个方向上取得了进展。 《自然》 上的一篇论文介绍了 WeatherNext Cyclones,这是一种业务化 AI 模型,能够生成热带气旋路径、强度和尺度预报的大规模集合,预报时效长达 15 天,在 2023–2025 年的气旋预报中,其提前量比领先的业务模型多出一天以上19。 另外,DeepMind 发布了一款名为 WeatherNext 的单一 AI 模型,可以同时预测气旋路径、强度和风场结构,准确度达到最先进水平,弥合了粗分辨率全球模型与细尺度局地模型之间的差距20。 在材料领域,麻省理工学院的研究人员与合作者开发了一种方法,可以在石墨烯层与二氧化硅衬底之间的亚纳米间隙中生长单层二硒化铌,从而制备出大面积、空气稳定的超薄超导体; MIT 新闻的报道称,这有望克服一个关键的制造瓶颈,该瓶颈一直阻碍着用于量子器件的二维超导体实现晶圆级生产21。
OpenAI 推出了 GPT-Live,这是一款第三代全双工语音系统,从音频路径中移除了轮次检测器,使模型能够同时听和说,并采用了全新的有状态流式推理架构,该公司表示这带来了低延迟22。 在视频生成领域,QbitAI 报道称,Sand.ai 发布了 MAGI-2-preview,这是一个开源模型,总参数量 114B,每次前向传播激活约 6B 参数,被称为首个开源百亿级混合专家视频生成模型23。
在具身智能方面,Google 发布了 Gemini Robotics ER 2,这是一款具身推理模型,在前代基础上引入基于视频的实时进度跟踪、多机器人协作以及与 Gemini Live API 的低延迟双向流集成 24。 Microsoft 开源了 Orchard,一个面向可扩展智能体研究的框架; 据该公司介绍,约 3B 活跃参数的小型开放权重模型可在复杂真实任务上逼近规模超过自身十倍以上的闭源前沿系统性能 25。 AWS 宣布与 Formula 1 共同构建了 Data Accelerator,这是一个基于 Amazon Bedrock AgentCore 的智能体系统,可自动完成数据源接入、模式演变和 GDPR 分类,使接入时间缩短约 99%,并消化了 18 个月的积压集成需求 26。 OpenAI 还宣布了 GPT-5.6 模型家族; 据该公司称,GPT-5.6 Sol 在最大推理强度下的编码表现,在 Artificial Analysis Coding Agent Index 上优于 Claude Fable 5,成本却不到后者的一半 27。
综合与展望
现有证据基础——11 项 A 层研究来源、12 项 B 层一手报告和 5 项社区整理内容——让我们对专用自主能力的转向抱有中到高度的信心,但在边缘部署的稀疏性优化所带来的实际安全漏洞上,覆盖最为薄弱。 这些发展预示着一个未来:AI 的价值将取决于领域扎根的忠实度,而非泛泛的流利度; 原生智能体自主性和设备端效率都在推动紧凑、感知集成的系统,但边缘端稀疏性优化的隐私影响——至今仍理解不足——给智能体所依赖的原始传感数据安全性带来了不确定性。 类似地,对物理保真世界模型和预后临床模型的追求,与生成式科学设计一致,都需要基于测量的验证,但自主代码与安全补丁的脆弱性,又让 AI 驱动的发现流水线的可靠性蒙上阴影。 一个核心的开放问题随之浮现:为物理和临床忠实度所需的架构,能否在不牺牲定义原生自主性的感知开放性的前提下,强化自身以抵御由效率优化所催生的新型攻击面?
原文链接与引用索引
- [1] Qwen-CUA:面向(几乎)所有场景的原生计算机使用智能体 — arXiv · Tier A/research_paper
- [2] AI不再用完即忘:华为诺亚开源MindMemOS,记忆和Skill一起进化 — 量子位 QbitAI · Tier C/media_report
- [3] Argus:面向长程推理的通用智能体运行时 — arXiv · Tier A/research_paper
- [4] GAUGE:面向仿真引擎与视频世界模型物理保真度的测量基准 — arXiv · Tier A/research_paper
- [5] 走进 Omniverse:开放世界模型如何推动物理 AI 前沿 — NVIDIA Blog: Generative AI · Tier B/official_tech_blog
- [6] EnvACE:通过世界排练内化环境动态的智能体强化学习 — arXiv · Tier A/research_paper
- [7] 自监督DXA表征编码多系统疾病风险、生物衰老与遗传性 — arXiv · Tier A/research_paper
- [8] 用于基于睡眠的风险分层与临床预后的基础模型 — Nature Communications · Tier A/research_paper
- [9] 教AI说病理学的语言 — Microsoft AI Blog · Tier B/official_tech_blog
- [10] AI生成的漏洞补丁仍需专家人工审核 — Hacker News: AI/LLM · Tier C/community_opinion
- [11] IssueTrojanBench:针对恶意Issue请求的AI编程智能体安全基准测试 — Hacker News: AI/LLM · Tier A/research_paper
- [12] 面向生产级密码学库验证的AI方法 — arXiv · Tier A/research_paper
- [13] 使用 LFM2.5-2.6B 在本地随处部署智能体 — Hugging Face Blog · Tier B/official_tech_blog
- [14] 通过统一小样本、零样本、持续与上下文学习实现边缘端多用途设备自适应 — arXiv · Tier A/research_paper
- [15] SparSEEty:通过确定性侧信道从利用稀疏性的LLM推理系统中提取Token — Hacker News: AI/LLM · Tier A/research_paper
- [16] AI从零开始创造16种新病毒 — Hacker News: AI/LLM · Tier C/community_opinion
- [17] 斯坦福大学和Arc研究所科学家利用AI设计出在实验室中杀死细菌的新病毒 — The Decoder · Tier D/other
- [18] OpenAI未发布模型Astra解决十大开放数学问题 — LessWrong · Tier C/community_opinion
- [19] 利用人工智能进行热带气旋业务预报(Nature) — Nature · Tier A/research_paper
- [20] WeatherNext:AI模型在气旋预测领域取得突破 — DeepMind Blog · Tier B/official_tech_blog
- [21] 研究人员制造出空气稳定的超薄超导体,助力量子器件规模化 — MIT News: Computer Science · Tier D/other
- [22] 我们如何在六个月内构建了响应式语音AI实时系统 — OpenAI Blog · Tier B/official_tech_blog
- [23] 114B参数、6B激活,Sand.ai刚刚开源全球首个千亿MoE视频生成模型 — 量子位 QbitAI · Tier C/media_report
- [24] 推出 Gemini Robotics ER 2 — Google AI News · Tier B/official_tech_blog
- [25] Orchard:面向可扩展智能体AI的开放框架 — Microsoft Research · Tier B/official_tech_blog
- [26] 从数周到数分钟:Formula 1®如何利用AWS上的智能体AI加速数据运营 — AWS Machine Learning Blog · Tier B/official_tech_blog
- [27] GPT-5.6融合前沿智能与前沿效率 — Hacker News: AI/LLM · Tier B/official_tech_blog