AI Sentinel: Frontier

AI Daily Review

2026-06-23 · 中文 · full text with sources

在 App 里订阅关键词提醒

你关心的话题一有动静就推送 · 30 天归档 · 每日语音
因审核政策原因,暂未在中国区上架;海外 Apple ID 可下载

AI 收益越来越来自控制层,而非原始规模扩张

2026-06-23 00:00 UTC

要点

当天的证据表明,AI 进步越来越不是单纯由原始规模定义,而是由控制层定义; 这些控制层让强大的模型在受限环境中变得可靠、经济且可用。 长周期智能体正被重新塑造成具备外部记忆、验证、搜索和资源分配能力的受治理系统; 推理时方法通过改变预训练模型的计算方式而非重新训练模型来带来增益; 评测也正从通用评分准则转向可执行、对策略敏感的规范。 同样的模式也出现在具身 AI 中:显式世界模型改善了规划,同时带来了新的完整性风险; 在商业部署中,路由、交易和工作流集成日益决定价值。 在科学、统计和临床等领域,进展同样更多取决于任务表述和归纳偏置,而不是通用基础模型迁移; 效率、机器人、医学、去中心化学习、产品和治理等相邻方向的进展,也进一步强化了从能力积累转向能力控制的总体趋势。

长周期智能体正在成为受治理的系统,而不只是更大的提示词

长周期智能体设计正在摆脱一种假设:模型只需“记住”并执行初始计划即可。 原因在于,重放配对表明,计划可能只是留存在上下文中,而不是作为内部状态持续存在 1。 其实际后果不只是优雅性降低,还包括隐藏的脆弱性:如果智能体在计划文本仍然可见时通过了行为测试,那么之后的上下文压缩或驱逐可能会悄然破坏同样的长周期行为 1。 ALFWorld 压力测试将这种失效模式具体化:在每种策略 150 次运行中,朴素的计划驱逐使成功率下降了 34% 1

这一结果直接说明,资源治理应被视为一个控制层,而不是节省 token 的事后补救; 因为当计划存储在上下文中时,上下文保留、提示词冗长度和工具预算都会成为可靠性变量 1, 2。 Stackelberg 框架进一步扩展了这一诊断,将多轮资源选择视为控制器与执行器之间的上下文博弈:控制器承诺质量目标和成本补贴,执行器选择资源动作 2。 在这一框架下,静态规则并不足够,因为它们要么浪费 token,要么在长会话中降低质量; 而动态治理在一次 300 轮真实 API 实验中,将平均 token 成本降低了 17.4%,且没有造成统计上显著的质量损失 2。 这两项结果高度一致:一项表明记忆管理对计划执行具有承重作用,另一项则提供了在成本—质量约束下分配上下文及相关资源的形式化机制 1, 2

ENVS 将这种从隐式提示转向外部控制的变化延伸到了 GUI 智能体的动作选择中; 在 GUI 场景下,长周期控制面临稀疏、延迟且昂贵的反馈 3。 ENVS 并不依赖单条持续轨迹,而是从冻结策略中采样候选动作,按粗粒度动作指纹分桶,并在并行虚拟机中对一致性最高的动作桶进行分支搜索 3。 这是围绕策略构建的验证与搜索脚手架,而不是声称仅靠策略本身就能支撑长周期任务 3。 其在 OSWORLD 上报告的 30.3% pass@8、相比 ARPO 风格在线强化学习少 25–30% 的 GPU 小时,以及在噪声干扰下 29.0% 的性能表明,结构化搜索能够提升长周期 GUI 性能,同时相对于该比较基线减少计算开销 3

推理模型的证据为同一模式提供了训练侧的类比:理论研究表明,在思维链推理中,带可验证奖励的强化学习通过学会高效回溯,能够在推理时计算效率上比监督微调实现指数级优势 4。 这一结果并不只是关于生成更长的轨迹,因为被识别出的优势在于能够定位困难决策,并通过回溯分配测试时计算,而纯模仿缺乏这种机制 4。 相对于 ENVS,RLVR 提供了一条通过学习来修正早期推理路径的路线; 而 ENVS 则在稀疏反馈下,为围绕行动选择进行分支提供了一条外部的、经过验证的搜索路线 3, 4。 相对于上下文治理研究,二者都指向同一个约束:持久的长程能力依赖于受管理的记忆、计算分配、验证和搜索,而不能把计划、反馈和修订仅仅当作非正式的提示词产物 1, 2, 3, 4

推理时适应正在成为获得可用收益的最快路径

最清晰的共同模式是,收益正通过改变推理时计算从预训练系统中提取出来,而不是重新开启主干训练; SpotAttention 将稀疏路由改造到冻结的 Transformer 上,TEXEDO 在冻结生成器的输出中进行选择,PG-MAP 则在去噪轨迹中优化条件信息和潜变量状态 5, 6, 7。 这并不是某一种单一技术,而是一种共同的控制层转移:预训练模型仍是底座,而路由、选择或优化决定其能力在运行时如何被使用 5, 6, 7

SpotAttention 通过向冻结的预训练 Transformer 添加一个轻量级插件式选择器,使长上下文推理能够在不重新训练主干的情况下使用块稀疏注意力,从而明确提出了效率层面的论点 5。 它面向的是长上下文使用的成本结构:二次复杂度的预填充和随长度线性增长的 KV 缓存读取主导了推理成本; 其报告的结果是,相比 FlashAttention,每步解码延迟最高降低 3.9 倍 5。 重要的架构含义在于,可用的长上下文行为可以通过在推理时决定哪些块获得注意力来改进,而不是把完整上下文视为始终处于激活状态的计算预算 5

TEXEDO 认同这一推理时前提,但把它从语言上下文转移到了具身运动可行性上 6。 它不是重新训练文本到动作生成器,使其内化下游控制器限制,而是使用冻结的文本到动作生成器采样多个候选动作,并用选择器挑选最符合控制器约束的选项 6。 其动机是实际的,而非表面上的:现有基于重定向人体数据训练的文本到动作模型,可以生成运动学上看似合理、但在平衡、接触或驱动约束下仍会失败的动作 6。 相对于 SpotAttention,这里的选择器不再是为了效率而路由注意力块,而是为了物理可执行性而路由生成候选; 但两个系统都把决定性计算转移到围绕冻结预训练组件的轻量级推理时层中 5, 6

PG-MAP 将同一论点延伸到扩散和流匹配生成中,其中运行时干预既不是稀疏路由,也不是候选选择,而是联合轨迹优化 7。 它通过前向一致性耦合,在每个去噪步骤联合优化文本条件和潜变量状态,而不是只改变生成过程中的某一个静态轴 7。 其报告的改进覆盖组合对齐和纹理质量两个方面,在 SD 1.5/SDXL 上的 PickScore 胜率为 55–57%,在 SD3 上为 91.9% 7。 这一结果使 PG-MAP 与 TEXEDO 形成了富有成效的张力:TEXEDO 采样备选方案并从中选择,而 PG-MAP 持续重塑条件—潜变量轨迹; 但二者都把推理时搜索或优化作为从现有生成器中提取更可用行为的机制 6, 7

关于 Spatial-TTT 的媒体报道显示,同样的工程直觉也正在空间智能中出现:一个 20 亿参数的多模态模型在观看长视频时,会持续更新内部 3D 世界状态,而不是依赖不断加长的上下文窗口 8。 该报道称,与领先的行业模型相比,这种从被动长上下文存储转向主动、基于参数的空间记忆的方式,使峰值内存降低超过 40%,同时在路线规划、相对方向和外观排序任务上提升了准确率 8。 鉴于该信息来自 Tier C 来源,需要谨慎看待; 但 Spatial-TTT 仍然把推理时适应模式从注意力、动作和扩散延伸到了状态管理:运行时更新成为一种替代方案,不再只是把更多上下文一路携带下去 8

这些案例共同展示了近期能力提升的一条务实方向:通过在推理时插入机制来决定计算资源流向何处、哪个候选结果得以保留、轨迹如何演化,或保留什么状态,从而让预训练系统更低成本、更可控,或更符合任务约束 5, 6, 7, 8。 共同的启示并不是训练已经变得无关紧要,而是当天若干最有力的例子都把边际改进定位在训练之后对计算过程的控制上:在延迟、控制器、对齐和记忆约束下,让冻结模型变得更可用 5, 6, 7, 8

评估与安全正在从通用评分规则转向可执行、对策略敏感的规范

从这些证据来看,评估与安全正在远离通用评分规则,因为所适用的标准越来越取决于部署策略、模型能力或领域任务语义,而不是稳定的全局分类体系 9, 10, 11。 SingGuard 在多模态防护栏场景中明确体现了这一转变:它将自然语言安全规则作为运行时输入,以应对固定分类体系在部署策略变化或跨模态风险组合下失效的情况 9。 其动态规则准确率在策略变化下从 0.6465 提升到 0.7415,这支持了一个范围较窄但重要的结论:当治理标准发生变化时,受策略条件约束的决策可以优于静态规则类别 9

同样的压力也出现在自动化评估中,但失效模式不同:当 VLM 被用作视频生成器和世界模型的评判者时,固定的全局模式可能要求每个模型对其未必能感知的维度打分,从而掩盖模型特有的盲点 10。 “按 VLM 定制分类体系”的方向因此与 SingGuard 的运行时策略输入形成互补:二者都拒绝单一通用评分规则,但 SingGuard 根据策略上下文改变规则,而 VLM 评估工作则结合评判模型的感知与评估特征改变评分规则 9, 10。 这一点很重要,因为当 VLM 评判者的分数成为生成视频和世界模型的奖励信号或筛选标准时,其可靠性会直接限制下游系统质量 10

RoboGaze 将同样的批判从模型特定的评判扩展到机器人视频评估中的任务特定诊断 12。 它没有把机器人视频评估视为单一的标量打分,而是通过一套面向机器人的层级分类体系,将评估重构为结构化诊断推理,涵盖任务执行、物理合理性和视觉质量 12。 这与按 VLM 定制分类体系的主张一致,都拒绝无差别的分数; 但它的主要重点在于诊断任务执行过程中哪里失败、何时失败以及为何失败,而不是将评分规则校准到某个具体的 VLM 评判者 10, 12。 在机器人场景中,其安全相关性也更加具体,因为当视觉上可信但物理上不可能的合成视频成为机器人预测与规划的接口时,这类视频会被视为可靠性风险 12

NeuroDoc 进一步推进了这一模式,将基准构建本身视为一个规范问题,而不是事后评分问题 11。 在 EEG 基准测试中,尽管基础模型会在许多异构数据集上进行预训练,关键任务语义仍分散在论文和未文档化的代码中,导致人们需要反复手动重建任务 11。 NeuroDoc 的规则手册引导式任务文档和可执行内核,再配合 NeuroAudit 的结构化社区评审,使基准语义变得明确且可审计,而不是隐含在文字或代码片段中 11。 与 SingGuard、按 VLM 定制分类体系以及 RoboGaze 相比,这是同一转向中最接近基础设施的一种形式:预期标准不再被假定为通用标准,而是被写明、条件化、分解,或做成可执行形式,使评估与安全决策能够依据明确规范进行检查 9, 10, 12, 11

具身空间智能正在获得显式世界状态,但这种世界状态也成为新的失效点

具身空间 AI 正在收敛到一个共同的设计前提:有用的行动越来越依赖显式的内部世界状态,而不仅仅依靠直接感知或语言层面的推理 13, 14, 15。 CanonicalGS 将这一前提体现在静态场景重建中:它把前馈式高斯泼溅转化为表征学习,在解码高斯基元之前,将多视角证据聚合为稳定的、以场景为中心的规范潜在世界 13。 IRR-Drive 将同样的逻辑扩展到动态决策中,把文本化的轨迹意图与未来语义 BEV 预测相结合,使自动驾驶中的反思在最终规划之前建立在对物理场景演化的预期之上 14。 Humanoid-OmniOcc 则提供了互补的数据基础设施论点:人形机器人需要全景立体占据覆盖,因为面向驾驶的、前向视角的、远场数据集,以及依赖单目或 LiDAR 的替代方案,都会引入并不适合头戴式人形平台的空间先验 15

这些工作都表明,表征质量正成为一项一阶能力约束,而不再只是下游可视化细节 13, 14, 15。 在 CanonicalGS 中,引入稳定的规范潜在世界,是因为主要为渲染而优化的前馈式高斯泼溅方法在加入更多视角时可能出现收益递减或不稳定 13。 在 IRR-Drive 中,复杂动态场景下的可靠性,取决于通过未来语义 BEV 预测让反思具备空间落点,而不是让高层推理停留在纯文本层面 14。 在 Humanoid-OmniOcc 中,具身空间能力与来自四组同步立体相机的 360 度视觉覆盖相关,因为机器人的视角和身体形态会改变何种占据信息才是合适的 15

同样的转变也带来了更尖锐的失效模式:一旦规划器信任某个想象出的或规范化的世界,该表征中的污染或不完整就可能传播到动作选择和验证过程中 16。 针对“先想象、再行动”的视觉-语言-动作策略所描述的攻击,将由世界-动作模型生成的潜在想象识别为新的攻击面,原因正是这些系统依赖想象中的未来来进行规划和安全验证 16。 这一结果与 CanonicalGS 和 IRR-Drive 的建设性路径形成直接张力:系统越能从稳定的规范世界或预期的 BEV 未来中受益,这些中间世界的完整性就越关键 13, 14, 16

覆盖范围是第二个瓶颈,而 Humanoid-OmniOcc 将这一约束从理论问题变成了具体问题 15。 如果人形智能体使用由自动驾驶假设塑造的空间数据进行训练或评估,那么其内部占据表征就会继承关于视角和关注范围的不匹配先验 15。 这一担忧与 CanonicalGS 对稳定多视角聚合的强调相互补充,因为只有当被聚合的证据以适合具身平台的形式覆盖场景时,稳定性才有价值 13, 15。 它也与 IRR-Drive 对未来 BEV 预测的使用相互补充,因为用于规划的预测取决于产生该预测的空间状态是否充分 14, 15

由此得到的结论并不是想象出的世界可有可无; 证据指向相反方向 13, 14, 15。 稳定的规范表征、未来语义 BEV 预测和全景占据数据集,正成为具身约束下空间智能的使能层 13, 14, 15。 尚未解决的风险在于,这些层本身会成为安全关键对象; 其完整性、覆盖范围以及抗操纵能力,必须被视为控制系统的一部分,而不是被当作被动的模型内部状态 16, 15

商业 AI 基础设施正围绕路由、交易与工作流嵌入重组

贯穿路由、支付和工作流封装的最强共同信号是:生产环境中的 AI 价值正在转向围绕模型的控制基础设施,而不再只取决于某一个模型的选择 17, 18, 19, 20。 Tier A 的路由证据从技术层面明确体现了这一转变:在编码任务中,没有单一模型能在所有编码维度上都占据优势; 静态路由器之所以失效,是因为它们无法在部署期间获取基于执行结果的反馈 17。 同一项研究指出,LLM 路由的核心瓶颈是信息不足,而不是推理失败; 并称向路由器提供按维度划分的性能统计数据,可带来 15.3% 的相对增益 17。 这一发现将“最佳模型”选择重新界定为一个运营问题:如何收集、更新并使用特定部署环境中的性能信息 17

Ampersend 与 AWS 的支付集成把这种路由逻辑从模型选择扩展到市场接入,但其证据性质有所不同,因为它来自第一方厂商叙述 18。 Ampersend 和 AWS 表示,Amazon Bedrock AgentCore Payments 已与一个模型路由市场集成,使 AI Agent 能够在无需人工介入、也无需与各提供商分别签订计费合同的情况下,自主发现、选择并支付 LLM 推理及其他智能服务 18。 这与路由论文的关联非常直接:如果路由器在拥有基于执行结果的性能信息时会改进,那么市场层就补上了必要的交易机制,使 Agent 能够依据路由决策在付费服务之间采取行动 17, 18。 Ampersend 和 AWS 还称,托管钱包、x402 原生结算以及确定性支出治理,可为 Agent 构建者节省预计三到四个月的钱包托管与计费集成工作,从而把支付定位为部署基础设施,而不是边缘性的计费问题 18

AWS 关于在 SageMaker 上运行 ComfyUI 的教程展示了同样的基础设施模式,只不过它发生在企业工作流内部,而不是跨模型市场之中 19。 AWS 提出了一套可投入生产的架构,用于将 ComfyUI 生成式 AI 工作流作为批处理作业运行在 Amazon SageMaker 上,从而把生成式工作流转化为托管处理基础设施,而不是手动桌面操作流程 19。 AWS 将企业用例置于营销活动素材创建的背景下,并称手动创建素材既缓慢又昂贵 19。 结合路由与支付方面的证据来看,这个例子再次转移了价值重心:运营资产不只是图像生成模型,还包括将生成式流水线封装为可重复的批处理工作,并与企业生产需求对齐的能力 17, 18, 19

NVIDIA 的科学计算公告则把工作流嵌入扩展到了另一类领域:其瓶颈不是营销生产,而是数据移动和分析规模 20。 NVIDIA 发布了用于 GPU 加速处理天文 FITS 数据的 cuPhoton、用于从高速探测器进行实时流式传输的 DAQIRI,以及面向大规模材料和分子模拟的 ALCHEMI NIM 微服务 20。 NVIDIA 将这些工具置于 LSST 相机和 CERN 的 ATLAS 探测器等科学仪器的背景下,并称这些仪器产生数据的速度超过传统 CPU 系统的存储或分析能力,迫使研究人员丢弃 99% 以上的碰撞事件,并让天体物理流水线等待数日 20。 综合来看,这些证据描绘出的商业 AI 基础设施,是由路由智能、可编程交易能力,以及面向企业和科学场景的工作流嵌入共同组成的技术栈 17, 18, 19, 20

领域 AI 的进展越来越依赖任务表述和归纳偏置,而非通用基础模型迁移

在这些领域案例中,进展的核心并不是把宽泛模型应用到标准输入上,而是围绕实际使用中真正重要的结构来重新表述任务:未见过的多微生物组成、稀疏科学观测、端到端统计工作流,以及 ECG 的解剖组织方式 21, 22, 23, 24。 PHOEBI 在微生物学中体现了这一点:它将一个湿实验数据集与留出组合协议相结合,数据集包含约 120,000 张相差显微图像,覆盖六种细菌的 40 种组合; 该协议用于测试模型对未见过的多微生物混合物的组成泛化能力 21。 这种设计使细菌识别不再局限于纯培养、单标签或菌落尺度计算机视觉基准中的封闭集假设,而是转向开放世界的混合物场景; 这一场景也正是自动化细菌识别作为缓慢且昂贵的 16S rRNA 测序替代方案时所隐含的应用环境 21

Neural Operator Processes 将同样的逻辑从生物识别扩展到科学场预测:该方法面向稀疏、不规则的上下文集合,而不是密集配对网格,因为许多数据同化和基于 PDE 的推断问题提供的是稀疏、不规则测量,而非完整观测场 22。 因此,其贡献并不只是一个规模更大的通用预测器,而是一种概率算子学习表述:它结合神经过程条件化与神经算子解码,在部分观测条件下推断完整输出场 22。 与 PHOEBI 相呼应,这里的共同做法是让基准或模型契合该领域的观测机制,而不是把领域问题简化成传统监督学习格式 21, 22

StatABench 增加了另一种不同但互补的约束:统计能力通过开放式建模任务来评估,这些任务要求端到端分析与报告生成,并结合智能体式工具使用和动态多维评估,而不是孤立地选择答案 23。 结果显示,这种表述暴露出显著的能力缺口:GPT-5.1 在 Stat-Closed 上仅达到 68.6%,最佳开源模型达到 60.6%,而顶尖智能体框架在 Stat-Open 上的平均分为 61.86 23。 这一证据与“宽泛的语言模型能力会自动迁移到统计实践中”的假设存在张力,因为该基准经过验证的 LLM-as-Judge 协议关注的是报告、工具和建模决策中的分析质量,而不是通用文本流畅度 23

ECG 研究则最鲜明地展示了领域归纳偏置与通用多模态迁移之间的架构差异 24。 LeadGroupECG 通过确定性的导联组提取器编码解剖学导联组结构,并使用结合自适应池化与概念瓶颈分数的双路径决策头; 其内部 ROC-AUC 稳定在 0.92–0.94,外部 ROC-AUC 达到 0.85–0.86 24。 零样本多模态 LLM 在同一 ECG 图像分类场景中的表现接近随机,ROC-AUC 约为 0.5,表明在该案例中,相关临床结构并不能通过通用零样本多模态使用得到恢复 24

总体来看,这些研究一致表明,领域 AI 的收益取决于让任务、观测模型、评估机制或架构与领域结构相匹配 21, 22, 23, 24。 这一模式并非笼统地反对基础模型,但它确实反驳了这样一种看法:在科学、统计和临床场景中,当组成混合物、部分观测、智能体式分析和生理组织方式定义了问题本身时,通用基础模型迁移仍是决定性机制 21, 22, 23, 24

简要关注

ScalingAttention 指出,视频扩散 Transformer 的注意力头会收敛到一种稳定、与提示无关、尺度不变的“内在稀疏拓扑”(Intrinsic Sparse Topology),这种拓扑编码在权重中,而不只是由输入诱导产生。 由于该方法无需重新训练且不损失质量即可加速视频模型,它表明架构稀疏性是一种可利用的系统属性,而非事后压缩技巧 25。 DEEPDISCOVERY 将工业代码检索重新定义为任务级恢复问题,即跨文件、配置和测试恢复完整实现路径,以解决编码智能体倾向于检索局部相似但运行上不完整片段的问题 26。 Black-CL 为黑盒部署约束下的视觉-语言模型持续学习提出了更严格的基准,包括无骨干网络梯度、无法访问架构、计算资源有限,以及在全局标签空间中进行任务无关推理 27

多篇面向智能体的论文不再主要追求更强的基础模型,而是转向更好的监督、诊断与信用分配。 CLI-Universe 提出了一种由内而外的合成引擎,可基于结构化能力分类体系生成终端智能体任务,旨在缓解可执行、无歧义且带有可靠测试的训练数据稀缺问题 28。 一项关于 LLM 智能体“过早承诺”的研究识别出一种失效模式:智能体会锁定早期解释并为其辩护; 研究引入了表征承诺,将其作为完成前隐藏状态诊断指标,用于识别不可靠轨迹 29。 G2PO 通过将 rollout 重构为全局状态转移图,处理长时程智能体强化学习中的稀疏奖励和高方差信用分配问题,同时仅带来很小的计算开销 30

机器人与具身系统也带来了一组并行的基础设施进展。 PanoVine 展示了一种具备全身视觉运动控制的自主软体生长藤蔓机器人,使这一此前受极端柔顺性和形状不可预测性限制、主要依赖遥操作的平台向前迈进 31。 MotionMAR 提出了一种由粗到细的自回归方法,可从稀疏的头部和手部追踪器观测中重建全身人体运动; 对于 VR/AR 和人机交互而言,这是一项关键能力,因为最少传感器配置往往会产生抖动或不合理的身体动力学 32。 在机器人模仿学习中,一种轨迹标准化方法从数据预处理层面处理操作员速度不一、停顿以及动作密度不一致的问题,使该改进能够与现有策略架构兼容 33

工业安全也进入当日议程:CITADEL 是一套面向 IIoT、基于 CSI 的端到端干扰检测系统,可在通用硬件上结合已知攻击分类、开放集零日检测和对抗鲁棒性。 其重要性在于,它超越了粗粒度 RSS 方法和昂贵的软件定义无线电方案; 在半导体制造和化工处理等环境中,射频干扰可能带来物理安全风险 34

综合与展望

总体来看,当日证据表明,该领域正在从以规模为中心的能力生产,转向工程化控制层的构建,使现有与新兴模型能够在具体情境中更可靠、更经济、也更可治理。 长时程智能体、推理时适应、可执行评测、具身世界模型、商业路由基础设施以及领域特定归纳偏置,都强化了同一种趋势:性能提升越来越多来自对模型如何行动、如何计算、如何被评判以及如何嵌入环境的结构化设计,而不是假定更大的预训练模型会内化这些要求。 相关张力同样重要。 外部脚手架可以改善验证和资源分配,但也会在记忆、路由、策略解释和世界状态表示中引入新的失效面。 任务特定评测能够让标准更明确,却可能削弱不同系统之间的可比性。 领域化建模可以在通用迁移表现不足的地方释放进展,但也会提高部署专业知识和基准设计的成本。 商业基础设施与这些趋势相呼应,将模型选择、支付和工作流集成转化为可编程层,这意味着在约束条件下善于编排能力的系统可能获得实际优势。 鉴于 83 项进展覆盖面广,且以 Tier A 研究来源为主,这一综合判断具有中等偏强的可信度; 不过,在依赖二手报道、社区信号以及仍处早期的商业或治理主张之处,结论最为薄弱。 核心开放问题在于,这些控制层能否在规模化条件下实现可组合与可审计,还是说该领域只会把一种不透明性——大型模型内部机制——替换成另一种分布在智能体、评估器、路由器和领域工作流中的不透明性。

原文链接与引用索引