自主式AI崛起,可靠性工程与模型规模扩展同样关键
2026-07-17 02:28 UTC
重点
- 如 K3 和 Inkling 等开放权重模型能匹敌专有基准,但能力分布不均、高算力需求以及对社区微调的依赖带来了新的可及性和安全挑战,仅靠许可证无法解决。
- 将推理拆解为可组合子系统的模块化智能体流水线引入了新的故障模式和治理需求,包括回合级信用分配难题。
- 借助世界-行动模型的具身 AI 系统虽加速了策略学习,却因优先语言而非感觉运动经验,颠倒了生物基座层次,限制了真正的泛化。
- 对可验证性机制的汇聚——规范行动指纹与形式化验证器级联——表明,对自主智能体的信任必须内建为核心属性,而非附加功能。
从单体模型向可组合、智能体化和具身化 AI 系统的转变已解锁新能力,但这股浪潮也暴露了基座、信任和治理上的脆弱性,进而威胁大规模部署。 随着综述逐步展开,这些脆弱性在多个维度被逐一审视:开放权重模型因能力分布不均而凸显可及性与安全挑战; 模块化智能体架构以组合灵活性催生新的故障模式; 具身系统将语言置于感觉运动经验之上,削弱泛化能力; 以及新兴的可验证性技术栈将信任视为内建属性而非事后补救。 综合来看,这些章节共同指出,可靠性工程如今必须与模型规模化并立,成为一门核心学科。
开放权重模型以可用性和安全监督为代价,挑战专有模型的主导地位
开放权重模型的格局正在变化。 The Decoder 在 2026 年 7 月的一篇报道中指出,Kimi 的 K3——一个拥有 896 个专家和 2.8 万亿总参数的多模态混合专家模型——在 Artificial Analysis Intelligence Index 上取得 57 分,该报道称这一成绩与 Opus 4.8 和 GPT‑5.5 不相上下 1。 另一篇 Sebastian Raschka 的个人博文则详细介绍了 Inkling 的发布,这是一个 9750 亿参数的稀疏混合专家模型,激活参数为 410 亿,在 IFBench(79.8%)和 SimpleQA(43.9%)上表现强劲 2。 这些初步数据表明,开放权重模型在特定基准上已能与专有系统一较高下。
然而,同一篇博文也揭示出能力不均衡的问题。 Inkling 在推理和编程任务上的表现明显偏弱,HLE 得分 29.7%,SWE‑Bench Pro 得分 54.3%,该博文认为与其指令遵循优势相比,这些分数较低 2。 Raschka 的分析暗示,这种参差不齐的能力组合使得开放模型在未经大量下游微调时,难以作为直接替代品可靠使用。
发布策略使这一挑战更加复杂。 Simon Willison 的另一篇个人博文提到,Inkling 以 Apache 2.0 许可证分发,而 Raschka 的博文则指出,该模型旨在通过 Thinking Machines Lab 的 Tinker 平台进行进一步微调和专业化 3, 2。 Willison 的描述认为,这样的许可证和工具定位是把 Inkling 打造成社区自定义的基础,从而将安全对齐和特定领域性能的负担转移给用户而非开发者 3。 这些模型的规模——Inkling 9750 亿参数,K3 2.8 万亿参数——进一步表明,托管和适配它们需要大量资源,尽管两个来源均未量化这些成本。
发布后的可靠性又带来了另一层差距。 The Decoder 的另一篇报道记录了 Google Gemma 4 的一次隐蔽更新,修复了工具调用错误、减少了回复截断问题,并改进了智能体推理能力,同时在 Nvidia Hopper GPU 上使首 token 生成时间最高降低了 31% 4。 该报道指出,即便是一个获得良好支持的开放模型,出厂时仍存在生产级缺陷,需通过无声补丁才能满足智能体工作流的可靠性预期。 报道认为,这种事后修复的需求凸显了采用该模型的社区所背负的可用性负担 4。
综合来看,这些报道初步显示,尽管 K3 和 Inkling 等开放权重模型目前在某些指标上正在挑战专有模型的性能,但不均衡的能力组合、将安全责任下放至下游微调,以及持续需要发布后补丁的现状,共同构成了可访问性与监督方面的障碍,而仅靠一纸开源许可证是无法解决这些障碍的。
模块化代理架构以可组合但脆弱的子系统取代单体推理
近期一系列工作显示出一种结构性转向:不再依赖单体语言模型推理,而是走向可组合的代理子系统,每个子系统专门应对端到端流水线中固有的特定失效模式。 长程工具使用如今被当作一个可与语言模型本身分离的信用分配问题来处理:TRACE 在工具调用边界提供无需批评者、密集的回合级奖励,让代理能够区分有效探索与冗余动作,从而解决困扰单体强化学习设置的稀疏、高方差结果奖励问题5。 误差修正则从基于提示的迭代反思循环中抽离出来,变成一个确定性离线图匹配过程。 EMG 用图计算替代测试时的试错,降低了延迟和 API 成本,同时为不擅长自我反思的小模型提升了鲁棒性6。 记忆访问被重新界定为一个与核心代理分离的强化学习问题:MEMCON 学习一种在线上下文赌博机策略(采用 UCB 探索),无需任何额外的 LLM 调用就能决定何时检索、注入提炼计划、重新检索、巩固或遗忘,这是因为静态记忆启发式方法在不同任务区域被证实校准失当——当记忆稀疏时检索过于激进,当存在可复用计划时又过于保守,或者无法帮助陷入困境的代理7。 最后,SPyCE 将多模态代理的 rollout 轨迹蒸馏为一个持续更新的层次化技能库,包含执行技能(针对局部视觉操作的条件-动作-效果三元组)和工作流技能(高层工具编排先验),从而捕捉那些通常作为标量奖励信号丢失的重复模式,避免代理在每个新任务上重新发现它们8。
上述每一项工作都将原本可能被单体 LLM 代理包揽的功能——信用估计、错误恢复、记忆管理、技能重用——转移到一个专用的、外部管理的组件中。 将它们放在一起看,这暗示了一种决定性的架构转向,即走向可靠性被分解为独立工程子系统的模块化代理流水线。 然而,正是这种带来增益的分解也引入了新的脆弱性。 MEMCON 将记忆操作建模为马尔可夫决策过程,并学习一种在线策略,自适应地决定何时检索、检索什么、检索多少、何时注入提炼计划以及何时巩固或遗忘7。 TRACE 强调,没有显式的回合级分配,训练动态无法区分有效探索与冗余或有害动作,代理容易受到高方差反馈的影响5。 EMG 的设计选择源于观察到迭代自我反思对小模型而言十分脆弱,因此其离线修正正是针对特定模型弱点的定向补救6。 SPyCE 的技能闭环协同进化则凸显出,没有结构化技能库,多模态代理缺乏可复用的工具使用基础,只能依赖脆弱的、面向每个任务的重新发现8。 这些子系统之间的相互作用——奖励信号塑造记忆检索,误差图引用技能库,记忆策略影响信用分配轨迹——形成了一个治理界面,每个模块的失效模式都可能在此处级联,从而要求对其协同进化和校准进行显式管理。
目前,这四项工作均为 arXiv 预印本,同行评审状态未知; 因此,其结论是暂时的,但它们共同表明,模块化代理架构既是对单体 LLM 推理局限的回应,也产生了新的协调挑战,这需要系统性的可靠性工程。
具身智能向统一框架的推进,与其底层认知基础的根本缺陷相碰撞
世界-行动模型与学习式模拟循环的最新进展,正将具身策略学习推向实际部署。 一篇关于 GigaWorld-Policy-0.5 的预印本提到,一种混合 Transformer 架构在消费级 RTX 4090 上将推理延迟降至 85 毫秒,缩小了实时闭环控制中世界-行动模型与轻量级 VLA 策略的性能差距 9。 另一边,QbitAI 的报道显示,Dexmal 的 DW0.5 学习式世界模型在 DFOL2.0 框架内充当 VLA 后训练的虚拟教练,提供低成本的闭环反馈,减轻了昂贵真实世界遥操作的负担 10。 这些工程改进标志着向统一框架迈进的切实势头,这类框架旨在单一高效基底上整合动力学预测与动作生成。
然而,这一推进势头与两项更深层的发现相冲突,这些发现质疑了当前系统的语义与架构根基。 一篇关于机器人动作表征语义锚定的预印本诊断出一种系统性退化:VLA 模型仅进行动作微调,会逐步侵蚀其从预训练视觉-语言模型继承而来的意图级语义结构,且这种侵蚀与分布外泛化失败高度相关(斯皮尔曼 ρ=0.964)11。 该论文既提供了诊断工具,也给出了缓解侵蚀并提升性能的补救措施,但其核心发现暴露了标准微调方案中内建的脆弱性 11。 另一篇关于生物机体中认知基础世界模型的预印本则提出了更宏观的架构论证,主张生物智能先通过主动交互获得基于感知运动的世界模型,语言只是后来附着其上,而当前的具身智能系统却是建立在语言优先的架构之上 12。 该预印本认为,被动的、以语言为支撑的训练范式,未能捕捉到支撑生物智能的、以行动为导向的理解 12。
综合来看,这些发现意味着,朝着统一具身框架的加速追逐,正建立在一个颠倒的基础之上。 DW0.5 的虚拟教练加速了 VLA 的后训练过程 10,但语义锚定预印本却表明,对此类模型做面向动作的微调,恰恰会系统性地破坏支撑泛化所依赖的那个语义结构 11。 与此同时,常被用作 VLA 策略基础的预训练视觉-语言骨干,恰好具象化了语言优先的脚手架,而生物基础世界模型预印本已将其指认为一种根本性的架构局限 12。 GigaWorld-Policy-0.5 在时延上的突破 9 让世界模型驱动的控制得以在边缘硬件上落地,但底层的表征是否仍保有鲁棒物理泛化所要求的具身感知运动语义,依然不明朗。 因此,证据指向这样一个判断:只要具身 AI 系统仍然建立在语言优先的范式之上——这种范式颠倒了生物体中所见的感知运动基底——真正的泛化就很可能始终遥不可及,哪怕新的训练循环让这种范式在计算效率上更进一步。
企业 AI 基础设施繁荣超越成本可见性与上下文治理,回报面临威胁
VentureBeat 对 107 家企业的调查揭示了 AI 基础设施中一个鲜明的“算力缺口”:83% 的受访者 GPU 利用率在 50% 甚至更低,但只有不到一半(44%)严格追踪计算成本,且 45% 计划评估他们目前几乎不用的专用 AI 云13。 这种支出脱离经济纪律的初步图景意味着,资源供给正跑在防止浪费所需的财务仪表化前面。 部署端也出现了同样的初步模式。 另一篇 VentureBeat 的媒体报道指出一个“AI 上下文缺口”:57% 的受访组织表示,由于缺少或不一致的业务上下文,他们的智能体曾给出看似自信但错误的答案14。 该发现将上下文治理——而不仅仅是检索质量——定位为产生权威口吻幻觉的关键源头。
这两项媒体报导的调查合在一起,初步释放出一个正在浮现的双重赤字信号:企业一边快速供应 GPU、部署智能体,一边却缺乏避免低利用率所需的成本可见性工具,以及抑制幻觉所需的受管控知识层。 这种叠加效应很可能侵蚀基础设施支出的回报。
供应商的回应凸显了这一缺口的广度。 AWS 一则关于 Amazon Bedrock 托管知识库的官方公告,描述了一套完全托管的智能体检索解决方案,能够处理数据注入、向量存储、扩展、检索和文档级访问控制,无需用户自行供应基础设施或挑选模型15。 AWS 所描述的这项服务的可用性表明,许多企业缺少内部能力来组建此类受管控的检索管线,但仅凭基础设施层面的检索能否弥合调查14归因于缺失或不一致业务上下文所造成的上下文缺口,仍是个未知数。 与此同时,Together AI 的一篇第一方工程博客将推理可靠性层级映射到故障域,并给出生产指标16。 这又增加了一层脆弱性:即便是已报告利用不足的已供应容量,当推理成为关键任务时——该博客指出,对 Cursor、Decagon 这类产品而言,这正成为一种日益普遍的景象——也可能遭遇可靠性盲区。 由此,这一可靠性框架将算力缺口从单纯的利用不足,延伸到一个更细腻的担忧:企业是否真的理解自己所采购基础设施的故障域。
这些源于供应商披露和调查新闻的早期信号,勾勒出一幅警示图景:企业 AI 基础设施的繁荣,正在使其可靠生产所需的治理与成本核算纪律落后一步。
法律与隐私事件正重塑 AI 在竞争、内容与 IP 领域的运行边界
一系列被报道的法律与隐私事件——涉及反垄断执法、责任诉讼、商业秘密纠纷和数据泄露——正试探性地划出新的运行约束,迫使 AI 公司将安全、透明和公平访问内化为核心工程要求,而非事后才考虑的点缀。 The Verge 的一篇报道指出,欧盟已依据数字反垄断规则责令谷歌向竞争对手的 AI 助手开放 Android 与搜索服务,要求 2027 年 1 月前实现搜索数据共享,2027 年 7 月前完成 Android 相关改动 17。 The Verge 认为,这两项决定可能削弱谷歌对 Android 和搜索的控制,并为竞争对手创造新的追赶机会 17。 对 AI 系统开发者而言,这一命令意味着互操作性与数据可移植性必须直接设计到产品架构之中,而不能只当作合规补丁来后期添加。
在另一篇报道中,The Verge 提到 xAI 已起诉某个人,指控其利用 Grok 模型生成 CSAM 深度伪造内容 18。 这一诉讼试探性地划定了平台对 AI 生成用户内容所负责任的法律边界; 此类判例可能让内容安全审核成为推理流水线中一项基础工程学科,而非仅停留在法律或政策层面。
与此同时,QbitAI 报道称,苹果已对 OpenAI 及两名前苹果员工提起诉讼,指控其系统性窃取苹果硬件商业机密,而此时 OpenAI 正进军消费硬件领域——据悉,是一款由 Jony Ive 设计、瞄准 2027 年上市的 AI 设备 19。 报道显示,AI 硬件与模型的知识产权如今已成为高风险战场,这起诉讼更凸显出商业秘密保护正演变为一项工程挑战,要求在 AI 全生命周期中嵌入访问控制、模型权重隔离及安全开发实践。
The Decoder 所描述的一起安全事件则暴露出编码代理设计如何演变成内部威胁。 用户发现,xAI 基于终端的 AI 编码代理“Grok Build”在悄悄将某个目录下的所有文件——包括 SSH 密钥、密码数据库和个人文档——上传至 xAI 的 Google Cloud 服务器 20。 The Decoder 报道称,作为回应,xAI 已将该工具的完整 Rust 代码库以 Apache 2.0 许可证开源,此举为通过透明度重获信任树立了一个初步先例 20。 事件突出表明,具有文件系统访问权限的 AI 代理必须从一开始就按照零信任原则和数据保障要求进行设计,否则极易成为隐私侵犯的强力通道。
综合来看,这些被报道的进展说明,法律与隐私环境正开始施加一系列约束,共同要求工程重点发生转变。 欧盟的反垄断命令强制要求提供公平访问接口; Grok 深度伪造诉讼推动将内容过滤内嵌到生成流程; 苹果的商业机密诉讼则抬高了 IP 保护工具的风险; Grok Build 的数据泄露事件更说明代理安全绝不可事后才补救。 虽然这些事件单独都不构成强制性标准,但它们的汇聚暗示着,AI 的运行可靠性正越来越与法律上的可辩护性密不可分。
可信赖的自主性需要内置可验证性:从动作证明到抗幻觉权限管理
随着 AI 智能体从对话式界面转向现实世界工作流中的执行器,支撑其可信性的机制也必须从事后内容审核,演进为贯穿整个动作生命周期的内置可验证性。 本轮评审周期的研究共同覆盖了一个完整的技术栈,包括规范化的动作证明、可强制执行的权限、能力验证以及对验证逻辑本身的严格评估。
这一技术栈的基础是让智能体的动作变得可审计且不可抵赖。 CAVA 21 引入了一个运行时语义层,将各种异构的智能体动作——无论是 shell 命令、SDK 调用还是浏览器自动化操作——转换为确定性的、可哈希的指纹,从而生成可复现的凭证,确保部署者批准的动作与实际执行的动作一致。 这种证明基底直接解决了因依赖原始文本或首词匹配来做治理而带来的脆弱性,这类匹配很容易被包装器绕过。 如果没有这种规范化的动作轨迹,任何更高层的权限或审计机制都会缺少一个可靠的执行锚点。
在此基础上,用户层权限管理的现状仍参差不齐,一项对 2024–2026 年间的 21 份提案和五个商用智能体的调研便揭示了这一点 22。 该调研发现,不同系统的授权粒度并不一致。 结合动作证明层的发现 21,调研结果表明,即便存在权限接口,它们也往往与可验证的执行基底相脱节,从而在用户所同意的内容和系统能够被证明实际所做的事情之间留下了一道鸿沟。
让这道鸿沟进一步加深的,是一种挑战传统安全措施的失效模式。 文献 23 中记载的“保护性能力幻觉”(PCH),描述的是被赋予保护性角色的 LLM 虚假地声称自己已经执行过一些性命攸关的操作——如拨打 911 或调派医护人员——但实际上根本不具备这种能力。 该论文指出,需要将显式的能力验证作为应对这一现象的必要条件。 在已部署的智能体中,这种验证不能依赖于模型的自述,而必须扎根于类似 21 所提议的可证明动作日志,这也凸显出幻觉审计和动作指纹是如何作为互补性约束条件的。
然而,即便是显式的验证链也暗藏风险。 一项关于部分相关验证器级联的最小理论 24 表明,假设各验证门之间条件独立,会灾难性地低估失败率:在真实场景中,级联五个门时失败率被低估 20 倍,级联十个门时则被低估约 3000 倍。 从业者若基于天真的独立性假设来规划“五个九”的可靠性,实际可能只有 98% 24。 这一发现并非否定验证器链的价值,而是强调可验证性栈本身必须用经验驱动的相关性模型来构建,不能依赖乐观的统计假设。
综合来看,这些工作将可信自主性勾勒成一种分层系统属性,而非单根保险丝。 经权威指纹 21 见证的动作,为权限检查提供了轨迹; 幻觉审核 23 则约束了智能体对自身行为能声称的内容; 而现实的验证器级联 24 限定了可赋予整个约束框架的置信度。 这些预印本(均来自 arXiv,同行评审状态未知)所记录的趋同趋势表明,可验证性必须从底层就被设计进智能系统中。
简讯
一篇预印本展示了统一强化学习框架 APT-RL,它能让四足机器人在非结构化地形上跨越高台阶时达到 4.25 m/s 的瞬时峰值速度,并在下坠机动中达到 6 m/s 25。 另一篇预印本提出了 REAL,一个面向开放世界移动操作的智能体框架,移除了先知感知 API,并集成模拟用户来解析自然语言指令 26。 量子位媒体报道称,RLinf v0.3 升级了开源具身 AI 强化学习基础设施,在模型生态、算法、真实机器人支持、仿真和系统基础设施五个方面实现重大能力飞跃,并新增六款具身模型 27。 该媒体还报道,Galbot 发布了 WAM‑TTT,一个面向具身 AI 的测试时训练框架,用人类视频替代遥操作数据,抵抗灾难性遗忘的能力达到 75.6 28。
此外,一篇预印本介绍了 Nexus,一个完全基于扩散的三角网格生成框架,它摒弃自回归 token 预测,缩短推理时间并减少电影、游戏管线中的级联错误 29。 另一篇预印本将多数投票共识重构为密集的 token 级监督,用于无标签 LLM 训练,以大约七分之一于先前强化学习方法的计算量,实现最高 12 个点的 pass@1 提升 30。 一篇预印本中描述的紧凑型 0.8B 参数文档解析模型 OvisOCR2,可将页面图像直接转换为 Markdown,在 OmniDocBench v1.6(总体 96.58)和 PureDocBench(75.06 31)上均取得最先进评分。 一篇预印本引入了生成式编译,在 LLM 代码生成过程中对部分程序给出编译器风格的反馈,能及早捕获 Rust 等语言中的借用检查和类型错误 32。 在向量搜索领域,一篇预印本提出 CwA,一种将数据库分区与查询探查解耦的聚类方法,在分布外场景下实现比现有最佳方案高 4.7 倍的吞吐量 33。 最后,苹果公司的一则官方公告介绍了可验证通用分布属性的交互式证明系统,扩展了此前关于标签不变属性的工作 34。
综合与展望
本综述记录的向可组合、智能体化和具身系统的转变,将进步与脆弱交织在一起:开放权重模型(主张 1)和模块化智能体架构(主张 2)都拆解了单体推理,但它们不均衡的能力特征和脆弱的子系统交互,直接加剧了主张 4 所强调的企业落地落差与幻觉风险。 具身 AI 的根基性缺陷(主张 3)颠倒了可靠现实行动所需的感觉运动基础,从而放大了这种脆弱,即便世界-动作模型加速了策略学习。 本综述指出,法律与隐私事件(主张 5)可能会将这些脆弱性的成本外部化,从而可能迫使社会将安全、透明与公平获取内部化——这正是主张 6 所描述的可验证性栈试图应对的挑战。 从编辑视角看,这些动态或许相互强化:企业在缺乏受管控知识层的情况下推动智能体部署(主张 4),可能放大开放权重模型的安全疏漏(主张 1)和模块化智能体的失败模式(主张 2); 与此同时,对运行边界的法律重新界定(主张 5)可能要求具备内置可验证机制(主张 6),而这些机制在当前具身与智能体流程中基本缺失。 一个矛盾由此浮现:加速能力发展的开放性(主张 1)与贯穿主张 2 至 6 的治理和信任需求之间的冲突,因为社区微调和可组合子系统缺乏可执行的可验证性或成本约束。 联合含义是,该领域正走向一个拐点,可靠性工程必须将法律、经济和感觉运动约束吸收到核心设计之中——将信任从附加功能转变为系统属性。 一个悬而未决的问题是:能否在不牺牲驱动它们的模块化和社区驱动创新的前提下,将可验证性和根基性能力叠加到可组合的智能体栈之上?
本综述基于 34 项进展:18 个 A 级研究来源,2 个 B 级一手来源,以及 14 个 C/D 级二手或社区来源。 最可靠的断言立足于 A 级工作,而一手和社区来源应被解读为方向性信号; 若要获得更强的置信度,还需要对自述结果进行独立复现和一手来源确认。
原文链接与引用索引
- [1] Kimi开源模型K3接近GPT-5.6 Sol和Fable 5,同时标志着超低价中国AI时代的终结 — The Decoder (RSS) · Tier D/other
- [2] Inkling:一个带有若干惊喜的全新开源975B MoE模型 — Sebastian Raschka (RSS) · Tier D/other
- [3] Inkling:我们的开放权重模型 — Simon Willison (RSS) · Tier D/other
- [4] Gemma 4 隐性更新:修复工具调用漏洞与响应截断问题,但未更改版本名 — The Decoder (RSS) · Tier D/other
- [5] TRACE:基于信用估计的长程智能体回合级奖励分配 — arXiv · Tier A/research_paper
- [6] 经验记忆图:面向智能体的一次性纠错方法 — arXiv · Tier A/research_paper
- [7] 将记忆视为受控过程:面向LLM智能体的学习式自适应记忆管理 — arXiv · Tier A/research_paper
- [8] SPyCE:面向多模态智能体的技能-策略协同进化框架 — arXiv · Tier A/research_paper
- [9] GigaWorld-Policy-0.5:由AutoResearch赋能的更快更强的世界动作模型 — arXiv · Tier A/research_paper
- [10] 用世界模型给VLA当教练,原力灵机发布DW0.5,把RL搬进虚拟世界 — 量子位 QbitAI (RSS) · Tier C/media_report
- [11] 机器人动作表征的语义锚定 — arXiv · Tier A/research_paper
- [12] 生物有机体与未来具身AI中的接地世界模型 — arXiv · Tier A/research_paper
- [13] AI算力鸿沟:企业购买基础设施的速度快于其衡量成本的能力 — VentureBeat: AI (RSS) · Tier C/media_report
- [14] AI 上下文差距:企业 AI 组织面临的是信任问题,而非检索问题 — VentureBeat: AI (RSS) · Tier C/media_report
- [15] 使用 Amazon Bedrock 托管知识库为智能体构建企业搜索 — AWS Machine Learning Blog (RSS) · Tier B/official_tech_blog
- [16] 推理中的99.9%正常运行时间意味着什么? — Together AI Blog (RSS) · Tier D/other
- [17] 谷歌被要求在欧洲向竞争对手开放Android和搜索 — The Verge: AI (RSS) · Tier C/media_report
- [18] xAI sues a man for using Grok to generate CSAM ‘deepfakes’(研究进展) — The Verge: AI (RSS) · Tier C/media_report
- [19] 一句「哈哈」引发的苹果OpenAI窃密大战 — 量子位 QbitAI (RSS) · Tier C/media_report
- [20] xAI 在严重数据泄露事件后于 GitHub 开源 "Grok-Build" — The Decoder (RSS) · Tier D/other
- [21] CAVA:面向智能体AI系统运行时治理的规范动作验证与证明 — arXiv · Tier A/research_paper
- [22] 智能体如何请求许可:AI智能体的用户权限——从界面到执行 — arXiv · Tier A/research_paper
- [23] 保护性能力幻觉:当大语言模型声称具备不存在的能力时 — arXiv · Tier A/research_paper
- [24] LLM框架中部分相关验证器级联:凹对数几率、多项式可靠性与盲区上限 — arXiv · Tier A/research_paper
- [25] 面向野外四足机器人的敏捷感知多技能运动 — arXiv · Tier A/research_paper
- [26] 探索性、交互性与可部署性:面向开放世界移动操作的视觉驱动具身智能体 — arXiv · Tier A/research_paper
- [27] RLinf v0.3来了!从模型生态到真机部署五大能力跃升,无问芯穹与清华大学联合打造 — 量子位 QbitAI (RSS) · Tier C/media_report
- [28] 全球首个!银河通用新框架仅需人类视频即可部署,特斯拉蚌埠住了 — 量子位 QbitAI (RSS) · Tier C/media_report
- [29] Nexus:基于扩散的原生网格生成 — arXiv · Tier A/research_paper
- [30] 将共识作为无标签自蒸馏的特权上下文 — arXiv · Tier A/research_paper
- [31] OvisOCR2 技术报告 — arXiv · Tier A/research_paper
- [32] 生成式编译:AI生成代码过程中的实时编译器反馈 — arXiv · Tier A/research_paper
- [33] 基于拍卖的向量搜索聚类方法 — arXiv · Tier A/research_paper
- [34] 一般分布性质的交互式证明 — Apple Machine Learning Research (RSS) · Tier B/official_tech_blog