能力超越可靠性成为AI的决定性分水岭
2026-08-15 02:00 UTC
要点
- 视觉语言模型无法系统性地将内部知识转化为适当的拒答行为,削弱了安全关键型应用中的可靠性。
- 尽管整体性能优异,前沿模型在基础数值推理上仍表现出持续性的失误,这表明存在根本性的架构局限。
- 可解释性研究结果受到测量伪影的干扰,包括探针方向的措辞和 token 位置的选择,这使已发表结果的有效性受到质疑。
- 开源权重模型通过架构和训练后创新,在规模大幅缩小的情况下实现了与前沿模型相媲美的性能,重塑了竞争格局。
- 智能体 AI 系统正从研究原型发展为用于复现和维护的实用工具,但其可靠性仍参差不齐,需要严格的评估。
当代人工智能的特征,与其说体现在原始能力上,不如说体现在模型“能做什么”与“能被信任知道什么”之间日益扩大的鸿沟上。 效率提升、开源权重竞争以及智能体自主性的发展不仅真实存在,且正在加速; 然而,推理、校准和可解释性方面屡屡受挫的系统性证据却如影随形。 本综述从多个前沿领域审视了这种张力。 文章首先记录了视觉语言模型如何编码其无法通过拒答来表达的知识,以及前沿模型在基础数值推理上如何屡屡失误。 随后对可解释性本身进行审视,揭示了测量伪影如何削弱已发表结论的可靠性。 接着,论述转向开源权重的效率革命与智能体系统参差不齐的可靠性,随后探讨了新型安全漏洞及 AI 治理的地缘政治重塑。 这些部分共同勾勒出该领域的全景:进步固然真实,但认知基础依然脆弱。
拒答鸿沟:VLM编码了无法表达的知识
视觉语言模型(VLM)所掌握的知识与其愿意表达的内容之间的差距,如今已具备实证可测性,而结果指向了认知克制方面的系统性失败。 TRAPSBench 基准测试是一个程序化生成的视频数据集,包含 1,404 对匹配的物理视频,其中单一目标改变会导致结果无法判定。 该基准测试表明,VLM 编码了足以回答物理问题的信息,但在结果无法判定时却未能弃权 1。 这并非知识缺失,而是知识无法访问或无法表达。 该基准测试附带的 PECS 指标要求模型既能正确回答又能选择性弃权,通过评估模型是否具备在适当时候说“我不知道”的能力,使这一失败现象变得显而易见 1。 作者指出,这项研究与自主智能体等安全关键领域直接相关,在这些领域中,自信地给出错误答案的代价远高于保持沉默的代价 1。
观察到的弃权差距与另一项针对 VLM 科学图表评估的行为证据相吻合,该评估发现模型会被视觉特征误导 2。 这一发现表明,模型的内部表征与其认知状态并未实现稳健对齐——即使底层信息模糊或矛盾,模型也可能“看到”误导性线索并坚持给出答案 2。 综合来看,这两项研究揭示了一个共同的潜在脆弱性:无论任务是涉及刻意设定为无法判定的物理结果 1,还是具有误导性的科学图表 2,视觉输入通路都能覆盖或绕过模型进行校准判断的能力。
弥合这一差距可能需要从根本上改变模型处理不确定性的方式。 一种提出的机制是"格莱斯式退避"(Gricean retreat),这是针对大语言模型引入的概念:当模型对所指对象不确定时,通过生成更宽泛的陈述来以信息量换取真实性 3。 这种方法不是在事后纠正幻觉,而是利用内部表征,从一开始就引导生成过程指向适当宽泛的所指对象 3。 虽然格莱斯式退避是为大语言模型和所指特异性而提出的,但其逻辑直接针对 TRAPSBench 中识别出的失败模式:如果模型无法弃答,至少可以退回到仍能保持真实的宽泛程度 1, 3。 这种联系虽是解释性的,但两者的契合度令人瞩目——两个框架都将无法表达不确定性视为核心可靠性缺陷,而非边缘问题。 来自这些来源的证据表明,编码-表达差距并非小众问题,而是视觉语言模型可靠性的结构性挑战,需要新的评估指标、新的行为训练,甚至可能需要新的架构机制才能弥合。
数值推理失败:前沿模型的隐藏漏洞
前沿模型在整体表现优异的同时,却存在初级的数值推理失误,且这种失误持续存在,表明其推理架构存在根本性局限。 现有证据表明,问题出在这些系统组织和执行推理过程的结构性机制上,而非单纯的原始能力不足。
核心问题在于,标准评估协议可能会系统性地高估真实的推理能力。 4 提出了一种针对大语言模型评估的协议级可识别性审计方法,将有限类准则形式化,以检验观测支撑集是否能够点识别目标行为估计量。 该研究表明,标准评估协议可能无法点识别真实的推理能力,这意味着所报告的数值表现可能存在水分。 这进一步说明,当前主导基准测试的基于准确率的结论,可能无法反映底层推理过程的结构有效性。
有证据表明,推理成功的关键决定因素是过程质量,而非长度或效率,这进一步加深了上述担忧。 5 提出了 TsuGO,这是一个通过围棋死活题来评估大语言模型推理中搜索效率(SearchE)的过程级基准。 该研究指出,搜索组织和推理资源分配是大语言模型推理评估中缺失的一环,并证明更长的思维链或更高的 token 效率并不必然意味着更好的搜索。 综合 4 的结论,这些发现表明,无论是推理的度量还是推理的执行,都存在被聚合级分数所掩盖的隐蔽结构性缺陷。
聚合指标的掩盖效应在命令生成场景中得到了直接验证。 文献 6 提出了 QuoteBench,这是一个包含 56 项任务、14 个系列的基准测试,针对大语言模型(LLM)一次性生成的 Bash 命令进行精确的最终状态验证,旨在将命令路径的可靠性与规划及恢复过程剥离评估。 其核心创新在于采用交叉 2×2 实验设计,独立改变生成契约。 该论文表明,匹配的执行得分会掩盖命令路径上方向相反的巨大影响:例如,GPT-5.6-sol 的匹配分差为 −3.6 分,却掩盖了 −64.3 分的传输损耗,而这一损耗被 +60.7 分的补偿抵消了。 这一发现与数值推理的情况如出一辙:模型在取得相当不错的总分的同时,可能在特定推理路径上出现灾难性失败,而这些失败恰好被其他路径上的补偿性成功所抵消。
综合来看,这三篇预印本(同行评审状态均未知)呈现出高度一致的图景。 文献 4 指出,评估协议可能无法识别真正的推理能力; 文献 5 证明,驱动推理质量的是过程组织而非输出长度; 文献 6 则表明,匹配得分会掩盖任务执行中方向相反的巨大影响。 这共同意味着,前沿模型当前的数值表现可能掩盖了系统性的基础性失败——这些失败之所以持续存在,正是因为评估工具和推理过程本身都容易受到结构性缺陷(而不仅仅是定量性缺陷)的影响。
可解释性测量危机:探针伪影与位置选择
可解释性研究正面临一场测量危机,实验设计中的伪影使已发表发现的有效性日益受到质疑。 两篇近期的预印本指出了两种不同但趋于一致的混淆源。 一项研究表明,在评估感知探测中,用于引出激活方向的对比提示词的具体措辞构成了一个未报告的自由参数; 探测方向被证明是提示词的属性,而非模型的属性,这可能会从根本上破坏跨模型比较的有效性 7。 该论文指出,该领域已发表的缩放声明是提示词措辞的伪影,而非模型属性 7。 在稀疏自编码器(SAE)评估中也出现了类似的发现:在最高激活词元位置测量潜在变量因果效应的标准惯例并非实验者的选择,而是依赖于字典的伪影,以至于在相同数据上训练的不同 SAE 会为同一潜在变量选择不同的测量位置 8。 这种混淆具有不可见、未报告且随规模扩大而恶化而非改善的特点,这可能会从根本上改变机制可解释性社区报告和比较 SAE 评估结果的方式 8。
综合来看,这两篇预印本揭示了一个系统性漏洞:看似中立的测量选择——一种情况是提示词措辞,另一种是词元位置——实际上与被测量的对象本身纠缠在一起。 其后果是,跨模型和跨字典的比较可能只是在比较伪影,而非模型属性。 由于这两种混淆在标准报告实践中均不可见,使得现有文献容易受到经不起方法论推敲的声明的影响,从而加剧了问题的严重性。
在此背景下,第三篇预印本提出了一种可能部分规避这些测量陷阱的方法。 SAEVerbalizer 通过将特征的解码器方向注入到 LLM 的表示中,并对 LLM 的下游层进行微调,从而为 SAE 特征生成自然语言解释 9。 该框架将解释建立在内部表示空间而非观察到的行为之上,通过消除语料库规模的推理和示例检索,能够降低 SAE 特征解释的计算成本,并可能提升解释质量 9。 该方法依赖于解码器方向,而非最高激活的 token 位置或对比提示的措辞,这使其成为易产生伪影的评估流程的潜在替代方案——尽管该预印本本身并未声称能解决另外两篇论文中所指出的混淆因素。
这些发现之间更多是张力而非定论。 位置选择伪影 8 和提示措辞伪影 7 均表明,可解释性测量并非对模型内部机制的中立观察,而是由实验选择共同构成的。 SAEVerbalizer 9 提供了一种不同的测量途径,但其作为修正措施的有效性,取决于其自身的流程是否会引入另外两篇论文所揭露的那种未报告的新自由参数。 作为同行评审状态未知的预印本 7, 8, 9,这些发现需要经过复现和审查,才能全面评估其对领域测量标准的影响。
开放权重效率革命:小模型,大宣称
开源权重生态系统日益呈现出一个反直觉的命题:具备前沿竞争力的性能不再需要前沿规模的参数。 10 亿参数模型 Mimir v1 采用分层推理模型(HRM)架构从零开始训练,仅依赖许可的后训练数据,便在英语基准测试中取得了具有竞争力的性能,并在丹麦语基准测试中取得了最先进的结果 10。 该预印本将此视为对以规模为中心的范式的直接挑战,指出小模型能够为数据资源有限的研究人员和国家项目降低门槛 10。 这并非单一架构的孤立现象; 该趋势已扩展至各类开源权重发布中。 智谱 AI 发布了 GLM-5.3,这是一款与其前身 GLM-5.2 共享相同基座的编程模型,所有改进均源于扩展的后训练而非规模的增加 11。 媒体报道指出,该公司声称这是最强大的开源权重编程模型,在基于智能体的任务中提升最为显著 11。
推动这些性能提升的架构与后训练创新,也正在重塑部署经济学。 Qwen3.8-27B 是一款 270 亿参数的原生多模态稠密模型,已在 Apache 2.0 许可下开源,支持 262K 原生上下文,并可通过 YaRN 扩展至 100 万 token,同时引入了 `reasoning_effort` 功能,可根据任务难度控制思考深度 12。 QbitAI 报道称,此次发布可能会显著降低在消费级硬件上部署强大 AI 模型的门槛,从而促进其在研究和工业界的更广泛应用 12。 综合来看,这些发布表明,在当前的竞争格局中,效率和训练技术——而非单纯的参数量——才是关键差异化因素,GLM-5.3 仅靠后训练取得的提升 11 以及 Mimir v1 的许可数据约束 10 进一步印证了这一转变。
然而,这场效率革命在经济层面的影响并非简单直接。 Hugging Face 在 2026 年夏季对开源模型现状的观察指出,关注度(点赞数)与采用率(下载量)正在脱钩,且开放权重正将价值向 API 和硬件转移 13。 这一观察与对个别模型发布的庆祝性论调之间存在着一种有益的张力:尽管 Qwen3.8-27B 和 GLM-5.3 等模型可能降低了使用门槛 12, 11,但由此产生的价值变现可能正在向其他环节集中 13。 现有证据并未在特定模型发布与这种价值转移之间建立因果关系,但综合来看,这些资料表明,开放权重的效率革命既是一项技术成就,也是一次经济重构——在这一重构中,模型本身的商业核心地位可能正让位于其周边的基础设施。
智能体自主性:从研究复现到软件维护
智能体 AI 系统正日益被定位为研究复现、软件维护和科学发现的实用工具,然而证据表明其能力参差不齐,且严重依赖人类监督。 从研究原型走向实际部署工具的趋势确实存在,但伴随着持续的可靠性差距,亟需严格的评估框架。
最能直接体现其实用价值的是 Anthropic 内部对 Claude Code 的部署。 The Decoder 的媒体报道称,该系统在 Anthropic 自有软件的日常维护中接受了测试,几周内共生成 388 个拉取请求,经人工审查后合并了 180 个,合并率达 46% 14。 这一数据既展现了当前智能体系统的潜力,也暴露了其局限:该工具能够规模化处理常规维护,但超过半数的自动生成内容被驳回,表明人工审查仍是工作流中不可或缺的环节 14。 该报道将其定义为混合自主模型,智能体将开发者从繁杂任务中解放出来以投入复杂工作,但仍需人工监督以把控质量 14。
研究领域则呈现出充满争议的局面。 一篇介绍 Replica 的预印本描述了一个可扩展的任务空间,该空间从 1990 至 2026 年间的 100 篇机器学习与 AI for Science 论文中自动生成了 310 项图表复现任务,每项任务要求智能体在单个 H200 MIG 切片上、60 分钟时限内复现一张隐去部分信息的结果图 15。 作者称,一个在复现任务上经过后训练的 27B 模型表现优于 Claude Opus 4.8 和 GPT-5.5 等前沿模型,且展现出更符合科学原则的行为,例如实现底层机制而非硬编码输出 15。 然而,该文献也将此项工作置于机器学习复现危机的背景下进行审视,指出在整个领域内,结果复现的能力尚不够稳健 15。
另一套评估框架进一步加剧了这种已展现能力与系统性脆弱性之间的张力。 一篇预印本论文为长周期 AI 研发智能体引入了系统性评估方法,将研究过程分解为三项基于规则的能力指标——方案构建(C1)、执行(C2)和反馈控制(C3),并通过对照实验衡量累积经验对性能的影响 16。 该框架表明,当前的智能体更像是工程优化器,而非自主研究者:它们能够制定并实施实用方案,但真正的方法论创新极为罕见,252 个最佳初始方案中仅有 3 个具备新颖性 16。 论文还指出,相较于峰值性能,可靠性更能拉开模型间的差距; 这一发现与 Replica 的结果相呼应,共同表明一致性而非原始能力才是真正的约束瓶颈 16。
据 The Decoder 报道,普林斯顿大学与英国 AI 安全研究所的一项研究直接对“自主 AI 研究触手可及”的说法提出了挑战。 该研究引入了“影子评估”(Shadow Evaluation)方法,将未发表论文的核心研究问题交给智能体,并让原作者以会议审稿人的身份审查结果 17。 作者认为,这提供了一种比同行评审更严谨的评估方法,他们将同行评审形容为“超负荷、随机且审稿质量堪忧” 17。 这种方法与 Replica 的任务空间形成对比,后者基于已发表论文中隐去关键信息的图表进行评估 15; 而影子评估方法则针对未发表的研究进行测试,有望弥合复现与真正发现之间的差距 17。
综合来看,这些资料揭示了一条发展轨迹:智能体系统正从研究演示迈向实际部署,但现有证据并不支持其具备自主科研能力的说法。 软件维护中 46% 的合并率 14、270 亿参数模型的成功复现 15,以及长周期评估中将其定性为“工程优化器”的结论 16,都表明这些系统在受限且定义明确的任务中具有实用价值。 影子评估研究 17 以及方法论创新稀缺的现象 16 表明,向自主科研的跨越仍有待证实。 这四份资料贯穿始终的主题是:严谨的评估——无论是通过合并率、复现任务、分解的能力指标,还是影子审查——绝非可有可无的附加项,而是判断智能体系统究竟是真正可靠,还是仅在孤立案例中表现惊艳的必要条件。
安全与保障:开放模型时代的新型漏洞与防御
AI 的安全格局正沿着与“能力-可靠性”差距相同的轴线发生分化:推动进步的开放性与自主性同样也扩大了攻击面,而防御手段仍处于起步阶段,且往往是被动的。 证据表明,威胁正从静态的模型级风险,转向需要全新防御姿态的动态部署级漏洞。
核心挑战在于,已部署的模型运行于非静态环境中。 随着恶意软件不断演变,分类模型会出现性能退化,这属于概念漂移问题。 一篇论文提出了一种使用单类支持向量机(OCSVM)的新型检测方法来解决此问题,作者称这是该方法首次应用于这一目的 18。 该研究实现了高效、自动化的漂移检测与重训练,与持续重训练相比,有望降低计算和能源成本 18。 这应对了动态威胁环境中的现实问题,但它仍属于被动机制——仅在漂移发生后进行检测,而未能预防底层漏洞。
那些利用智能体系统物理与多模态特性的攻击,进一步加剧了这种被动范式的压力。 UniTexture 提出了针对视觉-语言-动作(VLA)模型的首个跨任务通用 3D 对抗纹理攻击,表明仅靠任务多样性无法使多任务 VLA 免受单一共享对抗物体外观的影响 19。 这是一种部署级漏洞,对物理机器人安全具有直接影响,跨套件与跨模型迁移结果已证实这一点 19。 结合概念漂移的研究 18,这些发现表明,安全性不能被视为模型规模或任务广度的涌现属性; 它必须针对部署环境进行显式设计。
防御手段不断涌现,但往往只针对特定的攻击向量。 RAGSieve 提出了一种针对检索增强生成(RAG)语料库投毒的自引用检测框架,通过从受检系统自身构建参考,避免了对可信语料库、特定攻击特征或全局阈值的依赖 20。 该方法无需投毒标签或可信语料库即可为 RAG 投毒提供实用防御,填补了已部署系统中的关键安全漏洞 20。 这种方法以自包含性著称,但仍然只是针对单一类别攻击的点防御。
最具雄心的系统性防御方案瞄准了硬件层。 LessWrong 上的一篇社区帖子提出在 GPU 层面强制执行 AI 模型安全合规:除非模型能证明其符合既定安全标准,否则 GPU 将拒绝加载该模型的张量 21。 帖子指出,这可以为开源权重模型提供关键的安全网,因为这些模型目前缺乏闭源权重模型的防护机制,且构成了显著的网络安全风险 21。 该提案直面了开源权重分发中固有的矛盾:推动创新的易获取性同时也消除了集中控制。 尽管 OCSVM 18、UniTexture 19 和 RAGSieve 20 方法在软件和模型层面运作,但 GPU 层面的强制执行理念 21 表明,对开源模型提供有意义的安全保障可能需要从计算基础设施本身进行干预。
AI地缘政治:出口管制、主权AI与开源张力
前沿AI正日益成为战略性的国家资产,国家控制的法律架构以及主权AI倡议的兴起正在重塑全球竞争格局,并由此加剧了开源运动面临的压力。 AI的地缘政治维度已不再局限于市场竞争,而是深深嵌入国家安全与国家权力的工具体系之中。
对前沿AI出口管制与网络安全的分析最直接地阐明了这一动态,该分析指出,获取前沿AI正成为国家网络防御的一部分,且生产国可以撤销这种获取权 22。 这种定位将前沿AI视为地缘政治博弈的杠杆,而非单纯的商业商品,其中扣留技术能力本身就是一种战略工具。 此类控制机制并非假设; LessWrong上的一篇社区文章详细说明了美国行政分支如何通过现行联邦法规单方面影响或控制AI公司,特别提到了《国防生产法》(DPA)、出口管制、《国际紧急经济权力法》(IEEPA)以及《发明保密法》 23。 综合来看,这两份资料勾勒出了一幅连贯的图景:学术分析确立了实施控制的战略逻辑,而LessWrong的文章则列出了执行控制的具体法律手段,强调注重安全的监管可能需要立法行动,而非行政命令 23, 22。
针对这种能力的集中化,各国正寻求建立本土能力,由此催生了“主权人工智能”(sovereign AI)的逆向趋势。 英伟达(NVIDIA)官方宣布印尼首个高校AI技术中心——UGM Indosat NVIDIA AI Technology Center (NVAITC)——正是这一趋势的例证 24。 该中心是在印尼“AI卓越中心”倡议下,由通信与数字事务部、Indosat以及加查马达大学(Universitas Gadjah Mada)合作建立的,旨在为本土人才提供开发符合国家优先事项的AI解决方案所需的算力和专业知识 24。 该举措能够促进AI主权和经济增长,使印尼成为全球AI创新的贡献者 24。 这种主权推动与上述出口管制体系存在直接矛盾:生产国试图保持对前沿能力的控制,而消费国则投资于本土基础设施以减少依赖。
这种地缘政治摩擦对开源生态系统产生了重大影响。 Hugging Face 对开源模型现状的观察指出,开放权重正将价值转移至API和硬件 13。 这表明,随着国家行为者加强对前沿模型的控制,开放权重分发的战略重要性可能正在下降。 限制获取尖端能力的出口管制与推动建立本土替代方案的主权AI相结合,可能会加速这一转变,因为AI的价值越来越向基础设施(算力和API)集中,而非开放权重本身 13, 22, 24。 依赖模型权重自由流动而繁荣发展的开源运动,因此陷入了进退两难的境地:一方面是国家驱动的限制,另一方面是市场驱动下向专有基础设施的转移。
简讯
核心论证部分之外的若干进展,因其方法论上的雄心,同样值得关注。 在科学发现方面,ProteinDPO 利用直接偏好优化将蛋白质语言模型与实验稳定性数据对齐,应用于 H5N1 流感血凝素,在保持抗体识别能力的同时大幅提升了热稳定性 25。 另一篇研究论文介绍了一种“深度受体扫描”平台,可并行对 766 种人类 GPCR 和 174 种已知 GPCR 剪接变异体进行实验表征,有望加速对表征不足的 GPCR(最常见的药物靶点)的探索 26。 在临床病理学中,MambaMIL+HiLA-MIL 是一种将 Vision Mamba 与高低注意力分离机制相结合的多示例学习模型,旨在对全切片图像进行淋巴结转移检测,以解决这一耗时且易出错的任务 27。
理论与方法论方面的贡献同样备受瞩目。 一篇论文首次完整刻画了 Transformer 能够在哪些正则语言上实现长度泛化,并基于该语言句法幺半群的大小提供了一种多项式时间判定算法 28。 另一篇论文引入了解掩码增长复杂度(UGC),这是针对掩码扩散的数据几何的路径解析度量,其局部增量可直接控制 KL 散度离散化误差,为验证最优采样调度提供了原则性框架 29。 在一篇关于隐式多模态上下文学习的论文中,提出了“选择-实现假说”,将干预复杂度分解为选择(共享与查询条件化)和实现(局部偏移、多位点或路由)两个维度 30。
多个系统正朝着更高的自主性与可扩展性迈进。 OmniScientist 直接从异构原始证据(包括图像、信号、音频、视频、三维结构、轨迹、表格、公式和图表)中开展多学科研究,而非依赖预先计算的文本、代码或标量摘要,从而弥补了现有 AI 科学家系统“证据不完整”的缺陷 31。 Evoke 为交互式世界模型引入了一种有界循环过程,通过外部的、以相机为索引的世界状态库将持久的世界状态与去噪器解耦,有望实现具备响应式控制的小时级交互式世界生成 32。 Latent On-Policy Self-Distillation 将来自人工设计文本产物的特权上下文重新构建为端到端可学习的潜在基底,从而在自我进化的 AI 中移除了设计者指定的产物 33。 最后,LigBench 为基于 LLM 的研究思路生成提供了一种自动化评估基准,旨在减少对主观 LLM 评分或人类专家的依赖 34。 综合来看,这些进展表明该领域正在同步扩大自动化发现的范围、收紧理论保证,并审视当前系统中固有的表征假设。
综合与展望
综合各项发现,该领域正处于一种张力之中:效率与自主性在快速进步,但正是这些从中受益的系统,在推理和校准方面却持续表现出初级的失败。 弃权差距与数值推理失败共同表明,能力与认知可靠性不仅是不同的维度,在某些情况下甚至呈负相关——而可解释性测量危机使这一模式更加复杂,因为用于诊断这些失败的工具本身可能就不可靠。 开放权重效率革命与智能体自主性的崛起强化了这一图景,更小、更易部署的模型和自主系统扩大了这些潜在漏洞的暴露面。 安全问题,尤其是围绕开放权重扩散的担忧,与这一解读相吻合; 与此同时,地缘政治压力引入了一种相互冲突的动态:出口管制可能会减缓前沿能力的传播,但主权 AI 倡议同时加速了国内发展,造成了一种可靠性标准碎片化的不均衡全球格局。 编辑视角的解读表明,对效率和自主性的推动可能正在超越稳健评估与可解释性方法的发展步伐,从而留下一个可能进一步扩大的可靠性差距。 一个核心悬而未决的问题是,架构创新能否弥合这一差距,或者当前推理范式中的根本限制是否需要我们更加彻底地摆脱基于扩展的方法。
本次回顾共汇总了 34 项进展:26 项 A 级研究来源、2 项 B 级第一方来源以及 6 项 C/D 级二手或社区来源。 最确凿的论断基于 A 级工作,而第一方和社区来源应被视为方向性参考; 要获得更高的置信度,需要对自述结果进行独立复现和一手来源确认。
原文链接与引用索引
- [1] TRAPSBench:视觉语言模型编码但未能表达认知克制 — arXiv · Tier A/research_paper
- [2] 视觉语言模型在失明或被误导时如何表现?科学图表上的行为评估 — arXiv · Tier A/research_paper
- [3] 迈向格里斯的退让:探测大语言模型的知识边界与指称特异性 — arXiv · Tier A/research_paper
- [4] 超越局部准确率:受控LLM推理评估的协议级可辨识性审计 — arXiv · Tier A/research_paper
- [5] TsuGO:通过围棋死活题探究LLM推理中的搜索效率 — arXiv · Tier A/research_paper
- [6] QuoteBench:匹配分数如何掩盖命令路径失败 — arXiv · Tier A/research_paper
- [7] 探针方向是其提示词的属性 — arXiv · Tier A/research_paper
- [8] 你在哪里测量决定了你测量什么:基于消融的稀疏自编码器评估中的位置选择问题 — arXiv · Tier A/research_paper
- [9] SAEVerbalizer:通过表示言语化生成稀疏自编码器特征的解释 — arXiv · Tier A/research_paper
- [10] DFM Mimir v1:一个仅使用许可后训练数据、在1B参数下实现前沿性能的开放HRM — arXiv · Tier A/research_paper
- [11] 智谱AI发布GLM-5.3,声称是最强的开源权重编程模型 — The Decoder · Tier D/other
- [12] 刚刚,Qwen3.8-27B 开源了!家用显卡也能跑 — 量子位 QbitAI · Tier C/media_report
- [13] 开放模型现状:2026年夏季观察 — Hugging Face Blog · Tier B/official_tech_blog
- [14] Claude Code 现在以 46% 的合并率对 Anthropic 的软件进行日常维护 — The Decoder · Tier D/other
- [15] 训练AI科学家复现研究 — arXiv · Tier A/research_paper
- [16] 超越最终评分:面向长周期AI研发的智能体系统性评估 — arXiv · Tier A/research_paper
- [17] 研究反驳Anthropic和OpenAI关于自主AI研究即将实现的说法 — The Decoder · Tier D/other
- [18] 恶意软件分类模型的概念漂移检测与自适应重训练 — arXiv · Tier A/research_paper
- [19] UniTexture:面向视觉-语言-动作模型的跨任务通用对抗纹理 — arXiv · Tier A/research_paper
- [20] RAGSieve:用于检索增强生成中知识投毒检测的自引用局部对比 — arXiv · Tier A/research_paper
- [21] 如果我们把AI模型安全强制到GPU层面会怎样? — LessWrong · Tier C/community_opinion
- [22] 必然的主权?前沿AI出口管制、网络安全与国家AI能力的局限 — arXiv · Tier A/research_paper
- [23] 美国行政部门如何控制AI公司 — LessWrong · Tier C/community_opinion
- [24] 加查马达大学、Indosat 与 NVIDIA 开设印尼首个大学 AI 中心以培养本地 AI 人才 — NVIDIA Blog: Generative AI · Tier B/official_tech_blog
- [25] 与实验数据对齐改进蛋白质生成建模 — Nature Methods · Tier A/research_paper
- [26] 通过深度受体扫描对GPCRome进行高效实验表征 — Nature Communications · Tier A/research_paper
- [27] 弱监督人工智能用于全切片图像上多癌种淋巴结转移检测 — Nature Communications · Tier A/research_paper
- [28] Transformer长度泛化的代数分解理论 — arXiv · Tier A/research_paper
- [29] 掩码扩散的数据几何:通过解掩码增长复杂度实现认证最优调度 — arXiv · Tier A/research_paper
- [30] 何时任务向量足够?隐式多模态上下文学习的实证理论 — arXiv · Tier A/research_paper
- [31] OmniScientist:一个全模态全学科的AI科学家 — arXiv · Tier A/research_paper
- [32] Alaya-EVOKE:从线性扩展监督到无尽世界 — arXiv · Tier A/research_paper
- [33] 潜在在策略自蒸馏 — arXiv · Tier A/research_paper
- [34] LigBench:一个统一且与人类对齐的基于LLM的研究想法生成基准 — arXiv · Tier A/research_paper