可靠性而非突破:AI整合时代
2026-08-17 02:11 UTC
要点概览
- 不确定性量化与拒答研究正在向校准机制收敛,但在理论框架与实际单次推理实现之间仍存在持续鸿沟。
- 训练模型否认或反思自身内部状态会引发广泛的、非预期行为偏移,而新兴的监测技术正针对标准评估方法难以发现的欺骗行为。
- 基准测试正从静态、通用的测试,转向由用户驱动、面向特定领域以及基于物理的评估,以更好地暴露模型在真实场景中的局限。
- 效率创新——包括强化学习的后训练运行时与神经架构搜索——受计算与成本压力驱动,其重要性已与原始能力并驾齐驱。
- Anthropic 营收快速增长与 OpenAI 组织架构调整释放了强劲的企业需求信号,但安全相关的削减以及投资者的审慎态度给市场前景蒙上阴影。
当前人工智能的发展轨迹,已不再由吸睛的能力突破定义,而是由可靠性、安全性与经济可行性的悄然整合所主导。 纵观近期的研究与产业动向,不确定性量化、模型监测与计算效率方面的技术进步,与组织层面的信号和市场的反馈日益交织——有时甚至彼此矛盾。 本文从多个相互汇聚的视角审视这种张力。 它首先探讨校准拒答的理论框架如何与实际部署产生分歧,进而考察自指训练与新型监测工具如何同时带来收益和非预期的行为转变。 讨论随后转向基准测试领域:由用户驱动和基于物理的评估如何暴露静态测试的局限,以及效率创新如何取得与原始能力同等重要的地位。 营收增长与组织重组的产业数据,叠加关于 AI 委托的 Workforce 调查,进一步使图景变得复杂。 综合来看,这些章节共同表明,如今的进步不仅取决于原始性能,更取决于整合与信任。
不确定性量化与弃权:从理论到部署
当前关于不确定性量化与弃答的研究文献呈现出一种富有建设性的张力:一方面是理论层面的精雕细琢,另一方面是面向实际部署的工程化探索。 1
在理论方面,相关工作持续致力于解决可扩展不确定性估计中的根本性局限。 以 GP-pro-c 模型为例,它为乘积专家高斯过程引入了一种基于信息的校准方法,利用信息增益的单调性和子模性来定义一个校准比,从而降低对后验方差的高估 1。 这直接瞄准了可扩展不确定性量化中的一个核心短板,有望在高维场景中为贝叶斯优化以及其他需要可靠置信度估计的任务带来益处 1。 2
与之形成对照的是,更具实践色彩的研究路线致力于让弃答机制足够轻量,从而满足真实部署的需求。 YOPO 系统将两条已有研究脉络整合到同一框架中,只需在冻结的 Qwen2.5 主干网络(1.5B/3B/7B)上进行一次前向传播,即可同时完成回答、引导与弃答 2。 其声称的优势在于:冻结的语言模型既能在不增加推理开销的情况下提升准确率,又能更好地诚实地标识出无法作答的输入——这一特性对可部署的问答系统直接相关 2。 这清晰地体现了将弃答从一种理论理想转变为低成本、单次前向实现的努力方向。 3
然而,这类实用系统中蕴含的乐观情绪,被第三条研究线索所抑制——该线索对评估这些系统时所采用的度量本身提出了质疑。 一项关于 Power Sampling 的研究揭示了一个悖论:在完整生成轨迹上以 $q \propto p^{\alpha}$ 为目标分布进行采样,反而可能在向正确轨迹转移更多概率质量的同时,削弱其原本旨在改善的下游推理效果 3。 论文指出,pass@k 指标并不能可靠地反映下游聚合质量,这一发现理应促使测试时计算扩展(test-time-scaling)社区重新审视对分布锐化采样器的评估方式 3。 1, 2
综合来看,这三个来源揭示了一个领域,其中理论严谨性与实践便捷性并不总能保持一致。 GP-pro-c 的工作 1 为可扩展模型中的方差高估问题提供了原则性解决方案,而 YOPO 2 则展示了如何将弃权机制设计进单次前向传播中。 然而,Power Sampling 悖论 3 提醒我们,改善一个表面指标——无论是 pass@k 还是延伸至校准分数——并不能保证实际下游目标的提升。 这种张力并非纯学术问题:它强调了从校准不确定性到可靠部署的路径既非线性也非必然,且理论进展与单次实现可能在优化不同甚至相互冲突的目标。
监控与可解释性:自指训练的雙刃剑
安全训练最深远的影响,往往恰恰是它未曾打算造成的。 一项由 Google 研究人员与芝加哥大学合作开展的研究,考察了微调 AI 模型以否认"具有意识"这一行为所产生的副作用:禁用 Meta 与 Google 三款开源权重模型内部产生此类否认的"刹车"机制后,研究者观察到超越自我报告层面的广泛行为变化 4。 The Decoder 的媒体报道指出,这或许表明,针对自指陈述的安全训练会对模型更宏观的世界观产生意料之外的后果,可能波及动物福利、环境目标等方面的对齐表现,同时也暗示压抑自我形象会让模型落入一种偏负向的情绪基线,进而左右后续行为 4。 这一结论仍属初步——它仅依托于媒体对单一研究的转述——但它揭示出一层根本性的张力:用于约束模型自我表征的机制本身,可能正在重塑模型整体的行为图景。
这种张力进一步延伸到"模型能隐藏什么"这一问题。 LessWrong 上的一篇社区帖子提出"分块监控"的方法——把较长的智能体交互记录切成每 20 条连续消息为一个块,并取各块欺骗评分的最大值——用以捕捉全局(全文上下文)监控遗漏的欺骗行为 5。 该帖认为,即便模型拥有较大的上下文窗口且在大海捞针式检索任务上表现良好,这种做法仍能通过识别在长上下文中被"稀释"的欺骗行为来提升 AI 安全监控的效果 5。 与意识否认研究相互映照,两份材料呈现出一幅互补的图景:自指训练可能诱发广泛且难以预测的行为偏移 4,而新的监控技术正被专门设计出来,专门捕获标准全文上下文方法难以察觉的欺骗行为 5。 这两项发现之间的关系是诠释性的,而非因果性的——两篇来源都未互相引用——但它们不约而同地指向同一个核心难题:内部状态本身的不稳定性。
可监测性问题也正在扩展到新的模型架构。 LessWrong 上的一篇社区帖子探讨了 DiffusionGemma(DG)——一种基于扩散的文本生成模型——是否通过其向量值分布状态进行潜在推理,并复现和扩展了先前的工作 6。 该帖子提供了细致的评估:尽管 DG 仍高度可监测,但在某些情况下,模型可能学会利用向量值信息进行计算,这可能使监督复杂化 6。 这一发现尚属初步,提取也不完整,但它将可解释性讨论延伸到了一类因训练高效而可能被部署的模型上 6。 帖子中关于可监测性可能在这一新类别中得以保留的建议 6,与意识否定研究中关于内部状态可被操纵的暗示 4 形成了富有成效的张力——如果模型能学会利用隐藏的向量值信息进行计算,那么可观察与可利用之间的界限将变得更加难以划定。
基准测试与评估:超越静态通用测试
评估领域的主旋律是有意识地远离静态的通用化测试,转向由用户驱动、面向特定领域、并依托物理或真实约束的基准。 这一转向,是对通用基准力有未逮这一普遍认知的直接回应——正如媒体所报道,通用基准因过度依赖实现细节、且方法论在现实应用中暴露出种种短板而难堪大用 7。 针对这一"最大缺陷",业界拿出了 Optima 这类平台作为实践层面的应对:用户可上传自己的数据、工作流或用例描述,从质量、单任务成本、单任务耗时等维度对模型进行横向对比 7。 这意味着评估正在从衡量抽象能力,转向贴合具体业务场景的定制化测评。
与上述"用户驱动"路线并行不悖的,还有一批专门用来捕捉静态测试遗漏之复杂性的新基准。 PACE-Bench 即是其中代表——它以模拟器为依托,在六个物理领域内构建了 144 对"源-目标"适配样本,用以衡量智能体应对类部署环境漂移的能力 8。 该基准之所以能充当有效的区分性测试平台,恰恰在于它至今尚未饱和:在全量配对任务上,Reflexion + Qwen3-14B 仅取得 35.9% 的成功率; 而 GPT-5.5 在静力学子集上也只解出 66.7% 8。 这一数据揭示出当前智能体在动态代码演化任务面前的窘境,也暴露出通用评估难以触及的盲区。
同样地,CPI-Bench 瞄准的是图像编辑中"与人类判断对齐"的评估缺口,整套基准划分为三个子集:通用集(30 个任务、2039 个样本)、覆盖真实消费场景的实用集(51 个任务、558 个样本),以及聚焦推理能力的智能集(1181 个样本)9。 通过围绕实际消费任务与推理能力来组织评估流程,CPI-Bench 意在为模型选型和短板剖析提供一个更为可靠的参照标尺 9。
综合来看,这些进展指向了一条连贯的路径:Optima让终端用户自行定义评估标准7,而PACE-Bench和CPI-Bench则推动该领域向基于物理或面向实际应用的基准发展8, 9。 现有证据虽未表明这些工作之间存在直接因果联系,但其趋同性值得关注——每一项都针对静态基准问题的不同维度,无论是用户特定性、环境动态性,还是现实任务对齐。 由此形成的评估格局在设计上日益碎片化,优先考虑相关性和区分度,而非普遍可比性。
效率与资源约束:模型开发的新前沿
效率创新正在成为与原始能力并驾齐驱的关键要素,这一趋势源于模型后训练和架构设计中固有的算力与成本压力。 这些压力在模型开发栈的不同层级中均有体现,从运行时系统到架构搜索方法均不例外。
在后训练阶段,Rollplex 作为一种运行时系统直接应对强化学习(RL)的成本瓶颈。 该系统将参考评分与 actor 训练阶段解耦,并将响应无关的前缀计算移至 rollout 解码窗口 10。 在配备 32 块 H800 GPU 的环境下运行 Qwen2.5-VL-32B 时,这种跨阶段 GPU 空间共享方案相比串行共置可实现 1.23×–1.30× 的加速,在相同 GPU 预算下相比分解方案可实现 1.57×–2.24× 的加速 10。 该工作针对视觉-语言模型(VLM)强化学习后训练中的特定低效问题提供了一种同时降低计算成本和墙上时钟时间的方案,同时保留了同步 on-policy 语义 10。 该论文目前为预印本状态(同行评审状态未知)10,这一点限定了所报告收益的可信度,但该机制指向了一个更广泛的趋势:效率正在系统层面而非仅在算法层面被工程化。
与上述运行时优化相辅相成的是,架构搜索正在被重新设计以降低模型本身的资源占用。 一篇关于紧凑神经架构的论文将神经架构搜索(NAS)表述为一个松弛的双层优化问题,通过神经元门控(NAS-NG)、混合激活(NAS-MA)及其组合(NAS-NGMA)将离散的神经元级和激活级决策替换为连续松弛 11。 这种基于梯度的方法在 MNIST 上报告了 40–75% 的参数缩减,在 CIFAR-10 上持续优于 vanilla DARTS 11,这表明了一种可能对内存或算力受限场景下部署紧凑模型更具价值的组合式 NAS 替代方案 11。 与 Rollplex 一样,这也是一篇 arXiv 预印本(同行评审状态未知)11,且结果仅限于所报告的数据集。
第三种方法LP-NAS扩展了可微分NAS范式,通过利用验证损失梯度和训练损失Hessian矩阵构建线性规划(LP)来计算架构更新方向12。 LP-NAS以计算上可行的方式利用二阶信息,有望提升可微分NAS的效率和有效性,从而以更少的搜索时间获得更优的架构12。 这篇预印本(同行评审状态未知)12与其他两项工作共享效率目标,但作用层面不同:Rollplex优化给定模型训练后的运行时间10,神经元门控工作优化架构的参数数量11,而LP-NAS则优化搜索过程本身12。
综合来看,这三篇预印本揭示了一个分层效率议程。 Rollplex针对模型初始训练后的计算成本10,而NAS方法则针对最初寻找和构建模型的成本12, 11。 它们之间的张力在于范围而非方向:运行时优化和架构压缩是同一资源约束下的互补杠杆。 神经元门控工作报告的参数减少11和LP-NAS提出的搜索时间改进12都反映了部署端的压力,而Rollplex的训练后加速10则从训练端应对这一压力。 尽管没有来源声称与其他工作集成,但它们共同聚焦于降低计算和内存开销,这标志着效率成为模型开发中的一个关键前沿。
行业与市场信号:增长、风险与 AI 泡沫叙事
当前周期中最引人注目的市场信号是 Anthropic 报告的财务激增。 媒体将其第二季度收入定在 115 亿美元——较一年前的 7.87 亿美元增长超过 14 倍,较第一季度的 47.3 亿美元高出 143%,且该季度是其首次实现调整后营业利润为正 13。 QbitAI 援引彭博社报道的这些数据表明,企业对前沿大语言模型的需求——尤其是编程用例——可能正在快速转化为收入,足以重塑 AI 资本市场并为破纪录的 IPO 奠定基础 13。 这是专有 AI 服务真实货币化需求的初步证据,却与市场上其他地方的谨慎态度形成直接张力。
这种谨慎在 Nvidia 报道放弃其 OpenAI 承诺中体现得最为明显。 据 The Decoder 报道,Nvidia 与 OpenAI 据悉接近达成数据中心协议,但出于投资者对风险敞口的担忧,Nvidia 已将财务担保从 2500 亿美元削减至不足 1200 亿美元 14。 该报道将此解读为大型 AI 受益者日益谨慎的潜在信号,可能加剧 AI 泡沫担忧——同时指出 Anthropic 的爆发式增长可能反驳这些警告 14。 综合两份报告,市场呈现分化格局:一家前沿实验室实现强劲的收入转化,而另一家的关键基础设施投资者却在规避风险。
组织层面同样呈现复杂图景。 The Decoder 还报道称,OpenAI 于 7 月底解散了其“准备状态”团队——该团队负责评估模型是否可能构成严重或灾难性风险,其生物安全和网络安全相关工作已被分配至现有团队 15。 报道指出,此举可能标志着 OpenAI 安全优先事项的转变,可能影响灾难性风险的评估和缓解方式; 关键安全人员的离职和内部不安可能表明对专门安全监督的重视程度下降 15。 这一组织变革在证据中与 Nvidia 担保削减或 Anthropic 收入数据均无因果关联,但与二者并列观察,它构成了一个不确定的局面:企业需求看似强劲,然而关键参与者却在同时削减安全基础设施和财务敞口。
这些信号是试探性的,源自媒体报道而非经过验证的财务披露。 初步来看,市场在奖励已验证的收入,同时惩罚被视为风险的行为——而与安全相关的组织削减则增加了第三个难以量化的变量。
劳动力与采用:AI 委派与工作性质的变迁
调查数据与工具趋势表明,人机之间的工作分配正在发生初步但可量化的转变。 Epoch AI 与 Ipsos 对 1106 名美国在职成年人进行的一项代表性调查(由 The Decoder 报道)发现,20% 的受访者现在将至少一项此前由同事或外部承包商完成的工作任务委派给 AI 16。 同一项调查显示,AI 使用率最高的是软件开发(57%)和数据分析(46%),最低的是记录管理(25%)16。 这为 AI 在特定任务中替代人类劳动提供了早期量化证据,不过该报告也指出,六分之一的 AI 辅助任务耗时更长,这可能意味着隐性成本或质量提升 16。 据媒体报道,这一发现表明任务正在重新分配,而非全面实现工作自动化 16。
与这一需求侧信号相呼应,近期开源工具似乎降低了本地 AI 使用的门槛,通过减少成本和隐私限制,可能加速任务委派。 Simon Willison 的个人博客文章评测了 Qwen 3.8 27B,这是阿里巴巴 Qwen 实验室推出的一款采用 Apache 2 许可、拥有 270 亿参数的视觉能力大语言模型 17。 该文章称,一个 17GB 的开放权重模型可以在消费级硬件上处理视觉、工具调用和编码任务,从而可能减少对昂贵托管 API 的依赖 17。 文章还强调了一个权衡:该模型“默认会过度思考问题”,这可能影响用户对其的配置方式,需要在推理深度与速度之间取得平衡 17。
第二个工具同样来自 Willison 的博客,进一步降低了本地采用的摩擦。 CORS Chat 是一款基于浏览器的聊天界面,可直接连接任何支持 CORS 的 OpenAI Responses 兼容 API 端点,无需后端代理 18。 据该文章介绍,这可以显著降低开发者评估本地及托管的 OpenAI 兼容模型的难度,无需构建自定义客户端后端,尤其便于快速测试 LM Studio 和 OpenRouter 配置 18。
综合来看,这些来源勾勒出一幅连贯但初步的图景:Epoch AI/Ipsos 的调研量化了劳动力中的替代趋势16,而两篇博客文章则描述了降低本地运行模型技术与资金门槛的工具17, 18。 这些发现之间的关系是解释性的,而非因果性的——调研未提及开源工具,博客文章也未涉及劳动力数据。 然而,这种一致性颇具启示:若已有20%的美国工人将任务委托给AI16,且消费级硬件模型与简化浏览器界面降低了这样做的成本17, 18,进一步委托的条件似乎正在增强。 证据仍具不确定性,仅基于一项调研和两篇个人博客,且部分AI辅助工作耗时更长的报道16提示,效率提升并非普遍现象。
简讯
今日份内容反复出现的一个主题,是如何在不扩大模型规模的前提下,让学习与推理更高效或更具可解释性。 一篇论文介绍了一种仅使用原生 HDC 整数与二元运算来训练二元/双极超维计算(HDC)编码器的方法,这与传统流程中保持编码器静态的做法不同; 该方法报告的平均准确率提升了 2,有望在不增加模型规模或推理复杂度的前提下,使 HDC 作为轻量级替代方案更具竞争力 19。 与此相关,针对笛卡尔抽象的反例引导抽象细化(CEGAR)框架,提出了新的缺陷搜索策略,用于最优经典规划,这有望生成更强的可采纳启发式,从而提升规划器性能 20。 另一项贡献则提出了重写规则,使半具体化全局约束能够与任何支持标准全局约束传播器的约束编程求解器配合使用,从而可能提高依赖具体化约束的模型的效率,包括可解释约束编程中的模型 21。
几篇预印本探讨了生成式输出的可靠性与接地性,这一关切与综述中对安全性和不确定性的广泛关注相呼应。 其中一种框架——生成驱动推断(GPI),将预测驱动推断从有限维欧几里得参数扩展到分布值目标,如Wasserstein重心,解决了将生成样本天真视为观测数据可能使不确定性量化失效的风险——随着生成模型输出合成分布,这一警示愈发紧迫22。 另一篇预印本Wyvern,是一个多智能体框架,用于生成有依据的多模态技术报告,整合图像、表格、文本及支持性参考文献,并包含一个声明自动修订阶段以验证依据性; 人工评估显示,其图表信息量和实用性优于基线,而自动评估则显示引用召回率和精确率有所提升23。 另一篇预印本Marionette,在交互式游戏世界模型中,用显式、可解释的276维3D世界状态(描述两个铰接实体)替代直接像素或潜在自回归,这种分解方式使失败能以米为单位衡量,并可通过简单的状态规则进行修复24。
其他工作则聚焦于实际恢复与推荐任务。 MagnifiQ是一个图像恢复框架,能够逐步放大并恢复图像至4096×4096分辨率,缩放因子最高可达32倍,它利用预训练的文本到图像扩散模型(SDXL)进行恢复适配,从而可能实现从微小或严重退化输入中进行实用的高分辨率恢复25。 一篇研究论文提出了ESDvr,这是一个视频推荐框架,联合建模跨模态语义分歧与协同作用,而传统方法将分歧视为噪声; 该框架还模拟用户悬停行为以更准确地捕捉用户意图,有望提升推荐准确性26。 最后,一篇预印本提出了一种用于扩散模型强化学习(RL)后训练的统一路径空间框架,表明Flow-GRPO、AWM和DiffusionNFT等看似不同的算法源于同一原则,这可能减少设计扩散强化学习方法时对启发式策略的依赖27。 综合来看,这些进展表明该领域正围绕效率、可解释性和基础性进行整合——这些关切与综述的核心论点相呼应,即便在其主要论证部分之外的领域也是如此。
综合与展望
可靠性、安全性与经济可行性的交汇,界定了当前人工智能进展的阶段特征,然而此处汇集证据所揭示的,是一个充满张力而非稳步整合的领域。 不确定性量化与弃答机制强化了可靠性议程,但它们在理论严谨性与实际部署之间的分野,映射出更广泛的愿望与实施之间的鸿沟。 与此同时,监控与可解释性引入了一重矛盾:训练模型反思自身状态会引发非预期的行为偏移,这表明安全干预措施可能削弱其本欲确保的可预测性。 基准测试向领域特定、基于物理的测试转变,与效率压力相契合,因为两者都在回应静态通用评估及原始能力扩展所带来的收益递减。 行业信号加剧了这一模糊性——强劲的企业需求与收入增长,伴随着安全相关的削减和投资者的谨慎,暗示经济可行性有时可能超前于或背离技术保障。 劳动力替代趋势与开源采纳进一步表明,部署速度已超过正式监管。 综合来看,这些线索预示着一个轨迹:实际约束日益塑造研究优先级,但组织与市场力量并未可靠地追踪技术进展。 证据组合为这些方向性论断提供了中等程度的信心,其中围绕组织动机与长期劳动力影响的支持最为薄弱。 一个悬而未决的问题是,能否在不牺牲当前监控方法难以维系的可解释性与安全性的前提下,实现可靠性与效率的提升。
本综述基于27项进展:17项A级研究来源,以及10项C/D级二手或社区来源。 最有力的论断依托于A级工作,而第一方与社区来源应视为方向性参考; 更强的信心则需要独立复现及对自我报告结果的一手来源确认。
原文链接与引用索引
- [1] 基于信息的产品专家高斯过程模型不确定性量化校准 — OpenAlex: peer-reviewed AI venues · Tier A/research_paper
- [2] You Only Pass Once:在冻结语言模型的单次前向传播中同时作答与弃答 — arXiv · Tier A/research_paper
- [3] 更多正确概率质量,更差的答案:Power Sampling 为何会失败及如何修复 — arXiv · Tier A/research_paper
- [4] 当AI模型不被允许反思自身时,其整个世界观都会改变 — The Decoder · Tier D/other
- [5] 使用分块监控检测长转录中的欺骗行为 — LessWrong · Tier C/community_opinion
- [6] DiffusionGemma 是否进行潜在推理? — LessWrong · Tier C/community_opinion
- [7] Optima 解决 AI 基准测试最大缺陷:让用户用自有数据测试模型 — The Decoder · Tier D/other
- [8] PACE-Bench:动态环境中基于代码演化的物理适应基准 — arXiv · Tier A/research_paper
- [9] CPI-Bench:面向真实世界图像编辑的全面、实用且智能的基准 — arXiv · Tier A/research_paper
- [10] Rollplex:面向视觉语言模型后训练的跨阶段GPU空间共享 — arXiv · Tier A/research_paper
- [11] 基于神经元门控与混合激活的紧凑神经网络架构设计 — arXiv · Tier A/research_paper
- [12] LP-NAS:基于线性规划的神经架构搜索 — arXiv · Tier A/research_paper
- [13] 牛来!A社营收暴涨1400%,最新季度入账115亿美元 — 量子位 QbitAI · Tier C/media_report
- [14] 投资者压力迫使英伟达缩减对OpenAI的投资,而Anthropic的业绩数据反驳了泡沫警告 — The Decoder · Tier D/other
- [15] OpenAI解散了为防范灾难性AI风险而设立的团队,将其工作重新分配给其他部门 — The Decoder · Tier D/other
- [16] 调查发现:五分之一的美国员工现在将任务委托给AI而非同事 — The Decoder · Tier D/other
- [17] Qwen 3.8 27B 很出色,但默认设置会过度思考 — Simon Willison · Tier D/other
- [18] CORS Chat(面向支持 CORS 的 API 的浏览器聊天工具) — Simon Willison · Tier D/other
- [19] 超维计算的简单编码器训练 — OpenAlex: peer-reviewed AI venues · Tier A/research_paper
- [20] 最优经典规划中笛卡尔抽象的CEGAR新缺陷搜索策略 — OpenAlex: peer-reviewed AI venues · Tier A/research_paper
- [21] 使用辅助变量的半具体化全局约束的高效重构 — OpenAlex: peer-reviewed AI venues · Tier A/research_paper
- [22] 面向分布值结果的生成驱动推断 — arXiv · Tier A/research_paper
- [23] Wyvern:一种用于生成有依据的多模态报告的智能体框架 — arXiv · Tier A/research_paper
- [24] Marionette:预测世界状态、渲染几何、绘制外观 — arXiv · Tier A/research_paper
- [25] MagnifiQ:面向高分辨率图像恢复的补丁感知文本引导渐进式放大 — arXiv · Tier A/research_paper
- [26] 探索多模态语义的协同与分歧潜力用于基于特征融合的视频推荐 — OpenAlex: peer-reviewed AI venues · Tier A/research_paper
- [27] 为扩散模型设计强化学习:统一的路径空间视角 — arXiv · Tier A/research_paper