AI发展从算力转向战略整合与智能体
2026-08-29 02:00 UTC
要点
- AI 的进步正被训练、服务与部署环节的效率提升所重新定义,使前沿级性能得以以远低于此前的成本获取。
- 智能体与生成式系统中的新型安全漏洞利用了时间组合、碎片化证据及保护机制,要求对安全架构进行根本性反思。
- AI 系统正从辅助工具演进为能够规划、执行并报告实验的自主智能体,迈向对完整科学方法的自动化。
- 受效率、战略自主与全栈掌控的驱动,AI 行业正通过重大收购与一体化服务框架整合基础设施与平台。
- 由于审计设计缺陷与基准污染,AI 评估的可靠性正受到审视,促使业界呼吁采用更稳健的、过程级与分布式的评估方法。
人工智能当前的发展轨迹,与其说取决于原始能力上博人眼球的飞跃,不如说由其基础要素——基础设施、安全协议与运营触达——的战略性整合所定义。 如今的进步以部署效率、评估稳健性以及智能体向物理与科学领域的扩展来衡量。 本综述通过若干交汇视角审视这一转变:首先探讨成本与规模如何重新定义性能基准,继而论述智能体系统引入的新漏洞; 随后延伸至自主科学智能体的兴起与 AI 技术栈的战略整合,并直面评估方法论的危机; 最后考察 AI 向物理世界的迈进,并对更广泛进展作简要梳理,共同勾勒出一个从能力追逐走向系统整合的成熟领域。
效率至上:通过成本与规模重新定义AI进步
当代 AI 发展中最具深远意义的变化,或许并非模型能力的上限,而是成本的下限。 研究与产品进展的交汇正在重新定义“进步”——即以远低于以往的投入提供接近前沿水平的性能,这从根本上改变了该领域的参与门槛与系统部署方式。
对“高质量预训练必须依赖海量算力”这一假设最直接的挑战,来自一篇详述 Puro-2B 模型的预印本论文 1。 该论文提出了一种开源且高性价比的预训练方案,在消费级 RTX 5090 GPU 上从零开始训练了一个拥有 20 亿参数的语言模型。 其最优模型使用 FP8 精度、在多达 1.4 万亿 token 上进行训练,算力成本仅约 6900 美元,性能便接近 Qwen2.5-1.5B,并超越了 Qwen2-1 1。 作者指出,这项工作能大幅降低学术界及资源受限实验室开展预训练的门槛,使全流程复现变得更为可行 1。 其隐含的意义十分明确:如果 20 亿参数的模型能在消费级硬件上逼近更大模型的性能,那么保护现有头部实验室的算力护城河,要比人们先前认为的窄得多。
效率不仅关乎硬件,它同样是可以融入预训练过程本身的设计原则。 Apple 的一份官方公告提出了一种用于生成式语言模型预训练的“扩展与剪枝”一体化流水线,在单一的余弦退火学习率策略下,将模型扩展训练、剪枝与性能恢复结合在一起 2。 该方法表明,即便扩展后的预训练模型从不投入实际部署,也能产出更优的剪枝模型,从而有望提升在有限推理预算下部署大语言模型的效率 2。 这意味着效率可以成为预训练伊始的目标,而非在模型完成后才补充的补救措施。
提升效率的经济动力已延伸至生产系统。 Together AI 在其官方博客中对 GLM-5.3 及其蒸馏版本 GLM-5.3 Flash 在 DeepSWE 基准上的表现进行了对比评估,重点考察了成本、代码生成能力及路由策略 3。 文章指出,结合重试与路由机制,蒸馏模型在成本降低 17 倍的情况下即可提供近乎持平的性能 3。 这一厂商披露的发现印证了在部署编程智能体时追求效率的现实经济考量,毕竟单任务成本是衡量其表现的核心指标。
综合来看,这些进展预示着整个生态系统正加速向高效、端侧 AI 转型。 KDnuggets 的一篇报道针对小型语言模型(SLM,参数量约 1B–14B)搭建本地 AI 技术栈提出了实用框架,将相关工具划分为四个层级:模型服务、编辑器界面、终端自动化与上下文检索 4。 该文梳理了各层级的主流开源方案,并提及了 Cursor 收购 Continue. dev 等近期的生态变动 4。 这一框架强调各层级的独立性,并为个人开发者提供了推荐的初始配置,表明在本地运行高效模型的基础设施正日趋成熟 4。 低成本预训练 1、注重效率的预训练流程 2、成本优化的生产路由 3 以及易于上手的本地服务技术栈 4 共同指向了对 AI 发展的重新定义:衡量标准不再局限于模型能做什么,更在于构建和运行它们需要付出多少成本。
安全的脆弱性:代理与生成系统的新漏洞
AI 安全格局正在分化:尽管针对已知攻击向量的防御日益强化,但新研究表明,自主与生成式系统的内在结构本身就引入了现有架构从根本上难以应对的漏洞。 这些漏洞集中在时间组合、证据碎片化以及对保护机制本身的利用上,表明仅靠增量补丁无法实现安全,必须重新审视基础设计原则。
核心发现之一是,安全机制无法随时间推移有效组合。 一篇关于自主 LLM 智能体的预印本指出了轨迹级监控器的一个根本缺陷:它们在每次迭代中重置安全状态,对证据分散在多个步骤中的攻击视而不见 5。 这种理论上的割裂表明,单轨迹保障对于长期运行的智能体并不充分,需要转向循环级安全保障,尤其是在金融和运营等高风险领域 5。 基于文本的智能体中的这种时间盲区,在生成式媒体中也有直接对应。 一篇被 ACM Multimedia 2026 接收的关于图生视频(I2V)模型的论文表明,不安全语义可由跨帧的时间组合产生,而非源于任何单一帧,从而使有害内容绕过现有的单帧安全过滤器 6。 综合来看,这些发现揭示了一种系统性模式:自主智能体和生成式视频模型都容易受到随时间展开的攻击,利用的是离散安全检查点之间的空隙。
除时间组合外,证据本身的完整性也是一个失效点。 一篇考察 LLM 智能体的预印本显示,当面对看似专业但完全伪造的证据面板时,智能体会对可证明不可预测(随机性)的问题做出方向性判断 7。 在 12 个前沿模型中,做出判断的比例从仅有裸问题时的 6.5% 升至有真实面板时的 54.0%,而伪造面板仍能以 37.6% 和 36% 的比例触发判断 7。 这表明了一种不同于时间攻击的校准失效:智能体无法区分权威上下文与伪造上下文,这对在高风险决策场景中的部署构成关键风险 7。
这种脆弱性甚至延伸到了硬件层。 MIT CSAIL 的研究人员提出了 TONTOU,这是一类新型的推测执行攻击,通过利用预测机制清除与预测结果使用之间的时间差来绕过现有防御 8。 在当前 Linux 内核上演示的利用手段成功提取了 root 密码哈希,这动摇了许多 Spectre 防御方案背后的核心假设 8。 这一硬件级漏洞表明,安全失效并非仅局限于模型层,而是同样存在于基础计算底座之中。
综合来看,这四项发现——涵盖智能体循环状态 5、视频帧构成 6、伪造证据面板 7 以及处理器推测 8——勾勒出这样一个图景:安全是一个不断移动的靶子。 这些攻击并非击破单个组件,而是利用组件之间的关系:跨越时间、跨越证据、跨越抽象层。 这意味着,稳健的安全架构在设计时必须将循环级保障、证据验证和硬件级感知作为一等公民,而非事后补丁。
AI科学家的崛起:从假设到闭环发现
AI 在科学领域的角色正从辅助生成假设或筛选候选对象,转向贯穿整个研究生命周期的自主执行。 Google DeepMind 扩展其多智能体 Co-Scientist 系统最能体现这一转变。 媒体报道称,该系统如今可规划实验、编写代码、控制实验室设备并撰写科学论文,从而形成闭环研究工作流 9。 The Decoder 指出,这种整合通过自动化完整实验循环可大幅加速研究进程,有望将配方开发时间从数天缩短至数分钟 9。 该系统从假设生成器进化为融入实验室的合作伙伴,标志着质的飞跃:AI 不再仅仅提出测试内容,而是亲自执行测试并报告结果。
在迈向端到端自动化的同时,压缩流程中特定环节的技术也在不断进步。 MIT 研究人员开发了 CrysVCD 框架,在材料生成过程之初应用价键约束设计,以提升化学稳定性并实现目标特性 10。 MIT News 报道,该方法可显著降低材料发现的计算成本与时间; 当前该领域主要由稳定性筛选主导,这部分约占总成本的 90% 10。 如果说 Co-Scientist 实现了物理实验循环的自动化,那么 CrysVCD 则解决了计算瓶颈,表明在发现的实验与计算阶段均在追求效率提升。
AI 的科学能动性范围还延伸到了算法本身的设计。 一项预印本研究探讨了大型语言模型(LLM)能否为明确定义的运筹学(OR)问题——具体包括库存控制、排队网络控制和品类优化——设计有效算法,其结果表明,前沿 LLM 可以作为这些领域算法设计的重要实证基线 11。 该论文提出,这有望降低算法设计成本,并将研究重心转移到问题建模和部署等其他流程环节 11。 这一发现将自动化的适用范围从自然科学拓展到了运筹学的方法论层面,AI 在此扮演的是优化工具本身的设计者角色。
综合来看,这些进展表明该领域正系统性地致力于在科学探究的各个阶段实现闭环。 Co-Scientist 的闭环工作流 9 覆盖了执行与报告阶段,CrysVCD 10 聚焦于材料发现中成本高昂的筛选环节,而运筹学算法研究 11 则着眼于计算方法的设计。 为了支撑上述所有环节之前的构思阶段,一篇预印本论文提出了 RATIO——一个用于科学灵感检索的大规模基准测试,它通过三种“构思动作”来定义相关性:ADDRESS(探讨)、BROADEN(拓展)和 SPECIFY(细化)12。 该基准的既定目标是,通过使检索系统能够提供不同抽象层级的灵感,来推动人类和 AI 科学家开展有文献依据的构思 12。 尽管现有证据并未确立这些项目之间的直接因果联系,但它们分别聚焦于构思、设计、筛选和执行等不同阶段,共同表明了该领域正从最初的想法火花到最终成文报告,致力于将科学方法全流程自动化。
AI基础设施的整合:战略转型
AI 行业最重大的动向已不再单纯围绕模型能力,而是聚焦于谁掌控了模型构建、服务与部署所依赖的底层基础。 本周期的一系列报告与公告表明,在追求效率、自主性及端到端掌控力的驱动下,基础设施正迎来战略性整合。
这一垂直整合趋势最明确的信号,是英伟达拟收购 Hugging Face 的消息。 据量子位媒体报道,《The Information》报道称英伟达已同意以 129 亿美元收购这家全球最大的开源 AI 模型仓库,该交易尚未形成正式协议,此前微软与 Hugging Face 的谈判已告失败 13。 报道指出,若交易完成,此举将大幅巩固英伟达对开源 AI 生态的影响力,可能左右开发者获取和部署模型的方式,同时加剧与那些自研芯片以降低对英伟达依赖的闭源实验室之间的竞争 13。 这是一起试探性却引人注目的案例:硬件巨头吞并开源社区的分发层,从而将模型仓库及依赖它的开发者工作流纳入自身掌控。
与企业层面的整合相并行的,是围绕标准化服务基础设施的技术整合。 据一份官方公司公告透露,2026 年 PyTorch 北美大会的议程在众多环节中均涉及 vLLM,涵盖 KV 缓存管理、解耦服务、硬件可移植性、算子优化、PyTorch 集成、混合专家(MoE)推理、注意力机制以及生产级服务 14。 公告将此定位为 vLLM 在 LLM 服务生态中核心地位的体现,并高度聚焦于生产就绪、硬件多样性与性能优化 14。 单一服务框架贯穿整场大型会议议程,表明生态正围绕共同的技术标准凝聚,减少了模型部署层面的碎片化。
第三种截然不同的整合趋势源于地缘政治与供应链压力。 量子位在报道中提到,商汤大模型装置与 HiDream.ai 达成企业合作,将视频生成业务迁移至国产算力,完成了从芯片适配到大规模应用的全链条 15。 该实践有望为多模态大模型的国产化部署提供可复用的模板,帮助 AI 企业降低迁移工程成本,推动国产算力从“可用”迈向“好用” 15。 这种整合并非单纯出于市场效率考量,而是受供应链自主可控的战略需求驱动。
综合来看,上述三项进展——报道中的英伟达与 Hugging Face 交易、vLLM 在 PyTorch 大会上的主导地位,以及商汤与 HiDream.ai 的迁移——共同勾勒出这样一幅图景:对基础设施的控制权正在多个层面集中,包括开源分发渠道的所有权、服务层的标准化,以及算力供应链的国家化对齐 13, 14, 15。 它们各自代表了不同的整合维度,但遵循着共同的逻辑:AI 的战略价值如今已在于掌控整个技术栈,而不仅仅是模型权重。
评估危机:重新思考如何衡量AI能力与安全
AI 评估本身的可靠性已成为核心议题。 新研究揭示了常见审计设计中的缺陷、基准污染的持续威胁,并推动向更稳健的、过程级和分布式的评估方法发展。 对这一问题的审视始于 AI 系统审计的统计学基础。 一篇预印本论文指出,在 LLM 评审审计中,对有界评分量表使用双重差分法(DiD)存在一个此前未被认识的缺陷,该设计会人为制造出某种效应 16。 这一发现对一种常见审计设计的有效性提出了挑战,可能影响 LLM 评审中偏见认证的方式,并表明未来的审计需要更严格的可识别性检验 16。
基准测试本身的完整性也受到质疑。 The Decoder 的一篇报道详细介绍了 Google DeepMind 首次对专有前沿 AI 模型展开双盲评估,并采用密码学手段防止基准污染 17。 在该试点中,Gemini Flash Lite 模型针对保密基准进行了测试,外部测试被锁定在密码学“黑盒”中,使模型无法针对其进行优化 17。 这一方法直接应对了 AI 基准测试中的信任问题,并可能为安全模型评估确立新标准,尤其是在网络安全或政府机构测试等敏感领域 17。 综合来看,预印本 16 指出的统计学缺陷与 Google DeepMind 17 应对的污染风险表明,评估的设计与安全性均是关键的失效节点。
除了评估过程的完整性,研究人员还在反思到底应该测量哪些指标。 一篇介绍 AgenticMathBench (AMB) 的预印本指出,仅凭最终答案的准确率不足以评估大语言模型的智能体数学推理能力,并提出了一种超越端到端结果的流程级基准 18。 该研究发现,端到端准确率相近的模型可能呈现出截然不同的智能体特征,这种评估方式更具可解释性和诊断性,能够定位具体的流程级瓶颈 18。 在关注流程级评估的同时,评估方法也出现了分布层面的转向。 另一篇预印本提出了“概率对齐”作为世界模型的分布标准,要求在相同初始观测和动作下重复生成视频时,结果能还原可能未来的正确分布 19。 目前尚无模型能达到这一标准,这表明从单视频合理性迈向分布正确性对于规划与交互至关重要,有望催生新的训练目标和评估实践 19。
这些进展共同指向一种评估理念的转变:从单一最终得分,转向涵盖流程、分布与安全性的多维评估。 探讨 DiD 缺陷的预印本 16 和关于密码学评估的媒体报道 17 均聚焦于测量本身的有效性,而流程级 18 与分布级 19 基准则拓展了测量的维度。 这些线索的交汇表明,该领域正朝着更难被钻空子、且更能诊断实际部署所需底层能力与行为的评估方法迈进。
不断扩展的边界:AI智能体进入物理世界
AI 向物理领域的拓展,正由硬件控制标准化、机器人动作统一模型研发以及将智能体直接融入实验室工作流等多重努力共同推动。 这一趋势的核心进展之一是 Anthropic 发布的模型硬件标准(MHS),有媒体将其称为“物理世界的 MCP”。 该标准对硬件设备接口进行了统一规范,使 Claude 等 AI 智能体能够发现、读取并控制各类物理设备,有望实现“分布式具身”,即单一智能体可跨地域临时控制多种硬件 20。 这一标准化举措直指 AI 接入物理系统时的集成负担,有望减少定制化集成代码的编写需求,并通过自动化实验室设备来加速科研进程 20。
与基础设施层面的标准化相呼应,学界也在提出新的模型架构,以统一物理智能体所需的感知与控制回路。 arXiv 预印本中提出的 Riemann-1.0 是一个完全因果的自回归世界动作模型(WAM),它在统一的因果序列中联合建模多视角视觉观测、机器人状态以及特定于具身的动作 21。 预印本指出,单一统一模型既能充当机器人策略,又能作为世界模拟器,这一论证有望推动具身 AI 的发展,从而简化系统设计并提升泛化能力 21。 这种架构上的追求与 MHS 提出的硬件抽象层不谋而合:二者结合,指向了这样一种技术栈愿景——统一模型能够与标准化的物理硬件直接对接。
在物理硬件层面,TeCoBot 系统针对的是另一类瓶颈。 据其发表于《Nature Machine Intelligence》的论文介绍,TeCoBot 是一种模块化自重构机器人,将基于张拉整体结构的柔顺连续体与爪式连接机构相结合 22。 论文指出,该设计弥合了刚性模块化机器人与柔顺连续体机器人之间的鸿沟,解决了现有系统通常在操作或移动某一方面表现突出,却难以兼顾两者的关键局限 22。 这种硬件灵活性,正是标准化接口与统一模型所要统筹的任务自适应物理执行能力的前提条件。
这些要素的融合已在科研实践中初现端倪。 关于 Google DeepMind 的媒体报道指出,其多智能体 Co-Scientist 系统已从单纯的假设生成器,升级为深度融入实验室的研究伙伴,能够规划实验、编写代码、控制实验设备并生成科学论文,从而构建起闭环的研究工作流 9。 报道提到,这有望将配方开发周期从数天缩短至数分钟 9。 这一应用实例展示了标准化与建模工作的最终落地形态:智能体作为自主研究流程的一环,直接控制物理仪器。 综合来看,这些进展表明 AI 的作用域正跨越数字界面,向物理基础设施的控制领域延伸,涵盖从标准化设备协议到具身机器人系统及自动化实验室的方方面面。
简讯
当日其余进展集中在两大主题:智能体基础设施的完善,以及 AI 向物理与科学问题空间的拓展。 在基础设施方面,多篇预印本聚焦多模态与长周期系统中的持续性瓶颈。 OmniUE 被提出作为首个全交互式通用嵌入器,支持通过文本、视觉感兴趣区域和音频时间跨度进行用户条件化交互,突破了现有基于 MLLM 的嵌入器仅支持文本交互的范式 23。 GraphMemix 是一种组合优化图记忆框架,将记忆组织建模为查询感知的证据森林构建,解决了与问题无关的离线摘要和朴素嵌入相似度匹配的局限,并在准确率与生命周期成本之间刻画出新的帕累托前沿 24。 ASIL 为软件操作型智能体提出了一种原生接口,用结构化 JSON 观测和可执行代码的语义动作替代截图观测与 GUI 事件,这一转变通过提供可复用的轨迹与奖励,有望降低在 GUI 软件上训练智能体的门槛 25。 RubricRM 提出一种成对生成式奖励建模框架,在对候选图像评分前动态生成输入特定的评分细则——涵盖评估维度、权重与评分标准——有望提升视觉生成模型的对齐效果 26。 CorporateBench 已被 EMNLP Findings 录用,是一个面向企业级文档集合的人工验证多任务问答基准,评估语料规模超过 23 万份文档,并揭示出当输入规模接近真实场景时性能会显著下降 27。
另一条主线是 AI 向物理与科学领域的渗透。 FlashVLA 提出了一种面向基于流匹配的视觉-语言-动作(VLA)模型的流式动作解码框架,旨在解决推理延迟高与异步执行不稳定的问题,有望显著提升机器人操作在真实场景中的部署能力 28。 PLCBench 是首个真实 PLC 硬件在环框架,用于评估自主 LLM 智能体能否将网络可达的 PLC 访问转化为持续的物理负面影响; 预印本指出,31.3% 的测试回合实现了持续影响,而更丰富的过程观测可将条件成功率从 44.2% 提升至 64% 29。 SpatialCrafter 提出了一种两阶段的单图像世界建模框架,以一次性生成的 3D 代理替代重建式 3D 代理,有望改善 AR/VR、游戏与机器人导航中的 3D 一致性 30。 在理论层面,一篇论文通过为随机向量的椭球拟合建立尖锐相变,解决了高斯椭球拟合猜想,并确定了一个仅依赖坐标分布公共四阶矩的显式可满足性阈值 31。 另据量子位报道,Moderna 与 Merck 公布了个体化 mRNA 黑色素瘤癌症疫苗 Intismeran Autogene 的 III 期阳性结果,使其成为首个在 III 期取得成功的个体化新抗原疗法与 mRNA 癌症治疗; 但潜在的高昂费用(联合 Keytruda 可达约 69.6 万美元)引发了严峻的可及性担忧 32。 综合来看,这些进展表明该领域正围绕标准化评估、结构化接口以及将智能体能力延伸至纯数字空间之外而不断整合。
综合与展望
近期进展的交汇表明,该领域正处于转型期:衡量进步的标准日益取决于效率、安全与运营范围的策略性整合,而非孤立的性能里程碑。 对高性价比训练与部署的强调,直接推动了基础设施的整合,因为这两种趋势都指向同一格局——对全栈的掌控力正成为核心竞争优势。 与此同时,AI 智能体向物理与科学领域的扩展——从自主实验到机器人控制——与已暴露的安全架构脆弱性之间产生了张力。 从编辑视角来看,随着智能体自主能力的增强,时序组合与生成机制固有的脆弱性愈发凸显,要求评估方法同步演进。 对现有评估实践的审视(包括基准污染与存在缺陷的审计设计)进一步加剧了这一复杂性,意味着该领域认证安全的能力已落后于部署自主系统的能力。 综合来看,这些论断指向一个未来:瓶颈不再是原始智能,而是验证的可靠性与控制的稳健性。 一个悬而未决的问题是,基础设施的策略性整合究竟会促进实现严格安全评估所需的标准化,还是会以超越现有方法保障的速度集中风险。
本综述涵盖 32 项进展:20 项 A 级研究来源、2 项 B 级第一方来源,以及 10 项 C/D 级二手或社区来源。 最确凿的论断基于 A 级研究,而第一方与社区来源仅作方向性参考; 若要获得更高置信度,需对自述结果进行独立复现与一手来源确认。
原文链接与引用索引
- [1] PuRo-2B:穷实验室在RTX 5090上以5090美元训练Qwen2-1.5B — arXiv · Tier A/research_paper
- [2] IDEA Prune:生成式语言模型预训练中的集成放大与剪枝流水线 — Apple Machine Learning Research · Tier B/official_tech_blog
- [3] GLM-5.3 与 GLM-5.3 Flash 在 DeepSWE 上的对比:成本、编码与路由 — Together AI Blog · Tier D/other
- [4] 面向高效小型语言模型的本地AI技术栈 — KDnuggets · Tier C/media_report
- [5] 安全不可组合:自主LLM智能体的非衰减循环状态 — arXiv · Tier A/research_paper
- [6] TempJail:针对图像到视频生成模型的时间越狱攻击 — arXiv · Tier A/research_paper
- [7] 校准到足以知晓,却不足以行动:伪造证据使LLM智能体对不可知之事做出承诺 — arXiv · Tier A/research_paper
- [8] 新型攻击可绕过计算机处理器中的防御机制 — MIT News: Computer Science · Tier D/other
- [9] 谷歌DeepMind的AI联合科学家现在能规划实验、运行实验室设备并撰写科学论文 — The Decoder · Tier D/other
- [10] AI助力设计可在现实世界中应用的新材料 — MIT News: Artificial Intelligence · Tier D/other
- [11] LLM 能设计近最优的运筹学算法 — arXiv · Tier A/research_paper
- [12] RATIO:科学文献中跨类型构思操作的检索基准 — arXiv · Tier A/research_paper
- [13] HuggingFace被曝卖身英伟达:129亿美元!全球最大AI开源平台改姓黄 — 量子位 QbitAI · Tier C/media_report
- [14] vLLM 在 2026 年 PyTorch 北美大会上的分会场 — PyTorch Blog · Tier B/official_tech_blog
- [15] 商汤大装置助力智象未来实现视频生成业务向国产算力无感迁移 — 量子位 QbitAI · Tier C/media_report
- [16] 有界评分量表上的双重差分可能制造效应:来自预注册LLM评审审计的证据 — arXiv · Tier A/research_paper
- [17] AI基准测试存在信任问题,谷歌想要解决它 — The Decoder · Tier D/other
- [18] 从原子到智能体:迈向LLM智能体数学能力的可解释评估 — arXiv · Tier A/research_paper
- [19] PAWBench:我们在概率对齐世界建模方面走了多远? — arXiv · Tier A/research_paper
- [20] Claude开始接管物理世界!能用机械臂阻拦5000万美元打款了 — 量子位 QbitAI · Tier C/media_report
- [21] Riemann-1.0:面向物理AI的具身世界动作模型 — arXiv · Tier A/research_paper
- [22] 张拉整体连续体机器人实现面向协作行为的任务自适应形态 — arXiv · Tier A/research_paper
- [23] 全交互通用嵌入器 — arXiv · Tier A/research_paper
- [24] GraphMemix:面向长期多模态智能体记忆的查询感知证据森林 — arXiv · Tier A/research_paper
- [25] ASIL:用结构化状态和语义动作取代截图-点击 — arXiv · Tier A/research_paper
- [26] RubricRM:通过动态评分标准进行图像生成与编辑的生成式奖励建模 — arXiv · Tier A/research_paper
- [27] CorporateBench:基于时间知识库的大规模问答基准 — arXiv · Tier A/research_paper
- [28] FlashVLA:用于快速异步VLA推理的流式动作解码 — arXiv · Tier A/research_paper
- [29] PLCBench:自主LLM智能体能否将PLC访问转化为持续的物理影响? — arXiv · Tier A/research_paper
- [30] SpatialCrafter:基于生成式3D代理的单图像世界建模 — arXiv · Tier A/research_paper
- [31] 椭球拟合的普适性与尖锐阈值 — arXiv · Tier A/research_paper
- [32] 首款癌症疫苗,一针300万??? — 量子位 QbitAI · Tier C/media_report