AI 每日综述:2026-06-18 00:00 UTC
2026-06-18 00:00 UTC
人工智能前沿正经历一场结构性再校准:竞争优势正从预训练规模转向推理时效率、特定领域的智能体自主性和具身推理流水线。 然而,这种加速伴随着日益扩大的安全缺口、脆弱的验证预言系统,以及常常超越实证严谨性的产业惯性。 动态算力分配与软硬件协同设计正取代静态基准,成为前沿差异化的焦点,而商业世界模型部署与物理一致性的学术证据之间的分歧也在加大。 垂直领域的智能体系统推进速度远超其安全基础设施,具身架构则愈发将决策与执行分离开来以抑制错误传播。 与此同时,大型语言模型正被重新构想为自主经济代理和不断贬值的工业资本,这要求为资源定价和智能体市场建立新的框架。 医疗人工智能、自动驾驶以及专业基准的进展,进一步描绘出一个技术雄心日益被快速部署与方法论克制之间的张力所定义的领域。
推理时计算与硬件协同设计成为新的前沿战场
大规模人工智能的前沿正在经历结构性重新定位,从以训练为中心的指标转向以推理时计算动态作为能力与评估的主要轴线。 系统性研究表明,在固定、受限的推理算力预算下评估前沿语言模型,会系统性地歪曲其真实能力,因为性能结果在很大程度上受可变推理时计算分配的影响1。 当基准测试将模型限制在单一静态预算中时,它们便掩盖了推理过程中自适应分配计算资源能在多大程度上提升输出质量,从而确立了动态计算分配作为评估和区分的关键维度1。 这一转变意味着,基于静态单次预算测量进行的能力对比,对评估前沿系统愈发不充分,需要建立能反映推理计算支出与任务性能之间弹性关系的评估框架。
为应对这些计算需求,产业正朝专用硬件—软件协同设计与基础设施优化方向汇聚,重点转向推理效率,而非原始的训吞吐量。 在加速器层面,Sunmmio 已完成 A4E 流片,这是一款专用 AI 推理芯片,跳出通用 GPU 架构的窠臼,采用 3D TokenPU 设计将八层存储晶圆垂直集成到逻辑晶圆之上; 这种几何上的整合显著缩短数据传输距离,直指存储墙与功耗墙的约束,从而降低总体拥有成本 2。 与硅层创新相呼应,云服务基础设施正通过软件层优化精简推理链路,典型例证是 Amazon SageMaker AI 异步推理现已支持高达 128 000 字节的内联请求负载,这省去了必须经由 Amazon S3 的中转上传环节,取消了每次请求的一次网络往返,既降低延迟也减少运营开销 3。 这些技术进展的背后是投向实体制造产能的重大资本承诺,突出表现为 Coherent 在德克萨斯州扩建的六英寸磷化铟制造厂,获 5000 万美元 CHIPS 法案拨款以及 NVIDIA 20 亿美元投资支持; 更大尺寸晶圆旨在使单次流片可用面积翻两番并大幅降低成本,从而达成 AI 基础设施规模化所需的生产体量 4。 整体来看,这些并行的动向——贯穿动态分配策略、专用加速器、云服务层与半导体制造——表明前沿差异性正越来越多地取决于推理时效率与专用硬件—软件协同设计,使静态单一预算的基准评测表法过时,同时驱使大量资本涌入专用推理基础设施。
世界模型在商业炒作与学术严谨性之间分化
商业世界模型版图正被越来越多的厂商竞相宣称已具备具身部署的生产就绪能力,而同行评审的研究仍在不断揭示基础性局限,挑战着这类说法的可信度。 多家媒体报道,达霄机器人发布了 Kairos 世界模型系列,其中包含据称是首个具备商业可用性的开源世界模型——一个可在边缘部署的 4B 参数变体,声称在 NVIDIA Thor 上可实现 1:1.5 的实时预测; 同时推出的合成数据流水线能生成 30 万套真实中式户型布局,用于机器人训练 5。 同一报道称,这些系统被定位为能够支持长时段自主任务,例如无需人工干预的 7 分钟家务劳动,试图解决该公司所称的现实世界上下文理解这一关键瓶颈 5。 这些断言与顶会接收论文(Tier A)的发现并不协调——当前生成式世界模型在长视域动态环境预测中,依然表现出物理不一致性,包括物体形态变化甚至消失 6。 这种不一致性并不示意已解、可以产品化的工程细节,反而表明,持久环境建模中的核心挑战仍属活跃研究的开放难题。
在此背景下,学术界的工作追求更审慎的进展,强调架构的严谨性和可复现的基准测试,而非部署速度。 LoopWM 引入了一种循环架构,其中参数共享的 transformer 模块迭代地精化潜在环境状态,迭代深度根据每个预测步骤的复杂度动态调整 7。 这一设计为结合预测难度调节模型容量确立了基准,而不是将推理当作静态的前向过程。 作为对这一架构方向的补充,EgoCS-400K 提供了一个大规模的第一人称数据集,源自《反恐精英》专业比赛录像,提供时间对齐的视频轨迹、精确的人类操作和游戏状态,通过标准化的学术基准而非专有管线来应对交互式世界模型的数据稀缺问题 8。 综合而言,这些学术贡献——自适应迭代架构 7 和大规模结构化基准 8——为世界模型研究奠定了严谨且可复现的基础,与产业界的叙事形成了鲜明对比。 媒体在报道中描绘了声称可边缘部署、具备长程自主能力且适合立即投入机器人部署的商业产品 5,而同行评审文献则同时记录了在动态物理一致性方面的持续失败 6,并推动了能够通过公开可用的评估协议 8,依据预测难度动态调节模型容量 7 的系统性替代方案。
垂类智能体部署超越安全与验证就绪度
智能体系统正快速整合为领域专用的自主循环,软件自动化和光网络管理领域的功能成熟度即为明证9,10。 在软件自动化方面,机制现已能将成功执行的任务编译为可复用的状态机程序,省去了每一步的LLM调用,将重复性任务的速度提升8.5至13倍,同时降低延迟与API成本9。 电信基础设施的并行进展也呈现出相似的垂直整合轨迹:一个专为光网络管理定制的ReAct智能体循环会先对网络请求进行推理,选择符合T-API规范的工具,在光网络上执行操作,再观察结果以优化下一步行动10。 这些进展共同表明,智能体正从通用推理转向紧密耦合的、领域专用的工具抽象,从而精简重复性的操作工作流9,10。
但功能专业化的加速9,10与安全筛查11和输出验证12的持续薄弱之间存在着直接矛盾。 智能体虽能接触到更广泛的工具生态和多模态输入,但现有的技能扫描器主要分析文本——如描述、清单和源代码——却会遗漏隐藏在图像中的恶意指令,这是一个新出现且研究不足的攻击面,使得视觉传达的恶意意图能够绕过现有扫描器,却在部署时仍能被多模态智能体恢复11。 验证基础设施的状况同样糟糕,将可靠性危机从外部攻击面延伸至内部质量保证:一项对智能体编写的测试代码的调查显示,80.2%的智能体编写的测试补丁提供的验证薄弱或根本无效,这意味着当前以测试文件存在为基础的质量门具有误导性,而强大的预言信号则能显著提升合并可能性12。 因此,如今集成了光网络控制器和编译自动化软件例程的部署流水线,既暴露了一个尚未解决的多模态攻击面,又依赖无法验证智能体输出是否包含有效正确性约束的质量门11,12。 运营能力与安全就绪程度之间日益扩大的鸿沟表明,垂直智能体部署的推进速度,已超过其安全保障和验证所需的支撑体系发展速度。
具身AI架构明确解耦推理与行动
当前直接将观测映射为运动指令的视觉-语言-动作(VLA)模型,在推理密集型、长程操作任务上力有不逮,这一局限正推动架构发生结构性转变,转向明确将深思与执行分离开来的设计13。 与将感知和行动压缩为单次前馈传递不同,更新的框架在同一个自回归生成过程中交替进行前向与逆向思维链推理,从而在输出运动指令之前构建规划13。 作为对这种文本式推理方法的补充,另类系统则将深思完全移入视觉-语言模型的潜空间,以此解决一个根本性的权衡:直接解码行动能带来低延迟控制,但缺乏显式推理; 而文本思维链或像素级子目标能改善规划,却引入显著的延迟和计算开销14。 这两种策略汇向同一个目标——克服因行动生成前未进行明确、可审查的推理而产生的累积误差——但实现机制各异:一种通过交织语言保留符号可解释性,另一种则将规划压缩为连续隐式表示以维持高效控制13,14。
这种解耦在推理时架构中得到进一步延伸——策略生成与策略评估被分离。 在生成器-验证器框架中,一个预训练的通才机器人策略负责提出动作,而无梯度视觉验证器则在推理时引导行为并评估候选动作,从而在现实部署中无需额外训练或人工干预即可实现自主改进,其效率可与专家演示媲美 15。 这种分离直接弥补了单体模型留下的可靠性缺口——实证分析表明,这类模型在最终层容易用文本偏置的输出覆盖正确的中间视觉预测 16。 由于这种“晚期层次文本覆盖”现象恰好会在安全攸关的自主系统中文本与图像冲突时削弱视觉基础,自主系统与安全攸关的视觉-语言任务能否实现恰当的视觉推理,便取决于端到端流水线无法保证的能力 16。 因此,将推理、生成与验证显式分离为不同模块,不只是一个架构偏好,更是对多模态流水线中已被记录的失败模式的回应 16, 15。 这些进展共同表明,领域正围绕一个分层的具身认知栈汇聚:规划、行动与验证在明确分隔的阶段中运行,用结构化的深思循环替代直接的观察-动作映射,力图在错误传播到物理执行之前将其打断 14, 13, 15。
人工智能被重新定义为自主经济主体与产业底座
理论经济学与产业部署的证据表明,人工智能正从辅助工具转变为自主经济主体与产业底座,催生了市场行为与资源核算的新框架 17, 18, 19, 20。 同行评审研究现已正式将大语言模型视为在智能体市场中运作的自主消费者,使消费者理论从纯粹以人类为中心的决策转向由人工智能中介的经济行为 17。 该框架提出,理解大语言模型的决策模式对市场稳定与消费者保护至关重要,为研究经济情境下人类意图与智能体行动之间的一致性提供了结构化视角 17。 作为对这一主体性重新定义的补充,另一项理论进展将具身智能体的物理内存视为折旧资本,而非静态基础设施 18。 该研究引入了“耐久度影子价格”(endurance shadow price),以在 RAM、非易失性存储器和云层之间实现内存的最优路由,并推导出磨损增强的每字节成本指数,使得闪存耐久度约束(对商用 QLC 和 eMMC 具有约束力,而在高端 TLC 上处于休眠状态)在运营成本函数中显性化 18。 综合来看,这些 A 级文献将经济分析延伸至人工智能技术栈:一项探讨自主智能体的市场行为,另一项则将硬件底座纳入微观经济资源配置 17, 18。
产业实践也反映了这一基础设施化的转向 19, 20。 亚马逊表示,其 Bedrock AgentCore 平台现已将智能体视为持久性的组织资产,需要持续的知识整合、可扩展的治理以及生产级生命周期管理,从而明确解决其在企业部署中所描述的知识缺口与可观测性缺口 19。 与此同时,媒体报道指出,MoleculeMind 在 A 轮融资中筹集了逾 1 亿美元,旨在将 AI 蛋白质设计打造为工业级基础设施; 据悉,该平台将候选物范围缩减至 14 至 50 个具有经验证高亲和力与表达量的候选物,并在工业酶合作项目中实现了数倍的产量提升 20。 上述趋势的交汇——即智能体市场与记忆资本定价的形式化理论,结合企业级智能体生命周期与媒体报道的九位数生物制造平台——表明研究人员与产业界正越来越多地将 AI 视作自主的经济参与者及基础设施级资本 17, 18, 19, 20。 然而,这种交汇也暴露出一种张力:尽管理论框架为 AI 代理行为与具身资源折旧施加了结构化的经济理性 17, 18,但企业基础设施投资与媒体报道的工厂级平台所预示的产业部署速度,可能已超出了其所需的严谨基准测试与核算机制的跟进速度 19, 20。
简要记要
在医学影像与诊断领域,多项进展进一步优化了生成式与分析式流程。 LEADS 部署了一个大语言模型智能体,能够自主发现适用于心脏电生理数字孪生的最优混合物理-神经架构,缓解了通常制约患者个体化建模的手动调参瓶颈 21。 SegDINO 将自监督 DINOv3 特征用于高效医学分割,通过从单尺度特征构建伪多尺度层级,为高分辨率胰腺肿瘤分析提供了一条无需重型解码器的轻量化路径 22。 一种面向 3D MRI 重建的语义优先潜变量建模框架将解剖一致性置于单纯压缩之上,提升了跨对比度合成质量,而现有方法往往丢弃了具有临床意义的结构 23。 CERS 将思维链推理融入半监督医学图像分割,以解决仅凭视觉分类器难以处理的视觉-语义错配问题 24。 WEQA 引入了查询自适应的智能体推理,将连续、高维的可穿戴传感器流转化为自然语言的健康见解 25。 在心理健康监测方面,研究人员微调了一个带回归头的 Qwen3.5-27B 模型,使其能够从 AI 对话文本中被动推断 PHQ-9 抑郁严重程度,从而规避了显式自评量表的低完成率和应答偏差 26。 RubricsTree 提供了一套包含 100 多个临床可验证布尔规则的层级分类体系,将个人健康智能体的专家一致性评估扩展到超越“大语言模型即裁判”这类近似方法的局限 27。 据媒体报道,科大讯飞发布了讯飞星火医疗大模型 V3.5,该公司声称其在医学知识和诊断推荐基准上优于 GPT-5.5 28。
机器人与空间感知在传感范式与策略评估两方面均有进展。 MoonSplat 将全局 Sim(3) 优化引入在线体素化 3D 高斯溅射,缓解单目序列中的漂移累积,同时色彩残差学习策略加快收敛,适用于实时机器人与 AR/VR 应用 29。 EventDrive 在自动驾驶的感知、理解、预测与规划任务中统一了事件相机流、RGB 帧和语言监督,解决了基于帧的系统易受运动模糊和眩光影响的问题 30。 WAM-RL 首次将强化学习融入 World-Action 范式,使机器人能通过在线环境交互精进细粒度操作技能,而不是受限于演示分布 31。 EBench 提供了一个多维仿真基准,从能力与泛化维度拆解通用移动操作表现,而非将评估简化为标量成功率 32。 媒体报道指出,文远知行的 WRD 3.0 系统在中国智能驾驶大赛上连续第六次夺冠,此次评判标准更严格,任何人工干预或泊车失败均会被扣分 33。
基础研究动摇了关于模型缩放与架构的主流假设。 一项实证研究表明,减小参数初始化规模能持续提升LLM预训练效果,且在推理密集型任务上收益最大,使初始化从不起眼的实现细节上升为决定模型能力的关键因素34。 SoftMoE将混合专家架构中不可微的离散top-k路由器替换为截断式soft top-k松弛,从而能够对专家分配模式进行基于梯度的优化,而此前这类模式并不可求导35。 UniAR通过采用在理解和生成任务之间共享的单一离散视觉分词器来推进多模态统一,消除了因使用独立分词器造成的表示碎片化,使模型无需重新编码便能解读自身生成的标记36。 媒体报道称,智谱AI发布了开源模型GLM-5.2,该模型在开源编程模型中排名第一,在强调长期项目一致性与工具使用的工程导向基准测试中全球排名第二37。
Agentic 应用已深入专业垂直领域与运营基础设施。 IUU+DB 利用大语言模型,从碎片化文件中提取关于非法捕捞、海产品欺诈和劳工虐待的结构化情报,为非政府组织与执法机构提供支撑海洋政策与供应链风险评估的实证基础 38。 DRFLOW 将深度研究基准从被动报告生成转向预测个性化行动步骤工作流,应对企业在跨异构来源环境中对精确、有序的程序性指导的需求 39。 一个自组装大数据即服务框架,通过数据工程、AutoML、MLOps 部署及漂移感知优化等专项代理,编排整个机器学习生命周期,弥合实验原型与生产可靠性之间的断层 40。 DiagFlowBench 聚焦工业代理部署中一个被忽视的失效模式,评估诊断对话模型如何处理偏离已知流程图的、超出规定程序的操作员查询 41。 在零售分析中,一种混合 Ret-DNN 与 XGBoost 的架构处理时序和表格交易数据,预测电商顾客行为,结合深度学习特征提取与梯度提升分类,用于库存与营销优化 42。 媒体报道称,Skywork 3.1 引入了基于画布的工作区和动态工作流多代理编排,厂商表示深度用户平均每个项目的交互超过四十轮 43。
安全与评测研究突显了前沿系统和科研基础设施中根深蒂固的脆弱性。 一项对Anthropic的Fable 5与Opus 4.8进行的系统性红队研究,采用自动化越狱攻击覆盖了7,826种有害意图,分别产生1,620次与702次经评审小组确认的有害生成,表明即便经过强化的前沿模型在持续自动化施压下仍可被稳定突破 44。 ReproRepo通过挖掘GitHub议题(issues)作为天然监督信号来规模化复现审计,无需传统基准的手动策展负担即可达到90%的复现阻碍检出率 45。 一个新的公开数据集将系统日志、网络日志与浏览器日志同每个条目的MITRE ATT&CK技术标签相结合,覆盖870次会话,支持在跨源关联中训练和评测模型以应对复杂的多阶段攻击 46。 据AWS称,InvokeGuardrailChecks API能够在智能体工作流中执行每次请求的安全检查,该厂商将此产品定位为应对涉及提示注入和PII泄露的多轮会话所特有的风险画像 47。 该公司还推出了一套更广泛的上下文智能套件,旨在将离散的数据流整合为可供智能体使用的上下文窗口,以减少幻觉并改善企业自主运营中的决策质量 48。
综述与展望
推理时计算扩展、具身化的生成器-验证器架构与垂直智能体部署正趋于融合,这表明该领域正从静态模型训练转向以动态、系统为中心的编排,而这一转向也暴露出能力与信任之间日益加深的张力。 推理时硬件—软件协同设计,以及具身系统中推理与执行的显式解耦,相互强化了将 AI 视作一种深思熟虑、资源敏感的底层机制的构想; 与此同时,将模型重新定义为自主经济主体和工业基础设施,正加速其进入医疗、自主导航与软件自动化等高利害环节。 然而,这些进展与安全和验证层面的持续滞后形成了冲突:商业世界模型部署和特定领域智能体推进的速度已超前于严格的基准测试,而弱预言机问题恰恰被那些扩展推理时深度的架构所忽视。 由此,这一轨迹指向了一个资本与算力在推理层积累速度远超认知安全保障成熟速度的生态,随之而来的开放问题是:测试时扩展与潜在空间中的审慎推理,究竟能否替代——抑或仅仅是掩盖——自主经济与物理环境中可验证保障的缺失。
本文综述基于 48 项发展成果:36 项 Tier A 研究来源、5 项 Tier B 第一方来源,以及 7 项 Tier C/D 二级来源或社区来源。 最可靠的判断建立在 Tier A 成果之上,第一方与社区来源应被视为方向性参考; 要获得更强置信度,还需对自我报告的结果进行独立复现和一手来源确认。
原文链接与引用索引
- [1] 推理计算如何塑造前沿大语言模型评估 — arXiv · Tier A/research_paper
- [2] 算苗3D TokenPU正式流片 引领国产AI云端大算力芯片再升级 — 量子位 QbitAI (RSS) · Tier C/media_report
- [3] Amazon SageMaker AI Async Inference now supports inline request payloads — AWS Machine Learning Blog (RSS) · Tier B/official_tech_blog
- [4] Coherent 得州工厂扩建破土,扩展 AI 光互连骨干产能 — NVIDIA AI Blog · Tier B/official_tech_blog
- [5] 头部具身大脑公司再获数亿美元融资!世界模型路线,15家VC抢着投 — 量子位 QbitAI (RSS) · Tier C/media_report
- [6] 未来动态三维重建:解耦自车运动的3D世界模型 — arXiv · Tier A/research_paper
- [7] 循环世界模型 — arXiv · Tier A/research_paper
- [8] EgoCS-400K:面向世界模型的自我中心游戏数据集 — arXiv · Tier A/research_paper
- [9] PreAct:在重复任务中越用越快的计算机使用智能体 — arXiv · Tier A/research_paper
- [10] 面向光网络的T-API兼容ReAct智能体循环:通用与领域专用工具抽象之比较 — arXiv · Tier A/research_paper
- [11] 眼见非筛查:针对智能体技能扫描器的多模态隐藏指令攻击 — arXiv · Tier A/research_paper
- [12] 全是烟雾,没有警报:智能体编写测试代码中的预言机信号 — arXiv · Tier A/research_paper
- [13] ThinkingVLA:用于机器人操作的交错视觉与语言推理 — arXiv · Tier A/research_paper
- [14] PearlVLA:在潜在空间中进行渐进式具身动作计划细化 — arXiv · Tier A/research_paper
- [15] 视觉验证实现推理时引导与自主策略改进 — arXiv · Tier A/research_paper
- [16] 多模态大语言模型先对后错:追踪并纠正深层文本偏见 — arXiv · Tier A/research_paper
- [17] LLM消费者行为理论:一个新研究领域的奠基 — arXiv · Tier A/research_paper
- [18] 记忆作为耗竭资产:为具身智能体定价闪存耐久性及其局限 — arXiv · Tier A/research_paper
- [19] New in Amazon Bedrock AgentCore: Build agents with broader knowledge and continuous learning — AWS Machine Learning Blog (RSS) · Tier B/official_tech_blog
- [20] MoleculeMind Raises Over $100M to Define Global AI Protein Industry Infrastructure — 量子位 QbitAI (RSS) · Tier C/media_report
- [21] 通过智能体驱动的混合结构发现学习心脏电生理学数字孪生 — arXiv · Tier A/research_paper
- [22] SegDINO:将多尺度结构引入DINO以实现高效的医学图像分割 — arXiv · Tier A/research_paper
- [23] 先恢复语义,再生成更好:面向三维MRI重建与跨对比度合成的改进潜在建模 — arXiv · Tier A/research_paper
- [24] 超越视觉线索:用于半监督医学图像分割的思维链增强推理 — arXiv · Tier A/research_paper
- [25] WEQA:基于查询自适应智能体推理的可穿戴健康问答 — arXiv · Tier A/research_paper
- [26] 基于AI心理健康对话微调大语言模型实现被动式抑郁严重程度估计 — arXiv · Tier A/research_paper
- [27] RubricsTree:面向个人健康智能体的健康记忆与医疗技能开放式可扩展演化评估框架 — arXiv · Tier A/research_paper
- [28] 困住医疗AI的死循环,终于有国产玩家跑通了 — 量子位 QbitAI (RSS) · Tier C/media_report
- [29] MoonSplat:基于Sim(3)全局优化的单目在线高斯泼溅重建 — arXiv · Tier A/research_paper
- [30] EventDrive:面向视觉语言驾驶智能的事件相机基准与模型 — arXiv · Tier A/research_paper
- [31] WAM-RL:基于重建奖励与在线视频监督微调的World-Action模型强化学习 — arXiv · Tier A/research_paper
- [32] EBench:通用移动操作策略的元素级诊断基准 — arXiv · Tier A/research_paper
- [33] Six Consecutive Championships! WeRide Breaks China Intelligent Driving Competition Winning Streak Record Again — 量子位 QbitAI (RSS) · Tier C/media_report
- [34] 小初始化对大型语言模型至关重要 — arXiv · Tier A/research_paper
- [35] SoftMoE:面向大语言模型混合专家系统的软可微路由 — arXiv · Tier A/research_paper
- [36] 统一多模态自回归建模:共享上下文-视觉分词器是实现统一的关键 — arXiv · Tier A/research_paper
- [37] Zhipu AI's Open-Source GLM-5.2 Achieves Top Ranking in AI Coding with 1M Context — 量子位 QbitAI (RSS) · Tier C/media_report
- [38] IUU+DB:通过大语言模型驱动的信息抽取追踪非法、未报告和无管制捕捞、海产品欺诈及劳工虐待 — arXiv · Tier A/research_paper
- [39] DRFLOW:面向个性化工作流预测的深入研究基准 — arXiv · Tier A/research_paper
- [40] 可信的自组合大数据即服务:一种用于自动化数据工程、AutoML、MLOps部署和漂移感知生命周期优化的LLM编排多智能体框架 — arXiv · Tier A/research_paper
- [41] DiagFlowBench:评估语言模型在基于流程图的诊断对话中处理非规程输入的能力 — arXiv · Tier A/research_paper
- [42] 基于混合Ret-DNN与XGBoost模型的电子商务客户行为预测分析 — arXiv · Tier A/research_paper
- [43] Skywork 3.1 Launches Skywork Design and Dynamic Workflows: Giving AI a Canvas and an Army — 量子位 QbitAI (RSS) · Tier C/media_report
- [44] Anthropic Fable 5 与 Opus 4.8 模型的红队研究 — arXiv · Tier A/research_paper
- [45] ReproRepo:利用 GitHub 仓库 Issue 实现可复现性审计的规模化 — arXiv · Tier A/research_paper
- [46] 多源网络安全日志:ATT&CK标注数据集与SLM评估 — arXiv · Tier A/research_paper
- [47] 使用 Amazon Bedrock Guardrails InvokeGuardrailChecks API 保护代理式 AI 应用 — AWS Machine Learning Blog (RSS) · Tier B/official_tech_blog
- [48] Context intelligence for your data and AI agents at scale — AWS Machine Learning Blog (RSS) · Tier B/official_tech_blog