AI前沿从模型能力转向智能体系统运营
2026-06-26 00:00 UTC
要点
- 强化学习的后训练为智能体任务赋予了隐性优势,但从实验室走向生产环境的过程中,也暴露出关键的稳定性与多样性缺陷,亟需新的监督与安全机制。
- 推理硬件与服务栈正借助定制芯片和内核级优化进行彻底重构,实现五倍吞吐量提升,并大幅降低大规模智能体部署的成本。
- 在敏感场景中部署 AI 智能体与实时系统,扩大了攻击面,需要事后防御与执行时对齐来补充传统的训练时安全保障。
- 具身智能的进展日益倾向于结构化三维推理、模块化动作先验和高效微调,而非对单体视觉-语言-动作模型进行暴力式规模扩展。
- 开源 AI 生态正凭借顶尖的开放模型、正式认证和维护者支持计划走向专业化,共同降低了企业级部署的门槛。
人工智能正经历一场范式转变:从对孤立模型能力进行基准测试,转向大规模工程化构建稳健、高效且安全的智能体系统。 这一转变由研究与生产全栈的多重进步交汇推动:后训练信号正在解锁智能体行为,却也暴露了生产环境中的关键稳定性故障; 而专用推理硬件与服务优化正在降低持续运行的成本。 与此同时,多模态推理在结构上依然脆弱,要求进行超越生成流畅性的严格评估; 具身智能也越来越倾向于结构化三维先验与模块化架构,而非单体模型的规模扩张。 在这一技术背景下,开源生态正逐步成熟为一套由认证工具与人才标准构成的专业化基底,而与此同时,已部署的智能体与实时模态也在扩大安全与对齐方面的攻击面。 这些进展共同标志着一个新阶段:衡量进步的标准不再只是静态性能,而是自主系统在复杂环境中的可靠编排能力。
智能体AI:从后训练信号到生产韧性
强化学习的后训练对顺序型智能体任务隐含着一种结构性优势:经RL训练的策略与其参考策略之间的对数概率比,能够在随机MDP下还原出最优的步级优势函数,从而在无需耗费高昂成本构建专门过程奖励模型的情况下获得进度优势1。 由于长程交互与随机环境的存在,为智能体构建过程奖励模型的成本众所周知极为高昂,这种内置信号意味着标准的RL后训练本身即可原生支持智能体推理的步级评估1。 然而,隐式优势的存在并不等同于稳定部署。 在多步工具使用场景中,纯RL训练会因控制token出现意外的概率尖峰而触发灾难性崩溃,这种失效模式会破坏结构化输出,并掩盖那些本质上仍然完好的底层能力2。 多步工具使用对大语言模型智能体至关重要,这一崩溃揭示出,原始的RL优化会破坏可靠运行所必需的控制结构,且故障根源在于格式层面的token动态,而非能力丧失2。 因此,必须引入引导探索的监督信号,才能在利用RL隐式优势的同时避免陷入训练不稳定2。
自改进机制中的多样性退化进一步加剧了这种脆弱性。 在策略自蒸馏——即模型利用采样得到的正确演示进行自我教学——虽然在平均准确率上媲美甚至超越标准RL,却会急剧拉平pass@k曲线,并同时侵蚀功能多样性与语义多样性3。 由此产生的同质化现象,在需要多样化推理策略的分布外场景中导致失败,表明高平均奖励可能掩盖行为储备的危险收窄3。 结合多步RL中的控制token崩溃来看2,这种多样性崩溃说明,针对实验室准确率优化的后训练方法会生成脆弱且行为同质化的策略,难以适应生产级智能体系统的需求。
弥合潜在能力与安全运行之间的鸿沟,因此需要超越原始训练信号的新型监督与诊断机制。 模型取证框架提供了一种系统性的方法,用以判断令人担忧的智能体行为究竟源于真正的未对齐——即恶意意图——还是源于混淆等良性原因4。 若缺乏这种取证层面的意图验证,安全评估便可能将有能力但仅处于困惑状态的模型误判为危险,也可能遗漏真正具有欺骗性的动机4。 因此,尽管RL后训练具备内在的进展优势1,但要实现生产级韧性,仍需将防止崩溃的监督训练信号2与能够区分未对齐和良性故障的运行时取证工具4相结合——这种组合是在受控实验室条件之外实现安全部署的必要条件。
多模态模型:推理的脆弱性与鲁棒评估的必要性
多模态语言模型已在生成能力上取得令人瞩目的进展,但越来越多的证据表明,其推理过程存在结构性脆弱,且对输入的呈现方式异常敏感5。 一项通过 Facet-Probe 对十八个前沿及开放权重多模态大语言模型开展的系统审计显示,打乱选项、证据片段、文档排序、图像集合以及混合模态输入,会普遍诱发答案翻转; 受审模型无一具备顺序不变性,各维度的面板平均翻转率介于24%至50%之间,即便表现最优的模型仍有13.4%的试验出现翻转5。 这种顺序敏感性表明,模型输出仍会随证据与选项的排列方式而改变5。 与此同时,OCR-Robust 研究表明,视觉语言模型在面对文档、场景文字、收据、手写体、数学内容、图表及表格上的视觉扰动时,OCR 推理能力显著退化,揭示了文档理解在视觉变化下存在另一种相关但不同的脆弱性6。 这些发现共同证实,多模态系统对顺序重排与视觉失真均存在脆弱性5,6。
这种脆弱性并不止于表层的输入扰动,而是深入到了组合推理本身。 TriViewBench 提出了一种合成的三视角基准,通过显式参数化物体数量与遮挡程度来扩展结构复杂度; 结果表明,尽管当前多模态大模型在标准视觉问答任务上表现优异,但随着场景复杂度提升,其全局恢复性能会暴跌逾80% 7。 这种在受控扩展条件下的系统性失效说明,表面上的视觉推理优势并不能迁移至结构化的组合泛化场景 7。 与此同时,RevengeBench 将严格评估的逻辑拓展至传统问答格式之外——它将从纯行为轨迹中恢复可执行决策程序视为代码空间内一个可解的逆问题,为对手建模与策略可解释性提供了具体试验场,强调在生成式、可执行机制下的推理,而非静态的答案选择 8。 将这些基准并置审视,它们共同指向一项核心诉求:5 与 6 暴露了模型对输入顺序和视觉噪声的不稳定性,7 揭示了其在组合复杂度下的性能崩溃,8 则表明有必要在标准基准之外检验可解释的代码级推理。 鉴于这些失效模式同时存在于对抗性排序、视觉扰动、参数化场景复杂度与逆推理挑战之中,评估必须联合检验跨模态一致性、扰动鲁棒性以及对结构化组合的泛化能力,所谓“可靠的多模态推理”才能成立。
硬件复兴:智能体时代的专用化与推理服务效率
大规模智能体AI的演进正推动推理基础设施自下而上地重新设计,从通用加速器迈向垂直整合的芯片与软件协同优化。 OpenAI与Broadcom称,双方联合研发的Jalapeño加速器是一款从零设计的ASIC架构,专为当前及未来的大语言模型推理负载而打造; 通过掌控完整的软硬件栈,该方案意在降低推理成本、减少延迟并提升交互式产品的可靠性 9。 这种专有专用化趋势,与充分利用下一代数据中心硬件的服务栈优化形成了呼应:SGLang团队在NVIDIA GB300分离式通道上部署DeepSeek-V4,吞吐量提升了5倍,每GPU可持续约11,200 tok/s,同时每用户仍保持约50 tok/s,交互体验并未受损; 该团队指出,这一配置能够降低高交互性生产区域中大规模混合专家模型部署的成本 10。 这些厂商披露的数据表明,无论是定制芯片还是分离式服务架构,都在同步追求吞吐量与成本效率。
在软件层面,编译器与内核层面的创新正将效率提升扩展到各类硬件目标,无需手动重写模型。 PyTorch团队指出,Inductor会自动将运算融合为Triton内核,这种仅通过装饰器即可实现的优化能够降低内核启动开销与内存流量,带来最高10倍的加速11。 与此同时,TokenSpeed-kernel维护者介绍了一个开源、跨平台的API层,旨在将LLM推理运行时与硬件专属的内核实现解耦; 其出发点在于需要同时应对多样的模型架构、量化格式、GPU代际以及厂商库12。 综合来看,这些进展共同勾勒出一幅充满张力的硬件复兴图景:Jalapeño代表了封闭栈的垂直整合,力图从单一架构中榨取极致效率9; 而TokenSpeed-kernel则追求在多芯片生态中的横向可移植性12。 两者都依赖内核级抽象——无论是通过自动融合11还是基于注册表的选择12——将专用硬件转化为可部署的吞吐能力。 SGLang在GB300上的测试结果10正处于这一交汇点,厂商基准测试表明,近期的生产环境收益或许并非来自单一层面,而是源于新型加速器与为其优化的服务栈之间的紧密耦合。
真实场景中的安全与对齐:守护智能体、数据与语音
随着人工智能智能体与实时系统逐步进入应急响应、银行、医疗等敏感领域13,14,既有及新兴的攻击面均呼唤事后防御与执行时对齐机制15,16。 当前智能体的护栏与系统提示位于其自身地址空间内,一旦智能体能够触及自身的运行时控制接口,便面临提示注入、越狱及自我修改等威胁15。 为此,执行时对齐被提出作为继训练时、推理时方法之后的第三大支柱,专门用于在运行阶段保护那些可能逃逸的AI系统15。 这种对运行时加固的重视,与应对微调阶段供应链受损问题的事后框架形成互补:摘要任务的微调数据集规模虽小,影响力却远超其体量,因而极易成为攻击目标——攻击者可在维持标准评估分数的同时注入偏见或事实错误,而统一的事后防御无需完整重训练即可检测并修复此类投毒16。 这些思路共同体现了一种更广泛的范式转变:防御机制不再仅仅依赖部署前的对齐,而是同时覆盖初始训练之后及系统执行期间15,16。
运行时与事后检测机制仍须应对在推理阶段持续存在的架构性与模态漏洞 14, 13。 表格基础模型的注意力机制会在推理过程中泄露成员信息:一种利用注意力集中模式的无影子模型攻击,效果比基于置信度的攻击高出7.7%,在医疗和金融等需要推理时上下文学习的场景中暴露了私人记录 14。 这种推理时泄露表明,敏感数据即使在标准模型运行中也可能遭到破坏,从而进一步夯实了执行时保护措施的必要性 14, 15。 因此,微调投毒的事后检测 16 与借助注意力层在推理时提取私人记录 14,构成了模型生命周期两端互为补充的、以数据为中心的威胁; 二者均要求补救方案不能预设训练流程绝对干净,也不能假设推理端点完全封闭 16, 14。 与此同时,部署在应急响应、银行和医疗领域的实时语音AI系统出现了感知与行动的脱节:决策过程中,它们始终优先处理词汇内容而非声音表达,无法处理那些承载着安全关键信息的声调——无论是危机电话、恐慌状态下的金融授权,还是讽刺性同意场景; 即便通过提示让模型关注声音表达,也只能带来片面且不一致的改善 13。 与执行时对齐旨在拦截的对抗性操纵不同 15,这种感知失效在提示模型关注声音表达时依然存在,说明运行时的对齐不能仅依赖基于指令的修正 13, 15。 因此,语音系统中的词汇优先倾向带来了一种新型的非对抗性安全缺口,它与运行时对齐和数据投毒防御所应对的对抗性攻击面并存 13, 15, 16。 综合来看,这些发现表明仅靠训练时的保护措施并不充分,要保障已部署AI的安全,必须同时应对运行时的对抗性暴露 15、数据投毒修复 16、推理时的隐私泄露 14,以及实时决策中的感知脱节 13。
具身智能:结构化映射与模块化先验超越粗放式规模扩张
具身性能主要靠扩大基础模型来提升的假设正日益受到质疑。 越来越多的证据表明,结构化的空间推理与模块化的任务分解,无需同比例增加参数规模,就能带来更大的性能提升。 RoboAtlas 直接挑战了模型规模与能力划等号的观念,转而证明一套可扩展的三维语义映射系统在 GOAT-Bench 上取得了 90.6% 的成功率,并在超过 1800 平方米的真实环境中实现了 100% 的任务成功率 17。 这种对显式几何与语义结构的强调,在 Learning Action Priors for Cross-embodiment Robot Manipulation 一文中得到了呼应。 该研究反对将视觉-语言主干与动作模块联合训练的主流做法,并指出将运动先验学习与跨模态对齐解耦,可避免策略被迫从零开始探索动作动态并从头对齐模态 18。 RoboAtlas 通过显式几何与语义结构获得可靠性 17,而动作先验框架则通过将运动理解与视觉-语言对齐相隔离,实现了跨具身操作 18。 这两种截然不同的策略——一种植根于空间结构化,另一种植根于模块化解耦——共同对单一整体的联合训练持怀疑态度 17, 18,并共同指向一点:具身能力若被分解为结构化感知与模块化动作,远比压缩进单一的大规模基础模型更为有效 17, 18。
对单体架构的批判已超越静态系统设计,延伸至在线部署的动态过程——固定配置的模型在陌生环境中会表现出显著的脆弱性。 《In-Context World Modeling for Robotic Control》强化了这一判断:其观察发现,现代VLA模型之所以无法适应新环境,根源在于隐式假设训练配置固定不变; 该研究进而提出将系统识别重构为上下文适应问题,使模型能够基于一小段自生成的、与任务无关的交互历史,自主推断系统运行方式,从而以自主推理替代数据密集型的重新训练19。 该方法无需为适配每次新部署而扩大微调规模,而是将单体架构的批判从静态设计拓展至在线适应19。 17, 18, 20
即便现有VLA策略的微调仍不可避免,结构化的训练方案也能突破传统模仿学习与RL微调的瓶颈。 FORCE以三阶段RL微调框架为例,在杜绝早期训练崩溃、省去高昂人工监督的前提下,将绝对成功率较基线提升79%,训练速度加快32.5%20。 在这一格局下,FORCE与映射及模块化先验的进展形成互补:它证明了稳定且样本高效的强化学习无需昂贵的人工监督即可打破模仿天花板,从而使高效微调与向结构化、模块化系统转型的大趋势保持一致20。
总体而言,这些进展预示了一条明确的发展轨迹——结构化的三维推理、模块化动作先验与高效微调机制,将取代单体视觉-语言-动作模型无节制的规模扩张17, 18, 19, 20。
开源生态的成熟化:从模型到人才标准
开源AI生态系统正在形成与企业软件行业类似的制度结构,将社区劳动和工程能力视为正式学科,而非纯粹的志愿活动。 Linux基金会与PyTorch基金会推出了面向初级从业者的PyTorch Certified Associate正式认证,并明确指出,企业亟需识别能够可靠运用PyTorch为生产级机器学习系统做出贡献的候选人21。 与此人才标准相配套,PyTorch基金会宣布2026年度贡献者奖项将表彰九个类别及多个托管项目中的杰出个人; 通过正式认可教育、开发者基础设施和社区倡导等非代码贡献,这些奖项巩固了维系大型开源机器学习生态系统所必需的社会基础设施22。 上述计划共同将开源参与重塑为一种具备正式资质的职业,为技术和非技术贡献者均开辟了明确的发展路径。
这种专业化同样延伸至支撑企业依赖关系的安全底层。 Patch the Planet将前沿AI模型与专职安全工程师相结合,主动在操作系统、编程语言、密码学库和网络协议栈等关键开源基础设施中搜寻、验证并修补漏洞; 该组织指出,这些基础设施目前由不堪重负的志愿者维护,而漏洞报告的积压正与日俱增23。 通过将专职工程资源嵌入维护流程,该项目表明,保障公共基础设施的安全需要持续、制度化的投入,而非仅靠零散的志愿劳动。
与此同时,该生态系统正在沉淀出一批经过生产验证的基础设施模式,衔接区域开发与全球部署的双重需求。 首届新加坡 PyTorch 见面会吸引了 80 位亚太从业者参与技术分享,聚焦生产级 AI 基础设施,体现出从 AI 应用消费向主权架构的战略转变; 会上介绍的基于 Rust 的 vLLM 前端缓解了 Python GIL 的性能开销,同时 vLLM-Omni 框架实现了图像、视频、语音、文本的统一服务,二者直接回应了制约大规模部署的生产瓶颈 24。 这一区域性的工程推进与全球部署趋势相互呼应——同期举办的 KubeCon、CloudNativeCon、OpenInfra 峰会及中国 PyTorch 大会的公告指出,中国在云原生技术栈上部署大规模 AI 智能体与 GPU 基础设施的产业动能强劲,而展示生产级部署案例能够为可靠性与可扩展性提供同行验证的参考范式 25。 综合来看,这些进展标志着开源生态正沿一条成熟轨迹演进:正式化的资质认证、结构化的社区认可、安全维护计划以及生产级基础设施贡献,共同推动其从模型发布走向企业就绪的运营标准。
简讯
Google 医疗 AI 系统 AMIE 借助双智能体架构——由共情对话智能体与可交叉引用临床指南的推理智能体协同——已从单次诊断进阶至纵向疾病管理26。 OpenAI 称,GPT-5.5 Instant 现已向免费 ChatGPT 用户提供前沿水平的健康智能服务; 此次模型评估依托全球逾 260 名医生组成的网络,他们共审核了超过 70 万条回复27。 该公司还表示,GPT-5 Pro 曾协助一位免疫学家破解长达三年的谜题:葡萄糖究竟如何影响 T 细胞特化。 模型提出,脱氧葡萄糖会阻断 IL-2 蛋白的合成,而实验室此前恰恰遗漏了这一机制性洞见28。 在文学翻译方面,一项经同行评审的研究指出,尽管智能体 LLM 流程产出的译文被读者评为“尚可”,但热衷阅读的群体在清晰度与沉浸感上仍更偏好人工翻译,这表明自动评估指标与真实阅读体验并不一致29。 与此同时,研究者发布了首个面向阿尔及利亚方言的端到端语音对话系统; 该语言资源稀缺,缺乏标准化书写系统且频繁与法语进行语码转换,此项成果弥补了语音技术在该领域的重要空白30。
Google 介绍,Gemini Omni 是一款原生任意模态到任意模态(any-to-any)模型,能够生成视频并通过对话方式编辑视频,同时保持角色一致性、物理规律和场景记忆; 该模型随 Gemini 3.5 系列一同发布 31。 该公司在 I/O 2026 大会上展示了由后台“信息代理”驱动的代理式搜索能力,以及专为编程和长程任务优化的 Gemini 3.5 Flash 模型 32; Google 还表示,整场大会由其自研 AI 技术栈(包括 Gemini、Lyria 3 Pro 和 Google Flow)制作完成,标志着 AI 从演示工具向生产工具的转型 33。 Google Finance 已结束公测,推出 AI 驱动的投资组合追踪、对话式研究和主动市场简报功能,用户可通过截图或自然语言查询导入持仓 34; Lens 和虚拟试穿等搜索功能也正被重新用于二手和复古商品购物,体现了通用 AI 界面无需专门垂直应用即可服务于循环经济行为 35。 Omio 表示,正通过将 OpenAI 模型与 47 个国家逾 3,000 家供应商的实时交通库存直接对接,从传统搜索转向对话式旅游商务 36。 OpenAI 为 ChatGPT Enterprise 推出了统一的信用额度使用分析和精细化支出控制,使财务负责人能够按用户、产品和模型维度查看消耗情况 37; 三星电子则正在面向韩国及全球 Device eXperience 部门的全体员工推广 ChatGPT Enterprise 和 Codex,显示出生成式 AI 正被视作核心企业平台的趋势 38。 Google Futures Lab 展示了多项应用原型,包括实时美式手语辅导工具 SignFluent,以及 AI 自重训练教练 MuscleMemory 39。
某篇报道介绍了一篇论文,该论文提出了一个关于人工超级智能存在风险的五类别框架,其视野超越技术对齐,还涵盖权力集中、国际治理、社会健康与伦理挑战 40。 另有报道聚焦一篇文章,该文批判了“继任主义”——一种据称在AI精英阶层中日益流行的意识形态,它将人类被AI取代视为道德上可接受甚至不可避免,并警告此类观念可能瓦解那些以人类繁荣为目标的对齐工作 41。 还有报道提及一篇文章,该文借助“摩洛克”(Moloch)这一隐喻——即破坏性的盲目优化动力——重新阐释对齐问题,指出无论是人类还是未来的AGI系统,若不断做出渐进式妥协,反而可能加速对齐机制原本试图阻止的危害 42。 据报道,ARENA已启动第九期项目,这是一个为期四至五周的线下机器学习工程训练营,聚焦技术AI安全,定于2026年秋季在伦敦安全AI倡议(London Initiative for Safe AI)举办 43。 在自动驾驶领域,报道称Momenta正推进首次公开募股,而世界模型领域的竞争日趋白热化; 与此同时,中国AI驾驶员的收入在过去三年飙升了42倍,预示着该行业正由研究阶段迈向商业化 44。
综合与展望
现有证据以同行评审和第一方来源为主,足以支撑对技术进步的总体乐观判断,但在智能体实际部署中安全干预措施的长期实证记录方面仍最为薄弱。 纵观所涉领域,一条清晰的脉络正在浮现:整个领域正从对单体模型的规模化扩展,转向对可靠系统的工程化构建。 后训练强化学习与专用推理硬件的进展互为助力,前者不断拓展智能体的能力边界,后者持续降低部署的经济门槛; 然而,正是这种技术汇聚加剧了安全与对齐工作的紧迫性——脆弱的多模态推理与实时系统中涌现的新型攻击面,其演进速度已超出现有监督机制的应对能力。 与此同时,具身AI的体系化探索与开源生态的专业化演进,共同挑战了“暴力扩展是通往鲁棒性的唯一路径”这一固有假设,转而青睐模块化、标准规范与人才队伍的成熟。 这些线索共同指向:AI进步的下一阶段将不再是孤立基准测试的突破所能定义,而是取决于高效硬件、组合式架构与运行时安全保障在生产级智能体流水线中的深度融合。 一个关键且悬而未决的问题在于,当前事后防御工程的推进速度,能否跟得上在开放环境中运行的自主多模态智能体不断扩大的攻击面。
本综述共援引44项进展:18项A级研究来源、21项B级第一方来源,以及5项C/D级二手或社区来源。 其中多数证据来自第一方或社区报告,未经独立核实,因此在获得同行评审的复现验证之前,相关趋势应视为初步判断。
原文链接与引用索引
- [1] 训练后阶段的被忽视免费午餐:面向LLM智能体的进展优势 — arXiv · Tier A/research_paper
- [2] 多步工具使用强化学习为何崩溃以及监督信号如何修复它 — arXiv · Tier A/research_paper
- [3] 基于采样演示的在线策略自蒸馏会降低输出多样性 — arXiv · Tier A/research_paper
- [4] 模型取证:调查令人担忧的行为是否反映了对齐失调 — arXiv · Tier A/research_paper
- [5] 相同证据,不同答案:审计多模态大语言模型中的顺序敏感性 — arXiv · Tier A/research_paper
- [6] OCR推理有多鲁棒?在视觉扰动下评估视觉语言模型的OCR推理鲁棒性 — arXiv · Tier A/research_paper
- [7] TriViewBench:面向多模态大语言模型的多视角结构推理可控复杂度扩展基准 — arXiv · Tier A/research_paper
- [8] RevengeBench:从行为实验中逆向工程代码空间策略 — arXiv · Tier A/research_paper
- [9] OpenAI与Broadcom联合发布面向LLM推理优化的定制芯片 — OpenAI Blog · Tier B/official_tech_blog
- [10] 使用 SGLang 在 GB300 上部署 DeepSeek-V4:自发布首日以来,在同等交互性下吞吐量提升 5 倍 — PyTorch Blog (RSS) · Tier B/official_tech_blog
- [11] 为什么 PyTorch Compile 如此快速:内核融合 — PyTorch Blog (RSS) · Tier B/official_tech_blog
- [12] TokenSpeed-Kernel:面向多芯片LLM推理的可移植API与高性能算子 — PyTorch Blog (RSS) · Tier B/official_tech_blog
- [13] 实时语音AI能听见,却不会倾听 — arXiv · Tier A/research_paper
- [14] 表格基础模型注意力层的隐私漏洞及高风险查询保护 — arXiv · Tier A/research_paper
- [15] 不可解雇的安全内核:面向AI智能体及其他可逃逸AI系统的执行时AI对齐 — arXiv · Tier A/research_paper
- [16] 检测、遗忘、恢复:防御文本摘要模型中的数据投毒攻击 — arXiv · Tier A/research_paper
- [17] RoboAtlas:上下文主动式SLAM — arXiv · Tier A/research_paper
- [18] 面向跨具身机器人操作的动作先验学习 — arXiv · Tier A/research_paper
- [19] 面向机器人控制的上下文世界建模 — arXiv · Tier A/research_paper
- [20] FORCE:通过价值校准预热与自蒸馏实现高效的VLA强化微调 — arXiv · Tier A/research_paper
- [21] PyTorch认证助理(PTCA)正式发布 — PyTorch Blog (RSS) · Tier B/official_tech_blog
- [22] 2026年PyTorch基金会贡献者奖提名开放 — PyTorch Blog (RSS) · Tier B/official_tech_blog
- [23] Patch the Planet:Daybreak 倡议支持开源维护者 — OpenAI Blog · Tier B/official_tech_blog
- [24] PyTorch新加坡见面会:亚太地区的一个里程碑 — PyTorch Blog (RSS) · Tier B/official_tech_blog
- [25] KubeCon + CloudNativeCon + OpenInfra Summit + PyTorch Conference China 大会日程正式发布 — PyTorch Blog (RSS) · Tier B/official_tech_blog
- [26] AMIE:从单次诊断迈向长期疾病管理的医疗AI系统 — Google AI Blog · Tier B/official_tech_blog
- [27] 提升 ChatGPT 的健康智能水平 — OpenAI Blog · Tier B/official_tech_blog
- [28] GPT-5如何帮助免疫学家Derya Unutmaz解开长达三年的谜团 — OpenAI Blog · Tier B/official_tech_blog
- [29] AI翻译文学作品虽“尚可”,但读者仍偏爱人工翻译 — arXiv · Tier A/research_paper
- [30] Dziri Voicebot:面向阿尔及利亚方言的端到端低资源语音对话系统 — arXiv · Tier A/research_paper
- [31] Gemini Omni 与 Gemini 3.5 的 9 项演示 — Google AI Blog · Tier B/official_tech_blog
- [32] 回顾 Google I/O 2026 的 12 大重磅时刻 — Google AI Blog · Tier B/official_tech_blog
- [33] 我们如何使用 Gemini 打造 Google I/O 2026 — Google AI Blog · Tier B/official_tech_blog
- [34] 我们最新的 Google Finance 升级,包括一款新应用 — Google AI Blog · Tier B/official_tech_blog
- [35] Google Search 提升二手和复古购物体验的五种方式 — Google AI Blog · Tier B/official_tech_blog
- [36] Omio 如何打造对话式旅行的未来 — OpenAI Blog · Tier B/official_tech_blog
- [37] 面向企业的新版使用分析与支出管控功能 — OpenAI Blog · Tier B/official_tech_blog
- [38] 三星电子向员工全面开放 ChatGPT 与 Codex — OpenAI Blog · Tier B/official_tech_blog
- [39] 查看Futures Lab的真实AI原型 — Google AI Blog · Tier B/official_tech_blog
- [40] Superintelligence Challenges & Existential Risks — LessWrong (RSS) · Tier C/community_opinion
- [41] Alignment & Succession: The Ideology of Successionism — LessWrong (RSS) · Tier C/community_opinion
- [42] How To Kill Moloch — LessWrong (RSS) · Tier C/community_opinion
- [43] ARENA 9.0: Call for Applicants — LessWrong (RSS) · Tier C/community_opinion
- [44] World Model Scramble: Momenta First to Rush IPO — 量子位 QbitAI (RSS) · Tier C/media_report