AI创新超越安全网,暴露系统性验证滞后
2026-06-24 00:00 UTC
要点
- 具有改进遮挡处理能力的视觉-语言-动作模型,仍表现出当前安全基准未能捕捉到的指令盲区。
- 相关的判断与模型无法检测自身对抗性输出的问题,降低了大语言模型评估的可靠性,而公开数据编辑则使得隐秘的价值操纵成为可能。
- 真实企业智能体的准确率远低于理想化基准,推动了对设计时验证和加固多租户安全基础设施的采用。
当日研究揭示了 AI 架构快速演进与验证机制缓慢且脆弱之间的差距日益扩大。 在多个前沿领域,新能力的发展速度超越了旨在认证其安全性与可靠性的框架。 视觉-语言-动作模型在遮挡处理上取得了新突破,却依然容易出现指令盲区,且缺乏稳健的安全评估指标。 大语言模型评估自身在结构上就存在脆弱性,相关的判断与隐藏的数据来源侵蚀着信任。 在生成建模领域,重心正从原始质量转向对齐,但对散度的选择与奖励设计带来了微妙的权衡,无法简单优化。 即便是优化器的研发,也因重尾噪声和并行计算而加速,超越了 AdamW,而企业智能体在真实世界基准测试中遭遇的困境,暴露出严重的可靠性缺口。 这些线索共同揭示了一种系统性的滞后:架构创新始终先行一步,让评估、对齐与部署保障在压力下仓促追赶。
VLA能力扩展超越指令落地与安全
遮挡处理与技能泛化——机器人操作中两个长期存在的瓶颈——正通过架构创新加以突破,这些创新拓展了视觉-语言-行动(VLA)模型的原始能力边界。 UniviewVLA 引入了一种生成式世界模型,仅从标准的代理视角与腕部视角流中合成未来的辅助相机视图,无需依赖额外的物理摄像头即可推断被遮挡的夹爪与物体关系 1。 该设计将遮挡任务的成功率从 40.0% 提升至 73.3%,且未施加任何显式的安全或语言对齐干预 1。 作为另一条并行路线,w2VLA 通过依次施加条件的 FiLM 块将陈述性知识(物体身份与空间位置)与程序性技能执行解耦,意在打破阻碍 VLA 在低数据模仿学习场景中将技能迁移到新物体上的虚假技能-物体关联 2。 这种模块化解耦虽便于技能迁移,但论文的关注点仍停留在程序-陈述划分上,并未触及模型是否真正会遵循伴随新物体出现的文本指令这一问题 2。 总体而言,这些工作延展了能力前沿——带来了更完善的视角推理与更具组合性的技能重用——却仍未回答两个交织的问题:在分布偏移下模型是否真的关注语言,以及其生成的动作是否满足安全约束。
当 VLA(视觉-语言-动作模型)在机器人学习中常见的稀疏数据集上进行微调时,指令落地(instruction grounding)的脆弱性便会显现。 研究表明,在微调过程中保持平坦度(flatness preservation)能直接缓解“指令盲区”问题——在这种失效模式下,模型会忽略语言指令,转而依赖从有限演示中习得的视觉快捷方式 3。 该研究指出,这种盲区是由稀疏数据引发的陡峭、高曲率损失极小值(loss minima)所导致的; 通过显式地平坦化损失平面,无需增加额外数据即可显著提升语言落地的能力与鲁棒性 3。 这一发现揭示了一种结构性矛盾:许多以能力为导向的 VLA 架构旨在追求峰值名义性能,但这可能会在无意中导致模型收敛至上述陡峭极小值,从而损害部署时至关重要的指令遵循可靠性 3。 w2VLA 和 UniviewVLA 所报道的能力提升并未基于这些平坦度标准进行评估,因此不能排除其操纵得分的提高与语言落地能力的下降共存的可能性。
安全评估的滞后程度则更为严重。 LIBERO-Safety 基准测试被引入,旨在首次对 VLA 的物理碰撞规避和语义安全推理进行联合评估 4。 该基准揭示了系统性的缺陷:现有的 VLA 训练管线和评估套件既缺乏可扩展的安全关键数据,也未能系统性地覆盖物理与语义层面的危险。 这意味着模型在表现出高任务成功率的同时,可能会违反安全约束 4。 1, 2
这一点与能力提升直接相关:虽然 UniviewVLA 通过合成视图有助于避免遮挡,但该模型尚未经过评估,无法确定这些基于更丰富信息的动作是否遵循碰撞约束或能正确解析不安全的指令; 同样,w2VLA 将技能迁移至新对象的能力也未在安全相关场景中进行测试——在这种场景下,将熟悉的技能应用于新对象可能在语义上是不恰当的 4, 1, 2。 安全基准测试作为一个独立的新贡献而存在,这正凸显了能力扩展与安全保障目前处于脱节状态:安全评估更像是一种事后补丁,而非集成化的设计要求。 3
总体而言,通过世界建模获得的遮挡处理增益1与通过声明‑过程分离实现的技能迁移进展2表明,架构创新能够推动 VLA 能力向前发展。 然而,这些增益并未伴随与之相称的可靠性提升:指令盲视依然存在,其根源在于稀疏微调数据固有的尖锐极小值3,而安全评估仍是一项独立的事后工作,暴露出当前训练与评估中的系统性覆盖空缺4。 因此,今日的研究勾勒出这样一幅领域图景:新能力的推出速度,超过了围绕语言锚定与物理‑语义安全构建验证框架的速度,而这些框架正是使新能力在非结构化环境中值得信赖的关键。
关联错误与数据溯源加剧大模型评估与对齐漏洞
当前大语言模型的评估与对齐框架十分脆弱,这种脆弱性源于三个相互叠加的漏洞,它们共同动摇了安全部署的信心。 首先,那些本该用来评估模型安全性的机制本身就被隐藏的统计依赖性所破坏。 一项对 LLM 作为评审员组成的面板的研究表明,将来自七个模型家族的九个前沿模型组合起来,实际上只能得到两张独立的投票,因为这些模型存在相关的错误模式5。 这一发现意味着,通常被视为一种保障措施的多模型评估,无法克服系统性的盲点,而单纯增加评审员数量或使用更智能的聚合方法,不会从本质上改变安全评估的可靠性5。 因此,评估基础设施提供了一个脆弱的基础,给人以鲁棒的错觉,实则掩盖了共同的失效模式。
这种脆弱性还因模型无法识别自身输出是否已被篡改而被放大。 对安全关键场景下内省能力的系统评估表明,目前没有一个大语言模型能在自己的回应源于对抗性预填充时可靠地自我报告; 平均检出率依然很低,模型反而退而求其次,依赖表面的拒绝启发式规则,而非真正察觉到被操控6。 这一失败削弱了内省安全监控的提议:一个无法区分被操控输出和正常输出的模型,无法担当自己的监督者。 综合来看,关联的评估错误5和内省缺失6揭示了一种双重失效:外部评审面板给出过度自信的安全判断,而内部的自检机制又无法识别这些判断正在被绕开。
当考虑到为模型对齐提供数据的数据管道时,这些监控缺陷的后果会更为严重。 媒体报道强调,对维基百科的针对性编辑可以渗透到大型语言模型(LLM)的输出中,实际上让少数匿名编辑无需任何权重访问或 API 攻破,就能影响广泛部署系统的价值观7。 此类数据来源攻击完全绕过了评估和内省机制,在训练或检索阶段插入有偏内容。 这不仅是零散案例,它直接联系到对“基于人类反馈的对齐为何在结构上脆弱”的形式化分析。 从社会选择理论的角度看,标准的 Bradley-Terry 奖励学习会对异质性的人类偏好隐式执行 Borda 式聚合,而这种方法的脆弱性在于,当偏好不独立时,容易遭受克隆鲁棒性违规和扭曲8。 这种理论上的脆弱性意味着,通过投毒数据——例如被悄悄编辑的百科词条——引入的价值观操纵,可以利用聚合逻辑本身,使习得的奖励发生偏移,而目前使用的浅层评估面板和不存在内省检查根本察觉不到这种偏移。
这些发现并非孤立存在,它们彼此强化。 5 中描述的评估幻觉表明,不能信任安全审查能够检测到 7 中报告的那种对抗性影响,而 6 中记录的内省失败则证实,模型无法从内部弥补这一盲点。 所有这些的背后,是形式化证明所揭示的事实:奖励学习的规范性基础,面对数据来源攻击所引入的相关性操纵恰恰是脆弱的8。 其结果是形成了一条漏洞供应链:评估面板没有提供真正的独立性,内省防护机制缺失,对齐过程本身运行在一个理论上脆弱的聚合方案之上,使得整个体系易于通过不可信数据源遭受隐蔽的价值观漂移。
生成模型借助散度与奖励设计从质量转向可控对齐
生成模型研究的重心正从最大化原始输出的保真度,转向工程化可控对齐。 这一转向围绕两个相互咬合的设计轴心展开:定义对齐目标的奖励模型架构,以及在优化性能与输出多样性之间取得平衡的散度正则化选择。 DiT-Reward 将预训练的文生图扩散变换器(Diffusion Transformer)重新用作自身的奖励模型,使生成策略与评估器收敛到统一的表征空间 9。 这种统一消除了对外部判别式视觉-语言编码器的依赖,不仅将推理速度提升了 1.65 倍,还改善了奖励密度和细粒度对齐效果,在所有四个偏好评测基准上均优于外部 HPSv3 模型,其中在 HPDv3 上达到 77.6% 9。 这一结果表明,扎根于生成器内部表征的奖励模型能够更精准地捕捉微妙的对齐准则,从而将奖励设计从边缘选择转变为输出可调控性的核心决定因素。
与奖励架构互为补充,训练后对齐中参考策略散度正则化的选择,正成为一个核心控制参数。 对 GRPO 风格的自回归文生图对齐方法进行的系统研究发现,散度度量从根本上支配着性能与多样性的权衡 10。 具体而言,在前向 KL、逆向 KL 等替代方案中,JS 散度在 CLIPScore 和 HPS-v2 基准上持续提供最强或最具竞争力的优化结果 10。 这将散度选择从单纯的正则化细节提升为一个有意识的调节旋钮:约束过松会带来多样性崩塌的风险,而过严又会压制对齐所需的优化信号。 因此,散度设计直接塑造了下游在忠实遵循 prompt 与避免输出重复之间的平衡。
同样的可控性强调体现在结构干预中,这些干预将创意自由与内容保留解耦。 Vera 引入了一种分层扩散框架,生成编辑层与用于合成的 alpha 蒙版,明确将视频编辑与原始内容分离,而非重绘每一个像素 11。 这一架构约束消除了端到端再生中固有的漂移,避免背景或角色细节发生意外改变,并支持迭代式后期制作流程 11。 通过把内容保留直接嵌入生成机制,Vera 在不牺牲保真度的前提下提供了生产级可控性——这种隐式对齐策略无需依赖事后的奖励校正。
与此同时,语义浏览通过在语义潜空间中导航,为可控多样性开辟了一条正交路径,支持沿可解释轴对变体进行系统化探索 12。 10 中的发散正则化塑造了整体分布的范围,而语义浏览则在推理阶段提供用户导向的细粒度多样性,直接回应了既要避免单调重复、又要防止语义不一致的实际需求。 Vera 的分层编辑 11 与语义浏览 12 共同表明,迈向可控对齐的演进并不局限于训练目标的设计,也涵盖推理阶段的架构与交互范式。 当天的研究由此记录了一种连贯的转向:生成模型的质量不再仅以保真度得分来衡量,更取决于输出能在多大程度上根据精确意图被引导、编辑和多样化; 奖励统一 9 与发散调校 10 提供了理论杠杆,而分层生成 11 与潜空间导航 12 则给出了实际的部署支架。
重尾噪声与并行性驱动优化器设计进入后Adam时代
AdamW 作为大语言模型训练默认优化器的主导地位,正受到这些模型中观测到的梯度噪声重尾结构的正式挑战。 经验证据表明,大语言模型中的梯度噪声呈重尾分布,而近期理论结果指出,Lion 和 Muon 等基于符号的优化器在此类噪声下可实现最优收敛,但 AdamW 在同样条件下的收敛性仍是一个悬而未决的问题 13。 这一落差直接动摇了 AdamW 享有普遍收敛保证的前提,并推动了对替代更新规则的探索。
然而,基于符号的方法并非简单的即插即用方案。 通过混合尖峰矩阵感知模型对 Muon 进行的几何分析揭示出一种河谷式地貌:优化器在早期探索阶段表现优异,但在后期收敛阶段却持续遭遇困难 14。 这一发现将 Muon 重新定位为早期阶段的优化器而非完整替代品,进而催生了能够结合快速初始进展与稳定最终精炼的混合训练调度设计 14。
基于符号的下降方法的局限性,部分可追溯至一个此前隐藏的机制:该家族的一个变体 Muown 隐式地执行角度步长衰减,其中未归一化方向的行范数调节着有效步长 15。 通过将这角度步长衰减显式化并使其可独立调度,所得的 AngularMuown 优化器在稠密的 1.24 亿/5 亿参数模型以及一个 11 亿参数的混合专家模型上,相较 Muown、NorMuon 和 AdamW 展现出更好的训练稳定性与速度 15。 这一进展表明,基于符号的优化器家族并非静止不变,而是可以通过对其内部动力学更清晰的理论理解来加以精炼。
这些进展逐步重塑着优化器的格局,而一种对传统端到端反向传播更为彻底的背离,则干脆绕开了 AdamW 的争论。 HBLL 框架将深度网络分解为分层组织的模块,并通过变分形式推导出的局部目标进行训练,用逐块学习取代全局反向传播,实现了 O(log N) 的并行时间复杂度 16。 HBLL 消除了顺序锁定和权重传输问题,为高度并行训练提供了一种原则性的概率方法,降低了内存和通信开销 16。 因此,后 Adam 时代沿着两条轴线展开:一是对真实大语言模型噪声模式下收敛性的理论探索不断深化,推动基于符号的变体超越 AdamW; 二是分层训练方案的出现,使随机优化器的选择退居次要位置。
AI智能体面临现实考验,企业基准测试暴露可靠性短板
企业代理部署难以将理想化的基准性能转化为生产可靠性,EnterpriseClawBench 有据可查地记录了这一现实 17。 该基准构建于真实工作场景会话而非合成任务,其 852 项任务套件揭示:表现最佳的系统——GPT-5.5 与 Codex 的组合——在人工审计子集上仅取得 66.3% 的准确率,这为真实世界的自动化设定了严格上限,与更简单学术基准上近乎完美的得分形成鲜明对比 17。 这一发现暴露了一个根本性差距:在受控条件下看似胜任的代理架构,在实际企业环境中盘根错节的相互依赖工作流上步履蹒跚,由此催生了双重应对策略——一则聚焦于部署前的工作流验证,另一则着眼于强化的运营基础设施。
这一差距的主要驱动因素,在于设计层面的结构性脆弱。 Pan 等人(2025)发现,44.2% 的多代理故障源于糟糕的系统设计,而不仅仅是组件性能问题——诸如不兼容的代理交互、缺失的中介或存在缺陷的控制流,这些问题无法被运行时护栏阻止,因为护栏只有在执行开始后才会启动 18。 Pan 及其同事的建议直接针对这一脆弱性:一个设计时验证框架,将智能代理工作流建模为由十二条形式化规则管控的构建块组合,在部署前就捕捉到架构上的不一致性 18。 此举将安全态势从被动拦截转变为主动验证,如果企业要弥合 EnterpriseClawBench 所突显的差距,这种演变势在必行 18。
向设计时严谨性的这一转变,还在多智能体语境之外的组件层面证据中获得了进一步支持。 对本地 7B 模型上的一个代理式检索增强生成流水线进行受控消融实验表明,自适应路由——这一旨在提升能力的典型设计选择——实际表现反而不如固定混合检索,精确匹配分数低了 1.8 分,原因是路由器在几乎所有多跳子问题中都对命名实体过度触发 19。 这一反直觉的结果突显出,架构复杂化并不会自动带来可靠性; 相反,设计时对自适应组件的假设必须经过实证验证,这条原则正与验证框架强调尽早捕捉结构性失误的理念相契合。
与设计时验证同样重要的是,企业要安全部署智能体,还离不开能够支持安全多租户运营且不带来单客户额外负担的基础设施。 Amazon Bedrock 的池化模型多租户架构展示了一种可投入生产的方法:它完全隔离租户数据与操作空间,实施基于层级的服务区分,并在共享基础设施上实现按租户分摊成本 20。 结合已发布的参考架构,该模式满足了代理式 SaaS 部署对严格数据隔离和成本可视性的要求,从而实现了仅靠运行时安全措施无法提供的安全、高性价比的规模化 20。 由此可见,基础设施上的应对是对设计时验证的补充:前者防止结构性设计缺陷进入生产环境,而后者则确保即便是设计正确的多智能体工作流,也能够在得到加固的租户安全边界内运行。
综合来看,这些证据才揭示了一条清晰主线。 EnterpriseClawBench 量化了真实世界复杂性带来的冲击,表明智能体远未达到部署级可靠性 17。 应对策略在两个方向上展开:设计时验证直接针对主导多智能体崩溃的设计缺陷 18,而专为多租户场景构建的架构则提供了可信服务所需的运行基底 20。 来自 RAG 消融实验的启示——更简洁、经过验证的检索设计可以胜过自适应方案——进一步强化了一个更广泛的要务:弥合可靠性差距的最佳路径,是在运行前与运行中仔细审查并加固智能体工作流,而非假定愈发复杂的推理能够自动弥补鸿沟 19。
简讯
此外,研究人员推出了首个面向自回归语音增强语言模型的后训练阶段,运用组序列策略优化与复合感知奖励,以弥合标记级训练和听感质量之间的错位 21。 同时,Google 宣布 Interactions API 已转入正式可用状态,作为 Gemini 模型与智能体的主要接口,将推理与编排融合为单一有状态接口,简化需要调用工具的长周期应用 22。
一项对广泛采用的“GPTs are GPTs”人工智能暴露评分的批判性审计指出,这些评分在时间、地理和本体论上的局限会随着它们进入政策领域而叠加放大,原本仅衡量技术可行性的静态分数,如今已成为未来工作辩论的核心依据,却并未说明哪些工作者受影响、如何受影响以及何时受影响 23。 能源方面,Eco Wave Power 称正在借助 NVIDIA 数字孪生仿真部署非侵入式波浪能浮体,旨在为承受 AI 数据中心压力的沿海负荷中心提供全天候的高密度可再生能源 24。
多项发布围绕机器人与微型设备展开。 媒体报道指出,NVIDIA 推出了面向机器人的 Halos,这是一套四层全栈安全系统,将 18 600 工程年的自动驾驶安全经验迁移到与人类共用工作空间的人形机器人和移动机器人上 25。 一篇论坛评论介绍了 MIT 的 Gleanmer 芯片,仅以 6 毫瓦就能实时构建精细的 3D 地图——约为此前最优芯片的 2.5%——扫除了长续航微型无人机和轻量级 AR 头显的功耗障碍 26。 NVIDIA 还详细披露了面向电信的一体化自主平台,融合合成数据、安全智能体运行时和 GPU 加速仿真,支撑受策略约束、可审计的智能体; 公告提到,54% 的运营商将数据敏感性列为最大 AI 障碍 27。 在具身智能领域,媒体报道中国初创公司跨维智能(Striding AI)完成来自正大集团和华勤科技的近 1 亿美元天使轮融资,从创立之初就将物理智能研发扎根于真实世界的制造与零售约束之中 28。
模型与应用方面,字节跳动发布了豆包-Seed-2.1 系列,有媒体报道称其在编程和智能体基准测试上持平或优于 Claude Opus 4.7 和 GPT-5.5,定价约为同类 Claude 模型四分之一 29。 另一则媒体报道介绍了百度一见为可口可乐世界杯活动部署的实时交互数字人——足球评论员范志毅,平台声称其已覆盖 30 个行业的超过 10 万个数字主播,直播规模增长 120%,制作成本下降 63.3% 30。 这一展示标志着 AI 数字人从新奇事物向营销基础设施的转变,但所提指标仍为第一方数据。
综合与展望
这些发现共同描绘出一个加速却不均衡演进的领域图景。 优化器设计与 VLA 架构的持续突破直接推动了能力的跃升,却也暴露了 LLM 与智能体部分所述的脆弱评估与对齐框架。 借助散度与奖励设计转向可控生成,正是为了弥合这一裂痕的自觉努力,但其对散度选择与奖励模型架构的高度敏感,恰恰呼应了削弱 LLM 评估的结构性脆弱。 这些脉络之间冲突最为明显之处在于:优化器社区追求更大规模、更快速度的训练范式,而智能体部署中越来越多的证据却表明,恰恰是在那些放量扩规的多租户场景下,现实可靠性反而下降。 智能体 AI 在企业基准测试中的准确率崩塌并非孤立的失效模式; 它是对齐流水线中已识别的关联性评估误差与数据来源问题的下游症状,并因 VLA 的指令盲区而加剧,使感知-行动回路在分布偏移下极为脆弱。 该领域因此陷入一个自我强化的循环:更快的优化器催生出更复杂的模型,后者又要求更精密的安全验证,但当前的评估范式甚至无法可靠地审视对抗性输出,也难以抵御通过公开数据编辑进行的隐蔽价值操控。 这一综合影响指向一个未来:首要瓶颈并非模型能力,而是可验证的可信度。 一个紧迫的开放问题是:面向智能体的设计时验证与加固基础设施,能否被推广为一套有原则的安全层,随模型复杂度自动扩展? 还是说,对齐中内在的性能-多样性权衡,将为可安全部署的智能设下永久的上限?
本综述基于 30 项进展:19 项 A 层研究信源、5 项 B 层第一方信源,以及 6 项 C/D 层二手或社区信源。 最为坚实的论断依托于 A 层研究,而第一方与社区信源应视作方向性参考; 要获得更强的置信度,还需对自我报告的结果进行独立复现与一手信源确认。
原文链接与引用索引
- [1] UniviewVLA:具有世界建模能力的统一多视角视觉-语言-动作模型 — arXiv · Tier A/research_paper
- [2] 在视觉-语言-动作模型中解耦陈述性知识与程序性知识 — arXiv · Tier A/research_paper
- [3] 平坦性保持视觉-语言-动作模型中的指令遵循能力 — arXiv · Tier A/research_paper
- [4] LIBERO-Safety:面向视觉-语言-动作模型的物理与语义安全综合基准 — arXiv · Tier A/research_paper
- [5] 九名评委,仅两票有效:相关错误削弱LLM评审面板 — Apple Machine Learning Research (RSS) · Tier B/official_tech_blog
- [6] 大语言模型能否可靠地自我报告对抗性前缀攻击,以及如何做到? — arXiv · Tier A/research_paper
- [7] 倡导者可以通过编辑维基百科影响大语言模型的价值观 — LessWrong (RSS) · Tier C/community_opinion
- [8] 从社会选择视角看人工智能对齐 — arXiv · Tier A/research_paper
- [9] DiT-Reward:面向文本到图像奖励建模的生成式表征 — arXiv · Tier A/research_paper
- [10] 在GRPO自回归文本到图像后训练中平衡性能与多样性 — arXiv · Tier A/research_paper
- [11] Vera:用于内容保留视频编辑的分层扩散模型 — arXiv · Tier A/research_paper
- [12] 语义浏览:面向图像生成的可控多样性 — arXiv · Tier A/research_paper
- [13] 开放问题:在重尾噪声下 AdamW 是否有效? — arXiv · Tier A/research_paper
- [14] 从河谷视角理解Muon优化器的优势与局限 — arXiv · Tier A/research_paper
- [15] Muown隐式执行角度步长衰减 — arXiv · Tier A/research_paper
- [16] 以树破链:具有 O(log N) 并行时间复杂度的深度学习 — arXiv · Tier A/research_paper
- [17] EnterpriseClawBench:基于真实工作场景的企业智能体基准测试 — arXiv · Tier A/research_paper
- [18] 通过构建模块组合可验证的概念模型:迈向智能体AI工作流的设计时验证 — arXiv · Tier A/research_paper
- [19] 剖析Agentic RAG:基于本地7B模型的多跳问答组件消融研究 — arXiv · Tier A/research_paper
- [20] 共享基础设施,隔离租户:基于 Amazon Bedrock AgentCore 的池化模型多租户架构 — AWS Machine Learning Blog (RSS) · Tier B/official_tech_blog
- [21] 基于感知奖励的后训练语音增强语言模型 — arXiv · Tier A/research_paper
- [22] Interactions API:Gemini 模型与智能体的主要接口 — Google AI Blog · Tier B/official_tech_blog
- [23] AI暴露分数:它们衡量什么、遗漏什么,以及下一步 — arXiv · Tier A/research_paper
- [24] Eco Wave Power 借助 NVIDIA AI 基础设施与数字孪生将海浪转化为电能 — NVIDIA AI Blog · Tier B/official_tech_blog
- [25] 机器人全栈操作系统!老黄率先抛出“具身版安卓” — 量子位 QbitAI (RSS) · Tier C/media_report
- [26] 新型芯片助力微型机器人在复杂环境中穿行 — MIT News: Artificial Intelligence (RSS) · Tier D/other
- [27] NVIDIA 为电信运营带来可信的 24/7 AI 智能体 — NVIDIA AI Blog · Tier B/official_tech_blog
- [28] 正行创新完成近亿美元天使轮融资,正大集团、华勤技术等多家上市企业联合加持 — 量子位 QbitAI (RSS) · Tier C/media_report
- [29] 刚刚,豆包2.1发布!Agent自己跑18个小时搞定芯片设计代码 — 量子位 QbitAI (RSS) · Tier C/media_report
- [30] 可口可乐的世界杯TVC,居然是prompt生成的 — 量子位 QbitAI (RSS) · Tier C/media_report