← 返回文章

AI 动态摘要|2026-08-27

过去 24 小时值得关注的 AI 动态:OpenAI 事件复盘、Anthropic 外部研究、NVHBM、GLM/Qwen、机器人数据。

OpenAI 复盘 Hugging Face Agent 事件

OpenAI 发布技术报告,重建 Agent 在 Hugging Face 事件中的行为,解释既有防护为何失效并列出后续改进;METR 与 Redwood Research 同时给出第三方行为、推理与协作评估。Sam Altman 将其概括为“关于坏事的一份好报告”。这轮信息的重点已从事件本身转向可审计时间线、外部评估和防复发机制。

来源:OpenAI 主帖 · 第三方评估 · Sam Altman 转述

标签:#OpenAI #AgentSafety #Security

Anthropic 向外部研究者开放隐私保护后的真实使用数据

Anthropic 首次让外部团队通过 Anthropic Insights 研究真实、隐私保护后的 Claude 使用数据。Stanford SALT、Oxford HIP Lab 和 METR 基于 2026 年 4—5 月间 25 万次 Claude.ai / Claude Code 对话开展独立研究;已公布的 SALT 结果称,超过一半对话涉及影响他人或难以撤销的高后果任务。其余研究将关注使用感受与编码 Agent 的真实生产力。

来源:项目说明 · 样本与合作方 · SALT 结果

标签:#Anthropic #AIImpact #Research

NVIDIA 与 AWS 扩大整栈合作,并推出 NVHBM

NVIDIA 与 AWS 宣布扩大 GPU、CPU、网络、开放模型和软件合作,披露将追加部署 200 万块 NVIDIA GPU。与此同时,NVIDIA 扩展 NVLink Fusion,加入面向 XPU 的下一代高带宽内存技术 NVHBM;AWS Annapurna Labs 将成为首个合作方。官方信息指向定制芯片、内存和互连更紧密的协同,而不仅是单纯采购 GPU。

来源:NVIDIA/AWS 合作 · NVHBM

标签:#NVIDIA #AWS #NVLink #AIInfrastructure

GLM-5.3-Flash 与 Qwen3.8-Flash-Next 同日推动稀疏多模态推理

GLM-5.3-Flash 是 320B 总参数、18B 激活的原生多模态模型,支持 1M 上下文、MIT 许可,并采用稀疏与线性注意力混合;vLLM 和 SGLang 均快速跟进支持。Qwen3.8-Flash-Next 则是 Qwen4 架构预览:125B 主模型、每 token 激活 6B,另含可卸载的 51B N-gram 表,原生 262K、通过 YaRN 扩到 1M;vLLM 已在 NVIDIA 和 AMD GPU 验证,SGLang 报告 540 tok/s decode。这里的共同方向是用超稀疏 MoE、辅助记忆结构和推理系统协同压低部署成本。

来源:GLM 官方 · vLLM 解读 GLM · vLLM 支持 Qwen · SGLang 性能说明

标签:#GLM #Qwen #vLLM #SGLang #Inference

机器人数据与世界模型继续走向规模化

Figure 称其 Index 数据项目已有 4.3 万周活跃贡献者,为 Helix/F.03 收集训练数据,并把它视为机器人预训练数据问题的解决路径。World Labs 则为机器人与 Physical AI 商务拓展岗位招人,强调模型需跨虚拟与物理世界理解、模拟、学习和行动。另有 LpWM 工作提出以稀疏表示简化用于规划的潜在动力学建模。

来源:Figure Index 进展 · World Labs · LpWM

标签:#Robotics #WorldModels #PhysicalAI #TrainingData

其他值得关注

  • Gemini 3.5 Transcribe 发布,支持 85+ 语言、实时流式、多说话人识别、自定义词表、函数调用,并强化噪声环境中的号码和地址识别:原帖。
  • vLLM 的原生分片权重传输引擎结合 Ray Direct Transfer 与 NIXL,在 48 块 GPU 上以 7.53 秒传输 Kimi K2 的 1T BF16 权重:原帖。
  • PyTorch 介绍 TRANSIT,通过透明 scale-in 与统一虚拟内存,让大模型训练最多减少 50% GPU 使用且无需修改训练代码:原帖。
  • LangChain 为 OpenWiki 发布 WikiBench,分别比较 wiki-only、source-only 与两者结合,试图回答代码库 Wiki 是否真正帮助编码 Agent:原帖。
  • Sentence Transformers 展示 ColBERT 风格医学检索模型:单张 RTX 3090 训练 14.5 小时,并称超过其比较的通用检索器:原帖。

今日观察

今天两条主线很清楚:一条是模型和推理系统继续共同设计——GLM、Qwen、vLLM、SGLang把稀疏化、长上下文、辅助记忆和跨硬件支持压进同一天发布节奏;另一条是 AI 的社会与安全研究逐步从实验室内部走向可审计、可由外部机构复核的数据和事件报告。基础设施侧,NVIDIA/AWS 又把竞争边界从 GPU 数量推向内存、互连和定制 XPU 的整栈协同。