OpenAI 将 Astra 列为首个网络安全“critical”模型
OpenAI 表示,正在评估的 Astra 因网络安全能力达到其 Preparedness Framework 的首个“critical”级别,正在加设控制措施。Sam Altman 随后称希望最终广泛提供该模型,但因网络能力需要更多时间安全发布。官方尚未在帖子中给出具体能力测试、阈值或开放时间,因此“critical”是其内部框架分级,不等同于已经发生现实攻击。
来源:OpenAI 公告 · Sam Altman 说明
标签:#OpenAI #Astra #Cybersecurity #Preparedness
vLLM 在 GB200 NVL72 上报告 Qwen3.5 达到 25K total TPS/GPU
vLLM/NVIDIA 团队给出的配置是 4–8 个 prefill DEP2 endpoint 对一个 decode DEP8 endpoint,GB200 NVL72,ISL/OSL 8192/1024,并发从 64 扫到 5120;其性能前沿超过 25K total tokens/s/GPU。优化包括 Blackwell 专用 GDN prefill kernel(官方称 kernel 最高 5.92×、端到端 prefill 1.13×、平均 TTFT 降 12%)、NIXL 双 descriptor 的 hybrid cache/GDN state 传输(descriptor 4,284→1,650、吞吐最高增 7%),以及修复 async scheduling 的两个竞态。团队称配置均有一键可复现 recipe。
这是厂商/项目方发布的特定长输入、P/D 解耦吞吐前沿,不应外推为普通短请求、低并发或单机部署性能。
来源:主帖 · 硬件与负载 · GDN kernel · 状态传输 · 异步调度 · 复现入口
标签:#vLLM #Qwen35 #GB200NVL72 #DisaggregatedServing
LangChain 发布 Managed Deep Agents 公测
LangChain 将 Managed Deep Agents 定位为“harness + 托管运行时”:开发者提供业务逻辑与知识,平台负责底层基础设施,同时保留模型选择、工具、middleware 和 Agent 生命周期控制。Harrison Chase 及团队的讨论将其类比为 Agent 时代的托管平台;社区同时指出潜在的 PaaS 锁定问题,未来是否出现类似 Kubernetes 的标准化抽象值得关注。
来源:发布文章 · 公测公告 · 产品边界说明 · PaaS 类比讨论
标签:#LangChain #ManagedDeepAgents #AgentRuntime
机器人研究与产品同时推进
Google DeepMind 继续展示 Gemini Robotics 2 的 whole-body intelligence 及 Apollo 2 演示;Sergey Levine、Andrew Wagenmaker 推出对 imitation learning 中 action chunking 作用机制的研究。前者是官方产品展示,后者是研究团队对一种关键训练技巧的机制分析,不能仅凭社交媒体摘要判断论文结论强度。
来源:Gemini Robotics 2 · Apollo 2 演示 · Action chunking 研究
标签:#Robotics #GeminiRobotics2 #ImitationLearning
开源模型与推理生态继续扩张
- Red Hat AI 发布 Qwen3.6-35B-A3B、Gemma-4-31B 与更新版 GLM-5.2 的 DSpark speculator,并称 GLM-5.2 decode 可达 4.0×;这是发布方数据,需按具体硬件和 acceptance rate 复现:原帖
- SK Telecom 开放 A.X K2:688B MoE、256K context、Apache 2.0,可商用;帖子没有给出完整 benchmark 与部署成本:原帖
- LangSmith 数据称 7 月约三分之一活跃团队运行过 open-weight model,日用 open-weight 团队同比增 9×;这是平台样本,不代表全市场:原帖
- Hugging Face 发布 AI agents 复现 ICML 2026 论文的内容,值得后续查看成功判据、人工介入和复现质量:原帖
其他值得关注
- Hark 展示其 computer-use agent 完成 Target 搜索、下单和支付,称交互从 15 秒/turn 降至 5 秒/turn;是团队演示,不等于跨站稳定性:原帖
- Buzz Desktop v0.5.6 增加主题同步、rich link preview、手机号身份恢复并改善 agent 可靠性;另有用户称移动端 0.7.0 修复了既有 bug:桌面版 · 移动端反馈
- a16z 转述 Sensor Tower 数据称 Kimi 下载量接近增长 5 倍、DAU 增约 40%;这是第三方市场数据摘要,需核对时间区间和地域:原帖
- Google DeepMind 团队称 OpenAI 与 ElevenLabs 采用 SynthID 音频水印;本轮来源为团队成员转述:原帖
今日观察
今天最明显的两条线是“能力提升后的治理约束”和“Agent 运行时产品化”。Astra 表明模型发布开始真正受能力阈值约束;与此同时,Managed Deep Agents、Hark 与 Buzz 都在把 Agent 从一次性调用推进到长期运行、可管理的产品。底层则由 vLLM 的 P/D 解耦、专用 kernel 与状态传输继续压低大模型服务成本。后续应重点追踪 Astra 的能力与开放边界,以及 Managed Agent 平台是否形成可移植的运行时标准。