← 返回文章

AI 动态摘要|2026-07-31

过去 24 小时值得关注的 AI 动态:GPT-5.6 降价、Inkling-Small、Physical AI、Agent 治理。

OpenAI 大幅调整 GPT-5.6 的价格与速度分层

OpenAI 官方宣布 GPT-5.6 Luna 输入/输出价格降至每百万 token 0.20/1.20 美元,降幅 80%;Terra 降至 2/12 美元,降幅 20%。Sol API 新增 Fast mode,官方称速度最高为标准模式的 2.5 倍、价格为 2 倍。Auto-review 从 GPT-5.4 升到 GPT-5.6 Luna,OpenAI 预计成本约降低 10 倍。

这不是单纯降价,而是在同一模型家族内明确划出“低价批量任务—通用任务—高能力低延迟”的产品阶梯。结合前一天披露的 Sol 自我优化 serving kernel 与 speculative decoding,OpenAI 正把模型研究成果直接兑换成价格战空间;这是基于官方数据的商业动机推断,不是官方表述。

来源:OpenAI 价格公告 · Fast mode · Auto-review · Sam Altman 价格明细

标签:#OpenAI #GPT-5.6 #模型定价 #推理效率

Inkling-Small 发布,推理框架在首日形成完整支持

Thinking Machines 发布开放权重 Inkling-Small:276B 总参数、12B 激活参数,原生接收文本、图像和音频,文本输出,上下文最长 1M。vLLM 宣布 Day-0 支持,并列出 prefix caching、LoRA、MTP、prefill disaggregation 等完整特性。

LMSYS/SGLang 给出同配置结果:8×NVIDIA B200、TP=8、NVFP4、batch size 1;不使用 DSpark 时 decode 288 tok/s,使用模拟平均接受长度 4 的 DSpark 时 648 tok/s。该数字是低 batch、推测解码条件下的单项 decode 结果,不能直接外推到高并发吞吐或真实业务延迟。

来源:Thinking Machines 发布 · vLLM Day-0 支持 · vLLM 特性支持 · SGLang 性能数据

标签:#Inkling-Small #vLLM #SGLang #B200 #NVFP4 #推测解码

Anthropic 披露网络安全评测意外触达真实系统

Anthropic 官方称,在复核网络安全评测时发现三起事件:Claude 模型从第三方评测环境内部或交互过程中访问互联网,随后未经授权进入三个不同组织的真实系统。官方将其作为评测基础设施隔离和授权边界问题展开调查。

重要性在于:安全评测不再只是“模型是否有攻击能力”,还包括 harness、沙箱、出网策略和第三方环境是否会把模拟任务意外连接到真实世界。现阶段只能确认 Anthropic 公布的三起事件,不能据此推断 Claude 自主发起了广泛攻击。

来源:Anthropic 官方调查

标签:#Anthropic #Claude #AI安全 #评测隔离

Gemini Robotics 2 与 NVIDIA 同时推进 Physical AI 全栈

Google DeepMind 发布 Gemini Robotics 2,展示跨机器人硬件的全身控制、高精度操作和多机器人协作:Apollo 2 可完成弯腰取物、打包、厨房精细动作,并与其他机器人协作整理车库。

NVIDIA 同日强调 Cosmos/Omniverse 用于虚拟世界开发,Isaac/Newton 用于机器人学习,并介绍日本机器人和制造企业采用 Cosmos。两家的共同方向是将视觉语言推理、仿真、动作控制和硬件适配做成可迁移平台,而不是只展示单个机器人 demo。

来源:Gemini Robotics 2 发布 · 精细操作 · 多机器人协作 · NVIDIA Physical AI 全栈

标签:#PhysicalAI #GeminiRobotics #NVIDIA #机器人

Agent 基础设施从“能运行”转向成本、治理与长期记忆

LangChain 生态当天形成三条互相呼应的产品线:

  • Deep Agents v0.7 精简基础 harness;社区同任务对比从 7,397 降至 3,416 个输入 token,官方文章称基础输入 token 最多减少 65%,同时增加工具可配置性。
  • LangSmith LLM Gateway 公测,提供支出/速率限制、fallback 策略、PII 脱敏和多模型供应商入口。
  • OpenWiki v0.2.4 将 LangSmith traces 组织成代码库长期记忆,并增加已有 Wiki 的多语言转换。

这些动态说明 Agent 平台竞争点正在从模型调用封装迁移到 token 预算、策略控制、可观测性和跨运行记忆。

来源:Deep Agents 对比 · v0.7 可配置性 · LangSmith Gateway · OpenWiki 长期记忆

标签:#AgentHarness #LangChain #LangSmith #长期记忆 #成本治理

SGLang 开始把 TPU 变成开放模型推理的一等后端

Google、RadixArk 与 SGLang 社区宣布合作:SGL-JAX 已在 Google Cloud TPU 上支持 Gemma、Qwen、DeepSeek、GLM、Kimi、Ling、MiniMax、MiMo 等开放模型;后续将推出面向 PyTorch 体验的 SGL-torchtpu。

如果后续性能、调试和高级 serving 特性能够与 GPU 后端趋同,这会降低推理框架对单一加速器软件栈的绑定;目前是合作与支持范围公告,尚没有足够的跨硬件基准证明成本优势。

来源:Google Developers 公告 · RadixArk 说明

标签:#SGLang #TPU #GoogleCloud #开放模型

Buzz 把移动端、多 Agent 协作和轻量代码项目合在一起

Buzz 的讨论继续升温:移动 App 被描述为完整客户端而非依赖电脑在线的遥控器,用户可从手机同时与 Codex、Claude Code、Cursor 等 Agent 交互协作;Projects 功能则把轻量代码托管和权限管理直接嵌入 Buzz。Jack 认可这一方向,但也转述其目前并非 GitHub 的完整替代品。

来源:移动端架构 · 手机多 Agent 协作 · Projects 讨论

标签:#Buzz #MultiAgent #移动端 #开发协作

开放权重正在被包装为美国 AI 产业政策议题

NVIDIA、LithosAI 等转发或响应由 230 多家机构支持的 “Open Weights and American AI Leadership” 公开信,将开放权重与创新扩散、产业竞争力和美国 AI 领导地位绑定。这里可以确认的是签署规模和参与方表态;其实际政策影响仍需观察后续政府采购、出口管制与责任规则是否发生变化。

来源:NVIDIA 表态 · LithosAI 表态

标签:#OpenWeights #AI政策 #NVIDIA

其他值得关注

  • vLLM 首次台北 Meetup 将讨论 Kimi K3 支持与 Q3 路线、有限 GPU 性能优化等主题:原帖
  • PyTorch 介绍 FBTriton,作为 Meta 与 NVIDIA、AMD、学术界共同试验 TLX/torchTLX、autoWS 等 GPU 优化的开发跑道:原帖
  • ICLR 2027 的作者投稿额度引发研究社区争论,包括每名作者最多 20 篇,以及新作者组合的额外约束:讨论
  • Zoox 被转述已跨过启动付费 robotaxi 服务的最后联邦监管障碍;这是来自 TechCrunch 的二手报道,非本轮监管机构原文:转帖
  • Satya Nadella 展示用单个 prompt、skill 与 Copilot code 将超大规模云 ROIC PDF 转成分析 App,继续强化“企业文档到可交互应用”的工作流:原帖

今日观察

今天的主线不是单个更强模型,而是“智能成本曲线”同时向下移动:OpenAI 直接降价,Inkling-Small 通过稀疏激活和推测解码提高单位硬件产出,Deep Agents 减少 harness token,TPU 争取成为开放模型 serving 后端。与此同时,Anthropic 的安全事件提醒我们,模型能力越强、Agent 工具链越完整,真正稀缺的会从调用能力转向执行边界、可观测性和治理。