OpenAI 下调 GPT-5.6 Sol 价格,Codex 同步调整额度体验
OpenAI 宣布未来三个月将 GPT-5.6 Sol 的 API 与 credits 价格下调超过 20%,已在 API 上线,并逐步覆盖 ChatGPT Work 与 Codex credits;Pro、Plus、Business 订阅用量不变。Codex 产品侧同时宣布活跃用户达到 2,000 万,并向 Codex 和 ChatGPT Work 用户发放一次可留存的额度重置。团队还解释,部分异常用量投诉与将订阅额度转换成 API 的第三方工具有关,而非平台暗改限制。
来源:OpenAI 降价 · 适用范围 · Codex 2,000 万活跃用户与 banked reset · 额度差异说明
标签:#OpenAI #GPT-5.6-Sol #Codex #pricing
Vera Rubin 首批量产系统进入微软数据中心
Satya Nadella 展示首批生产级 Vera Rubin 已送达微软数据中心;NVIDIA 随后确认该平台正在进入全面量产爬坡。这是从发布路线图走向实际云基础设施交付的强信号,但帖子未披露具体系统形态、规模或上线时间,不能据此推断 Azure 已对外提供 Rubin 实例。
来源:微软交付现场 · NVIDIA 确认量产爬坡
标签:#NVIDIA #VeraRubin #MicrosoftAzure #AI-infrastructure
推理系统继续向“快速恢复、消费级部署、训练一致性”推进
SGLang 团队介绍 Weight Cache Daemon:用常驻 GPU 进程与 CUDA IPC 零拷贝提供后量化权重,把 Ling-2.6-1T FP8 的权重加载从约 495 秒降至约 0.63 秒,称约 785 倍加速。另一项工作展示官方 checkpoint 在本地硬件上的交互式推理:Qwen3.6 35B 在 8GB RTX 4060 笔记本约 39 tok/s、DeepSeek-V4-Flash 284B 在 RTX 5090 约 22–25 tok/s、GLM-5.2 753B 在 RTX PRO 6000 约 15 tok/s。vLLM 则分享 SkyRL IsoExec,用执行契约和统一模型减少 RL rollout 与 Megatron trainer 因浮点非结合性造成的 token logprob 偏差。上述数字来自各自发布者,测试条件不同,不应横向排名。
来源:SGLang 快速恢复 · 消费级硬件部署数据 · vLLM / SkyRL IsoExec
标签:#SGLang #vLLM #inference #RL #CUDA-IPC
机器人数据与触觉成为 Physical AI 的两个补课方向
Lightwheel 与 Hugging Face 开源 EgoSuite-Open100K,宣称包含 10 万小时第一视角人类操作数据、1.5 万多个任务和真实场景,并提供手部、身体姿态与腕部相机标注。Jim Fan 同日强调触觉在机器人中的欠开发状态,并指向 T-Rex 触觉响应灵巧操作项目及其开放数据集。两者共同指向一个趋势:Physical AI 的瓶颈正从单纯扩模型,转向大规模真实人类行为数据和触觉闭环。
来源:EgoSuite-Open100K · LeRobot 数据说明 · 触觉与 T-Rex · 数据集链接帖
标签:#PhysicalAI #robotics #tactile #open-data
Agent 安全边界被进一步拆成 harness 与基础设施两层
NVIDIA 安全团队提出:harness 决定 Agent “尝试做什么”,基础设施决定它“实际上能做什么”。这比仅在提示词或工具权限层做防护更接近生产系统现实,也与社区对 Agent 栈的分层讨论呼应:业务逻辑、运行循环与生产基础设施需要分别建模和治理。
来源:NVIDIA Agent 安全分层 · Agent 栈分层讨论
标签:#Agent #security #harness #infrastructure
其他值得关注
- MiniMax H3 在 Sol-Engine 的发布者测试中,相对其所引 SGLang baseline,在单张 GB200 上实现 5 秒 768p 视频 152.3s→6.85s(22.2×),10 秒场景称 27.7×;需等待更完整方法与独立复现:原帖。
- Google Antigravity 推出 Remote Control,可从现代浏览器及 iOS/Android 访问活跃会话,先向 Ultra 用户逐步开放:原帖。
- SenseNova-U1.5-8B-MoT 以开放权重统一处理文本与图像 token,发布者称无需 VAE、文本编码器或 DiT:原帖。
- Diffusers 0.40.0 将 Modular Diffusers 移出 experimental,并加入新模型、部分 tensor-parallel 支持和量化能力:原帖。
- NVIDIA DSX MaxLPS 宣称可在相同功率预算下提升最多 40% GPU 容量,核心是动态功率分配、每瓦性能与 45°C 热设计:原帖。
- vLLM Conference 下周举行,日程包含 Ray、Google Cloud、Dynamo 等社区活动:原帖。
今日观察
今天最清晰的主线不是单一模型能力跃升,而是“把能力变成可运营系统”:OpenAI 用降价和额度机制扩大使用,NVIDIA 与微软把下一代硬件推进到生产交付,推理框架则同时解决恢复时间、训练执行一致性和本地部署。与此同时,机器人侧开始补齐真实行为数据与触觉模态,Agent 安全也从抽象原则落到 harness 与基础设施的职责边界。值得持续跟踪的是:这些发布中的高倍性能数字能否在统一基准、完整配置和独立复现下成立。