OpenAI 预览 GPT-5.6 Sol Ultrafast,Cerebras 提供最高 750 tok/s
OpenAI 宣布在 API 中预览 GPT-5.6 Sol 的 Ultrafast 模式,官方口径为最高 14 倍速度、最高约 750 tokens/s,底层由 Cerebras 提供。首批只向部分客户开放,并根据容量逐步扩大;目标场景是延迟能够直接转化为业务价值的高端工作流。这里的 14 倍和 750 tok/s 都是发布方给出的峰值口径,当前动态未披露输入/输出长度、并发、首 token 延迟、价格、模型质量是否完全一致或硬件配置,因此不能直接与常规 API 或其他厂商基准横向比较。
来源:OpenAI 发布 · Cerebras 与速度口径 · 开放范围
标签:#OpenAI #GPT56Sol #Cerebras #Inference
ChatGPT Computer History 把跨应用活动变成长期上下文
OpenAI 推出桌面端 Computer History:在用户主动开启后,ChatGPT 可以记住电脑上应用和网站中的活动,后续对话减少重复解释。它基于 Chronicle research preview,官方称降低了 token 消耗并增加隐私控制;时间线视图支持回看工作,并从高频任务构建 skills。首批面向 Mac 上的 Pro、Business、Enterprise 用户全球推出,EEA、英国和瑞士稍后开放。该功能从“对话记忆”扩展到跨应用行为历史,价值和风险都明显上升;实际的数据边界、保留周期、企业管理员控制和删除语义仍值得继续核对。
标签:#ChatGPT #ComputerHistory #Memory #Privacy
Gemini 3.7 Flash 发布:三周迭代、编码能力增强和阶段性半价
Google DeepMind 发布 Gemini 3.7 Flash,重点强调编码、知识工作和 Web 开发能力相对 3.6 Flash 提升。Google 团队称新版本在 3.6 Flash 发布约三周后推出,API、AI Studio、Antigravity 等入口可用,并在年底前以相对 3.6 Flash 低 50% 的介绍价供应。第三方 Datacurve 报告其在 DeepSWE 上得分 65.5%,比 3.6 Flash 高 18.8 个百分点且单任务成本不足一半;这是第三方评测口径,不等同于 Google 官方的全面基准结论。
来源:Google DeepMind · 产品与价格说明 · DeepSWE 第三方结果
标签:#Gemini #Coding #API #Benchmark
DeepSeek-V4-Pro-0813 与 DeepSeek Harness 同步发布
DeepSeek 发布 V4-Pro-0813 检查点和 DeepSeek Harness。被 SGLang 引用的官方动态强调 Agent 能力与生产收益提升、V4-Pro/V4-Flash 支持 low/high/max 三档 reasoning effort,并原生支持 OpenAI Responses API。社区动态称新检查点以 MIT 许可证开放权重;SGLang已公开模型与 harness 入口,并将其定位为 agentic coding 模型。当前时间线没有完整模型卡和统一基准表,因此“明显跃升”等评价应视为项目方或社区判断。
来源:SGLang 与 DeepSeek 官方引用 · 开放权重与许可证转述
标签:#DeepSeek #V4Pro #Harness #AgentCoding
定时后台 Agent 进入 Managed Deep Agents 一等能力
LangChain 团队展示 Managed Deep Agents 的 schedule 支持:Agent 可以按计划主动唤醒,而不必等待用户提示。Harrison Chase 将后台 Agent 描述为未来方向,并建议先用轻量分类器判断任务是否值得运行,再触发更昂贵的 Agent,以控制持续运行成本。另一案例称 Unify 在上线前两周将 Agent 成本削减 90%–95%,并把 subagent 简化为函数调用;这是团队案例口径,具体基线与成本构成尚未披露。
来源:定时 Agent · 分层触发策略 · Unify 成本案例
标签:#LangChain #ManagedDeepAgents #Scheduling #Cost
NVIDIA 从光网络、旧 GPU 生命周期和 token economics 描绘 AI factory
NVIDIA 宣布 Spectrum-X Ethernet Photonics 进入量产,官方称相较现有方案减少 4 倍激光器、降低 5 倍功耗,并把平均故障间隔提高 10 倍。Jensen Huang 同时强调 A100 机群可从 2020 年持续服役到 2029 年,理由是 CUDA 允许跨 Ampere、Hopper、Blackwell 持续升级软件能力。另一组动态把 AI factory 的经营问题表述为预测 token 需求、调度供给并最大化 token 变现。这些指标均来自 NVIDIA;实际可用寿命和总体经济性仍取决于能效、维护、机会成本和工作负载匹配。
来源:Spectrum-X Photonics · A100 生命周期 · Token economics
标签:#NVIDIA #SpectrumX #A100 #AIFactory
其他值得关注
- MiniMax 发布开放权重 Music 3;社区介绍其由约 8B LLM 与 2.7B DiT 组成,SGLang 同日提供支持:官方 · SGLang
- Hugging Face TRL 的新异步 GRPO trainer 在项目方基准中快约 2–4 倍:原帖
- Stanford AI Lab 转发 nanochat SWE-bench speedrun:从随机初始化训练,声称 60 美元训练计算达到 5% pass@1、1000 美元达到 11%;仍需核对完整实验协议:原帖
- Figure 创始人复盘早期 tendon-based 机器人手的工程失误,强调包装、可靠性和可制造性优先于仿生直觉:原帖
- Uber 宣布与日产、Wayve 和 Hinomaru Taxi 合作,目标在 2026 年底前于东京提供 robotaxi 体验:原帖
- OpenAI Foundation 启动 AI for Civil Society and Philanthropy,首个项目规模为 1 亿美元:原帖
- OpenAI 称使用插件和 skills 最积极的前 10% 企业,其插件使用频率约为典型企业两倍、skills 约六倍;这是平台内部统计口径:原帖
- NVIDIA 与 CoreWeave 讨论 Vera Rubin NVL72 AI factory 的端到端验证和两周级持续运行,关注网络、存储、调度与恢复路径:原帖
今日观察
今天最鲜明的竞争不只是“更聪明”,而是围绕时间的三种优化:Cerebras 把单次推理压到极高输出速度,Gemini 用三周迭代和阶段性降价压缩产品更新周期,Computer History 与定时 Agent 则把系统从会话内工具扩展为跨天持续运行的工作伙伴。由此,新的核心指标会从单纯 benchmark 分数转向端到端等待时间、后台任务触发质量、长期上下文成本和隐私可控性;这些维度比峰值 tok/s 更能决定实际采用。