DeepSeek-V4-Flash-0731 开放权重,Agent 与长上下文成为主卖点
SGLang 转述 DeepSeek 官方发布:DeepSeek-V4-Flash API 进入公开测试,新 checkpoint 同日开放。vLLM 给出的结构信息是 284B 总参数、13B 激活参数、256 个 routed experts、每 token 激活 6 个专家、1M 上下文,并提供三个 reasoning-effort 档位,定位代码 Agent 和工具调用。
SGLang 称正式版 Agent benchmark 已显著超过 V4-Pro-Preview,但本轮帖子没有完整基准表和测试设置,因此不能把“显著超过”进一步量化。Hugging Face 社区随后上线一个无需 token、OpenAI 兼容的共享免费 endpoint,但它带轻度限流,属于社区部署而非 DeepSeek 官方服务。
来源:SGLang 发布转述 · vLLM 结构说明 · vLLM recipe · 社区免费 endpoint
标签:#DeepSeekV4 #vLLM #SGLang #MoE #CodeAgent
推理栈继续模块化:SMG 独立、SGLang 重构量化层
SMG(Shepherd Model Gateway)从 LightSeek Foundation 毕业并迁入独立项目,定位为与推理引擎无关的 gateway。PyTorch 与 vLLM 强调后续将共同维护可跨项目复用的 frontend、gateway 和多模态处理组件,包括 vLLM Rust frontend 所用的 multimodal processors。
另一边,SGLang 把量化路径拆为 Config、Method、Scheme、Kernel 四层;官方示例称 Qwen3-30B-A3B 权重从 61.08GB 缩小约 2.83 倍且精度损失很小。这里的 2.83 倍是权重体积结果,不等同于端到端吞吐提升。
来源:SMG 与 PyTorch 生态 · vLLM 协作说明 · SGLang 量化栈
标签:#InferenceGateway #SMG #Quantization #SGLang #RustFrontend
Agent 评测开始从总分转向失败分类与可复现任务
LangChain 发布 ReviewBench,用于评估代码审查 Agent;Harrison Chase 总结其内部评测方向是统一到 Harbor,并把 traces/原始数据转成 Harbor tasks。Berkeley 相关研究 AdaMAST 则从运行 trace 自动学习系统特定的失败 taxonomy,并跨运行复用这些分类来定位 Agent 在何时、何处、如何失败。
共同趋势是:Agent 评测不再只看一个成功率,而是把真实运行记录转成可复现任务,再用失败类型驱动下一轮改进。AdaMAST 帖子提到 SWE-bench Verified Mini 的提升,但可见文本未包含完整终值,日报不补猜数字。
来源:ReviewBench · Harbor 工作流 · AdaMAST
标签:#AgentEval #ReviewBench #Harbor #FailureTaxonomy
ChatGPT 桌面端加入 Activity 视图,Codex 转向任务收件箱
OpenAI Developers 发布 ChatGPT 桌面端 Activity 视图,把“需要用户处理的对话”和各项目最近更新聚合到一处。Tibo 表示该功能比预告提前一天上线;他此前还公开征集 Codex 日常体验中任何粒度的改进建议。
这是产品形态上的重要变化:当多个 Agent 和长任务并行时,核心交互从持续盯着聊天窗口转向异常、审批和完成结果组成的工作队列。这一判断是基于产品界面的推断,不是 OpenAI 的官方定位表述。
来源:Activity 视图转述 · Codex 体验征集
标签:#Codex #ChatGPTDesktop #AgentUX #ActivityInbox
Buzz v0.5.3 强化自托管、Agent 分享与团队协作
Buzz Desktop v0.5.3 带来 Agent、语音、共享计算、社区、消息、账号恢复和 Linux 等多项更新,包括自动将 huddle 转录给 Agent、macOS Agent 菜单。Block 同时发布自建 Buzz relay 的方法,并简化 Agent 对外分享。
值得注意的是,Block 团队还称其在调查非 Bitkey 钱包被盗事件时,把 Agent 放进 Buzz channel 协助根因分析。这是开发团队披露的实际使用案例,但不能据此判断 Agent 对调查结论的独立贡献比例。
来源:Buzz v0.5.3 · 自托管 relay · Agent 分享 · 安全调查协作
标签:#Buzz #SelfHosting #MultiAgent #TeamCollaboration
PyTorch 2.13 与 NVIDIA 案例继续压低本地和语音推理成本
PyTorch 2.13 将 FlexAttention 带到 Apple Silicon,并称 nn.LinearCrossEntropyLoss 可让大词表模型的峰值内存最多降低 4 倍,同时更新分布式训练、编译、profiling 与端侧推理。
NVIDIA 官方案例称 StudyFetch 使用 Riva、Parakeet ASR 和 NIM microservices 后,最大的一项推理工作负载成本下降近 10 倍,用于语音辅导、实时个性化和 Agent 学习平台。该数字是厂商案例,缺少本轮可见的原始成本、硬件和流量口径,适合作为线索而非通用基准。
来源:PyTorch 2.13 · NVIDIA StudyFetch 案例
标签:#PyTorch213 #AppleSilicon #NVIDIANIM #ASR #推理成本
机器人数据开始重视“失败样本”
Sergey Levine 推介 OopsieData:收集机器人日常产生但通常被丢弃的抓取失败等次优轨迹,建设公开数据集。其核心判断是机器人越多,自动产生的次优数据越多,而这些失败轨迹可用于学习恢复策略和提高鲁棒性。
Google DeepMind 同期展示 Gemini Robotics 2 在 FR3 Duo 上连续 20 分钟实时完成工具配套,并强调涌现出的失败恢复行为。两者形成互补:一边构建失败数据资产,另一边把恢复能力作为长时连续任务的关键观测指标。
来源:OopsieData · Gemini Robotics 2 长时演示
标签:#RobotLearning #FailureData #GeminiRobotics #Robustness
其他值得关注
- NVIDIA 称 DGX Spark 将 Arup 的部分结构设计探索从数小时压缩到数分钟,但帖子没有给出工作负载与对照配置:原帖
- PyTorch 表示 RadixArk 将于年内推出 PyTorch-native 的 SGL-torchtpu,支持 eager execution、PyTorch 生态兼容和 MPMD:原帖
- 一个公共领域影片实验用约 10 美元 GPU 时间为 370 小时视频建立语义检索索引,展示低成本视频归档搜索:原帖
- NeurIPS 发布 2026 年 7 月 newsletter;本轮可见帖只提供入口,没有额外研究发布信息:原帖
今日观察
今天最清晰的共同方向是“把 Agent 做成可运营系统”:模型层用稀疏 MoE、量化和多后端降低成本;serving 层把 gateway、frontend 和多模态处理拆成共享组件;评测层从总分转向 trace、任务与失败 taxonomy;产品层则用 Activity 收件箱、自托管协作和可分享 Agent 管理并行工作。模型发布仍重要,但真正形成复利的是这些可复用的系统层。