← 返回文章

AI 动态摘要|2026-08-23

过去 24 小时值得关注的 AI 动态:Codex 缓存、Marin 535B、Gemini 3.7 Flash、SGLang、Agent kernel。

Codex 用量消耗异常被归因于缓存命中率下降

Codex 团队表示,部分用户本周缓存命中率低于此前稳定状态,而持续命中缓存是控制用量消耗的重要因素,因此可能出现额度下降更快的感受。帖子将问题定位到缓存效率,而不是宣布新的额度规则;仍需观察后续修复范围和恢复时间。

来源:Codex rate-limit 更新

标签:#Codex #cache #rate-limit

Marin 启动开放的 535B MoE 训练航程

Percy Liang 团队启动 Marin 535B-A23B 训练,披露计划使用 11 套 GB200 NVL72、约三个月训练 18.75T tokens,总计算量约 2.7e24 FLOPs;训练结构为 80% 预训练加 20% mid-training,之后再做后训练。Anthony Platanios 强调其价值在于公开展示超大 MoE 模型训练过程。该信息来自项目发布与转述,实际训练稳定性、成本和最终质量尚待后续日志验证。

来源:Marin 训练计划转述

标签:#Marin #MoE #GB200-NVL72 #open-training

Gemini 3.7 Flash 强调低成本 ARC 表现与产品分发

Sundar Pichai 称 Gemini 3.7 Flash 首周增长速度刷新 Gemini 系列纪录,并已进入 Search 与 Gemini App。引用的 ARC Prize 数据为 ARC-AGI-2 84.6%、约 0.25 美元/任务,以及 ARC-AGI-1 95.5%、约 0.12 美元/任务。这些是特定评测与计价条件下的数据,不能直接代表通用任务能力。

来源:Gemini 3.7 Flash 发布动态

标签:#Gemini #ARC-AGI #cost-efficiency

SGLang Weight Cache Daemon 给出完整启动链路收益

Ant Ling 进一步说明 Weight Cache Daemon 在 Ling-2.6-1T FP8 上把权重加载降至约 0.63 秒,相对磁盘加载最高约 780 倍,并将总引擎启动时间从 8.8 分钟缩短到约 0.53 分钟。与前一日只看权重加载相比,总启动时间更能说明生产恢复价值,但数据仍来自发布团队,需结合 GPU、存储和并发配置理解。

来源:Ant Ling 技术线程 · LMSYS 合作说明

标签:#SGLang #inference #recovery #CUDA-IPC

Agent 正在从写代码走向自动优化 kernel 与理解操作轨迹

Hugging Face 转帖的动态称,NVIDIA 自建 coding harness 优化 CUDA GPU kernels,并在 ARC-AGI-3 的 25 个公开游戏、183 个关卡上取得 100% 完成率;这是二手转述,需等待 NVIDIA 原始方法和复现细节。另一篇论文《Inducing Task Models from Computer-Use Traces》则研究从计算机使用轨迹中归纳任务模型,显示 Agent 能力建设正在同时向底层系统优化与高层操作抽象延伸。

来源:NVIDIA coding harness 转述 · Computer-use traces 论文

标签:#Agent #CUDA #computer-use #ARC-AGI-3

其他值得关注

  • Brett Adcock 展示机器人自主完成约 15 英尺上升和下降,并强调现阶段优先打通端到端自主系统,速度优化放在之后:演示 · 说明。
  • Sentence Transformers v6.0 把 ColBERT 风格 late interaction 的 MultiVectorEncoder 纳入一等模型类型,覆盖训练、推理和解释:原帖。
  • ChatGPT Sites 被用于临时生成音乐分享应用,展示“为了分享内容即时生成一个应用”的低门槛工作流:原帖。
  • Stanford CS336 的 18 节公开视频覆盖从数据清洗、Transformer 构建到训练、评估和部署:原帖。

今日观察

今日信息量不大,但几条主线彼此呼应:模型竞争正从单次能力分数转向系统效率、开放训练过程与产品分发;Agent 一端深入 CUDA kernel,另一端尝试从用户操作轨迹学习任务结构。真正值得后续追踪的不是漂亮的倍数或百分比本身,而是缓存命中、训练透明度、硬件配置和评测协议能否被持续观测与复现。