Codex 用量消耗异常被归因于缓存命中率下降
Codex 团队表示,部分用户本周缓存命中率低于此前稳定状态,而持续命中缓存是控制用量消耗的重要因素,因此可能出现额度下降更快的感受。帖子将问题定位到缓存效率,而不是宣布新的额度规则;仍需观察后续修复范围和恢复时间。
标签:#Codex #cache #rate-limit
Marin 启动开放的 535B MoE 训练航程
Percy Liang 团队启动 Marin 535B-A23B 训练,披露计划使用 11 套 GB200 NVL72、约三个月训练 18.75T tokens,总计算量约 2.7e24 FLOPs;训练结构为 80% 预训练加 20% mid-training,之后再做后训练。Anthony Platanios 强调其价值在于公开展示超大 MoE 模型训练过程。该信息来自项目发布与转述,实际训练稳定性、成本和最终质量尚待后续日志验证。
来源:Marin 训练计划转述
标签:#Marin #MoE #GB200-NVL72 #open-training
Gemini 3.7 Flash 强调低成本 ARC 表现与产品分发
Sundar Pichai 称 Gemini 3.7 Flash 首周增长速度刷新 Gemini 系列纪录,并已进入 Search 与 Gemini App。引用的 ARC Prize 数据为 ARC-AGI-2 84.6%、约 0.25 美元/任务,以及 ARC-AGI-1 95.5%、约 0.12 美元/任务。这些是特定评测与计价条件下的数据,不能直接代表通用任务能力。
标签:#Gemini #ARC-AGI #cost-efficiency
SGLang Weight Cache Daemon 给出完整启动链路收益
Ant Ling 进一步说明 Weight Cache Daemon 在 Ling-2.6-1T FP8 上把权重加载降至约 0.63 秒,相对磁盘加载最高约 780 倍,并将总引擎启动时间从 8.8 分钟缩短到约 0.53 分钟。与前一日只看权重加载相比,总启动时间更能说明生产恢复价值,但数据仍来自发布团队,需结合 GPU、存储和并发配置理解。
来源:Ant Ling 技术线程 · LMSYS 合作说明
标签:#SGLang #inference #recovery #CUDA-IPC
Agent 正在从写代码走向自动优化 kernel 与理解操作轨迹
Hugging Face 转帖的动态称,NVIDIA 自建 coding harness 优化 CUDA GPU kernels,并在 ARC-AGI-3 的 25 个公开游戏、183 个关卡上取得 100% 完成率;这是二手转述,需等待 NVIDIA 原始方法和复现细节。另一篇论文《Inducing Task Models from Computer-Use Traces》则研究从计算机使用轨迹中归纳任务模型,显示 Agent 能力建设正在同时向底层系统优化与高层操作抽象延伸。
来源:NVIDIA coding harness 转述 · Computer-use traces 论文
标签:#Agent #CUDA #computer-use #ARC-AGI-3
其他值得关注
- Brett Adcock 展示机器人自主完成约 15 英尺上升和下降,并强调现阶段优先打通端到端自主系统,速度优化放在之后:演示 · 说明。
- Sentence Transformers v6.0 把 ColBERT 风格 late interaction 的 MultiVectorEncoder 纳入一等模型类型,覆盖训练、推理和解释:原帖。
- ChatGPT Sites 被用于临时生成音乐分享应用,展示“为了分享内容即时生成一个应用”的低门槛工作流:原帖。
- Stanford CS336 的 18 节公开视频覆盖从数据清洗、Transformer 构建到训练、评估和部署:原帖。
今日观察
今日信息量不大,但几条主线彼此呼应:模型竞争正从单次能力分数转向系统效率、开放训练过程与产品分发;Agent 一端深入 CUDA kernel,另一端尝试从用户操作轨迹学习任务结构。真正值得后续追踪的不是漂亮的倍数或百分比本身,而是缓存命中、训练透明度、硬件配置和评测协议能否被持续观测与复现。