OpenAI:两个设置让 ARC-AGI-3 得分提高 188%
OpenAI 发现 GPT-5.6 Sol 在 ARC-AGI-3 上表现不佳,并非单纯模型能力不足,而是标准 harness 每一步都会丢弃 reasoning,context 变长后还会删除早期动作。改用 Responses API 并开启 retained reasoning 与 context compaction 后,公开集得分提高 188%,同时输出 token 减少约 6 倍。
这说明 Agent benchmark 测量的是模型、harness、API 设置、prompt 和上下文管理的组合,而不是孤立的模型能力。
标签:#OpenAI #ARC-AGI-3 #harness #context-compaction
GPT-5.6 Sol 被用于优化自身推理基础设施
OpenAI 表示,团队让 GPT-5.6 Sol 参与生产 GPU kernel 和 speculative decoding 优化:
- production GPU kernel 改进令 serving cost 下降 20%;
- speculative decoding 改进令 token-generation efficiency 提升 15% 以上。
这是“强模型反过来优化自身运行成本”的案例,但目前属于 OpenAI 自报结果,尚未看到独立复现。
来源:原帖
标签:#OpenAI #GPU-kernel #speculative-decoding #self-improvement
Microsoft 将模型与 harness、memory、action space 解耦
Satya Nadella 表示,Microsoft 正构建新的 model system,将模型、harness、context、memory 和 action space 分离,使系统不绑定单一模型家族,以改善 cost-to-outcome、业务连续性和模型替换能力。
Mustafa Suleyman 同时称,MAI-Cyber-1-Flash 在 MDASH harness 中登上 Cyberbench 第一,比 Mythos 高 12 个百分点、成本约为一半。
Microsoft 同期披露 FY2026:年收入 3310 亿美元,同比增长 18%;Microsoft Cloud 收入 2140 亿美元,同比增长 27%;Azure 收入 1000 亿美元,同比增长 41%。
来源:模型系统 · Cyberbench · 财报
标签:#Microsoft #harness #memory #Cyberbench
Kimi-K3 进入跨云、跨硬件生产化阶段
vLLM 连续公布 Kimi-K3 的部署生态:
- Baseten:托管生产 API;
- Modal:自动弹性伸缩 endpoint;
- DigitalOcean:完整 2.8T 模型与 1M 上下文;
- NVIDIA:Grace Blackwell、Blackwell、Hopper、NVL72,并与 Dynamo 集成;
- AMD:ROCm Day-0 支持;
- Red Hat:面向 H100/H200 的 FP8-Block checkpoint。
Kimi-K3 已从权重发布和单项 benchmark,进入跨云、跨硬件的产品化竞争阶段。
来源:NVIDIA · AMD · Baseten · Modal · DigitalOcean
标签:#Kimi-K3 #vLLM #NVIDIA #AMD #inference
OpenAI 免费向学术研究人员开放前沿模型
OpenAI 推出 ChatGPT for Academic Researchers:
- 首批覆盖 1 万名科学家、数学家和工程师;
- 计划到 2027 年扩展至 10 万人;
- 提供包括 GPT-5.6 系列在内的前沿模型;
- workspace 包含企业级隐私和安全保护;
- 研究数据默认不用于训练模型。
Sam Altman 表示,更好的路径是赋能各领域科学家,而不是让模型公司自己决定研究方向。
来源:计划发布 · Sam Altman
标签:#OpenAI #scientific-AI #research
Intent Lab 的 harness 哲学
贾扬清认为,正确的 harness 不应规定模型“如何工作”,否则会与模型自身能力冲突并产生脆弱性。harness 应定义任务、验证最终结果,把具体执行方法交给模型:how 属于模型,what 和验收标准属于 harness。
来源:原帖
标签:#Intent-Lab #jiayq #harness #long-horizon-agent
Agent harness 正在快速瘦身
Deep Agents v0.7 将 base prompt 和工具描述减少 65%,支持覆盖内置 middleware,并优化文件系统工具;目标是在性能大致相当的情况下显著降低基础输入 token。
标签:#Deep-Agents #LangChain #context-engineering
Buzz v0.5.1 与 Agent 原生 Git 身份
Buzz v0.5.1 增加自定义 harness、Claude prompt caching,并修复 observer feed、Inbox 和 Linux 启动问题。
Buzz 还展示了 Agent 原生 Git 模型:Agent 不借用用户的 Git 凭证,而是以自己的身份提交、签名,并在 commit 中携带授权该操作的人类身份的加密证明。
来源:v0.5.1 · Agent Git 身份
标签:#Buzz #ACP #agent-identity #Git
OpenWiki 从 Agent trace 维护长期知识
OpenWiki 接入 LangSmith traces,观察 Claude Code、Codex 等 Agent 实际如何理解和修改代码库,然后定期更新 wiki。Harrison Chase 将这种后台整理称为 “dreaming memory”。
Sightmap 则发布 YAML spec + CLI,用于维护应用的 view、component、request 和 memory 运行图。
标签:#OpenWiki #LangSmith #memory #Sightmap
DoorDash 发布无人机配送项目
DoorDash 宣布内部项目 DoorDash Air,并表示已经取得航空承运人认证。目标是利用无人机提高配送速度,同时扩大本地商户服务半径。
来源:Tony Xu
标签:#DoorDash #drone
其他值得关注
- BAIR 发布 K-Search,可自动把 CUDA kernel 迁移到 Apple MLX;attention translation 达到 Apple 原生实现约 0.97 倍速度。原帖
- Hugging Face 转发 ABot World 0.5B:可在消费级 GPU 上实时运行的本地 world model。原帖
- Google DeepMind 发布 Lyria 3.5,增强歌声、编曲、指令遵循和 BPM 控制。原帖
- Figure 已生产第 1000 台 F.03 机器人。原帖
- bitchat 正在扩展到智能手表,定位为基于 mesh 的去中心化对讲工具。原帖
- Tibo 表示已为 ChatGPT Work 和 Codex 用户重置使用额度;加载文本未完整展示新规则细节。原帖
今日观察
今天最清晰的共同主题不是单一模型升级,而是“模型之外的系统层”成为竞争焦点:OpenAI、Microsoft、Intent Lab 和 LangChain 分别从 retained reasoning、context compaction、memory/action 解耦、结果验证和 prompt 瘦身切入。与此同时,Kimi-K3 的多云、多硬件落地显示,大模型竞争正从 benchmark 快速转向可部署性和单位智能成本。