← 返回文章

AI 动态摘要|2026-07-30

过去 24 小时值得关注的 AI 动态:Agent harness、推理效率、Kimi-K3 生产化、科研 AI。

OpenAI:两个设置让 ARC-AGI-3 得分提高 188%

OpenAI 发现 GPT-5.6 Sol 在 ARC-AGI-3 上表现不佳,并非单纯模型能力不足,而是标准 harness 每一步都会丢弃 reasoning,context 变长后还会删除早期动作。改用 Responses API 并开启 retained reasoning 与 context compaction 后,公开集得分提高 188%,同时输出 token 减少约 6 倍。

这说明 Agent benchmark 测量的是模型、harness、API 设置、prompt 和上下文管理的组合,而不是孤立的模型能力。

来源:主帖 · 具体设置

标签:#OpenAI #ARC-AGI-3 #harness #context-compaction

GPT-5.6 Sol 被用于优化自身推理基础设施

OpenAI 表示,团队让 GPT-5.6 Sol 参与生产 GPU kernel 和 speculative decoding 优化:

  • production GPU kernel 改进令 serving cost 下降 20%;
  • speculative decoding 改进令 token-generation efficiency 提升 15% 以上。

这是“强模型反过来优化自身运行成本”的案例,但目前属于 OpenAI 自报结果,尚未看到独立复现。

来源:原帖

标签:#OpenAI #GPU-kernel #speculative-decoding #self-improvement

Microsoft 将模型与 harness、memory、action space 解耦

Satya Nadella 表示,Microsoft 正构建新的 model system,将模型、harness、context、memory 和 action space 分离,使系统不绑定单一模型家族,以改善 cost-to-outcome、业务连续性和模型替换能力。

Mustafa Suleyman 同时称,MAI-Cyber-1-Flash 在 MDASH harness 中登上 Cyberbench 第一,比 Mythos 高 12 个百分点、成本约为一半。

Microsoft 同期披露 FY2026:年收入 3310 亿美元,同比增长 18%;Microsoft Cloud 收入 2140 亿美元,同比增长 27%;Azure 收入 1000 亿美元,同比增长 41%。

来源:模型系统 · Cyberbench · 财报

标签:#Microsoft #harness #memory #Cyberbench

Kimi-K3 进入跨云、跨硬件生产化阶段

vLLM 连续公布 Kimi-K3 的部署生态:

  • Baseten:托管生产 API;
  • Modal:自动弹性伸缩 endpoint;
  • DigitalOcean:完整 2.8T 模型与 1M 上下文;
  • NVIDIA:Grace Blackwell、Blackwell、Hopper、NVL72,并与 Dynamo 集成;
  • AMD:ROCm Day-0 支持;
  • Red Hat:面向 H100/H200 的 FP8-Block checkpoint。

Kimi-K3 已从权重发布和单项 benchmark,进入跨云、跨硬件的产品化竞争阶段。

来源:NVIDIA · AMD · Baseten · Modal · DigitalOcean

标签:#Kimi-K3 #vLLM #NVIDIA #AMD #inference

OpenAI 免费向学术研究人员开放前沿模型

OpenAI 推出 ChatGPT for Academic Researchers:

  • 首批覆盖 1 万名科学家、数学家和工程师;
  • 计划到 2027 年扩展至 10 万人;
  • 提供包括 GPT-5.6 系列在内的前沿模型;
  • workspace 包含企业级隐私和安全保护;
  • 研究数据默认不用于训练模型。

Sam Altman 表示,更好的路径是赋能各领域科学家,而不是让模型公司自己决定研究方向。

来源:计划发布 · Sam Altman

标签:#OpenAI #scientific-AI #research

Intent Lab 的 harness 哲学

贾扬清认为,正确的 harness 不应规定模型“如何工作”,否则会与模型自身能力冲突并产生脆弱性。harness 应定义任务、验证最终结果,把具体执行方法交给模型:how 属于模型,what 和验收标准属于 harness。

来源:原帖

标签:#Intent-Lab #jiayq #harness #long-horizon-agent

Agent harness 正在快速瘦身

Deep Agents v0.7 将 base prompt 和工具描述减少 65%,支持覆盖内置 middleware,并优化文件系统工具;目标是在性能大致相当的情况下显著降低基础输入 token。

来源:Deep Agents v0.7

标签:#Deep-Agents #LangChain #context-engineering

Buzz v0.5.1 与 Agent 原生 Git 身份

Buzz v0.5.1 增加自定义 harness、Claude prompt caching,并修复 observer feed、Inbox 和 Linux 启动问题。

Buzz 还展示了 Agent 原生 Git 模型:Agent 不借用用户的 Git 凭证,而是以自己的身份提交、签名,并在 commit 中携带授权该操作的人类身份的加密证明。

来源:v0.5.1 · Agent Git 身份

标签:#Buzz #ACP #agent-identity #Git

OpenWiki 从 Agent trace 维护长期知识

OpenWiki 接入 LangSmith traces,观察 Claude Code、Codex 等 Agent 实际如何理解和修改代码库,然后定期更新 wiki。Harrison Chase 将这种后台整理称为 “dreaming memory”。

Sightmap 则发布 YAML spec + CLI,用于维护应用的 view、component、request 和 memory 运行图。

来源:OpenWiki · Sightmap

标签:#OpenWiki #LangSmith #memory #Sightmap

DoorDash 发布无人机配送项目

DoorDash 宣布内部项目 DoorDash Air,并表示已经取得航空承运人认证。目标是利用无人机提高配送速度,同时扩大本地商户服务半径。

来源:Tony Xu

标签:#DoorDash #drone

其他值得关注

  • BAIR 发布 K-Search,可自动把 CUDA kernel 迁移到 Apple MLX;attention translation 达到 Apple 原生实现约 0.97 倍速度。原帖
  • Hugging Face 转发 ABot World 0.5B:可在消费级 GPU 上实时运行的本地 world model。原帖
  • Google DeepMind 发布 Lyria 3.5,增强歌声、编曲、指令遵循和 BPM 控制。原帖
  • Figure 已生产第 1000 台 F.03 机器人。原帖
  • bitchat 正在扩展到智能手表,定位为基于 mesh 的去中心化对讲工具。原帖
  • Tibo 表示已为 ChatGPT Work 和 Codex 用户重置使用额度;加载文本未完整展示新规则细节。原帖

今日观察

今天最清晰的共同主题不是单一模型升级,而是“模型之外的系统层”成为竞争焦点:OpenAI、Microsoft、Intent Lab 和 LangChain 分别从 retained reasoning、context compaction、memory/action 解耦、结果验证和 prompt 瘦身切入。与此同时,Kimi-K3 的多云、多硬件落地显示,大模型竞争正从 benchmark 快速转向可部署性和单位智能成本。