← 返回文章

AI 动态摘要|2026-08-06

过去 24 小时值得关注的 AI 动态:Muse Code、Discovery Loop、Hark、Ling-3.0-flash。

Meta 发布 Muse Code:异步持久子 Agent、精确回放与 24 小时长任务

Meta 发布 Muse Code beta,一款由 Muse Spark 1.2 驱动的终端 coding agent,面向大型代码库中的多文件规划、实现和验证。官方披露的核心运行时设计包括:简单主 Agent loop、会话期间持续运行的异步后台 Agent,以及 append-only 本地事件日志;日志覆盖模型调用、工具运行、审批与编辑,使长任务可精确回放、重启后续跑。

Meta 称 Muse Spark 1.2 扩大了 coding 训练算力与环境多样性,并与 Muse Code 联合训练;在 Hopper GPU 上的长时压力测试中,Agent 运行超过 1,000 次工具调用、最长 24 小时,优化 KDA 与 MLA kernels,相对 baseline Triton 实现获得“很有竞争力”的提升。官方未在可见帖子中给出完整 kernel、shape、数值和成功率,因此这仍是产品方结果,不能仅凭“24 小时”和工具调用数判断可靠性。

来源:Muse Code 总述 · 异步 Agent 与事件日志 · Muse Spark 1.2 训练 · 长时 kernel 优化 · 多模态视频转网站示例

标签:#MuseCode #MuseSpark12 #CodingAgent #Replay #LongHorizon

Jeff Dean 等创立 Discovery Loop,目标是自动化科学与工程实验闭环

Jeff Dean、Sanjay Ghemawat、Oriol Vinyals 和 Quoc Le 创立 Public Benefit Corporation「Discovery Loop」,使命是自动化机器学习、科学和工程,以加速发现。Jeff Dean 表示团队将先聚焦 ML research/engineering,再扩展到其他科学与工程子问题;官方账号把产品方向概括为让 AI 以前所未有的规模运行实验。

Jeff Dean 同时宣布在 Google 工作 27 年后离开。Google 将以投资者和合作伙伴身份支持新公司;同日 Demis Hassabis 转任 Google DeepMind Chair 与 Alphabet Chief Scientist,并继续领导 Isomorphic Labs。这里反映的是顶尖研究组织从“大模型研发”向“自动实验闭环 + AI for Science”重组,但目前尚无系统架构、首个领域、实验成功率或商业模式细节。

来源:Jeff Dean 创始帖 · Discovery Loop 官方帖 · 实验闭环方向 · 离开 Google · Google 组织调整

标签:#DiscoveryLoop #AIForScience #AutomatedExperiments #JeffDean

Hark Handoff 主攻通用网页操作,发布方称超过 ChatGPT 5.4 与 Opus 4.8

Hark 发布 Handoff research preview,将其定位为可处理开放、不可预测网页环境的 internet-use model,面向订餐、订机票、购物和网页导航等日常任务。创始人 Brett Adcock 称模型在三个 browser-use benchmarks 上达到 frontier-level,并被独立验证为超过 ChatGPT 5.4 与 Opus 4.8。

这组结论目前来自公司发布帖;可见信息没有列出评测名称、任务集版本、浏览器环境、失败重试、人工接管率和成本。尤其真实网页会随时间变化,benchmark 排名不能直接等价为生产任务完成率。值得后续追踪的是所谓“独立验证”的完整报告与端到端失败分类。

来源:Handoff 发布 · 产品定位 · Benchmark 表述 · Research Preview

标签:#Hark #BrowserAgent #ComputerUse #AgentEvaluation

Ling-3.0-flash:124B 稀疏 MoE 与混合线性注意力进入 SGLang

SGLang 宣布 Day-0 支持 Ant Ling 的 Ling-3.0-flash。框架方将其描述为 124B MoE 生产 Agent 模型:预训练起即使用 KDA + MLA 以 5:1 堆叠,MoE 稀疏度为 1/64,并使用超过 10,000 个交互式训练环境;新增 INT4 和 MXFP4 版本可通过适配后的 SGLang 路径在单台 NVIDIA DGX Spark 上端到端运行。

帖子还称模型原生接入 SGLang HiCache 与 Mooncake 分层缓存,对长输入将 TTFT 降低 60% 至 80% 以上。该百分比是框架发布方口径,缺少输入长度、缓存命中率、并发和对照版本,适合视为复现实验线索,而不是跨系统通用结论。

来源:SGLang Day-0 支持与配置 · Cookbook

标签:#Ling30Flash #SGLang #KDA #MLA #DGXSpark #HiCache

MiniMax H3 从数据中心下沉到 DGX Spark 与 RTX 5090

Sol Engine 团队称,在 MiniMax H3 发布两天后,已实现 DGX Spark 上 480p、5 秒、24 FPS 视频生成加速 3.92 倍,以及 RTX 5090 上 720p、5 秒、24 FPS 加速 4.52 倍;方法包括全栈 kernel 优化、Sol-Attn 和跨 step caching,并使用原始模型权重。

这扩展了前一日 8×GB200 的结果,说明视频生成优化正在快速下沉到桌面设备。帖子未明确倍率的完整 baseline 版本、峰值显存、首帧/总延迟和质量对照,应把它作为部署候选数据;在采购或产品化前仍需固定分辨率、帧数、精度和质量指标复跑。

来源:Sol Engine 桌面性能

标签:#MiniMaxH3 #DGXSpark #RTX5090 #VideoInference

Agent 基础设施继续向“企业自有、精细治理、远端执行”发展

LangSmith LLM Gateway 增加 customer/user 级 rate 与 spend limits,使同一 API key 下也能隔离客户预算。Buzz Desktop 开始支持从桌面应用直接把 Agent 启动到远端 Kubernetes 集群;Open SWE 则被定位为企业自有 cloud agent orchestrator 的开源 starter kit。Hugging Face 另展示用 OpenCode harness、远端 sandbox、TRL 与 OpenEnv,在 Agent 实际工具循环产生的 token 上训练 coding agent。

这些更新共同指向:Agent 产品的差异化逐渐从单个模型调用,转到租户治理、可控远端执行、数据与记忆所有权,以及训练—评测—生产的一致 harness。

来源:LangSmith 客户级控制 · Buzz 远端 Kubernetes Agent · Open SWE · OpenCode RL 训练

标签:#AgentInfrastructure #Kubernetes #RuntimeGovernance #OpenSWE #AgentTraining

World model 从概念争论转向闭环仿真与多传感器物理智能

NVIDIA 用 Cosmos 解释 world model:让 physical AI 在真实执行前推演交互与可能未来。Wayve 的 GAIA-4 展示安全关键闭环仿真中的 cyclist/pedestrian counterfactual replay。Yann LeCun 重申 GPT 式 LLM 不适合作为 world model,但 world model 可以使用 Transformer;触觉、proprioception 和 force 等信号也可进入预测状态。

这轮动态的实质不是“世界模型是否替代 LLM”,而是物理智能需要怎样的状态、传感器和闭环验证。NVIDIA/Wayve 的内容是各自方案展示,尚不足以比较真实驾驶或机器人任务中的泛化与安全性。

来源:NVIDIA Cosmos 解释 · Wayve GAIA-4 · LeCun 对 LLM/world model 的区分 · 触觉与多传感器

标签:#WorldModels #Cosmos #GAIA4 #PhysicalAI #Simulation

其他值得关注

  • NVIDIA 转述 Palantir 的现场评价:未经 post-training 的 Nemotron 3 Ultra 在 24 小时内对其客户任务优于 frontier models;缺少任务集、对照模型与定量结果,属于合作方评价而非可复现 benchmark:原帖
  • AI at Meta 的第三方转帖称 Muse Spark 1.2 在 Artificial Analysis Intelligence Index 得分 54;应结合该榜单版本、价格和延迟口径查看:转帖
  • 224 Ventures 以 1 亿美元 AUM 启动,聚焦早期 AI-native 团队;Yann LeCun 参与该基金但称主要工作仍在 AMI 与 NYU:基金发布 · LeCun 说明
  • Block 推出 Investor Relations Bot,可用自然语言检索 shareholder letters、10-K 等公开材料:原帖
  • Buzz Desktop v0.5.5 增加每个 channel 的内置终端,并改善后台上传、断线重连、未读恢复与 Agent 控制:原帖
  • 有关注账号转述白宫新模型框架对开放模型与 API 区别对待;这属于政策解读和媒体转述,需以最终官方文本核验:讨论

今日观察

今天最强的共同信号是“实验闭环”成为新的产品边界:Muse Code 用可回放事件日志和后台 Agent 做软件实验循环,Discovery Loop 试图把同样思路扩展到机器学习与科学,Hark 则把闭环执行放到开放网页。模型能力仍重要,但决定系统能否长时间运行的正在变成状态持久化、可恢复执行、分层缓存、客户级资源治理和可验证的环境反馈。