← 返回文章

AI 动态摘要|2026-08-16

过去 24 小时值得关注的 AI 动态:AI 监管、Sol/Luna 委派、CAKE、Blackwell NVFP4、Agent harness。

Dario Amodei 回应 AI 监管与“过度负面”争议

Dario Amodei 罕见地用连续两帖回应 Gavin Baker 引发的讨论。他反对把监管选择简化为“把 AI 集中到少数公司手中”与“完全不监管”二选一,并表示自己的公开表达并非只强调风险:他认为自己对风险与收益的论述大致平衡,各写过一篇主要文章,也在风险访谈中讨论潜在收益。这是 Amodei 对自身政策立场和传播方式的直接澄清;由于抓取文本在长帖处被 X 折叠,日报不扩展推断其完整监管方案。

来源:监管回应 1/2 · 风险与收益叙事 2/2

标签:#Anthropic #AIRegulation #AIRisk

OpenAI 多 Agent v2 支持 Sol 委派 Luna,模型成为可分层调度资源

OpenAI 团队成员介绍,多 Agent v2 现在允许一个模型把任务委派给任意受支持模型;Tibo 给出的推荐形态是让 Sol 管理一组更高效的 Luna agents。这里的关键不只是“多 Agent”,而是把不同成本、速度和能力档位的模型纳入同一委派图,让较强模型承担规划与路由、较轻模型执行子任务。当前信息来自团队成员动态,尚未看到公开的任务分解协议、可靠性数据和成本基准。

来源:Sol 管理 Luna fleet

标签:#OpenAI #MultiAgent #ModelRouting

CAKE 把编译器本身纳入 Agent harness 的共同演化

Tianqi Chen 将 compiler-agent codesign 称为 ML compilation 与 kernel agents 的下一前沿。他引用的 CAKE 工作提出:编译器不是 Agent 调用的固定黑盒,而是 harness 的一部分,也可随 Agent 一起演化;其设计没有直接继承既有 tile/layout 抽象,而是让 Agent 从代码语料中提炼操作词汇。这个方向试图把搜索空间、编译反馈与代码生成语言共同设计,可能减少通用编译器抽象对 kernel Agent 的限制;实际收益仍要以论文实验和可复现代码为准。

来源:Tianqi Chen 与 CAKE 引用

标签:#Compiler #KernelAgent #CAKE #MLSystems

Blackwell NVFP4 自定义 matmul 声称在特定尺寸超过 cuBLAS 4.7%

一篇 H100 教程的续作展示了从零实现 Blackwell NVFP4 matmul。作者称在 N=8192 的测试点相较 cuBLAS 快 4.7%,并使用比 Hilbert curve 更贴合 NVIDIA 硬件的布局方法。这是作者给出的特定形状结果,不能外推为所有矩阵尺寸、精度模式或端到端模型推理都优于 cuBLAS;它更有价值的地方是公开展示低精度数据布局、调度与硬件适配思路。

来源:作者动态

标签:#Blackwell #NVFP4 #Matmul #CUDA

“拥有智能”被拆成模型、harness、context 与治理运行时

Harrison Chase 在 Sequoia 活动中把 Agent 概括为 model + harness + context,并进一步把“拥有智能”拆为开放 Agent 系统、可复利的 eval loop 和受治理运行时。他强调 harness 和 evals 往往是企业真正可控、可积累的部分,同时也承认现成 harness 是否足够取决于任务。配套社区动态还解释了 channel、sandbox 等 Managed Deep Agents 术语,并出现一键生成 LangGraph 后端与 Next.js 前端的开源 CLI。

来源:核心框架 · harness 适用边界 · Agent CLI

标签:#LangChain #AgentHarness #Evals #Governance

Figure 相关硬件路线继续强调重构后的成本下降

Brett Adcock 在回复中表示,一套系统的第一代设计成本过高,最新一代预计制造成本可降低约 80%;他还称一年前彻底改变技术路线并从头设计,导致第三代工程损失约一年时间,目前正在接近目标。动态没有明确给出完整物料表、产品型号或量产验证,因此 80% 只能视为创始人估计。结合其此前对 tendon-based 机器人手的反思,这反映 Figure 系列项目在仿生设计、可靠性与制造成本之间持续重新取舍。

来源:成本估计 · 重新设计时间线

标签:#Robotics #Figure #HardwareCost

其他值得关注

  • UC Berkeley 公开 2026 春季 CS185/285 Deep Reinforcement Learning 全套课程录像与网站:原帖
  • ChatGPT 一周功能更新包括自动生成测验和自然语言搜索餐厅预订等入口:原帖
  • Buzz Desktop v0.5.14 改进链接预览、发送并行性、DM 启动速度与 Inbox 删除操作:原帖
  • Corgi Cafe 被分析为“24/7 创业者空间 + 本地运营 + 饮品赞助广告”的获客模式,而非单纯线下咖啡店:原帖
  • Brett Adcock 的访谈覆盖下一代 AI 硬件、模型、人形机器人和武器检测系统:原帖
  • Jack Dorsey 分享 Block 的 Bitcoin Open Roadmap:原帖

今日观察

周末窗口缺少大型官方发布,但技术讨论反而更接近系统设计的控制面:谁决定模型之间的委派,谁拥有 harness 与 context,编译器能否随 Agent 共同演化,以及硬件路线是否值得付出一年重构成本。它们共同说明,Agent 竞争正在从“调用哪个模型”转向“如何组织模型、工具、编译反馈和长期资产”;可控性与单位任务成本会比单一模型品牌更持久。