← 返回文章

AI 动态摘要|2026-08-25

过去 24 小时值得关注的 AI 动态:Vera Rubin、Groq 3 LPX、AgentX、Vera CPU、Managed Deep Agents、Marble。

NVIDIA 集中发布 Vera Rubin、Groq 3 LPX 与 AgentX 性能叙事

NVIDIA 公布首批 Vera Rubin on-silicon agentic workload 数据,称在 AgentX 工作负载上,Vera Rubin NVL72 对 DeepSeek-v4-Pro 1.6T 可实现最高约 30 倍吞吐/兆瓦,并称相对 GB300 NVL72 可达到最高 35 倍更低 token 成本;GB300 NVL72 自身也被宣称可达最高约 15 倍吞吐/兆瓦。与此同时,Groq 3 LPX 宣布进入全面量产:NVIDIA 引用 Artificial Analysis 的 100K context 测试,称其在 Gemma 4 31B 上生成 3,431 output tok/s,接近下一个公开端点的 4 倍。以上均为厂商或合作方披露,倍率依赖 AgentX、模型、上下文、功耗和成本口径,不能外推到所有推理负载。

来源:Vera Rubin on-silicon 数据 · AgentX 30× 条目 · GB300 15× 条目 · Groq 3 LPX 100K context · 量产公告

标签:#NVIDIA #VeraRubin #Groq3LPX #AgentX #inference

AgentX 1.0 用真实多轮编码轨迹重新定义推理硬件评测

vLLM 祝贺 SemiAnalysis 发布 AgentX 1.0:一个开放的多轮 agentic coding benchmark,据称由约 300 万美元的真实轨迹构成,在 1,000 多颗芯片和约 2MW 持续运行算力上采集,包含百万级上下文、多轮与 sub-agent 场景,并观察到 95% 以上 KV-cache hit rate。它的重要性在于把硬件评测从短 prompt、静态 batch 推向长上下文和状态持续增长的真实 Agent 轨迹;具体排名仍需查看完整方法、采样和成本假设。

来源:vLLM / AgentX 1.0 · NVIDIA 方法链接

标签:#AgentX #vLLM #benchmark #KV-cache #agentic-coding

NVIDIA 将 Vera 定位为面向 Agent 的 CPU,称来自 163,594 个 agentic sessions 的遥测中,超过 97% 具有不同执行路径,因此传统 CPU fleet 的 right-sizing 更困难。SpaceX 宣布采用 Vera 加速 Agent 的编排、代码执行与数据处理;Elon Musk 进一步称双方设计了面向太空的 Vera Rubin NVL72,计划明年第四季度发射、2028 年扩大规模。NVLink Fusion 则瞄准把定制 XPU 接入成熟 AI factory 基础设施。遥测比例和发射计划均来自相关公司,尚不是独立验证或已完成部署。

来源:Vera CPU 遥测与定位 · SpaceX 采用 Vera · 太空系统计划 · NVLink Fusion

标签:#VeraCPU #SpaceX #NVLinkFusion #AI-factory

Agent 产品开始吞并“连接、权限与系统记录”层

Managed Deep Agents 0.6.0 将 Slack 应用配置自动化:无需手写 manifest、OAuth redirect 或复制 bot token,一条命令即可部署。Harrison Chase 将“连接”视为 Agent 落地中看似简单、实际困难的环节。另一组讨论认为 systems of record 必须演化为 AI harness,否则可能被 Agent 替代;反过来,Agent 要完成端到端工作也需要员工级上下文和权限。这里的趋势是 Agent 平台正从模型循环向企业身份、连接器和记录系统扩张。

来源:Managed Deep Agents 0.6.0 · Harrison Chase 评论 · system of record 讨论

标签:#Agent #LangChain #Slack #system-of-record #harness

World Labs Marble 进入 Figma Weave

Figma Weave 宣布集成 World Labs Marble,可把文本、图片或视频转换成可探索的 3D 世界,并在场景中移动视角和重新导演。这是本轮动态中最值得关注的 World Labs 生态动态:它把 world generation 从单独演示推进到创作工具工作流。帖子没有给出生成时延、几何一致性、导出格式或商业条款,仍需后续产品实测。

来源:Figma Weave × Marble

标签:#WorldLabs #Marble #FigmaWeave #3D-generation

其他值得关注

  • NVIDIA 强调 CUDA-X 不只是 GPU 驱动层,而是将 GPU 计算转为行业工作负载能力的专用库和算法体系:原帖。
  • GLiNER2.5 发布者称其在 16 个分类与抽取 benchmark 上的平均 F1 超过 GLiNER2;需查看逐任务数据和模型规模:原帖。
  • llama.cpp 文档迁移至新站点,并预告 speculative decoding、k/i-quant 和 coding-agent 内容:原帖。
  • Brett Adcock 说明机器人爬梯展示对应真实客户任务:到夹层工作后再下梯;动态没有披露成功率、接管次数或安全约束:原帖。
  • Yann LeCun 延续 world model 讨论,强调仅把 LLM 接到人形机器人上不足以获得打扫房间等真实能力:原帖。

今日观察

今天的信号高度集中在“Agent 负载开始反向塑造整套计算栈”。底层由 AgentX 把长上下文、多轮、sub-agent 和高 KV-cache 命中纳入评测;硬件层从 GPU 扩展到 Vera CPU、互连与功耗;产品层则开始接管 Slack、权限、连接器和 system of record。World Labs 进入 Figma Weave 说明同一趋势也发生在创意工具:模型能力只有嵌入真实工作流后才形成产品价值。后续最值得追踪的是 AgentX 的完整方法能否支持跨厂商独立复现,以及厂商“最高倍数”在真实部署中的可持续性。