NVIDIA 集中发布 Vera Rubin、Groq 3 LPX 与 AgentX 性能叙事
NVIDIA 公布首批 Vera Rubin on-silicon agentic workload 数据,称在 AgentX 工作负载上,Vera Rubin NVL72 对 DeepSeek-v4-Pro 1.6T 可实现最高约 30 倍吞吐/兆瓦,并称相对 GB300 NVL72 可达到最高 35 倍更低 token 成本;GB300 NVL72 自身也被宣称可达最高约 15 倍吞吐/兆瓦。与此同时,Groq 3 LPX 宣布进入全面量产:NVIDIA 引用 Artificial Analysis 的 100K context 测试,称其在 Gemma 4 31B 上生成 3,431 output tok/s,接近下一个公开端点的 4 倍。以上均为厂商或合作方披露,倍率依赖 AgentX、模型、上下文、功耗和成本口径,不能外推到所有推理负载。
来源:Vera Rubin on-silicon 数据 · AgentX 30× 条目 · GB300 15× 条目 · Groq 3 LPX 100K context · 量产公告
标签:#NVIDIA #VeraRubin #Groq3LPX #AgentX #inference
AgentX 1.0 用真实多轮编码轨迹重新定义推理硬件评测
vLLM 祝贺 SemiAnalysis 发布 AgentX 1.0:一个开放的多轮 agentic coding benchmark,据称由约 300 万美元的真实轨迹构成,在 1,000 多颗芯片和约 2MW 持续运行算力上采集,包含百万级上下文、多轮与 sub-agent 场景,并观察到 95% 以上 KV-cache hit rate。它的重要性在于把硬件评测从短 prompt、静态 batch 推向长上下文和状态持续增长的真实 Agent 轨迹;具体排名仍需查看完整方法、采样和成本假设。
来源:vLLM / AgentX 1.0 · NVIDIA 方法链接
标签:#AgentX #vLLM #benchmark #KV-cache #agentic-coding
Vera CPU 与 NVLink Fusion 补齐 Agent AI factory 的非 GPU 部分
NVIDIA 将 Vera 定位为面向 Agent 的 CPU,称来自 163,594 个 agentic sessions 的遥测中,超过 97% 具有不同执行路径,因此传统 CPU fleet 的 right-sizing 更困难。SpaceX 宣布采用 Vera 加速 Agent 的编排、代码执行与数据处理;Elon Musk 进一步称双方设计了面向太空的 Vera Rubin NVL72,计划明年第四季度发射、2028 年扩大规模。NVLink Fusion 则瞄准把定制 XPU 接入成熟 AI factory 基础设施。遥测比例和发射计划均来自相关公司,尚不是独立验证或已完成部署。
来源:Vera CPU 遥测与定位 · SpaceX 采用 Vera · 太空系统计划 · NVLink Fusion
标签:#VeraCPU #SpaceX #NVLinkFusion #AI-factory
Agent 产品开始吞并“连接、权限与系统记录”层
Managed Deep Agents 0.6.0 将 Slack 应用配置自动化:无需手写 manifest、OAuth redirect 或复制 bot token,一条命令即可部署。Harrison Chase 将“连接”视为 Agent 落地中看似简单、实际困难的环节。另一组讨论认为 systems of record 必须演化为 AI harness,否则可能被 Agent 替代;反过来,Agent 要完成端到端工作也需要员工级上下文和权限。这里的趋势是 Agent 平台正从模型循环向企业身份、连接器和记录系统扩张。
来源:Managed Deep Agents 0.6.0 · Harrison Chase 评论 · system of record 讨论
标签:#Agent #LangChain #Slack #system-of-record #harness
World Labs Marble 进入 Figma Weave
Figma Weave 宣布集成 World Labs Marble,可把文本、图片或视频转换成可探索的 3D 世界,并在场景中移动视角和重新导演。这是本轮动态中最值得关注的 World Labs 生态动态:它把 world generation 从单独演示推进到创作工具工作流。帖子没有给出生成时延、几何一致性、导出格式或商业条款,仍需后续产品实测。
标签:#WorldLabs #Marble #FigmaWeave #3D-generation
其他值得关注
- NVIDIA 强调 CUDA-X 不只是 GPU 驱动层,而是将 GPU 计算转为行业工作负载能力的专用库和算法体系:原帖。
- GLiNER2.5 发布者称其在 16 个分类与抽取 benchmark 上的平均 F1 超过 GLiNER2;需查看逐任务数据和模型规模:原帖。
- llama.cpp 文档迁移至新站点,并预告 speculative decoding、k/i-quant 和 coding-agent 内容:原帖。
- Brett Adcock 说明机器人爬梯展示对应真实客户任务:到夹层工作后再下梯;动态没有披露成功率、接管次数或安全约束:原帖。
- Yann LeCun 延续 world model 讨论,强调仅把 LLM 接到人形机器人上不足以获得打扫房间等真实能力:原帖。
今日观察
今天的信号高度集中在“Agent 负载开始反向塑造整套计算栈”。底层由 AgentX 把长上下文、多轮、sub-agent 和高 KV-cache 命中纳入评测;硬件层从 GPU 扩展到 Vera CPU、互连与功耗;产品层则开始接管 Slack、权限、连接器和 system of record。World Labs 进入 Figma Weave 说明同一趋势也发生在创意工具:模型能力只有嵌入真实工作流后才形成产品价值。后续最值得追踪的是 AgentX 的完整方法能否支持跨厂商独立复现,以及厂商“最高倍数”在真实部署中的可持续性。