← 返回文章

AI 动态摘要|2026-08-12

过去 24 小时值得关注的 AI 动态:Nemotron 3.5、ChatGPT Linux、River AI、Gemini 10 亿月活。

NVIDIA 推出 Nemotron 3.5 Lightning,推理框架当天跟进

NVIDIA 发布面向持续运行 Agent 的 Nemotron 3.5 Lightning:30B MoE、每 token 激活约 3B 参数,并与 NeMo Switchyard 路由库配套。官方称其面向高吞吐专用任务,输出速度最高可达同规模模型的 4 倍。vLLM 宣布可直接通过 OpenAI 兼容 API 部署,并给出“最高 4 倍吞吐、任务完成快 30%”的口径;SGLang 同日宣布 Day-0 支持,列出 MTP、DFlash、DSpark 三种 speculator。以上性能数字来自发布方,尚不等于统一条件下的独立基准。

来源:NVIDIA 官方 · vLLM · SGLang

标签:#NVIDIA #Nemotron #vLLM #SGLang #Agent

ChatGPT 桌面版登陆 Linux,Codex 工作流继续向桌面聚合

OpenAI 宣布 ChatGPT 桌面应用以预览形式支持 Linux,可在 ChatGPT、ChatGPT Work 与 Codex 中使用项目和浏览器工作流。首批覆盖 Ubuntu 24.04/26.04 LTS、Debian 13、Fedora 43/44,并提供 x64 与 ARM64 的 deb/rpm 包。相关团队动态还展示了从其他 Agent 导入项目、聊天、skills 与 plugins,并可选择自动同步更新;这部分信息来自 OpenAI Developers 被引用的动态。

来源:OpenAI 发布 · 发行版与架构 · 导入工作流

标签:#OpenAI #ChatGPT #Codex #Linux

River AI 融资 11 亿美元,主打“用户拥有和塑造的 AI”

River AI 宣布融资 11 亿美元,由 General Catalyst 与 AMP 领投,NVIDIA、AMD、Y Combinator、淡马锡等参与。公司把“由个人拥有、可按个人需求训练的 AI”作为定位,首个产品 River API 面向自定义 Agent 与 LLM。融资数字和投资方名单来自公司及创始人公开表述;产品差异化和长期可行性仍需观察。

来源:River AI · Igor Babuschkin

标签:#RiverAI #融资 #PersonalAI #Agent

Gemini 月活突破 10 亿,Google 称其为增长最快产品

Sundar Pichai 表示 Gemini App 月活用户超过 10 亿,是 Google 增长最快的产品,也是第 14 个达到十亿用户规模的产品。Demis Hassabis 随后确认这一里程碑。该数字是 Google 管理层披露的产品口径,未给出地区、活跃度定义或付费结构。

来源:Sundar Pichai · Demis Hassabis

标签:#Google #Gemini #AIProduct

LMSYS 用统一 Radix Tree 处理混合模型前缀缓存

LMSYS 介绍 Unified Radix Cache:把不同注意力类型的缓存复用语义统一到一棵树中,避免随着混合架构和缓存功能增加而组合式扩张专用缓存类。团队称 Hybrid 与 HiCache 已原生进入统一结构。这是推理引擎内部数据结构的工程重构,价值主要在降低复杂度并为混合注意力模型提供一致的前缀缓存能力。

来源:LMSYS · 实现者说明

标签:#LMSYS #Inference #PrefixCache

研究者声称可从多家前沿模型 API 提取隐藏推理

一组研究者称,他们利用多家前沿 AI 公司 API 中的漏洞提取隐藏推理,并表示在多数测试提示上,提取到的推理 token 数与计费的 thinking token 近似一一对应。这是研究者的公开主张,当前时间线中没有看到厂商复现、漏洞细节或修复确认;在证据补齐前应视为待验证的安全研究线索,而非已被独立确认的普遍漏洞。

来源:研究者动态

标签:#AISecurity #Reasoning #API

其他值得关注

  • Lightricks 发布 LTX-2.5,宣称提升像素保真度、跨镜头一致性,并继续覆盖影视、机器人和实时工作流:原帖
  • World Labs 转发线下 world-model builder meetup,显示其生态建设正从产品演示延伸到开发者社区:原帖
  • 关于数据受限预训练的新工作尝试用“等效新鲜 token”衡量重复数据价值,并建立 Compute-Data scaling law:原帖
  • Kimi K3 已接入 Databricks Unity AI Gateway:原帖
  • NeurIPS 2026 公布 workshop 列表,12 月在悉尼、巴黎与亚特兰大举行:原帖
  • Bitcoin Core v32.0 目标于 10 月发布,转述称初始同步最高提速约 3 倍并移除 libevent 外部依赖:原帖
  • Buzz Mobile v0.8.0 增加未读定位、频道排序、上传时发送等改进:原帖
  • Hark 展示跨月招聘 Agent 场景,把长时运行从即时任务扩展到招聘漏斗:原帖

今日观察

今天的主线不是单一更大模型,而是“让 Agent 更便宜、更连续、更可迁移”:NVIDIA 用小激活量 MoE 与路由器降低持续运行成本,vLLM/SGLang 快速补齐部署,OpenAI 把项目、skills、plugins 和浏览器工作流收拢到 Linux 桌面端,Hark 则把运行时长拉到招聘所需的月级周期。与此同时,River AI 的巨额融资与 Gemini 的十亿月活说明资本和分发仍高度集中;“个人可拥有的 AI”与平台化入口之间的张力值得持续追踪。