← 返回文章

AI 动态摘要|2026-08-13

过去 24 小时值得关注的 AI 动态:Qwen3.8、SL2T、远端 KV、Grok 4.6、MAI-Thinking-1。

Qwen3.8-2.4T-A95B 开放权重,vLLM 与 SGLang 同日提供部署路径

围绕 Qwen3.8-2.4T-A95B 的发布,推理生态给出了相当具体的 Day-0 支持。vLLM 将其描述为 2.4T 总参数、约 95B 激活、512 个 routed experts 的混合注意力 MoE,并列出 92 层中 69 层使用 linear attention、内置 MTP draft head、约 262K 上下文;其支持已在 NVIDIA 与 AMD 硬件上验证,并提供面向两类硬件的现成 4-bit checkpoint。SGLang/LMSYS 则强调 DSpark、Unified Radix Cache、HiCache、chunked pipeline-parallel prefill 与 P/D disaggregation 对长上下文服务的作用。上述架构和性能口径来自项目方动态,独立基准仍需另行核对。

来源:vLLM 发布 · vLLM 配方 · LMSYS/SGLang

标签:#Qwen #MoE #vLLM #SGLang #Inference

Google DeepMind 将手语转文字模型 SL2T 集成到 Pixel 11

Google DeepMind 发布 SL2T 手语转文字模型,并从 Pixel 11 的 ASL-to-English 开始接入 Gboard 与 Live Transcribe。团队称模型同时建模手、身体和面部动作,针对单手持手机等真实使用方式做了优化;隐私路径是设备端跟踪身体姿态、服务器端将姿态翻译成文本。项目由 Deaf Googlers、AI Sign Language Advisory Committee 和更广泛的 Deaf 社区参与设计。官方称其在学术基准达到当前最佳水平,但动态中未给出具体基准表。

来源:功能发布 · 系统与隐私路径 · 社区共创

标签:#GoogleDeepMind #Accessibility #SignLanguage #OnDeviceAI

vLLM 把模型加载与 KV 缓存同时接到 Azure Blob

vLLM 展示了一套“weights in, KV out”的对象存储路径:Dynamo ModelExpress 接入 model loader,将权重从 Azure Blob 装入 HBM;项目方称在 H100/A100 上相对默认加载方式最高快 7.3 倍。推理阶段则通过 vLLM KV connector、LMCache 与 NVIDIA Dynamo NIXL 把 KV block 停放到 Azure Blob,命中时取回而非重算。其工程意义是把冷启动与 KV 容量压力放到同一套远端存储/数据移动体系中;最高倍数仍是配方方测试结果,取决于模型、网络、缓存命中率和提示长度。

来源:模型加载路径 · KV 缓存路径

标签:#vLLM #KVCache #Azure #NIXL #LMCache

Grok 4.6 发布,NVIDIA 明确指向 GB300 NVL72 训练与运行平台

SpaceXAI 发布 Grok 4.6,称其相较 Grok 4.5 在同价位上有显著提升。NVIDIA 的祝贺动态进一步表示,Grok 4.6 在 NVIDIA GB300 NVL72 与 NVLink 平台上训练并运行,并宣称具备更好的性能、可靠性和 token 成本。当前抓到的是 SpaceXAI 被引用的发布摘要与 NVIDIA 的硬件归因,缺少完整模型卡、独立评测和具体集群规模,因此不对“frontier”或成本优势作额外推断。

来源:NVIDIA 动态及 SpaceXAI 引用

标签:#Grok #GB300 #NVL72 #NVIDIA

Microsoft 首个自研推理模型 MAI-Thinking-1 上线 Foundry

Mustafa Suleyman 表示,MAI-Thinking-1 是 Microsoft 从零构建的首个 reasoning model,现已在 Microsoft Foundry 提供。当前时间线只包含这一官方高层发布口径,尚无架构、训练数据、上下文长度、价格或完整评测信息;因此它更适合作为 Microsoft 自有模型路线进入推理阶段的产品信号,而不是可与其他模型直接比较的性能结论。

来源:Mustafa Suleyman

标签:#Microsoft #MAI #ReasoningModel

模型压缩、本地 AI 与应用可回放性同时推进

LLM Compressor v0.13.0 引入 REAP expert pruning:根据校准显著性移除完整 MoE experts,再量化到 FP8 或 NVFP4;同时支持 3/5/6/7-bit 等任意位宽量化。Hugging Face CEO 称 Transformers.js 月下载量已超过 1000 万,约为六个月前的十倍,反映浏览器端本地 AI 的扩张。Gradio 6.24 则默认把应用运行记录保存在浏览器 local storage,并允许绕过队列直接回放历史运行。三者共同指向更小的模型、更靠近用户的执行,以及更可复现的交互状态。

来源:LLM Compressor · Transformers.js · Gradio 6.24

标签:#Compression #LocalAI #TransformersJS #Gradio

其他值得关注

  • Tri Dao 推荐纯文本 discovery benchmark DiG-bench,认为其类似 ARC-AGI-3 但可减少视觉能力对结果的干扰:原帖
  • IBM、Together AI 与 NVIDIA 宣布在 IBM Cloud 上用 HGX B300 和 Spectrum-X 扩展开放模型推理:原帖
  • Managed Deep Agents 展示每日扫描 Hacker News/X、生成三条候选内容、保存长期记忆并发到 Slack 的社交媒体 Agent:原帖
  • Buzz 发布 Agent team 配置教程,继续降低多 Agent 编排的上手成本:原帖
  • MOSS-VL 发布 FP8 与 NF4 版本,项目方称 24GB VRAM 可本地运行图像、视频与实时流理解模型:原帖
  • Hugging Science 增加与科学模型、数据集和论文匹配的可直接试用 Demo Space:原帖
  • OCP 推进 Google、Microsoft、NVIDIA 共同参与的 800 VDC 开放电力架构标准化:原帖

今日观察

今天的变化呈现出两条相互强化的路线:一端是 Qwen3.8 这类总参数达到万亿级、但通过 MoE 和混合注意力控制激活成本的开放模型;另一端是推理系统迅速把量化、speculation、分离式服务、远端 KV、对象存储加载和多硬件配方拼成可部署栈。与此同时,SL2T、Transformers.js 与 Gradio 表明模型价值正在落到更具体的交互边界——无障碍输入、浏览器本地执行和可回放应用状态。后续值得追踪的不是单项发布数字,而是这些系统优化能否在独立测试中形成稳定的端到端成本优势。