Meta 以 Muse Glimmer 重返开放权重,目标是本地常驻 Agent
Meta 发布 Muse Glimmer:30B dense、开放权重、Apache 2.0、128K+ context、多模态,面向本地、always-on 的长程 Agent。官方与团队成员称,模型可以在单次自然语言指令下持续规划、调用工具、处理错误并重试;通过约 4-bit 量化将语言模型压到 20GB 以下,可在 24GB VRAM 的消费级 GPU 上运行,并配套轻量 DFlash drafter 降低生成延迟。Muse Spark 1.2 的开放权重也被预告将随后发布。
推理生态首日跟进:vLLM、SGLang、Transformers、llama.cpp、ExecuTorch 与 MLX 均出现支持或 recipe。SGLang/LMSYS 报告单张 RTX 5090 在 NVFP4 + DFlash 下约 230 tok/s,并称 RTX PRO 6000、DGX Spark 与 Apple Silicon 可直接运行;这是项目方在特定量化与推测解码配置上的数据,不应外推为 BF16、不同上下文或并发负载性能。Red Hat AI 另发布 FP8-block checkpoint,明确表示评测尚未完成。
来源:Meta 主帖 · Agent 演示 · 本地内存与 DFlash · vLLM Day-0 · SGLang 结果 · ExecuTorch
标签:#MuseGlimmer #Meta #OpenWeights #LocalAgents #vLLM #SGLang
OpenAI 发布 GPT-5.6-Cyber,并将 Daybreak 分成 Blue 与 Red 两层
OpenAI 宣布 GPT-5.6-Cyber,定位为高级、获授权的网络安全工作模型,并扩大 Daybreak 计划。Daybreak Blue 面向较广泛防御任务,使用包括 GPT-5.6 Sol 在内的前沿模型,覆盖漏洞发现、安全代码审查、恶意软件分析和事件响应;Daybreak Red 则为有经验、获批准的防御人员提供 purpose-trained cyber models,包括 GPT-5.6-Cyber,用于漏洞研究、exploit validation 与安全测试,并附加更严格控制和监测。
官方称其已在真实漏洞研究中广泛使用 GPT-5.6-Cyber,并发现包括 Chrome V8 在内的流行开源软件未知漏洞。帖子没有披露漏洞数量、严重度、复现率与误报率;“发现未知漏洞”是官方陈述,不能据此推断模型可替代人工安全团队。
来源:发布与 Daybreak · Blue 层 · Red 层 · 安全控制 · V8 漏洞研究
标签:#GPT56Cyber #Daybreak #Cybersecurity #VulnerabilityResearch
NVIDIA 将 AI factory compute 包装为可投资资产类别
NVIDIA 宣布与 Apollo、BlackRock、Blackstone、Brookfield、Goldman Sachs 和 KKR 合作,建立独立融资平台,目标是动员超过 5,000 亿美元第三方资本,帮助客户规模化获取 AI compute。Jensen Huang 将这一定义为从“制造芯片”向“AI factory infrastructure 可投资资产类别”的跃迁。
这是融资目标与产业叙事,不等同于已有 5,000 亿美元完成募集或部署。后续需要观察资本承诺、项目杠杆、GPU 残值、利用率、电力与长期采购合同,才能判断这种资产证券化是否可持续。
来源:NVIDIA 公告 · Jensen Huang 文章
标签:#NVIDIA #AIFactory #InfrastructureFinance #AICompute
Anthropic 用未发布 Claude 推进黎曼猜想相关下界
Anthropic 表示,研究团队让一个未发布版本的 Claude 尝试黎曼猜想;模型没有解决猜想,但在一个相关问题上推进了“满足黎曼猜想的 ζ 函数零点比例”的已知下界。可见帖子没有完整给出证明、验证流程和同行审查状态,因此应视为数学能力研究报告,而非黎曼猜想突破。
来源:原帖
标签:#Anthropic #Claude #Mathematics #RiemannHypothesis
Microsoft MAI-Image-2.6 在 Arena 文生图榜暂列第二
Mustafa Suleyman 转述 Arena 结果称,MAI-Image-2.6 以 1336 分位列 Text-to-Image Arena 第二,落后 GPT Image 2 Medium 45 分,并领先 Grok Imagine Image 2.0 Low 20 分。这是匿名偏好竞技场的当期排名,会随样本和投票变化,也不能替代提示遵循、编辑、文字渲染、安全与成本的专项评测。
来源:原帖
标签:#MAIImage26 #MicrosoftAI #ImageGeneration #Arena
Ling-3.0-tiny 以 1.3B 激活参数进入轻量 Agent 模型赛道
Ant Ling 发布 Ling-3.0-tiny:7.9B 总参数、每 token 激活 1.3B,并提供 BF16、FP8 与 INT4 开放权重;SGLang 与 vLLM 均宣布 Day-0 支持。发布方引用 Artificial Analysis 数据称 Intelligence Index 25、Agentic Index 16、GDPval-AA v2 为 772 Elo、τ³-Banking 为 20.80。这些分数来自发布帖引用,模型质量、吞吐和内存应在相同 checkpoint 与 harness 下复核。
标签:#Ling30Tiny #MoE #EdgeAI #SGLang #vLLM
其他值得关注
- Stagehand v4 定位为 browser-agent SDK,强调上下文管理、自愈动作与 iframe 支持;LangChain 提供其与 Managed Deep Agents 的教程:原帖
- LithosAI 宣称以原生精度运行 Kimi K3,在 Artificial Analysis 测得 295 tok/s,但帖子未披露硬件、输入输出长度、并发和完整价格:原帖
- World Labs 转帖 Autodesk Flow Studio 工作流,展示 Marble 参与 3D Editor + Canvas 的 world-building 阶段:原帖
- Fei-Fei Li 强调包括 AI 在内的工具应增强 human agency,并参与 Huberman Lab 长访谈:原帖
- Novo Nordisk 选择 AWS 作为 preferred cloud provider 与 strategic AI partner,方向包括加速药物发现;属于双方合作公告:原帖
- Tianqi Chen 宣布 XGBoost 论文获得 KDD 2026 Test of Time Award:原帖
今日观察
今天的主线是三种“基础设施化”同时发生:Meta 把本地多模态 Agent 压进单张消费级 GPU,并迅速获得完整推理生态;OpenAI 把高能力网络安全模型放进分层准入与监测制度;NVIDIA 则尝试把 AI factory 从设备采购转化为可融资资产。模型竞争不再只由参数与榜单决定,而越来越取决于谁能同时组织部署栈、权限边界和资本结构。