Meta 发布 Muse Spark 1.3:主攻长程 Agent 与代码任务
Meta 发布 Muse Spark 1.3,可通过 Muse Code 与 Meta Model API 使用。官方称新版本在 Agent 与 coding 任务上明显提升,能够在单线程跨多个 workflow 持续更长时间,并更主动地向用户提问和协作。外部 Artificial Analysis 称 max 版本在其 Intelligence Index 得分 62,位于 Claude Fable 5.1 与 Claude Opus 5 之后;另有转述称 DeepSWE v1.1 达到 75.4%。
这些排名和价格优势目前主要来自发布方与第三方榜单转述,max 版本仍是伙伴 limited preview,不能把不同 reasoning 配置与公开可用版本混为一谈。Meta 同时预告后续会发布 Muse Spark 开放权重,值得继续跟踪权重范围、许可和推理成本。
来源:Meta 官方主帖 · Alexandr Wang · Artificial Analysis · 开放权重预告
标签:#Meta #MuseSpark #CodingAgent #OpenWeights
Gemini 3.8 Flash 与 Flash Cyber 同时推进 Agent 和网络防御
Google 发布 Gemini 3.8 Flash,称其相较 3.7 Flash 在软件工程、Agent 任务与多步推理上有显著提升,是六周内第三次 Flash 更新;同时发布 3.8 Flash Cyber,定位为更强的 cyber defense 模型。Sundar Pichai 还称 3.8 Flash 在 DeepSWE v1.1 上超过多数更大的前沿模型。
这是 Google 官方能力表述,但本轮动态没有完整列出 benchmark 设置、成本与安全访问边界。与 OpenAI Astra、NVIDIA SafeMind 连续出现相呼应,网络安全正在从附加能力变成前沿模型独立产品线。
来源:Google DeepMind · Demis Hassabis · Sundar Pichai
标签:#Gemini38Flash #CyberDefense #AgenticAI
Groq 3 LPX × Vera Rubin:100K 上下文宣称达到 3,431 tok/s
NVIDIA AI Infrastructure 转述 Artificial Analysis 的公开 endpoint benchmark:Groq 3 LPX 在 100K context 的 Gemma 4 31B 测试中生成 3,431 output tok/s,接近下一最快公开端点的 4 倍,并被纳入 Vera Rubin NVL72 平台叙事。
这个数字很亮眼,但应明确它是特定模型、100K 输入和公开端点 benchmark 的结果,不代表所有请求形态、batch、并发和端到端延迟。后续需要核对硬件拓扑、首 token 延迟、输出长度、服务并发与测量方法。
标签:#Groq3LPX #VeraRubin #LongContext #Inference
Perplexity 开源 Lily,把 Hybrid Compute 的本地推理落到 Apple Silicon
Perplexity 开源 Lily,这是其 Computer hybrid compute 使用的本地推理引擎,专门为 Apple Silicon 上的 Qwen3.6-35B-A3B 优化,目标是在涉及敏感或私密文件的 Agent 步骤中使用本地模型,同时避免本地推理成为工作流瓶颈。
开源引擎让本地/云混合 Agent 从产品口号进入可审查实现,但隐私结论仍取决于路由策略:哪些提示、文件、embedding、遥测和失败回退会进入云端,需要结合代码和网络行为验证。
来源:Lily 开源帖 · DGX Spark 演示
标签:#Perplexity #Lily #LocalInference #AppleSilicon
AI 安全进入“开放标准、真实漏洞与可监控性”三条线
Open Secure AI Alliance 宣布并入 Linux Foundation,计划开发开放工具、共享标准和防御实践。与此同时,AISLE 声称在 curl 中发现并获验证 6 个新的 zero-day/CVE,而 OpenAI Codex Security 与 Anthropic Mythos 此前报告剩余问题为 0;这是一方对比性陈述,需要结合 curl 官方 CVE 记录和各工具的扫描范围审查,不能简单得出模型能力排名。
围绕 Astra 的可监控性,Jakub Pachocki 表示当前前沿模型(含 Astra)的计算图深度仍在 GPT-4 的两倍范围内,并称 OpenAI 在保留 chain-of-thought monitoring。Yuandong Tian 则提醒,即使显式 CoT 存在,模型仍可能学会隐藏真实思考过程。综合来看,开放审计标准、真实代码验证和行为监控缺一不可。
来源:Open Secure AI Alliance · AISLE/curl 转述 · Astra 可监控性 · CoT 评论
标签:#AISecurity #OpenSSF #CVE #CoTMonitoring
其他值得关注
- PyTorch 2.14 进一步披露:Inductor 引入 CuTeDSL 生成的 CUTLASS kernel(NVGEMM),Distributed 增加 nccl2 backend 与 c10d fault tolerance,并支持 Apple Silicon 原生线性代数、
torch.switch和torch.while_loop的 CUDA Graph capture。原帖 - NVIDIA 与 EnduroSat 合作,把 Space-1 Vera Rubin Module、Jetson Thor、IGX Thor 与软件栈预集成到 FRAME 卫星,以在轨处理采集数据;目前为合作与平台集成公告。原帖
- PaleBlueDot AI 的 HGX B300 集群获得 NVIDIA Exemplar Cloud 训练认证;其引用材料称六种训练配置均达到 NVIDIA 基线的 98% 以上,但这是认证体系内结果。原帖
- LangSmith 推出 Messages View beta,把 Agent conversation 与 tool call 按 Agent 当时看到的形态重放,反映 trace 正从基础设施诊断转向应用开发体验。原帖
- ChatGPT 桌面端负责人称该应用已成为自己的主浏览器。这是产品方向信号,意味着 AI 客户端正试图从助手升级为浏览与执行入口。原帖
今日观察
今天的竞争呈现明显的“三层同步”:模型层是 Muse Spark 1.3 与 Gemini 3.8 Flash 快速迭代;系统层是 Groq 3 LPX 长上下文吞吐、PyTorch 2.14 kernel/分布式能力和 Lily 本地推理;治理层则是开放安全标准、真实 CVE 验证与 CoT 可监控性争论。单看 benchmark 已越来越难判断产品价值,真正的差异正在由模型质量、部署效率、数据边界和可审计性共同决定。