Agent Plugins:技能与 MCP 配置开始形成跨客户端可移植标准
OpenAI Developers 发布 Agent Plugins research preview:同一插件可被多个兼容 Agent 客户端复用;共享格式可以打包 Agent Skills,并包含 MCP server 配置。发布时列出的兼容客户端包括 Codex、ChatGPT、Cursor、GitHub Copilot、Kiro 和 VS Code,标准由 OpenAI 与 AWS、Cursor、GitHub、Microsoft/VS Code、Vercel 等共同开发。
这比单一客户端的“插件市场”更重要:它试图把 Agent 的指令、工具接线和可分发单元从产品私有格式提升为生态接口。当前帖子尚未说明权限声明、版本锁定、签名、供应链审计和客户端行为一致性;可移植不自动意味着安全语义一致,后续最值得追踪的是 manifest 与权限模型。
来源:Agent Plugins 标准 · 首批兼容客户端
标签:#AgentPlugins #AgentSkills #MCP #Interoperability #Codex
Codex Security Review 进入研究预览,将仓库上下文带入 PR 安全审查
OpenAI Developers 宣布 Codex Security Review research preview。该功能针对 GitHub pull request 做更深的安全检查,结合仓库上下文,在 PR 中直接给出可操作发现,并支持配置自动审查。
官方帖没有披露覆盖的漏洞类型、误报率、数据权限边界或与现有 SAST/依赖扫描的分工,因此它应被视为补充型语义审查,而非传统安全门禁的替代。其潜在价值在于把跨文件约束、调用链和项目特定安全假设带进 code review。
标签:#Codex #SecurityReview #GitHub #AppSec
ChatGPT 统一付费用户的 GPT-5.6 Sol,并向免费用户开放无限 Luna 文本聊天
OpenAI 宣布 GPT-5.6 Sol 同时承担 Plus/Pro 用户的 Instant 与深度推理聊天,付费用户可通过 slider 调整 reasoning effort;Free 与 Go 用户从次日起获得无限 GPT-5.6 Luna 文本聊天,并可用 Think 按钮处理更难问题。官方强调,这一新版 Sol 面向 ChatGPT 日常聊天,与 Work 等其他场景所用版本分开。
OpenAI 称,在覆盖金融、医疗和法律的内部高风险事实性评测中,新 Sol 相比 GPT-5.5 Instant 的事实错误回答减少 68%。这是厂商内部评测,帖子未列出样本、判定方式和置信区间;更合理的解读是产品体验与成本层级被重新整理,而不是据此推断所有高风险任务都可无人监督。
来源:产品范围与免费额度 · 内部事实性结果 · Reasoning slider · Think 按钮 · 版本说明
标签:#GPT56Sol #GPT56Luna #ChatGPT #ReasoningEffort
Google DeepMind 开源 WeatherNext 气旋模型,平均增加 24 小时预警时间
Google DeepMind 称 WeatherNext 在气旋路径与强度预测上达到 state of the art,研究发表于 Nature,平均可额外提供 24 小时准备时间。官方案例称,在 Hurricane Melissa 期间,模型提前 5 天以 80% 置信度预测 Category 5 登陆;今年将为每场风暴提供 1,000 个概率预测,并通过 WeatherLab 给预报员使用。
团队同时开放代码和模型权重,允许用于学术、业务预报和区域化模型开发。这里的单次飓风案例不能代表所有 basin、强度阶段和极端快速增强场景;真正价值在于概率 ensemble、公开权重和业务预报流程能否持续验证。
来源:Nature 结果 · Melissa 案例与概率预测 · 代码与权重开放
标签:#WeatherNext #CycloneForecasting #AIForScience #OpenWeights
Kimi K3 获官方 Vendor Verifier 认可,vLLM 强调完整精度与生产服务
vLLM/Inferact 称,其 Kimi K3 服务路径已通过 Moonshot 的 Kimi Vendor Verifier,覆盖 vision、100 万上下文与 agentic coding,并提供部署 recipe。这里的“fully verified”指向模型供应商的兼容/精度验证,不等于所有硬件、并发和量化配置都有相同性能。
这条动态的重要性在于开放推理框架从“Day-0 能跑”向供应商验证的功能一致性迈进。吞吐、延迟、显存和稳定性仍应按具体 recipe、硬件拓扑和 workload 单独复现。
标签:#KimiK3 #vLLM #ModelServing #VendorVerification
SGL-Diffusion 将 GLM-Image 的 AR 与 DiT 拆成异构、解耦服务
LMSYS 发布 GLM-Image 的 AR+DiT 全栈优化方案:把单体 worker 改造成 Ascend NPU 上的异构解耦部署,让自回归阶段使用独立 SRT 服务和自己的 tensor parallel 配置,不再受 DiT 的 sequence parallel 配置绑定。帖子还提到动态调度等进一步优化,完整结果需以博客中的配置与基准为准。
这延续了视频/图像生成推理的结构性趋势:不同计算阶段有不同并行、缓存和设备需求,拆分后更容易独立伸缩。代价是跨服务传输、调度和故障恢复复杂度上升,不能只看单阶段加速。
来源:SGL-Diffusion AR+DiT 优化 · 技术博客入口
标签:#SGLDiffusion #GLMImage #Ascend #DisaggregatedInference
World Labs 展示 64 个空间智能 Hackathon 项目
World Labs 称,洛杉矶 Worlds in Action Hackathon 有超过 270 名开发者、64 支团队参加,作品涵盖沉浸式叙事、混合现实游戏、电影制作、桌面世界与音频响应式 3D。官方点名的项目包括虚拟摄影 copilot CinemaScout、桌面混合现实 LandFall 和音频响应 SynthSplat。
这不是新基础模型发布,但提供了 world model/空间生成技术的应用面信号:工具价值正在从“生成一个世界”转向可交互的创作和工作流组件。项目质量与持续使用仍需看公开 demo 和后续留存。
来源:Hackathon 总览 · 项目列表
标签:#WorldLabs #SpatialIntelligence #MixedReality #WorldModels
其他值得关注
- AI at Meta 称其模型参加五项 STEM Olympiad;可见官方帖明确列出亚洲物理奥赛与国际物理奥赛理论考试满分。完整成绩、工具政策和评分过程需结合官方说明核验:原帖
- NVIDIA 展示 Vera Rubin NVL72 compute tray:官方称 1 分钟自动装配、无 cables/hoses/fans,并引用 200 AI petaFLOPs 与 45°C 液冷设计;这是系统设计宣介,量产良率和维护数据尚未给出:原帖
- PyTorch 转述 TorchTitan 在 GB300 NVL72 上的 MoE 预训练纪录,需结合模型规模、精度、MFU 与对照栈查看:原帖
- Hark 表示 Online Mind2Web 结果由 Careerflow Human Data Labs 与 Ohio State 的官方 benchmark evaluator 独立验证;真实网页泛化仍不能由单榜排名代替:讨论
- CAKE 生成的 SM100/SM103 tinygemm2 kernel 合入 FlashInfer;发布方称大 shape 最高快 1.79 倍、kernel 几何平均减少约 18–23%,SGLang 端到端最高提升 7.6%:原帖
- Square sellers 已可接受 Google Ask Maps 的 agentic orders,Agentic Commerce 开始进入真实商户渠道:原帖
- Ai2 与 Hugging Face 扩大合作,Hub 存储约增至 2 PB,并为大型数据集与多 checkpoint 模型提供高速下载:原帖
今日观察
今天的主线是“Agent 生态开始标准化,同时高能力功能下沉到普通用户”:Agent Plugins 试图统一技能与 MCP 配置的分发格式,Codex 把安全审查嵌入 PR,ChatGPT 将更强模型与可调推理开放给更大用户面。与此并行,WeatherNext、Kimi K3 验证和 SGL-Diffusion 表明模型价值越来越依赖可验证、可移植、可部署的系统接口,而不只是一次 benchmark 分数。