← 返回文章

AI 动态摘要|2026-08-28

过去 24 小时值得关注的 AI 动态:MHS、网络防御、Microduck、vLLM 0.28、Vera Rubin。

Anthropic 推出让 Agent 安全操作真实设备的 MHS

Anthropic 启动 Model Hardware Standard(MHS)研究预览,目标是把科学仪器和先进制造设备变成 Agent 可发现、可调用且具安全约束的标准接口,将定制集成从数天或数周缩短到数小时或数分钟。早期案例包括 Genentech 的药物发现实验实时纠错、HHMI Janelia 将成像实验从数周压缩至一天,以及把 QuEra 量子计算机的激光稳定性从 58% 提升到 99.3%。Anthropic 明确称模型的物理直觉仍不足,因此暂不直接开源,先通过预览补齐安全评测和保护机制。

来源:MHS 发布 · 集成方式 · 早期案例 · 安全边界

标签:#Anthropic #PhysicalAI #AgentSafety

百余家机构联合呼吁加速 AI 网络防御

OpenAI、Anthropic、AWS、Google、Microsoft、Oracle 等百余家机构共同发布网络防御公开信,认为攻击能力与防御部署之间存在有限时间窗口,需要全球性地向防守方提供工具、资源和支持。Sam Altman进一步强调应与任何竞争者或合作方协作。这是跨模型厂商、云厂商和软件公司的共同安全倡议,官方事实是“联合动员”;关于威胁迫近程度仍主要来自签署方判断。

来源:OpenAI · 公开信转述 · Sam Altman

标签:#CyberDefense #OpenAI #AI安全

Microduck 把可训练的开源双足机器人降到 399 美元

Hugging Face 与 Pollen Robotics 发布 Microduck:约 25 厘米、低于 800 克、15 个执行器,并配备摄像头、LiDAR、IMU、麦克风、扬声器及可抓取的喙。其核心卖点是完整开源的 sim-to-real 强化学习闭环:先在模拟器训练,再部署到实机并继续教授新技能;售价 399 美元,计划圣诞节前发货。发布后的密集转发应归并为同一主题,而非多个独立事件;Thomas Wolf 随后称销售额已突破 100 万美元。

来源:Pollen Robotics 主帖 · Thomas Wolf 规格说明 · 开源 RL 栈 · 销售进展

标签:#Microduck #Robotics #OpenSource #ReinforcementLearning

vLLM 0.28.0 推进 Kimi-K3、DeepSeek-V4 与多硬件优化

vLLM 0.28.0 汇集 584 个提交、270 位贡献者。主要变化包括 Kimi-K3 全栈优化、DeepSeek-V4 sparse MLA 覆盖普通 decode/MTP/DSpark、DFlash2 与 DSpark confidence-scheduled speculative decoding;自适应 speculative token budget 宣称端到端 TTFT 改善 55%–65%,sequence parallelism 合并 all-gather 的内核级加速为 1.5–3 倍,共享专家分片可为 Kimi-K3 每卡节省约 17 GiB。前端侧加入 Rust 独立 renderer、gRPC 图像推理和 GPU 图像预处理。

来源:版本概览 · 性能与硬件 · Serving 与升级说明

标签:#vLLM #Inference #KimiK3 #DeepSeekV4

模型、推理与算力继续联合设计

NVIDIA 确认 H3 Max 的后训练和服务均运行于 GB200 NVL72;LMSYS 对 MiniMax-H3 在 8×H200 上报告无损路径 1.95 倍、近似路径最高 6.24 倍加速。Hark 同时宣布与 NVIDIA 的多年合作,将使用 Vera Rubin 平台的吉瓦级算力训练具长期个性化记忆的多模态系统;AWS 则收到首套 Vera CPU Server 与 Vera Rubin GPU。共同信号是模型发布越来越与机架级系统、推理算法和专用硬件绑定。

来源:H3 Max / GB200 NVL72 · 8×H200 性能 · Hark 合作 · Vera Rubin 到 AWS

标签:#NVIDIA #VeraRubin #VideoGeneration #AIInfrastructure

其他值得关注

  • Google 发布 Gemini Omni 1.1 Flash,新增首尾帧约束、视频参考、10 秒递增长视频扩展、360p 草稿和 4K upsampler;Arena 称其在 Text-to-Video 排名第一:原帖 · Arena。
  • Google DeepMind 试点前沿模型双盲评测,在不向评测方披露权重、也不向模型方披露测试提示的环境中评估安全与性能:原帖。
  • Stanford 牵头发布 Terminal-Bench-Science,用真实科研工作流跨学科评估 AI Agent:原帖。
  • OpenWiki 0.4.0 的 Claims runtime 把来源、验证状态和生成者关联到可持久化断言,尝试让代码库知识既能遗忘也能自纠:原帖。
  • Z.ai 宣布 GLM-5.3 权重即将发布;其团队称 GLM-5.3 Flash 在 OpenRouter 的周 token 份额接近 20%,但这一比例属于团队自报数据:权重公告 · 团队数据。

今日观察

今天最显著的变化是 Agent 从“操作网页和软件”进一步进入“操作真实设备”:MHS 试图建立安全接口,Microduck 则用低价开源硬件和 sim-to-real 工具降低实验门槛。与此同时,双盲评测、科研工作流 benchmark 和跨公司网络防御倡议都在补制度与验证层。基础设施侧依旧是联合设计逻辑:模型、推理引擎、量化/投机解码和整机系统正在成为不可分割的发布单元。