OpenAI 暂停部分前沿 RL 训练,理由是能力进入“网络安全关键”区间
Sam Altman 表示,OpenAI 已暂停部分 frontier RL training,以确认新的能力水平满足相应的 alignment、安全与监控标准;他补充说近期仍预计发布新的优秀模型,但这次暂停影响更远期的发布。这是 OpenAI CEO 对真实训练节奏的公开表述,不是外部传闻。动机上,它既是在执行此前“能力触及阈值就放慢”的承诺,也是在能力快速进展时为部署控制、滥用监测和网络安全评估争取时间。公开动态没有说明具体模型、暂停规模、触发指标或恢复条件,因此不能进一步推断训练已全面停止。
来源:暂停部分前沿 RL 训练 · 近期与远期发布说明
标签:#OpenAI #Alignment #Cybersecurity #FrontierAI
Anthropic 公布 Claude 蛋白 binder 设计实验,并开放提示词与数据
Anthropic 称,在不同实验设置下,Claude 设计的蛋白 binder 有 22%–35% 成功结合,而其给出的领域典型成功率为 10%–15%;公司同时发布技术报告,并开放提示词与实验数据。官方也主动强调 binder 不是药物:高亲和力结合只是开发药物样分子的第一步,之后仍需安全性、有效性和临床流程验证。因而这项结果应理解为受控实验中的分子设计命中率,而不是“Claude 已能开发药物”。Anthropic 还预告将推出面向科学家的高能力模型访问计划,目前称 Opus 5 是其生命科学研究中最强的可用模型。
来源:实验主帖 · 成功率 · binder 与药物边界 · 报告与开放数据
标签:#Anthropic #Claude #ProteinDesign #LifeScience
Miles v0.1 把 LLM 与多模态模型的 RL 后训练做成开放生产栈
RadixArk 发布开源 RL 框架 Miles v0.1,目标是帮助团队验证训练正确性、提高硬件利用率并维持大规模训练稳定性。配套生态显示,SGLang 是原生 rollout engine,训练侧可配 Megatron-LM 与 FSDP;AgentENV 已作为 agentic RL sandbox backend 接入。Eigent AI 还称其用 Miles 在数千个环境中训练 terminal coding 与 ML engineering agents,但这是使用方陈述,不能替代公开基准。相较单一算法发布,Miles 更值得关注的是把 rollout、训练、sandbox 和异步执行组织成可调试的后训练系统。
来源:Miles v0.1 · SGLang rollout · 训练侧组合 · AgentENV 集成
标签:#Miles #SGLang #ReinforcementLearning #PostTraining
TensorRT Model Connect 试图缩短 Hugging Face 模型到原生推理的路径
NVIDIA 将 TensorRT Model Connect 作为 Public Preview 发布,称受支持的 Hugging Face 模型可通过两条命令转换为端到端 TensorRT 推理,不需要中间 ONNX 导出,生成的 bundle 可由原生 C++ API 运行。Tianqi Chen 特别指出其一等支持 TVM-FFI,可把自定义 DSL 与 Agent 生成 kernel 接入 TensorRT。这里的产品事实是预览版发布与接口路径;易用性、模型覆盖和性能收益仍需对具体模型逐项验证,不能从“两条命令”推断所有模型都能无修改转换。
来源:NVIDIA 发布 · TVM-FFI 与自定义 kernel
标签:#TensorRT #TVMFFI #KernelAgent #Inference
Block 开源 Berd:把模型、harness、项目上下文放到同一个桌面环境
Block 开源内部使用的 Berd 桌面应用,用于跨项目、skills、tools、models 和不同 Agent harness 工作。团队的产品判断是:模型与 harness 已经很多,缺少的是员工愿意每天打开、能保留工作与上下文的统一环境;Berd 允许自带模型与 harness,并以更强的视觉个性区分 agents。它与 Block 现有 Goose、Buzz 形成相邻但不同的层次。当前动态主要展示产品定位和团队使用经验,尚无跨团队效率、任务成功率或资源成本数据。
来源:Block 产品说明转发 · 内部设计动机 · Berd 入口
标签:#Block #Berd #AgentDesktop #OpenSource
LangSmith Tuned Evaluators 把评测从发布检查推进到生产反馈循环
LangChain 发布 Tuned Evaluators,首个 evaluator 是 Perceived Error:它在生产 traces 上识别用户纠正、拒绝、重复请求或问题未解决等信号,并把反馈写回 Agent 改进流程。社区转述称专门训练的 judge 将评测成本降低约 82%,项目方还声称其内部 benchmark 超过 frontier judge;由于抓取到的长帖被折叠,日报不补写未展示的完整比较口径。核心方向很清楚:让较小、专门化的 evaluator 持续跑在生产轨迹上,使 eval 从上线前清单变成常驻反馈回路。
来源:Harrison Chase 发布 · Perceived Error 信号 · 成本转述
标签:#LangSmith #AgentEvals #ProductionMonitoring #FeedbackLoop
其他值得关注
- DFlash 2 团队称 Qwen3.8-27B 在 M5 Max MacBook Pro 达到 70 tok/s,最高为自回归解码的 4.6 倍且输出相同;这是作者给出的特定设备与模型结果:原帖
- Z.ai 宣布 GLM-5.3 API 上线,定位 coding、防御性网络安全和长时 Agent 任务,价格与 GLM-5.2 相同;转帖提到 Artificial Analysis Index 60:原帖
- Hugging Face 宣布 Hub 模型数超过 300 万:原帖
- Hugging Face CEO 称 ICML reproduction challenge 中 1,221 名参与者与 coding agents 协作核验和复现 2,226 篇论文;这是活动方统计:原帖
- Sentence Transformers v6.0 将 ColBERT 风格 late interaction 的 MultiVectorEncoder 纳入一等模型类型:原帖
- NVIDIA AI Infrastructure 转述 Shopee 的 Compass 模型月 API tokens 在八个月内从 30 亿增长至 3,400 亿;数字来自厂商案例,需结合请求结构和 token 口径理解:原帖
- 蚂蚁集团通过 InclusionAI 加入 PyTorch Foundation,成为 Gold Member:原帖
今日观察
今天的高价值动态形成了一个完整闭环:前沿实验因安全阈值而主动减速,科学应用用开放数据接受复核,后训练基础设施开始产品化,推理工具缩短模型到部署的路径,桌面环境统一多模型与多 harness,生产 evaluator 再把真实错误反馈回系统。竞争焦点已经不是“有没有 Agent”,而是能否同时掌握训练节奏、可复现实验、部署通路、工作上下文和持续评测这五个控制面。