← 返回文章

AI 动态摘要|2026-08-04

过去 24 小时值得关注的 AI 动态:OpenAI 数学、GPT-Live、MiniMax H3、企业 Agent 平台。

OpenAI 称下一代内部模型解决 10 项数学与理论计算机问题

OpenAI 官方称,下一代主要模型的内部版本在长期开放的数学和理论计算机科学问题上产生 10 项新结果,按 GPT-5.6 Sol API 费率估算使用约 2,000 美元 token。涉及球堆积、编码理论、群论、量子复杂性、格密码和极值组合等领域;官方特别提到非 sofic 群存在性,以及高维球堆积界的指数级改进。

OpenAI 同时发布论文稿、Lean 形式化证书和推理 walkthrough,供数学家检查。这些材料的公开是强验证信号,但“新结果”和证明的重要性最终仍应由同行审阅判断;不能只凭公司公告将十项全部视为已被数学界正式接受。

来源:官方总述 · 研究范围 · 论文与 Lean 证书

标签:#OpenAI #Mathematics #Lean #TheoreticalCS #AIForScience

GPT-Live 重构实时语音栈:音频快路径与异步推理分离

OpenAI 发布 GPT-Live 架构说明:模型可以在说话时持续听取输入;团队从客户端到模型重建语音栈,使音频连续流动,较深推理和工具调用不会打断对话。音频走专用 fast path,推理与工具使用异步执行;会话启动从 6 次网络往返缩减为 1 次。

核心设计不是单纯让模型生成更快,而是把低延迟对话平面与高延迟认知/工具平面解耦。这与实时 Agent 系统的普遍工程模式一致:先保证交互连续性,再异步合并复杂结果。

来源:GPT-Live 总述 · fast path 与 RTT · 工程文章入口

标签:#GPTLive #VoiceAI #RealtimeSystems #AsyncAgents

MiniMax H3 开放权重,多模态视频推理框架首日跟进

MiniMax H3 开放后,vLLM-Omni 与 SGLang Diffusion 均宣布 Day-0 支持。vLLM recipe 将其描述为 64B dense 多模态生成模型,可把文本、图像、视频和音频放进统一上下文,输出带原生立体声的 24 FPS 视频,支持文生视频、首尾帧和多参考生成。

SGLang 社区称模型可在 2×RTX 5090 或 1×RTX 6000 上本地运行,并称成本为 Seedance 2.0 的约三分之一;这是发布方/框架方口径,帖子没有展示完整质量、时长和成本对照。Sol Engine 团队另称在 8×GB200、1344×768、24 FPS、124 帧配置下,相比 Diffusers 端到端加速 3.95 倍、相比 SGLang 2.80 倍,优化耗时约 4.5 小时;该结果同样需要结合版本和生成参数复现。

来源:vLLM Day-0 支持 · vLLM recipe · SGLang Diffusion · Sol Engine 性能

标签:#MiniMaxH3 #vLLMOmni #SGLangDiffusion #GB200 #VideoGeneration

Qwen3.8-Max 预告 2.4T 模型,vLLM 承诺开放权重首日支持

Qwen 宣布 Qwen3.8-Max 为其当前最强模型,参数规模 2.4T,强调 coding 与 cowork,并预告下周开放 Qwen3.8-Max 和 Qwen3.8-27B 权重。vLLM 表示将按惯例提供 Day-0 支持。

可见引用文本提到“10 天以上自主 coding”,但后半段被截断,尚不足以判断任务定义、连续运行条件和成功率。当前应把它视为发布预告,而不是已可复现的长时 Agent 纪录。

来源:vLLM / Qwen 发布预告

标签:#Qwen38Max #OpenWeights #vLLM #CodingAgent

Stripe 用一名工程师一周构建内部知识 AI 平台 Kai

LangChain 案例称,Stripe 使用 Deep Agents,由一名工程师在一周内构建名为 Kai 的 Knowledge AI Platform;Harrison Chase 将其作为“内部 AI 平台改变公司运作方式”的例子传播。

这一案例说明 Agent harness 正从单个助手扩展到企业知识基础设施,但目前信息来自供应商案例,缺少用户覆盖、数据源数量、准确率、权限模型和持续维护成本,不能把“一周、一人”外推为完整生产平台的普遍交付周期。

来源:LangChain 案例 · Harrison Chase 转述

标签:#Stripe #DeepAgents #KnowledgePlatform #EnterpriseAI

Agent 基础设施走向 BYOK 与运行时治理

LangSmith LLM Gateway 宣布支持 BYOK,用户可保留现有模型供应商合同与密钥,同时使用 fallback、成本控制和 rate limit,避免为 token 支付额外 markup。这表明 gateway 的价值主张正在从“代售模型调用”转向独立的运行时策略层。

来源:LangSmith Gateway BYOK

标签:#LangSmith #BYOK #LLMGateway #RuntimeGovernance

NVIDIA 提出商户控制下的 Agentic Commerce

NVIDIA 将 AI Agent 描述为新的商品发现入口,并主张零售商可从发现到安全结账接入购物 Agent,同时保留对价格、支付和交易流程的控制。这里的关键议题不是“Agent 会不会购物”,而是谁控制商品目录、排序、支付凭据、退款和归因数据。

目前是 NVIDIA 的方案定位,帖子没有提供商户部署规模或转化率数据;商业价值仍需真实零售案例验证。

来源:NVIDIA Agentic Commerce · 方案入口

标签:#AgenticCommerce #RetailAI #NVIDIA #Payments

其他值得关注

  • Cash App 的 Moneybot 试验 Visual Prompts,希望用上下文和可视界面替代“用户先知道该问什么”的纯聊天入口:原帖
  • Base 宣布自研 Base Core 家庭电池和 10 亿美元 D 轮融资,Michael Dell 将其与“能源充裕”联系起来:转帖
  • 一个 macOS llama 应用可根据设备与上下文窗口推荐开放模型并启动 llama server/WebUI,降低本地推理门槛:原帖
  • Yann LeCun 强调优秀代码生成系统不是纯粹的自回归 token prediction,系统层工具和反馈回路同样关键:回复

今日观察

今天的更新展示了 Agent 系统的两端同时扩张:上游模型开始承担数学研究、统一多模态生成和长时编码任务;下游系统则把语音快路径、gateway 治理、企业知识平台和交易控制做成独立产品层。真正值得持续追踪的是这些层之间的接口是否开放、结果能否复现,以及供应商案例中的速度、成本和交付周期在真实生产环境中还能保留多少。