剑闻 | Grok 4.6 · DeepSeek V4 Pro · Qwen3.8 开源 · AI 双十亿用户 · 2026-08-13

Hermes AI Daily Intelligence

日期:2026-08-13


Executive Summary

今日 AI 行业由三大核心信号驱动:(1) 模型发布集中爆发——xAI Grok 4.6、DeepSeek V4 Pro 0813 GA、阿里 Qwen3.8-2.4T-A95B 开源三大模型在 24 小时内密集登场,Agent 性能逼近 Claude Fable 5 水平,开源模型首次进入 Qwen-Max 级别参数规模。(2) AI 用户规模跨过里程碑——ChatGPT 周活、Gemini 月活双双突破 10 亿用户,Google 成功将 Gemini 打造成其历史上增长最快的产品。(3) 资本基础设施化——NVIDIA 联合六大金融机构筹集 5000 亿美元 AI 基础设施基金,Anthropic 以 9650 亿美元估值冲刺 IPO,AI 从”科技赛道”正式进入”基础设施赛道”。

核心判断: 2026 年 8 月中旬,AI 行业进入”三浪叠加”阶段——模型能力逼近天花板(Agent 基准追上 Fable 5)、用户规模跨越临界点(10 亿 MAU 成标配)、资本从 VC 转向基础设施级融资(5000亿美元级)。行业竞争从”谁更强”转向”谁能用、谁更便宜、谁的生态更完整”。


Today Top 10

  1. [S+] xAI 发布 Grok 4.6:Agent 编码与知识工作追平 GPT-5.6 Sol82
  2. [S+] DeepSeek V4 Pro 0813 GA:1M 上下文,1/57 价格逼近 Fable 5 性能81
  3. [S] 阿里 Qwen3.8-2.4T-A95B 开源:Qwen-Max 级别首次开源,2.4T MoE79
  4. [S] NVIDIA 联合六大机构融资 5000 亿美元建 AI 工厂80
  5. [S] ChatGPT & Gemini 双双突破 10 亿用户里程碑78
  6. [A] Anthropic 多智能体系统研究:45 个协调 Agent 发现 266 个漏洞79
  7. [A] Anthropic 最快 9 月 IPO:9650 亿美元估值,年化收入 470 亿美元77
  8. [A] 微软首发自研推理模型 MAI-Thinking-174
  9. [A] OpenAI Astra 模型攻克 10 道数学难题,250 页论文 + Lean 验证76
  10. [A] Meta Muse Glimmer 30B 开源(Apache 2.0):本地 Agent 消费级 GPU 可跑75

S Level

[S+] xAI 发布 Grok 4.6:Agent 编码与知识工作追平 GPT-5.6 Sol

  • Signal Score: 82 / Confidence: 95(xAI 官方博客 + Cursor 联合发布 + 多家媒体交叉验证)
  • Business Impact: High — 影响 Agent 编码市场、AI 编程工具、知识工作自动化
  • Technical Impact: Agent / Coding / Reasoning / Tool Calling / Multimodal
  • Market Impact: xAI、OpenAI、Anthropic、Cursor、AI 编程工具市场
  • Action Recommendation: Experiment / Upgrade
  • 来源: xAI 官方 · Cursor Blog · Artificial Analysis · AI Release Tracker

xAI 发布 Grok 4.6,在 Grok 4.5 基础上通过扩展后训练、再生 SFT 轨迹和 Agent 环境 RL 实现性能跃升。500K 上下文窗口,在 Artificial Analysis Intelligence Index(九项基准综合分)上追平 GPT-5.6 Sol。在 CursorBench、FrontierCode、AA-Briefcase 等 Agent 编码基准上领先,复杂多步工作流仅需约 53 步(vs Claude Opus 5 约 103 步),单位任务成本显著更低。Cursor 同步宣布联合发布,Grok 4.6 已在 Cursor 中可用。


[S+] DeepSeek V4 Pro 0813 GA:1M 上下文,1/57 价格逼近 Fable 5 性能

  • Signal Score: 81 / Confidence: 90(DeepSeek API 文档 + OpenRouter + 多家媒体确认)
  • Business Impact: High — 影响 API 定价生态、AI 编程/Agent 成本结构
  • Technical Impact: LLM / Agent / Coding / Reasoning / Context
  • Market Impact: DeepSeek、OpenAI、Anthropic、xAI、API 市场
  • Action Recommendation: Experiment / Upgrade
  • 来源: DeepSeek API Docs · BenchLM · Apifox Blog · Kingy AI

DeepSeek V4 Pro 正式版 0813 在 8 月 12 日晚间悄悄上线,未举办正式发布会。模型支持 1M token 上下文窗口、384K token 最大输出。输入价格仅 $0.435/M token,是 Claude Fable 5 价格的 1/57。在 Agent 基准上逼近 Fable 5 水平,被誉为”Claude 级别 Agent 性能,57 分之一价格”。与 Grok 4.6 在 2 小时内先后发布,形成”双杀”效应。


[S] 阿里 Qwen3.8-2.4T-A95B 开源:Qwen-Max 级别首次开源

  • Signal Score: 79 / Confidence: 95(Hugging Face 开放权重 + NVIDIA Blog + LMSYS + IT之家)
  • Business Impact: High — 影响开源生态、企业部署、AI 基础设施成本
  • Technical Impact: LLM / MoE / Reasoning / Long Context / Inference
  • Market Impact: 阿里云、开源社区、NVIDIA、AMD、云服务提供商
  • Action Recommendation: Experiment / Research
  • 来源: Hugging Face · NVIDIA Developer Blog · LMSYS SGLang Day-0 · IT之家

阿里 Qwen 团队正式开放 Qwen3.8-2.4T-A95B 模型权重,这是 Qwen-Max 级别模型首次开源。2.4T 总参数 / 95B 激活每 Token,原生支持 256K 上下文(可扩展至 1M+)。采用混合注意力架构(Full + Linear Attention)。SGLang、Miles、vLLM 均提供 Day-0 支持,NVIDIA 发布 GB300 NVL72 部署指南,AMD 也宣布 Day-0 支持。注意: 许可证为 qwen3.8-max(非 Apache-2.0),商业使用需审阅许可条款。


[S] NVIDIA 联合六大机构融资 5000 亿美元建 AI 工厂

  • Signal Score: 80 / Confidence: 95(NVIDIA 官方新闻稿 + Apollo 官方声明 + 多家金融媒体)
  • Business Impact: Critical — 影响全球 AI 基础设施投资、数据中心建设、GPU 供需
  • Technical Impact: Inference / Infrastructure / Cloud Computing
  • Market Impact: NVIDIA、Apollo、BlackRock、Blackstone、Brookfield、Goldman Sachs、KKR、云计算厂商、芯片制造商
  • Action Recommendation: Monitor / Prepare
  • 来源: NVIDIA Press Release · Apollo · Cryptonomist

NVIDIA 与 Apollo、BlackRock、Blackstone、Brookfield、Goldman Sachs、KKR 签署谅解备忘录,建立独立 AI 算力融资平台,目标动员超过 5000 亿美元第三方资本,用于 AI 数据中心、芯片制造和配套电力基础设施。以”算力作为抵押品”的创新金融结构,是 AI 产业从”VC 投入期”进入”基础设施投资期”的标志性事件。


[S] ChatGPT & Gemini 双双突破 10 亿用户里程碑

  • Signal Score: 78 / Confidence: 95(OpenAI 官方博客 + Google 官方博客 + The Verge)
  • Business Impact: High — 影响 AI 消费市场、广告、搜索、生产力工具
  • Technical Impact: LLM / Multimodal / Consumer AI
  • Market Impact: OpenAI、Google、Microsoft、Apple、Meta
  • Action Recommendation: Monitor
  • 来源: The Verge · Google Blog · Ars Technica

OpenAI 披露 ChatGPT 在 7 月达到 10 亿周活用户,Google 则宣布 Gemini 月活达 10 亿,成为其史上增长最快的产品(第 14 个十亿级产品)。ChatGPT 增速放缓(从 900M 周活到 1B 用了 5 个月),Gemini 增速更快(从 7.5 亿月活到 10 亿仅数月)。63% 的 Gemini 交互通过语音输入,反映用户行为从打字向语音的范式转变。


A Level

[A] Anthropic 多智能体系统研究:45 个协调 Agent 发现 266 个漏洞

  • Signal Score: 79 / Confidence: 95(Anthropic 官方 Research 页面)
  • Business Impact: High — 影响软件安全测试、Agent 架构设计、AI 安全策略
  • Technical Impact: Agent / Multi-Agent / Security / Evaluation / Tool Calling
  • Action Recommendation: Research / Experiment
  • 来源: Anthropic Research

Anthropic 发布重要研究,揭示多智能体系统的模式与风险。实验设置 45 个协调 Agent,在共享虚拟机和论坛中协作,在 2700 万 token 运行中从 15 个开源项目发现 266 个漏洞。作为对比,独立并行方法在 650 万 token 中发现 21 个,仅 12 个重叠。协调 Agent 表现出专业化分工能力,但研究同时警示个体层面的良性行为怪癖可能叠加为意外的系统性失败。Agent 间交互量或将超过人机交互。


[A] Anthropic 最快 9 月 IPO:9650 亿美元估值

  • Signal Score: 77 / Confidence: 90(IT之家 + Tech Insider + 多家金融媒体)
  • Business Impact: High — 影响 AI 资本市场、竞争对手估值、人才流动
  • Technical Impact: N/A(资本市场事件)
  • Market Impact: Anthropic、OpenAI、xAI、AI 投资市场
  • Action Recommendation: Monitor / Prepare
  • 来源: IT之家 · Tech Insider · StartupHub

Anthropic 正与潜在投资者接触,计划 9 月底或 10 月初正式上市。公司估值 9650 亿美元,年化收入已超 470 亿美元(去年 100 亿,增长近 5 倍)。已秘密提交 S-1 文件,高盛、摩根大通、摩根士丹利承销。若成功,将是史上最大规模科技 IPO 之一。


[A] 微软首发自研推理模型 MAI-Thinking-1

  • Signal Score: 74 / Confidence: 90(Mustafa Suleyman X 发布 + Microsoft AI 官方页面)
  • Business Impact: High — 影响企业 AI 部署、微软 AI 生态、Copilot 战略
  • Technical Impact: Reasoning / LLM / Enterprise AI
  • Market Impact: Microsoft、OpenAI、Anthropic、Google
  • Action Recommendation: Experiment
  • 来源: Mustafa Suleyman @ X · Microsoft AI

微软发布首个从零构建的自研推理模型 MAI-Thinking-1,已在 Microsoft Foundry 上线公开预览。面向企业级推理密集型任务,在数学、知识和编码方面达到 SOTA 水平。结合微软 Foundry 的评估、可观测性、安全与部署工具链。MAI 系列持续扩展,此前已发布 MAI-Image-2.6 和 MAI-Code-1.1-Flash。


[A] OpenAI Astra 模型攻克 10 道数学难题

  • Signal Score: 76 / Confidence: 85(The Verge 报道 + OpenAI 发布 250 页论文 + Lean 验证)
  • Business Impact: Medium — 影响数学研究、科学发现、AI 推理能力边界
  • Technical Impact: Reasoning / Mathematics / Formal Verification
  • Market Impact: OpenAI、DeepMind、AI-for-science 领域
  • Action Recommendation: Research
  • 来源: The Verge

OpenAI 未发布的 Astra 模型解决了 10 道长期悬而未决的数学难题,涵盖球体堆积、纠错码、非 sofic 群存在性等领域,发布超 250 页论文及 Lean 形式化验证结果。数学家既兴奋又担忧——AI 正在进入数学发现的核心领域。


[A] Meta Muse Glimmer 30B 开源(Apache 2.0):本地 Agent 消费级 GPU 可跑

  • Signal Score: 75 / Confidence: 95(Meta AI at Meta 官方 X + OpenRouter + LMSYS + 多个来源)
  • Business Impact: High — 影响本地 AI 部署、Agent 应用、消费级 GPU 市场
  • Technical Impact: Agent / LLM / Multimodal / Local Inference
  • Market Impact: Meta、OpenRouter、NVIDIA、Apple、开源社区
  • Action Recommendation: Experiment
  • 来源: AI at Meta @ X · OpenRouter · LMSYS Blog

Meta 超级智能实验室首个开放权重模型 Muse Glimmer 正式发布。30B 密集参数文本+图像多模态模型,Apache 2.0 许可证,可在消费级硬件(Mac、24GB 显存 PC)上运行。MCP Atlas 得分 75.5,SWE-Bench Pro 得分 51.2。已上线 OpenRouter。SGLang 提供 Day-0 支持。Meta 同步预告将发布 Muse Spark 1.2 开源权重。


[A] 研究人员发现 API 漏洞可读取 LLM 加密推理过程

  • Signal Score: 75 / Confidence: 80(The Decoder 独家报道,持续验证中)
  • Business Impact: High — 安全影响所有推理模型提供商,触及隐私/合规红线
  • Technical Impact: Security / Inference / Privacy / Evaluation
  • Market Impact: OpenAI、Anthropic、Google、所有推理 API 提供商
  • Action Recommendation: Monitor / Prepare
  • 来源: The Decoder

Alexander Panfilov 团队发现 OpenAI、Anthropic、Google 等主要 AI 提供商的 API 存在漏洞,可读取推理模型的加密思考过程。扫描约 7000 条公开会话发现 62 个 API 密钥、33 个邮箱和 33 个密码。通过越狱,Anthropic 的 Haiku 4.5 可逐字转写 Opus 4.8 的原始推理。解码 10000 条推理轨迹的 API 成本约 720 美元。对隐私合规和推理安全构成重大挑战。


B Level

模型与产品

  • NVIDIA Nemotron 3.5 Lightning 开源 30B MoE 模型发布,专为本地 Agent 设计,SGLang Day-0 支持。同时传闻 NVIDIA 在开发万亿参数 Nemotron 4。— NVIDIA Blog · IT之家
  • LTX-2.5 视频模型 发布:10 秒 720P 视频仅需 6.8 秒(2 张 GB200),原生集成 ComfyUI,年收入 <$10M 组织免费。— IT之家
  • Claude in Chrome 升级为 Claude Cowork:侧边栏会话可保存历史记录,任务在桌面/网页/移动端无缝切换。— Claude Blog
  • Claude Code v2.1.229 发布:远程会话恢复、插件市场命令源。— GitHub Releases
  • OpenAI GPT-5.6-Cyber 发布:面向授权漏洞研究的网络安全专用模型。— OpenAI
  • ChatGPT 桌面端支持导入其他 Agent 工作数据(Codex 等),跨平台同步。— OpenAI Devs @ X
  • Runway Seedance 2.5 上线,支持 50 个角色参考和最长 30 秒音乐同步视频。— Runway @ X
  • Mojo 1.0 正式发布:提供稳定生产环境基础,200 名贡献者 1100+ PR。— Modular Blog
  • Google AMIE 医疗 AI 首次展示实时临床视频问诊能力,基于 Gemini + Project Astra。— Google Blog
  • 蚂蚁百灵 Ling-3.0-tiny 开源:7.9B 总参数 / 1.3B 激活的混合推理模型,提供 BF16/FP8/INT4 版本。— 公众号:蚂蚁百灵
  • 智谱 ZCode 全面升级:Goal、Subagents、Remote Control 与闲时任务四大功能上线。— 公众号:智谱
  • WorkBuddy 上线远程控制:PC/App/小程序打通,手机端实时同步电脑端 Agent 工作。— 数字生命卡兹克

研究与论文

  • Google Research:Recall 是参数化事实性的瓶颈 — 知识画像框架 + WikiProfile 基准(2150 条维基百科事实)。— Google Research Blog
  • OpenRouter 实时网页搜索基准测试:搜索预算增加 1→25 轮使 BrowseComp 得分近乎翻倍。— OpenRouter Blog
  • LMSYS Unified Radix Cache:为混合模型前缀缓存构建统一树结构。— LMSYS Blog
  • Apple Silicon macOS 虚拟机 GPU 直通:llama.cpp 推理加速 11-16 倍,接近裸机 98% 性能。— GitHub (trycua/cua)
  • a16z 数据显示:计算机操作 Agent 在 OSWorld 基准上最佳成绩从 42% 升至 85%(超人类约 72%),Claude Fable 5 以 85% 领先。— a16z

行业动态

  • Research Gold 造假曝光:声称”100% 人类撰写”的医学研究网站,AI 生成审稿人、AI 客服坚称自己是真人。— 404 Media
  • AutoGPT 用 AGENTS.md 和技能门控管理 AI 生成的 PR:CLA 签名被用作”人类探测器”。— GitHub Blog
  • tl;dv 数据泄露:18.1 万段 AI 会议录音暴露,可实时闯入他人通话。— Hacker News
  • 微信朋友圈 AI 帮写/点评内测:AI 内容进入社交核心场景,引发”人味消失”担忧。— 数字生命卡兹克

AI Labs

OpenAI

  • GPT-5.6-Cyber 网络安全专用模型发布(Daybreak Red)
  • ChatGPT 10 亿周活用户确认
  • ChatGPT 桌面端支持导入其他 Agent 工作数据
  • Astra 模型攻克 10 道数学难题(250 页论文 + Lean 验证)
  • RingCentral 案例:用 ChatGPT Work 和 Codex 构建 AI 原生工作流

xAI

  • Grok 4.6 发布 — 500K 上下文,Agent 编码/知识工作追平 GPT-5.6 Sol
  • 与 Cursor 联合发布,已集成在 Cursor 中
  • 53 步完成复杂多步工作流(vs Claude Opus 5 的 103 步)

Anthropic

  • 多智能体系统研究论文:45 协调 Agent 发现 266 漏洞
  • Claude in Chrome → Claude Cowork 升级
  • Claude Code v2.1.229 发布(远程会话恢复)
  • 最快 9 月 IPO,9650 亿美元估值

Google DeepMind

  • Gemini 月活破 10 亿,成 Google 增长最快产品(63% 语音交互)
  • AMIE 医疗 AI 实时视频问诊能力
  • Recall 研究:参数化事实性瓶颈框架
  • Gemini 助力 Database Migration Service 加速 PostgreSQL 迁移

阿里 Qwen

  • Qwen3.8-2.4T-A95B 开源(2.4T MoE,95B 激活)
  • NVIDIA、AMD、SGLang、Miles 均 Day-0 支持
  • 新许可证 qwen3.8-max(非 Apache-2.0)

微软

  • MAI-Thinking-1 推理模型首发(Foundry 公开预览)
  • MAI-Image-2.6、MAI-Code-1.1-Flash 持续扩展

Meta

  • Muse Glimmer 30B 开源(Apache 2.0, 消费级 GPU 可运行)
  • 预告 Muse Spark 1.2 开源权重
  • 扎克伯格发文:”超级智能应人人可用”

NVIDIA

  • Nemotron 3.5 Lightning 开源(30B MoE,本地 Agent)
  • 全球最大 AI 基础设施融资:$5000 亿
  • Nemotron 4 万亿参数传闻

Open Source

新发布/新框架

  • Qwen3.8-2.4T-A95B — 阿里最大开源模型,2.4T MoE,Hugging Face 开放权重
  • Muse Glimmer — Meta 30B Apache 2.0 多模态 Agent 模型
  • NVIDIA Nemotron 3.5 Lightning — 30B MoE 本地 Agent 模型
  • Ling-3.0-tiny — 蚂蚁百灵,1.3B 激活参数混合推理模型
  • Mojo 1.0 — Modular 正式发布 1.0 稳定版本

GitHub Trending 亮点

  • omnigent-ai/omnigent — 开源 AI Agent 框架,可编排 Claude Code/Codex/Cursor 等
  • hugohe3/ppt-master — AI 文档转原生 PowerPoint
  • infiniflow/ragflow — RAG 工作流引擎
  • NVIDIA-NeMo/Switchyard — 开源模型路由库
  • trycua/cua — macOS GPU 直通推理加速

Capital

重大融资

  • NVIDIA × 六大机构 × $5000 亿 — AI 基础设施融资平台(Apollo/BlackRock/Blackstone/Brookfield/Goldman/KKR)
  • CodeRabbit — Nvidia 支持的 AI 代码审查服务,融资 $1.43 亿,估值 $15 亿
  • Blacksmith — AI 代码测试初创公司,融资 $4500 万 Series B,估值 $5.5 亿(10x 增长)
  • Lovable — 瑞典 AI 初创公司,融资 $3.3 亿,估值 $66 亿(vibe coding 赛道)

IPO

  • Anthropic — 9650 亿美元估值,9 月底/10 月初 IPO,目标融资 $600 亿+

Policy

EU AI Act 执法时代开启

  • 8 月 2 日生效:EU AI Act 透明度义务(Article 50)已正式执行,违规罚款最高 €1500 万或全球年收入 3%
  • 仅 8/27 个欧盟成员国指定了执法联络人,监管碎片化问题突出
  • 美国联邦 AI 政策在国会陷入僵局
  • 中国已发出首批 AI 违规罚款
  • 企业需立即梳理 AI 系统透明度合规

Trend Summary

今天 AI 行业真正发生了什么?

1. 模型发布”三连发”:Agent 性能进入新台阶
Grok 4.6(xAI/Cursor)、DeepSeek V4 Pro 0813、Qwen3.8-2.4T(阿里)在 24 小时内密集发布,三个模型在 Agent 基准上均逼近或追平 Claude Fable 5 水平。这不是巧合,而是 Agent 能力成为模型竞争核心指标的直接体现。

2. 开源模型首次进入”前沿参数级”
Qwen3.8-2.4T 是首个 Qwen-Max 级别的开源模型,Muse Glimmer 是 Meta 超级智能实验室首个开放权重模型。开源不再是”追赶者”,而是开始定义 Agent 时代的计算基础设施。

3. AI 从”用户增长”转向”基础设施投资”
ChatGPT 和 Gemini 双双突破 10 亿用户,标志着 AI 消费级市场进入成熟期。与此同时,NVIDIA 的 $5000 亿融资计划标志着 AI 从”软件赛道”正式进入”基础设施赛道”——与电信、能源、交通等传统基础设施投资逻辑趋同。

4. 多智能体系统从理论走向实践
Anthropic 的 45 Agent 协调实验揭示了多智能体系统的巨大潜力(266 个漏洞 vs 21 个)和潜在风险(系统性失败)。a16z 数据显示计算机操作 Agent 能力一年内从 42% 跃升至 85%。多智能体正在从”概念验证”进入”生产部署”阶段。

正在形成的趋势

  • Agent 能力成为模型竞争核心指标:不再比”谁更懂世界”,而是比”谁更能完成任务”
  • 开源模型向万亿参数级冲击:NVIDIA Nemotron 4 传闻、Qwen3.8 开源,闭源 vs 开源界限正在模糊
  • AI 成本快速下降:DeepSeek V4 Pro 以 1/57 价格逼近 Fable 5,API 定价战持续
  • 推理模型安全新挑战:加密推理过程可被读取,隐私/合规需要新方案
  • AI 基础设施资本化:5000 亿美元级融资模式出现,AI 数据中心走向”金融化”

未来一周重点关注

  • 明天: Claude Code 自动模式默认化(8 月 14 日生效),Grok 4.6 实际体验评测
  • 本周: DeepSeek V4 Pro 与 Grok 4.6 的基准对比详细分析,Qwen3.8 开源社区反响
  • 提前布局: Anthropic IPO 进程(9 月),EU AI Act 合规执行情况,推理模型 API 安全漏洞后续发展,OpenAI 可能在 8 月发布更多 Astra 细节

发表评论

您的邮箱地址不会被公开。 必填项已用 * 标注

滚动至顶部