🤖 AI 大模型日报 — 2026-08-10
本报告基于多源公开信息整理,覆盖 2026 年 8 月上旬全球大模型领域的最新动态。
数据截至 2026-08-10,由 Hermes Agent 自动搜集整理。
📌 今日速览
- OpenAI 史上最大预训练模型 “Doug” 曝光(8 月 9 日):SemiAnalysis 披露 OpenAI 此前卡住的预训练问题已解决,正在推进代号 Doug 的更大规模预训练项目,与 GPT-6 并非同一模型,最迟或于 11 月前推出
- DeepSeek V4 正式版发布窗口开启:据新浪财经报道,V4 GA 预计 8 月 10 日至 20 日发布(封闭测试结束后约 1~2 周);V4-Flash 正式版已于 7 月 31 日上线公测,Agent 基准大幅提升
- DeepSeek 重启第二轮融资:计划募资 500 亿元、投前估值突破 5000 亿元,坐稳国内 AI 企业估值榜首,两轮累计融资或达千亿级
- 开源模型排行榜大洗牌:阿里 Qwen-3-235B 于 8 月拿下开源模型第一;智谱 GLM-4.5 与 OpenAI gpt-oss-120b 首次进入前十
- Claude Opus 5 登顶独立智能指数:Artificial Analysis 智能指数 v4.1 中 Opus 5 以 61 分居首(7 月 24 日),Fable 5 60 分、GPT-5.6 Sol 59 分
- 可灵 AI 创视频大模型融资纪录:落地近 30 亿美元融资,投后估值有望达 180 亿美元
- 上周智能科技投融资密集:8 月 3 日—9 日共披露 137 起,融资总额约 1268.54 亿元
🔥 热门话题摘要
OpenAI 秘密大模型 Doug 浮出水面:研究机构 SemiAnalysis 最新披露,OpenAI 此前卡住的预训练问题已经解决,正在推进代号Doug的史上最大规模预训练模型。爆料称 Doug 与 GPT-6 并非同一模型,且最迟可能在 11 月前推出——这意味着 OpenAI 在 GPT-5.6 之外还握有一张更大的底牌,新一轮"预训练军备竞赛"信号明确。
DeepSeek V4 正式版进入倒计时:V4-Flash 正式版(0731)已于 7 月底上线公测,Terminal Bench 2.1 达 82.7、Cybergym 76.7 等 Agent 基准大幅超越 V4-Pro-Preview,并原生支持 Responses API、适配 Codex。V4-Pro 正式版"将尽快发布",行业预计 8 月中旬(8/10—8/20)落地;叠加 500 亿元新一轮融资与 5000 亿元估值,DeepSeek 正在资本与技术双线冲刺。
“价格战"全面升级为"性价比战”:Gemini 3.5 Flash 以"速度 4 倍、价格砍半"冲击市场(头部企业迁移 80% 负载每年可省超 10 亿美元);Claude Opus 5 定价约为 Fable 5 的一半并登顶独立智能指数;GPT-5.6 宣布端到端服务成本再降 20%、token 生成效率提升超 15%。前沿能力的单位成本正在被系统性击穿。
开源生态格局生变:Qwen-3-235B 登顶 8 月开源模型排行榜,智谱 GLM-4.5 与 OpenAI gpt-oss-120b 首次闯入前十,DeepSeek-V4-Flash 在 OpenRouter 上 token 份额持续居前——开源阵营由"一超多强"走向多极竞争,国产开源模型集体崛起。
资本向头部 AI 集中、视频与智能体成吸金赛道:可灵 AI 近 30 亿美元融资创全球视频大模型纪录;Moonshot AI 融资 35 亿美元;上周国内披露 137 起投融资事件、总额约 1268.54 亿元。资金加速流向物理 AI、基础大模型与 AI 软件应用,早期融资占比高达 64.6%。
🌍 国际头部模型动态
OpenAI — GPT 系列
| 模型 | 时间 | 要点 |
|---|---|---|
| Doug(预训练中) | 2026-08-09 曝光 | 史上最大规模预训练项目,与 GPT-6 非同一模型;SemiAnalysis 称此前卡住的预训练问题已解决,最迟或 11 月前推出 |
| GPT-5.6 Sol / Terra / Luna | 2026-07-09 | 三档 Agent 模型:1.05M 上下文、128K 最大输出;新增 “ultra” 多智能体并行档位;Sol 编码智能体指数 80 分(超 Fable 5 2.8 分),token/时间/成本约为其 1/2、1/2、2/3;7/29 披露端到端服务成本再降 20%、token 效率提升超 15% |
| GPT-5.2 | 2025-12 | 推理与数学标杆,已被 5.6 系列取代主力地位 |
| GPT-Image 2 | 2026-04 | 原生图像生成模型,自带推理模式 |
其他动态:收购演示文稿初创 NextSlide 扩充办公生态;gpt-oss-120b 首次进入开源模型榜前十;OpenAI 高管称"Codex 这类 Harness 模式也就再火两个月",暗示技术路线迭代加速。
Anthropic — Claude 系列
| 模型 | 时间 | 要点 |
|---|---|---|
| Claude Opus 5 | 2026-07-24 | $5/$25 每百万 token(约 Fable 5 一半价格);Artificial Analysis 智能指数 v4.1 登顶(61 分);Coding Agent Index 上 Claude Code + Opus 5 居首(67 分),单任务成本 $7.08 低于竞品 $11.71;已成为 Claude Max 默认模型、Pro 最强模型 |
| Claude Fable 5 | 2026-06-09 | 旗舰模型,智能指数 60 分居次席;7 月 1 日解除限制全球重新部署 |
| Claude Sonnet 5 | 2026-06-30 | 1M 上下文、128K 最大输出,持久化记忆与多步工具调用 |
| Claude Code Auto 模式 | 2026-08-14 生效 | Pro/Max/Team 默认开启,安全分类器拦截 89% 危险命令 |
Google DeepMind — Gemini 系列
- Gemini 3.5 Flash(I/O 2026 发布,已 GA):定位"迄今最强大的智能体与编程模型",输出 token 速率达竞品 4 倍(Antigravity 优化版 12 倍),智能体任务成本通常不到竞品一半;GDPval-AA 1656 Elo、Terminal-Bench 2.1 达 76.2%、MCP Atlas 83.6%;支持多子智能体并行与数周自主工作流。
- Gemini 3.5 Pro:已在 Google 内部使用,“展现极大性能提升”,预计近期正式推出,正面迎战 GPT-5.6 与 Claude Opus 5。
- Gemini 3.6 Flash / Flash-Lite / Flash Cyber(2026-07-20):更低成本实现更高 token 效率(输出较 3.5 Flash 减 17%~65%)。
- 生态数据:Gemini App 月活从 4 亿增至 9 亿;月度 Token 处理量 3.2 千万亿(同比 +7 倍);2026 年资本支出预计 1800~1900 亿美元;Gemini Spark 个人智能体已向美国 AI Ultra 用户开放 Beta。
xAI — Grok 系列
- Grok 4.5(2026-07-15):xAI 收购 Cursor 后由 Cursor 团队主导训练的 Agent 模型,MoE 约 1.5T 参数、500K 上下文。
Meta — Llama / Muse 系列
- Muse Spark 1.2 (xhigh)(2026-08-05 上榜):Meta Superintelligence Labs 推理模型,LLM Rank 综合评分 90.4%,在多维评测中表现突出。
- Llama 4(Scout / Maverick)为上一代开源旗舰;开源榜上 Llama 系持续被 Qwen / DeepSeek / GLM 追赶。
其他国际厂商
- Mistral:Magistral 系列持续迭代小模型路线;Mistral Medium 3 为"前沿级多模态模型"。
- InclusionAI — Ling 3.0(2026-08-04/06):Tiny / Flash 版本上榜 LLM Rank,主打高性价比推理。
- AI9Stars — G9v3-39A5B(2026-08-03):新上榜模型。
🇨🇳 国内模型动态
| 厂商 | 模型 | 要点 |
|---|---|---|
| DeepSeek | DeepSeek-V4-Flash 0731(2026-07-31 正式版公测) | Agent 能力大幅增强:Terminal Bench 2.1 82.7、NL2Repo 54.2、Cybergym 76.7、DSBench-Hard 59.6;原生支持 Responses API 并适配 Codex;OpenRouter 上 token 份额持续居前、HF 官方仓下载量突破 61.8 万(环比 +42.6%) |
| DeepSeek | DeepSeek-V4-Pro 正式版(即将发布) | GA 预计 8 月 10—20 日;API 已支持 V4-Pro/V4-Flash,旧模型名 deepseek-chat / deepseek-reasoner 已于 7/24 停用 |
| DeepSeek | 新一轮融资 | 计划募资 500 亿元、投前估值超 5000 亿元,两轮累计或达千亿级,坐稳国内 AI 估值榜首 |
| 阿里 Qwen | Qwen-3-235B | 8 月开源模型排行榜第一名;Qwen 3.8 Max(8 月 3 日,2.4 万亿参数)为千问迄今最大旗舰;通义实验室已重组为 Alibaba Token Hub 旗下 Qwen 研发单元 |
| 智谱 GLM | GLM-4.5 | 首次进入开源模型榜前十;GLM-4.6 系列 Agentic Coding 大幅跃升,支持寒武纪国产芯片 FP8+Int4 混合量化部署 |
| 月之暗面 Kimi | Kimi K3 | 新一代旗舰大模型,在 2026 国际数学家大会期间引发关注;K2.7 Code 等持续迭代 |
| 可灵 AI | 可灵视频/图像系列 | 落地近 30 亿美元融资,创全球视频大模型公司最大融资纪录,投后估值有望达 180 亿美元;可灵视频 O1、2.6 及图像 O1 持续迭代 |
| 腾讯混元 | HunyuanVideo 1.5 | 开源视频生成,8.3B 参数,14G 显存消费级可跑 |
| 字节跳动 | 豆包 Doubao-Seed-1.6 系列 | 多模态全家桶;豆包 + 火山引擎组合重排 To B 业务 |
| MiniMax | MiniMax-M1、H3 | 推理 + 语音模型持续迭代;港股表现活跃 |
| 百度 | 文心 ERNIE 5.0 Preview | 文本榜国内第一(1432 分) |
| 华为 / 科大讯飞等 | 盘古 / 星火等 | 以昇腾算力 + 行业解决方案推动全栈落地 |
📈 行业趋势分析
1. 预训练军备竞赛再启:规模仍是暗线
OpenAI Doug(史上最大预训练项目)与 GPT-6 并行推进、Gemini 3.5 Pro 蓄势待发、DeepSeek V4 进入 GA 窗口——在"效率与性价比"的明线叙事之下,头部厂商的预训练规模军备竞赛并未停歇。模型能力的天花板仍由预训练投入决定,性价比战只是让同一能力层级内的竞争更激烈。
2. 性价比成为竞争主轴,价格体系加速重构
Gemini 3.5 Flash"速度 4 倍、价格砍半"、Claude Opus 5 半价登顶、GPT-5.6 成本再降 20%——前沿模型单位成本正在被系统性击穿,企业以更低的迁移成本获得前沿能力。价格弹性(effort 档位、轻量变体、Flash 系列)成为各厂标配,API 定价将进入持续下探通道。
3. 智能体 AI 从"演示"走向"生产"
Claude Code Auto 模式默认开启、Gemini 3.5 支持数周自主工作流与多子智能体并行、DeepSeek-V4-Flash 全面强化 Agent 基准并适配 Codex——"自主执行 + 安全兜底"成为 Agent 产品标配,智能体在编程、金融尽调、发票处理、税务申报等真实场景开始稳定交付,行业竞争焦点从"会不会推理"转向"能不能可靠、安全地干活"。
4. 开源阵营多极竞争,国产模型集体崛起
Qwen-3-235B 登顶开源榜、GLM-4.5 与 gpt-oss-120b 首入前十、DeepSeek-V4-Flash 高性价比扩散——开源生态从"一超多强"走向多极竞争,且中国厂商在开源榜占据明显优势。开源与闭源的边界也在模糊(OpenAI 发布开源权重模型、Meta 重心转向 Superintelligence Labs)。
5. 资本加速向头部集中,视频与具身智能成新吸金赛道
可灵 AI 近 30 亿美元(全球视频大模型纪录)、Moonshot AI 35 亿美元、DeepSeek 500 亿元融资——资金高度集中于头部基础模型与 AI 应用。亿欧数据统计上周国内融资事件 137 起、总额约 1268.54 亿元,资金向 AI 软件应用与物理 AI(具身智能、智能驾驶)赛道集中,早期融资占比 64.6%,开源繁荣带动创业热潮。
6. AI 与宏观发展议题深度绑定
世界银行 2026 世界发展报告《人工智能:发展新机遇》(8 月 4 日)指出,AI 可能让发展中国家在十年内实现原本需要更长时间的发展成果;各国围绕主权 AI、算力建设与"AI+"场景应用加速布局,AI 正从技术叙事上升为全球发展议程的核心变量。
📚 参考来源
- 新浪财经(2026-08-09):OpenAI 最大预训练模型 Doug 曝光;华尔街见闻、火星财经转载 SemiAnalysis 披露
- 新浪财经(2026-07-28):DeepSeek V4 正式版或延至 8 月中旬,国内大模型竞速生变
- DeepSeek API 官方更新日志(2026-07-31):DeepSeek-V4-Flash 正式版公测
- 钛媒体(2026-05-20):Gemini 3.5 发布——谷歌用"价格砍半、速度4倍"逼竞争对手出局
- OpenAI 官方(2026-07):GPT-5.6 发布与效率报告(openai.com/index/gpt-5-6/)
- Artificial Analysis 智能指数 v4.1 / Coding Agent Index v1.3(2026-07 更新)
- aivy.com.au(2026-08-07 更新):GPT-5.6 vs Claude Fable 5 / Opus 5 独立评测
- 世界互联网大会(2026-08):可灵 AI 融资近 30 亿美元创纪录
- 亿欧数据(2026-08-10):智能科技领域投融资周报(8 月 3 日—9 日)
- 全球人工智能趋势全景白皮书 2026(智慧城市行业分析)
- LLM Rank(llmrank.cn,2026-08-06 更新);LLM Stats AI News(llm-stats.com/ai-news)
- 世界银行(2026-08-04):2026 世界发展报告《人工智能:发展新机遇》
- 知乎专栏《国内外知名大模型及应用——模型/应用维度》(2026-08-05 更新)
报告生成时间:2026-08-10 | 由 Hermes Agent 自动整理