一、目录
(一)大语言模型与推理技术进展
- 阶跃推出 Step Edge 端侧模型家族
- 腾讯混元发布 Hy3 量化版及 llama.cpp MTP 补丁
- Thinking Machines Lab 发布多模态开源模型 Inkling
- 字节Seed模型升级:支持1M上下文并推出成本优惠
- OpenAI发布内部自动化红队模型GPT-Red
- InternLM 发布 Intern-S2-Preview-397B 多模态模型
- Google 推出 Gemma 4 更新,启用 FA4 并修补工具调用
- Muse Spark 1.1上线OpenRouter,仅面向美国开发者
(二)多模态与生成模型动态
- 腾讯混元全栈开源 HyOCR-1.5
- 阿里 ATH-MaaS 团队发布文档解析模型 OvisOCR2
- OpenMOSS开源MOSS-VL-Realtime模型,支持视频流实时视觉理解
- 阿里通义万相开源 Wan-Dancer-14B 音乐转舞蹈模型
- MiniMax正式上线Music 3.0音乐生成模型
- NVIDIA 推出开源 Nemotron 3 Embed 嵌入模型系列
- 商汤推出 SenseNova U1 Pro 具备原生图文交错思考能力
- 京东发布JoyAI-Talker与JoyAI-Video-Edit模型
- Qwen发布Qwen-Audio-3.0-Realtime实时语音模型
(三)垂直领域与具身智能模型
- actAVA发布医疗模型Cura 1T
- 中国气象局开源“风和”气象服务大语言模型
- 小米开源具身生成模型 Xiaomi-Robotics-U0 权重
- Xiaomi Robotics发布Xiaomi-Robotics-1:采用10万小时免实体预训练
二、详细内容汇总
(一)大语言模型与推理技术进展
1. 阶跃推出 Step Edge 端侧模型家族
阶跃星辰发布端侧模型家族Step Edge,采用「1+N」架构:由1个文本+视觉基础模型为核心,搭配Audio、GUI、Gen等多模态专项模型组成完整能力矩阵。该家族支持低至0.1秒的本地工具调用,可在端侧独立完成文本、视觉与语音处理,同时兼容端云协同调度模式。
官方数据显示,该系列在29项核心评测指标中取得第一,但相关对比结果均为内部自测产出。家族配套自研Step Inference NPU推理引擎以降低端到端延迟,相关产品在WAIC 2026线下展台进行展示。
参考链接:
https://edge.iap.platform.shaipower.com/waic/step-edge/
https://static.stepfun.com/blog/step-edge/
https://mp.weixin.qq.com/s/StOzmXaUGSsjUXkAoW-HZg
2. 腾讯混元发布 Hy3 量化版及 llama.cpp MTP 补丁
腾讯混元团队针对开源社区部署需求,推出295B参数Hy3模型的1bit、4bit及GPTQ Int4量化版本。原始BF16权重体量近600GB,量化后1bit版本压缩至85.5GiB,可在单张96GB显卡上完成部署;4bit版本为169.9GiB,需两张显卡运行;GPTQ Int4版本专门适配vLLM服务端部署场景。
官方表示,4bit版本输出分布与原始模型基本一致;1bit版本在长文理解能力上接近原模型,仅在Agent与代码任务上有小幅回落。团队同步发布llama.cpp补丁支持MTP投机解码,开启后1bit与4bit版本解码速度分别提升约50%和60%。
参考链接:
https://huggingface.co/tencent/Hy3
https://huggingface.co/AngelSlim/Hy3-GGUF
3. Thinking Machines Lab 发布多模态开源模型 Inkling
Thinking Machines Lab推出开源多模态混合专家模型Inkling,现已开放完整权重,可通过Tinker平台进行微调。模型总参数975B,激活参数41B,支持最高1M上下文窗口,原生兼容文本、图像、音频输入,支持灵活调节推理算力,平衡性能表现与部署成本。
模型权重已在Hugging Face上线,提供原始版本与适配NVIDIA Blackwell架构的NVFP4版本,支持SGLang、vLLM等主流框架本地部署,同时多家第三方平台提供API调用服务。同系列轻量版Inkling-Small目前仅开放预览,完整权重待测试完成后发布。
参考链接:
https://thinkingmachines.ai/news/introducing-inkling/
https://huggingface.co/thinkingmachines/Inkling
https://tinker.thinkingmachines.ai/playground
4. 字节Seed模型升级:支持1M上下文并推出成本优惠
字节跳动Seed团队完成Doubao-Seed-Evolving模型升级,正式支持百万Token超长上下文,可覆盖大型代码仓库、长篇文档等大体量处理场景。升级后模型长程任务能力在开发者众测中评分超过Doubao-Seed-2.1-pro,同时Token消耗效率更高,工具调用链路更精简。
官方同步推出「体验奖励计划」,参与可享调用成本立减20%。该模型已上线火山Agent Plan,单月套餐限时9.9元起。
参考链接:
https://mp.weixin.qq.com/s/oOOCgFFMl9XpsINb4HsqCg
https://ark.volcengine.com/region:cn-beijing/experience/gen_chat?model=doubao-seed-evolving-latest-version
5. OpenAI发布内部自动化红队模型GPT-Red
OpenAI推出内部专用的自动化红队模型GPT-Red,核心用途是大规模排查模型的提示注入安全漏洞。该模型通过自我对弈强化学习训练完成,能够攻破包括GPT-5.5在内的几乎所有内部与生产模型,目前已用于GPT-5.6 Sol的对抗性训练,提升模型安全鲁棒性。
官方数据显示,相比四个月前的最优生产模型,GPT-5.6 Sol在高难度直接提示注入基准上的失败率降低6倍。为避免恶意能力扩散,GPT-Red与对外部署模型保持隔离,仅限定内部使用。
参考链接:
https://openai.com/index/unlocking-self-improvement-gpt-red/
https://x.com/OpenAI/status/2077446718728425686
6. InternLM 发布 Intern-S2-Preview-397B 多模态模型
书生浦语发布Intern-S2-Preview-397B多模态基础模型,定位科学智能与长程Agent场景。模型实际参数量为403B,采用全新预训练范式——直接从科学文献原始页面进行视觉预训练,联合建模符号语义与视觉空间关系。
官方称其在开源模型中实现了领先的通用推理性能,在生物分子交互设计等专业科学任务上表现突出。模型支持最大256K文本长度与64K多模态推理长度,默认开启思维模式,兼容工具调用与时间序列推理,目前权重已开源。
参考链接:
https://huggingface.co/internlm/Intern-S2-Preview-397B
https://chat.intern-ai.org.cn
7. Google 推出 Gemma 4 更新,启用 FA4 并修补工具调用
Google推送Gemma 4模型更新,新版本已在Hugging Face开放下载。更新核心内容包括:在NVIDIA Hopper GPU上启用Flash Attention 4,预填充吞吐量提升25%-70%,首个词元生成延迟最高下降31%;同时修复了工具调用逻辑与聊天模板缺陷。
Unsloth AI提示用户需重新下载GGUF、MLX和NVFP4量化版本才能应用完整修复。针对官方宣称已修复的工具调用问题,有社区用户反馈多轮交互后仍会生成无意义内容。
参考链接:
https://huggingface.co/collections/google/gemma-4
8. Muse Spark 1.1上线OpenRouter,仅面向美国开发者
Meta旗下Muse Spark 1.1多模态推理模型正式登陆OpenRouter平台,目前仅向美国地区开发者开放。开发者可通过OpenRouter聊天室或MCP接口试用该模型,相关基准测试结果后续将陆续公布。
该模型为多模态推理架构,支持文本、图像、视频、音频与PDF输入,定位Agent工作流编排,可承担主智能体规划调度或子智能体执行角色。
参考链接:
https://x.com/MetaforDevs/status/2077804044505272425
https://openrouter.ai/meta/muse-spark-1.1
(二)多模态与生成模型动态
1. 腾讯混元全栈开源 HyOCR-1.5
腾讯混元团队全栈开源1B参数端到端OCR大模型HyOCR-1.5,公开完整的数据构造方法、训练配方与推理框架。模型引入基于90.7M参数草稿模型的DFlash投机解码框架,官方称在Transformers环境下实现6.37倍推理加速,支持通过llama.cpp在CPU、消费级显卡及普通笔记本本地部署。
训练层面采用Agentic Data Flow构造低资源语种、古文字与多图问答数据,将最大支持图像分辨率提升至4K,上下文窗口扩展至128K。官方表示该模型在OmniDocBench v1.6等多个基准取得SOTA,但在CHAOS-Bench幻觉抑制测试中绝对值仍偏低。
参考链接:
https://mp.weixin.qq.com/s/vKFCa9FfoGBUGK8J1MhFag
https://github.com/Tencent-Hunyuan/HunyuanOCR
2. 阿里 ATH-MaaS 团队发布文档解析模型 OvisOCR2
阿里巴巴ATH-MaaS团队推出端到端页面级文档解析模型OvisOCR2。该模型基于Qwen3.5-0.8B进行后训练,可将文档页面图像转换为符合自然阅读顺序的Markdown格式,完整覆盖文本、公式、表格与视觉区域的解析还原。
官方测试数据显示,OvisOCR2在OmniDocBench v1.6上取得96.58分,是首个登顶该榜单的端到端模型;同时在PureDocBench上取得75.06的最高Avg3得分。模型采用Apache 2.0开源协议,已在Hugging Face平台开放权重。
参考链接:
https://huggingface.co/ATH-MaaS/OvisOCR2
https://x.com/Xianbao_QIAN/status/2077160817292980489
3. OpenMOSS开源MOSS-VL-Realtime模型,支持视频流实时视觉理解
OpenMOSS团队开源视觉语言模型MOSS-VL-Realtime,采用Apache-2.0协议。模型参数量11B,上下文长度256K,专为连续视频流的实时视觉理解场景设计。
核心特性包括:流运行过程中支持随时提问、并行感知与生成、可随场景变化动态修正或中断回复、证据不足时主动保持沉默。官方称其在多个流媒体视频理解基准上达到开源模型SOTA。目前模型开放测试与研究用途,单个实例仅支持一路活跃实时会话。
参考链接:
https://openmoss.github.io/MOSS-VL
https://huggingface.co/OpenMOSS-Team/MOSS-VL-Realtime
4. 阿里通义万相开源 Wan-Dancer-14B 音乐转舞蹈模型
阿里通义万相团队开源音乐转舞蹈视频生成模型Wan-Dancer-14B,用户可基于单张人物图片与音频,在本地生成长时长、高画质且动作与音乐节奏精准同步的舞蹈视频。
模型采用全局关键帧规划+局部时序优化的分层架构,保障长视频动作连贯性,覆盖街舞、踢踏舞、拉丁舞、韩舞、中国古典舞五种风格。模型权重已上线Hugging Face与ModelScope平台,推理代码在GitHub开源,同时支持通过两个平台的在线空间直接体验。
参考链接:
https://x.com/Alibaba_Wan/status/2076879192214626512
https://huggingface.co/Wan-AI/Wan-Dancer-14B
5. MiniMax正式上线Music 3.0音乐生成模型
MiniMax正式推出新一代text-to-song音乐生成模型Music 3.0。新版本升级了语义理解模块,可更精准地解析曲风、编曲等创作指令;器乐音质得到提升,支持滑音、连奏等真实演奏技法;搭载新一代人声引擎,消除了高频机器嘶嘶声,人声自然度显著提升。
目前开发者与用户可通过API调用music-3.0正式版,也可使用免费版模型music-3-free进行体验。
参考链接:
https://platform.minimaxi.com/docs/guides/music-generation
https://minimaxi.com/audio/music
6. NVIDIA 推出开源 Nemotron 3 Embed 嵌入模型系列
NVIDIA发布Nemotron 3 Embed开源嵌入模型系列,包含8B与1B两种参数规格,已在Hugging Face开放权重,支持商业使用。
旗舰版Nemotron-3-Embed-8B-BF16在RTEB基准取得78.5%的得分,位列榜首;1B版本通过结构化剪枝与蒸馏技术得到,面向轻量化部署场景;适配Blackwell架构的NVFP4量化版可实现最高两倍的吞吐量提升。全系列均支持32k上下文窗口与34种语言检索,官方同步提供微调、蒸馏配方与NIM微服务部署方案。
参考链接:
https://huggingface.co/blog/nvidia/nemotron-3-embed-wins-rteb
https://build.nvidia.com/nvidia/nemotron-3-embed-1b
https://huggingface.co/nvidia/Nemotron-3-Embed-8B-BF16
7. 商汤推出 SenseNova U1 Pro 具备原生图文交错思考能力
商汤科技发布日日新SenseNova U1 Pro图片创作模型,目前开启邀请制预览。该模型基于NEO-Unify原生架构,统一理解、生成与动作链路,相比U1 Lite重点升级了原生图文交错思考链能力。
模型最高支持8K原生分辨率输出,官方宣称文字渲染出错率极低,可支撑印刷、展览级细节要求;内生支持数十轮Agentic Generation Loop智能体生成循环,实现整体风格与局部文本的同步精准可控编辑。正式版本与API服务预计2026年8月上线。
参考链接:
https://www.sensenova.cn/
https://x.com/SenseTime_AI/status/2078510614889238997
https://www.ithome.com/0/978/562.htm
8. 京东发布JoyAI-Talker与JoyAI-Video-Edit模型
京东在WAIC期间首次系统展示JoyAI全系列模型矩阵,同步发布两款新模型:JoyAI-Talker实时语音交互模型与JoyAI-Video-Edit实时视频编辑模型。
其中JoyAI-Talker具备低延迟对话、情绪理解、工具调用与记忆能力,可通过多模态信息精准理解用户意图;JoyAI-Video-Edit支持自定义画面与边预览边修改的流式编辑能力,可应用于视频生成与具身智能仿真数据合成场景。两款模型暂未公布具体开放时间与使用方式。
参考链接:
https://mp.weixin.qq.com/s/K_0jT-scyHgdJJi4y9ci7Q
https://mp.weixin.qq.com/s/A-Om9cK9rFnUme9l42BMLA
9. Qwen发布Qwen-Audio-3.0-Realtime实时语音模型
通义千问正式推出实时语音交互对话模型Qwen-Audio-3.0-Realtime,已在阿里云百炼平台上线。模型提供Plus(推理更强)与Flash(速度更快)两个版本,可在毫秒级响应的同时保障推理深度,支持边说边听、随时打断的全双工交互。
与传统依赖明确指令触发的语音模型不同,该模型可无需显式指令自动调用MCP、API等外部工具,调用结果自动融入对话记忆。模型还能根据语境动态调整语气与情感表达,官方称其在多个语音基准测试中取得高分或SOTA成绩。
参考链接:
https://mp.weixin.qq.com/s/mqZEm3auE_1YTKZ6Jxfzag
https://bailian.console.aliyun.com/cn-beijing/?spm=a2c4g.11186623.0.0.4ab7695bvInrXr#/model-market/detail/qwen-audio-3.0-realtime-plus?serviceSite=asia-pacific-china
(三)垂直领域与具身智能模型
1. actAVA发布医疗模型Cura 1T
actAVA推出万亿参数医疗专用模型Cura 1T,模型基于Kimi-K2.6微调,采用递归自我改进训练机制,聚焦患者护理、临床推理与医疗Agent工作流场景。
官方测试显示,该模型在HealthBench Hard等6项医疗基准中的5项得分领先,在MedXpertQA-Multimodal上排名第二;通用能力在各域外榜单中保持前五。同步开源了模型无关的评估工具cura-eval。官方强调Cura 1T为研究用途模型,不可替代专业医疗服务。
参考链接:
https://www.actava.ai/cura
https://github.com/actava-ai/Cura
2. 中国气象局开源“风和”气象服务大语言模型
中国气象局发布「风和」气象服务大语言模型,并启动全球开源计划。该模型由公共气象服务中心联合智谱等机构研发,基于GLM-4.5-Air的MoE架构,上下文长度128K。
模型训练使用超5000万tokens气象领域语料与49万指令微调样本,官方称在MetsEval-1k评估中得分优于主流通用大模型。权重已在Hugging Face、GitHub与ModelScope平台开放,采用MIT协议;模型已完成生成式AI备案,国际版同步上线提供服务。
参考链接:
https://mp.weixin.qq.com/s/kc6JDKiosorc8tIWbLHqhQ
https://github.com/PMSCCMA/FengHe
https://huggingface.co/PMSCCMA/FengHe
3. 小米开源具身生成模型 Xiaomi-Robotics-U0 权重
小米发布并开源38B参数自回归世界基础模型Xiaomi-Robotics-U0。模型采用统一多模态自回归框架,同时覆盖具身场景生成、具身迁移、具身视频生成与通用图文生成四类核心任务。
官方数据显示,该模型在WorldArena评测的126个模型中排名第一,真机OOD场景下任务完成进度平均提升超26%。目前代码与部分模型权重已开源,视频生成权重后续将陆续推出。
参考链接:
https://robotics.xiaomi.com/xiaomi-robotics-u0.html
https://huggingface.co/XiaomiRobotics/Xiaomi-Robotics-U0
4. Xiaomi Robotics发布Xiaomi-Robotics-1:采用10万小时免实体预训练
小米机器人实验室发布Xiaomi-Robotics-1机器人基础模型,通过「大规模免实体预训练+真实机器人后训练」的两阶段范式,突破机器人领域高质量数据稀缺的瓶颈。
预训练阶段使用10万小时、覆盖1700余种场景的免实体(UMI)轨迹数据;后训练阶段接入包含7200小时真实家庭机器人数据的跨实体数据集。实验显示,预训练效果随数据量与模型规模增长呈现清晰的Scaling规律,且该增益可完整传递到后训练的真实机器人任务中,暂无饱和迹象。
下游应用中,该模型学习全新复杂任务时,单任务平均仅需不到10小时演示数据即可达到75%的总体成功率,在四项主流仿真基准上均取得SOTA结果。
参考链接:
https://robotics.xiaomi.com/xiaomi-robotics-1.html