一个 8B「Transformer 混合专家」干三件事:美团 LongCat 把「看图、生图、改图」塞进同一个 ViT 块里
Hugging Face 每日论文(2026-08-24 精选)
8 月 24 日 Hugging Face 每日论文榜第九名的位置,是一篇来自美团 LongCat 团队的 UniSpace(arxiv:2608.08676)。它给出了一个 8B 参数的 Mixture-of-Transformer-Experts 模型,让看图(image understanding)、生图(text-to-image generation)、改图(instruction-based image editing)三件事,在同一个被冻结的视觉 ViT 里完成。最反常识的结论是:原本被认为「只会做语义理解」的 ViT 块,本身就具备保留细粒度视觉细节的能力——错的是参数化方式,而不是模型。
一个被默认的错:ViT 的 token 只能做语义理解
过去几年,多模态视觉编码器(CLIP、ViT、SigLIP 等)的训练目标是「让最后一层 token 和文本语义对齐」。这种对齐把 ViT 推向了语义抽象——它能告诉你「图里有一只猫」,但很难告诉你「猫的左耳尖有一道折痕」。
后果就是:想做生图或改图的研究者必须再搭一套独立的 VAE(变分自编码器)或者重建分支,从图像像素出发单独编码细节。这等于视觉信息被「劈」成两份:
- 一份走语义通路,给多模态理解用
- 一份走像素通路,给生图和改图用
两条通路在训练时互相不通信,最后只能在推理时拼到一起。这种「双通路」的设计是当前几乎所有统一视觉模型(unified vision model)的默认做法。
UniSpace 的论文核心论点是:这种「劈成两份」是不必要的。问题不在 ViT 本身,问题是 ViT 的 patch 参数化把细粒度信息过滤掉了——它不是不能保留,是参数化路径把它丢掉了。
Patch Reparameterization:换一种把图像「喂给」ViT 的方式
论文给出的解法叫 Patch Reparameterization。它做的事非常直接:在保留原有语义通路的同时,再加一条「重建感知」的 patch embedding 通路,把细粒度的视觉信息送到同一套被冻结的 ViT 块里。
具体到结构上,UniSpace 的 pipeline 是这样的:
- 图像进入模型时,同时生成两份 patch embedding——一份走「语义版」(沿用 ViT 的默认投影),一份走「重建版」(专门为像素级重建而训练)
- 两份 embedding 一起送进被冻结的 ViT Transformer 块,模型在内部用 MoTE(Mixture-of-Transformer-Experts)决定每条信息走哪几个专家
- 输出的 token 既能服务语义任务(看图),又能服务像素任务(生图、改图)
这套设计的精妙之处是:原始 ViT 的权重被完全冻结。模型不需要重新训练一个 ViT,而是在冻结的 ViT 外面再搭一套轻量的「再参数化通路」。这意味着任何已经训好的语义 ViT 都可以被零成本(不重训)地改造为 UniSpace——研究者只需要重训那套 patch embedding 和 MoTE 层。
| 模块 | 是否冻结 | 训练成本 | 作用 |
|---|---|---|---|
| ViT Transformer 块 | 冻结 | 0 | 同时承载语义与重建信号 |
| 语义 patch embedding | 可选冻结 | 低 | 提供原有语义通路 |
| 重建 patch embedding | 训练 | 中 | 注入细粒度视觉信息 |
| MoTE 路由 | 训练 | 中 | 决定不同任务走哪组专家 |
8B MoTE:让「三件事」共用一份表征
UniSpace 的最终规模是 8B 参数,采用 Mixture-of-Transformer-Experts 架构。这里的 MoTE 和常见的 MoE(Mixture-of-Experts)有两个区别:
- MoE 通常指「同一 Transformer 层里、FFN 部分切成多个专家」,注意力层是共享的
- MoTE 指「整段 Transformer 块都被切成专家」,不同任务可以在不同子专家里跑完整条前向
这个区别对生图和改图特别重要——生图需要长时间跨 patch 的注意力扩散,改图需要短时间精细化控制。两种计算模式如果共享注意力层就会互相干扰;用 MoTE 切成两组独立子专家后,它们可以并行跑而互不污染。
8B 这个规模也不大不小——比 BLIP-2、InstructBLIP 这类多模态理解模型大,比 SDXL、Flux 这类纯生图模型小。UniSpace 的设计哲学很明确:把「视觉空间统一」这件事做扎实,而不是在任何一个单项任务上追 SOTA。
论文给出的实际能力:文生图 + 指令式图像编辑
论文在系统级评估里展示了 UniSpace 的两件实用能力:
- 文生图(text-to-image):给定一段文本,模型从「一张空白潜变量」出发生成图像。和标准文生图模型相比,UniSpace 的优势是「它同时也懂语义」,所以在「文本 → 图像」的对齐上更稳定
- 指令式图像编辑(instruction-based editing):给定原图 + 一段自然语言指令(比如「把背景换成雪山」),模型在原图基础上改写。UniSpace 的优势是「它同时有像素通路」,所以改写后的图像在保留主体细节上更干净
两个能力是同一份模型权重提供的,推理时不必切换模型、不必切换数据集、不必切换 prompt 模板。这是「统一视觉空间」这个研究目标在 2026 年 8 月的一次明确回答:不再需要语义 ViT + 像素 VAE 两套并联,而是把两件事塞回同一个 ViT 块。
不再需要独立 VAE 通路:这件事对工程意味着什么
UniSpace 最值得工程团队关注的结论是:「不需要独立 VAE 通路」。这件事的影响不止学术——它在工程上有两个直接好处:
第一,部署成本下降。一份 8B UniSpace 取代「ViT + VAE + 生成器」三件套后,推理服务的 GPU 显存峰值会显著降低,模型并行策略也简单得多。这对在生产环境跑图像生成的团队是直接的工程收益。
第二,训练数据利用率上升。过去做生图和改图需要单独收集大量「图-文-图」三元组;UniSpace 用同一份多模态理解数据集就能训练,数据的边际效用被拉高。这对算力有限的中小团队尤其重要——他们可以用更少的数据得到「统一视觉空间」的能力。
局限与未验证:单一表征空间的代价
论文也诚实地给出了几条边界。
第一,UniSpace 的生图与改图能力,在单任务 SOTA 模型面前仍有差距。论文里给出的对比是「接近」而不是「超过」。这意味着如果你当前的任务只关心生图质量,那 SDXL、Flux 这类专业模型仍然是更直接的选择;UniSpace 的价值在「三件事都要做」的场景里。
第二,冻结 ViT 的选择是有代价的。ViT 一旦冻结,整个模型就锁死在原 ViT 的归纳偏置上。如果原 ViT 训练数据偏向自然图像,那 UniSpace 在医学图像、遥感图像、卫星图像等长尾领域的表现就需要重新评估。
第三,MoTE 的可扩展性还需要更多验证。当专家数从论文里的几组扩展到几十组、上百组时,路由的训练成本、专家负载均衡、推理时的路由延迟都会变成新问题——这是「MoE 类架构通病」,UniSpace 也不例外。
为什么这篇论文值得现在就去看
从研究脉络看,UniSpace 给「统一视觉表征」这条路线补了一块关键拼图。过去研究者要么选「双通路并联」,要么选「重训一整个多模态大模型」;前者部署重、后者训练贵。UniSpace 用 Patch Reparameterization 走了一条「冻结 ViT + 轻量再参数化」的中间路线,为以后做统一视觉表征的研究者提供了一个低成本的起点。
从工程视角看,UniSpace 的代码和模型权重大概率会开源在美团 LongCat 的开源生态里。如果你的团队已经在做多模态产品、并且为「ViT + VAE + 生图器」三件套的部署头疼,这是一篇可以直接对照实验的论文。
读完这篇论文最值得记住的一点是:「统一表征」不是一个必须把所有任务都打到 SOTA 才算赢的概念——它真正的价值,是把「同一份视觉信号被反复处理」这件事在结构层面干掉。UniSpace 用 8B 参数和冻结 ViT 做到了这件事,是 2026 年 8 月视觉多模态领域一个值得仔细读两遍的工作。