告别模型拼贴套路,自回归与离散扩散的融合,正在开启 AI 的体验时代。 作者丨张璐 编辑丨岑峰 “理解”和“生成”真的无法在同一个模型底座中完美融合吗? 不同于拼接独立模型的传统做法,NUS Show Lab 选择了一条更原生的架构路线:在单个 Transformer 中同时打通自回归预测与离散扩散生成。 作为多模态领域的重磅成果,Show-o 系列不仅打破了模态壁垒,更将触角延伸至具身机器人决策。 在 ECCV 2026 现场,Show Lab 负责人寿政教授详细还原了他们如何用闭环算法破解数据稀缺、消除连续视频帧卡顿,并实现云端大模型与端侧低延迟控制的完美配合。 寿政教授此次披露的研究成果,不仅是一次性能的跨越,更是多模态架构从“实验玩具”向“具身大脑”进化的分水岭。其核心突破点在于以下三个维度的重构: 首先,在架构底层,Showo 架构打破了文本离散性与视觉连续性的“死结”。通过将处理文本的自回归(AR)机制与处理视觉的离散掩码扩散(Discrete Diffusion)深度缝合,Showo 避开了传统自回归生成图像的效率泥潭,同时也解决了连续扩散模型无法直连 VLM 离散 Token 的痛点,实现了逻辑推理与高质生成的完美共生。 其次,针对困扰具身智能的“标注荒”,寿教授提出的循环一致性监督(Cycle Consistency)提供了极佳的解决方案。在缺乏人类标注的特定文化或低资源领域,模型通过“观察-描述-再合成”的逻辑循环实现自监督进化。这让 AI 从 YouTube 海量无标签“生肉”视频中吸取物理常识成为了可能,极大地拓宽了 Scaling Law 的数据边界。 最后,具身智能的落地成败取决于毫秒级的反应。团队自研的 Q1 实时骨干网,通过精密的特征对齐与蒸馏,实现了远超前沿闭源大模型的推理速度。这证明了:一个真正的“数字生命”大脑,不仅要能深思熟虑,更要在与物理世界碰撞的一瞬间,给出近乎本能的实时反馈。 以下为演讲全文,雷峰网AI科技评论在不改变原意的基础上,对内容进行了整理与编辑: 01 告别“只读不练”:多模态 AI 如何从“看懂视频”跨入“具身体验”? 过去几年,视觉与语言交叉领域的核心任务主要围绕视频理解与视频生成两条独立路线展开。前者致力于将视频转化为文本描述或解答视频问题,后者则根据文本提示词生成对应的动态视频。 以往业界往往为这两类任务分别训练专属模型,但一个天然的演进趋势是:能否构建一个单一的统一模型来同时完成这两类任务? 如今,AI 发展正迎来一个关键转折点,即从单纯的“语言-视频相互作用”迈入“体验时代”。 在这一新阶段,模型不再仅仅停留在对视觉和文本的关联认知上,而是融入了“动作”维度。模型需要具备在物理或虚拟环境中采取行动的能力,并通过环境给出的实时反馈实现“在做中学”。 02 Show-o 架构突破: 用单个 Transformer 打通“文本生成”与“高效绘图” 在实现多模态统一的探索中,业内曾出现过不同的技术尝试。 例如早期的NEXt-GPT项目,通过将大语言模型与专用的扩散模型进行外挂组合,实现了任意模态到任意模态(Any-to-Any)的输入与输出。 但这本质上依然是“大模型 + 独立生成模块”的分立架构,并未实现模型底座的真正融合。 要用单一网络同时搞定理解与生成,主要面临两套主流范式的权衡。 ▎纯自回归范式 以 Chameleon 为代表的自回归方案天然适配文本及图文交错数据,但在图像生成时需要将图像切分成数百个 Token 并进行逐 Token 预测,推理速度较慢且算力开销巨大。 ▎连续扩散范式 传统的连续扩散方案虽然生成质量高、速度快,但由于其运行在连续隐空间中,难以与基于离散 Token 的大语言模型在统一空间内无缝融合。 为了解决这一矛盾,Show-o 架构应运而生。它是首个将自回归与离散扩散融合在单一 Transformer 架构中的统一模型。 在处理文本理解与生成时,模型保持自回归模式; 而在进行图像或视频生成时,则切换至基于离散 Token 的扩散模式(基于 Mask-and-Predict 机制)。 模型仅需十几步迭代即可一次性恢复出完整的视觉Token,既保留了自回归对多模态文本的建模能力,又实现了扩散模型的高效图像生成,支持任意顺序和组合的多模态输入输出。 03 从静态生成到动态视频: Show-2 破解多模态统一的三大技术瓶颈 虽然 Show-o 验证了统一架构的可行性,但要迈向下一代统一模型,仍需破解三个核心难题: ▎双向反哺:不仅用“理解”教生成,更用“生成”提精理解 目前业内已普遍证实“理解能力可以促进生成”(例如提供更详尽的描述能指引更高质量的生成),但“生成能力如何反哺理解”仍是前沿课题。 为此,团队引入了循环一致性监督机制。对于缺乏文本描述的特定领域图像(如特定文化遗产或偏远自然景观),先利用理解模块生成描述文本,再将该文本作为输入驱动生成模块重建图像,通过对比原始图像与重建图像的差异建立自监督闭环。 ▎帧间流畅度革命:3D Tokenizer 与时空双向注意力 Show-o 初期主要针对静态图像或非连续关键帧,而 Show-2 则实现了向连续视频生成的跨越。 团队为此开发了一款通用的 3D Tokenizer,能够同时对图像和视频进行统一编解码。在注意力机制设计上,文本部分沿用因果单向注意力,保持前向预测的逻辑性;视觉部分则采用完全连接的时空双向注意力,让所有视觉 Token 在空间与时间维度上互相可见,大幅提升了生成视频的连贯性与画质。 ▎兼顾“高层语义”与“像素细节”的双路径架构 关于理解与生成是否应该共享同一个 Tokenizer,实验表明,若完全共享同一个编码器,在现有数据条件下理解性能相比专有的预训练编码器仍有微小差距。 因此 Show-2 采用了双路径架构:在输入端共享 3D Encoder,但在模型内部拆分为理解与生成两条路径。理解路径中特别加入语义层(Semantic Layer)进行特征蒸馏与对齐,既保障了视觉理解能力,又维持了极高的生成画质。 04 大脑落地物理世界: 从多模态大模型到机器人闭环控制 在完成多模态理解与生成的统一后,团队将这一统一架构思想进一步延伸至具身智能与机器人学习领域。 为了支撑具身智能的研究,团队搭建了完善的物理实验环境。桌面端部署了固定式双臂系统,分别搭载双指夹爪与五指灵巧手;移动端则结合了轮式导航底盘与顶部主动机械臂。通过双操纵手柄的遥操作采集系统,人类操作员可以实时控制机械臂运行并采集“状态-动作轨迹”数据。 在具体的模型部署上,传统的视觉-语言模型(VLM)正在向具备动作预测能力的视觉-语言-动作模型(VLA)演进: VLA 策略模型:在 VLM 底座的基础上加入动作调制层,能够根据视频输入和指令直接预测机器人应采取的物理动作。 世界模型(World Model):能够以当前视觉和动作输入为条件,预测未来环境的像素级变化。 世界动作模型(World Action Model, WAM):将两者融为一体,实现了“既预测动作,又预测未来动作产生的视觉结果”的闭环。 在落地应用层面,团队采取了云端大模型与端侧微调模型相结合的策略。云端前沿大模型虽然规划能力强,但推理延迟较高(单次决策约 8 至 20 秒); 而基于开源底座微调的本地模型能够实现近乎实时的低延迟控制,在自动化双臂协作等复杂任务中表现出更高的成功率与响应速度。 05 现场互动 Q&A ▎问:在 Show-2 中,团队将视觉理解与生成统一到了同一个模型架构中,并展现出了极高的灵活性与效率。请问在特定领域数据相对稀缺(Data Scarce)的场景下,这种统一理解与生成的架构,是否能比分立的模型带来更显著的性能提升? 答: 这是一个非常关键且具有实践价值的问题。 如果采用完全共享的编码器,在数据量极其有限的特定领域,模型确实容易在抽象语义理解(需要高度提炼)与高频生成细节(需要保留像素细节)之间产生拉扯。 这正是我们在 Show-2 中采用“共享输入 Encoder + 内部分立路径”这一设计的原因。我们在理解路径中特别引入了语义蒸馏层(Semantic Layer),使得模型在面对稀缺数据时,既能充分吸收生成任务所带来的丰富视觉表征,又不会牺牲理解任务的精度。随着跨模态表征对齐技术的不断演进,统一架构在少样本学习与跨域泛化上的潜在优势将会得到进一步释放。 为了方便大家抱团交流、互通会议消息,我们专门建了 ECCV 2026 参会交流群!进群你会解锁这些「福利」? 会议情报站:投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。 同行茶话会:天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。 前沿补给站:最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。 现场后援团:(会议期间专属开启):到了会场也不用慌—— 路线导航:场馆分布、报告厅怎么走,群里随时问; 议题共读:热门 session、Keynote 现场探讨,错过也能追; Poster 汇编:现场海报精华整理,一键收藏不遗漏; 约局广场:约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。 ? 进群传送门: 扫码进群或添加微信Qvv0909777,备注:ECCV + 单位/学校+姓名+方向。 搞科研/搞技术,信息差很重要。 来,一起快人一步! 上车,带你看遍全球 AI 顶会精华 可独家畅览: 专家演讲PPT 大会报告全文 热门论文解读 学术新星访谈 扫描上方二维码 或点击「阅读原文」关注专区。
NUS Show Lab 寿政教授:打通自回归与离散扩散,打造下一代具身大模型底座|ECCV 2026
告别模型拼贴套路,自回归与离散扩散的融合,正在开启 AI 的体验时代。 作者丨张璐 编辑丨岑峰 “理解”和“生成”真的无法在同一个模型底座中完美融合吗? 不同于拼接独立模型的传统做法,NUS Show Lab 选择了一条更原生的架构路线:在单个 Transformer 中同时打通自回归预测与离散扩散生成。 作为多模态领域的重磅成果,Show-o 系列不仅打破了模态壁垒,更将触角延伸至具身机器人决策。 在 ECCV 2026 现场,Show Lab 负责人寿政教授详细还原了他们如何用闭环算法破解数据稀缺、消除连续视频帧卡顿,并实现云端大模型与端侧低延迟控制的完美配合。 寿政教授此次披露的研究成果,不仅是一次性能的跨越,更是多模态架构从“实验玩具”向“具身大脑”进化的分水岭。其核心突破点在于以下三个维度的重构: 首先,在架构底层,Showo 架构打破了文本离散性与视觉连续性的“死结”。通过将处理文本的自回归(AR)机制与处理视觉的离散掩码扩散(Discrete Diffusion)深度缝合,Showo 避开了传统自回归生成图像的效率泥潭,同时也解决了连续扩散模型无法直连 VLM 离散 Token 的痛点,实现了逻辑推理与高质生成的完美共生。 其次,针对困扰具身智能的“标注荒”,寿教授提出的循环一致性监督(Cycle Consistency)提供了极佳的解决方案。在缺乏人类标注的特定文化或低资源领域,模型通过“观察-描述-再合成”的逻辑循环实现自监督进化。这让 AI 从 YouTube 海量无标签“生肉”视频中吸取物理常识成为了可能,极大地拓宽了 Scaling Law 的数据边界。 最后,具身智能的落地成败取决于毫秒级的反应。团队自研的 Q1 实时骨干网,通过精密的特征对齐与蒸馏,实现了远超前沿闭源大模型的推理速度。这证明了:一个真正的“数字生命”大脑,不仅要能深思熟虑,更要在与物理世界碰撞的一瞬间,给出近乎本能的实时反馈。 以下为演讲全文,雷峰网AI科技评论在不改变原意的基础上,对内容进行了整理与编辑: 01 告别“只读不练”:多模态 AI 如何从“看懂视频”跨入“具身体验”? 过去几年,视觉与语言交叉领域的核心任务主要围绕视频理解与视频生成两条独立路线展开。前者致力于将视频转化为文本描述或解答视频问题,后者则根据文本提示词生成对应的动态视频。 以往业界往往为这两类任务分别训练专属模型,但一个天然的演进趋势是:能否构建一个单一的统一模型来同时完成这两类任务? 如今,AI 发展正迎来一个关键转折点,即从单纯的“语言-视频相互作用”迈入“体验时代”。 在这一新阶段,模型不再仅仅停留在对视觉和文本的关联认知上,而是融入了“动作”维度。模型需要具备在物理或虚拟环境中采取行动的能力,并通过环境给出的实时反馈实现“在做中学”。 02 Show-o 架构突破: 用单个 Transformer 打通“文本生成”与“高效绘图” 在实现多模态统一的探索中,业内曾出现过不同的技术尝试。 例如早期的NEXt-GPT项目,通过将大语言模型与专用的扩散模型进行外挂组合,实现了任意模态到任意模态(Any-to-Any)的输入与输出。 但这本质上依然是“大模型 + 独立生成模块”的分立架构,并未实现模型底座的真正融合。 要用单一网络同时搞定理解与生成,主要面临两套主流范式的权衡。 ▎纯自回归范式 以 Chameleon 为代表的自回归方案天然适配文本及图文交错数据,但在图像生成时需要将图像切分成数百个 Token 并进行逐 Token 预测,推理速度较慢且算力开销巨大。 ▎连续扩散范式 传统的连续扩散方案虽然生成质量高、速度快,但由于其运行在连续隐空间中,难以与基于离散 Token 的大语言模型在统一空间内无缝融合。 为了解决这一矛盾,Show-o 架构应运而生。它是首个将自回归与离散扩散融合在单一 Transformer 架构中的统一模型。 在处理文本理解与生成时,模型保持自回归模式; 而在进行图像或视频生成时,则切换至基于离散 Token 的扩散模式(基于 Mask-and-Predict 机制)。 模型仅需十几步迭代即可一次性恢复出完整的视觉Token,既保留了自回归对多模态文本的建模能力,又实现了扩散模型的高效图像生成,支持任意顺序和组合的多模态输入输出。 03 从静态生成到动态视频: Show-2 破解多模态统一的三大技术瓶颈 虽然 Show-o 验证了统一架构的可行性,但要迈向下一代统一模型,仍需破解三个核心难题: ▎双向反哺:不仅用“理解”教生成,更用“生成”提精理解 目前业内已普遍证实“理解能力可以促进生成”(例如提供更详尽的描述能指引更高质量的生成),但“生成能力如何反哺理解”仍是前沿课题。 为此,团队引入了循环一致性监督机制。对于缺乏文本描述的特定领域图像(如特定文化遗产或偏远自然景观),先利用理解模块生成描述文本,再将该文本作为输入驱动生成模块重建图像,通过对比原始图像与重建图像的差异建立自监督闭环。 ▎帧间流畅度革命:3D Tokenizer 与时空双向注意力 Show-o 初期主要针对静态图像或非连续关键帧,而 Show-2 则实现了向连续视频生成的跨越。 团队为此开发了一款通用的 3D Tokenizer,能够同时对图像和视频进行统一编解码。在注意力机制设计上,文本部分沿用因果单向注意力,保持前向预测的逻辑性;视觉部分则采用完全连接的时空双向注意力,让所有视觉 Token 在空间与时间维度上互相可见,大幅提升了生成视频的连贯性与画质。 ▎兼顾“高层语义”与“像素细节”的双路径架构 关于理解与生成是否应该共享同一个 Tokenizer,实验表明,若完全共享同一个编码器,在现有数据条件下理解性能相比专有的预训练编码器仍有微小差距。 因此 Show-2 采用了双路径架构:在输入端共享 3D Encoder,但在模型内部拆分为理解与生成两条路径。理解路径中特别加入语义层(Semantic Layer)进行特征蒸馏与对齐,既保障了视觉理解能力,又维持了极高的生成画质。 04 大脑落地物理世界: 从多模态大模型到机器人闭环控制 在完成多模态理解与生成的统一后,团队将这一统一架构思想进一步延伸至具身智能与机器人学习领域。 为了支撑具身智能的研究,团队搭建了完善的物理实验环境。桌面端部署了固定式双臂系统,分别搭载双指夹爪与五指灵巧手;移动端则结合了轮式导航底盘与顶部主动机械臂。通过双操纵手柄的遥操作采集系统,人类操作员可以实时控制机械臂运行并采集“状态-动作轨迹”数据。 在具体的模型部署上,传统的视觉-语言模型(VLM)正在向具备动作预测能力的视觉-语言-动作模型(VLA)演进: VLA 策略模型:在 VLM 底座的基础上加入动作调制层,能够根据视频输入和指令直接预测机器人应采取的物理动作。 世界模型(World Model):能够以当前视觉和动作输入为条件,预测未来环境的像素级变化。 世界动作模型(World Action Model, WAM):将两者融为一体,实现了“既预测动作,又预测未来动作产生的视觉结果”的闭环。 在落地应用层面,团队采取了云端大模型与端侧微调模型相结合的策略。云端前沿大模型虽然规划能力强,但推理延迟较高(单次决策约 8 至 20 秒); 而基于开源底座微调的本地模型能够实现近乎实时的低延迟控制,在自动化双臂协作等复杂任务中表现出更高的成功率与响应速度。 05 现场互动 Q&A ▎问:在 Show-2 中,团队将视觉理解与生成统一到了同一个模型架构中,并展现出了极高的灵活性与效率。请问在特定领域数据相对稀缺(Data Scarce)的场景下,这种统一理解与生成的架构,是否能比分立的模型带来更显著的性能提升? 答: 这是一个非常关键且具有实践价值的问题。 如果采用完全共享的编码器,在数据量极其有限的特定领域,模型确实容易在抽象语义理解(需要高度提炼)与高频生成细节(需要保留像素细节)之间产生拉扯。 这正是我们在 Show-2 中采用“共享输入 Encoder + 内部分立路径”这一设计的原因。我们在理解路径中特别引入了语义蒸馏层(Semantic Layer),使得模型在面对稀缺数据时,既能充分吸收生成任务所带来的丰富视觉表征,又不会牺牲理解任务的精度。随着跨模态表征对齐技术的不断演进,统一架构在少样本学习与跨域泛化上的潜在优势将会得到进一步释放。 为了方便大家抱团交流、互通会议消息,我们专门建了 ECCV 2026 参会交流群!进群你会解锁这些「福利」? 会议情报站:投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。 同行茶话会:天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。 前沿补给站:最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。 现场后援团:(会议期间专属开启):到了会场也不用慌—— 路线导航:场馆分布、报告厅怎么走,群里随时问; 议题共读:热门 session、Keynote 现场探讨,错过也能追; Poster 汇编:现场海报精华整理,一键收藏不遗漏; 约局广场:约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。 ? 进群传送门: 扫码进群或添加微信Qvv0909777,备注:ECCV + 单位/学校+姓名+方向。 搞科研/搞技术,信息差很重要。 来,一起快人一步! 上车,带你看遍全球 AI 顶会精华 可独家畅览: 专家演讲PPT 大会报告全文 热门论文解读 学术新星访谈 扫描上方二维码 或点击「阅读原文」关注专区。
