Skip to Content
OmniOmni Model2025Qwen3-Omni Technical Report

Qwen3-Omni Technical Report

论文链接:https://arxiv.org/pdf/2509.17765 

代码链接:https://github.com/QwenLM/Qwen3-Omni 

摘要

我们提出了 Qwen3-Omni,这是一个单一的多模态模型,首次实现了在文本、图像、音频和视频四方面均保持最先进的性能,且性能与单模态模型相比没有任何下降。Qwen3-Omni 的性能与 Qwen 系列中同等规模的单模态模型相当,尤其在音频任务上表现卓越。在 36 项音频和视听基准测试中,Qwen3-Omni 在 32 项测试中达到了开源领域最先进水平 (SOTA),并在 22 项测试中达到了整体 SOTA,超越了 Gemini-2.5-Pro、Seed-ASR 和 GPT-4o-Transcribe 等强大的闭源模型。Qwen3-Omni 采用 Thinker–Talker Mixture-of-Experts (MoE) 架构,统一了文本、图像、音频和视频的感知和生成,从而生成流畅的文本和自然的实时语音。该系统支持 119 种语言的文本交互、19 种语言的语音理解以及 10 种语言的语音生成。对于自动语音识别 (ASR) 和口语理解,系统每次最多可处理 40 分钟的音频录音,从而实现跨地域的高质量音频和视听体验。它展现出强大的指令遵循能力,并允许用户通过自定义系统提示对对话语气和角色进行精细化定制。为了降低流式合成中的首包延迟,Talker 使用多码本方案自回归地预测离散语音编解码器。利用这些码本的表征能力,我们用轻量级的因果卷积神经网络 (ConvNet) 取代了计算密集型的分块扩散算法,从而实现了从第一个编解码器帧开始的流式传输。在冷启动设置(无先验上下文)下,Qwen3-Omni 的理论端到端首包延迟为 234 毫秒。为了进一步增强多模态推理能力,我们引入了一个 Qwen3-Omni-30B-A3B-Thinking 模型,该模型可以显式地对来自任何模态的输入进行推理。由于目前研究界缺乏通用的音频释义模型,我们对 Qwen3-Omni-30B-A3B 进行了微调,得到了 Qwen3-Omni-30B-A3B-Captioner,它可以为任意音频输入生成详细且低幻觉的字幕。Qwen3-Omni-30B-A3B、Qwen3-Omni-30B-A3B-Thinking 和 Qwen3-Omni-30B-A3B-Captioner 均以 Apache 2.0 许可证公开发布。

1.介绍

人类能够并行感知视觉和听觉输入,对这些信号进行认知处理,并通过文字表达、发声以及工具辅助或肢体动作等方式做出反应,从而促进与其他生物的信息交流并展现智能。基于单模态大模型理解和推理能力的快速发展,原生多模态系统已引起广泛关注。人类学习通常通过协调运用多种模态来实现,其中互补的专业化和跨模态协同作用能够提高学习效率。然而,当前以 LLM 为中心的多模态模型常常表现出模态权衡,即一种模态的提升伴随着其他模态的退化。

本报告旨在通过在现有的基于 LLM 的范式下探索集成多模态训练,来克服这一局限性。我们证明,联合多模态训练可以实现所有模态之间的性能均衡——即不存在模态特异性的性能下降——同时显著增强跨模态能力,例如视频理解。关键在于在文本预训练的早期阶段混合单模态和跨模态数据。Qwen3-Omni-30B-A3B-Base 模型证明,其在文本和视觉方面的性能与同等规模的单模态文本和视觉基础模型在广泛的基准测试中表现相当,同时还展现出强大的音频能力、视听理解能力、跨模态“思考”能力以及实时视听交互能力。开发性能不下降的多模态系统是一个可以实现的目标。此类系统具有两个关键特性:首先,它们能够在各自的任务中达到专用单模态模型的性能水平;其次,它们能够促进新型的跨模态推理和交互。后一种能力代表着一种显著的优势,因为传统的单模态方法并不具备这些能力。

Qwen3-Omni 基于 Qwen2.5-Omni 中引入的 Thinker-Talker 架构,并进行了五项关键升级:(1)Thinker 和 Talker 都升级为混合专家(MoE)设计;(2)我们用 AuT(Audio Transformer)编码器替换了 Whisper 音频编码器,该编码器基于 2000 万小时的监督音频从头开始训练,从而生成更强大的通用音频表示。AuT 采用分块窗口注意力机制来实现实时预填充缓存;(3)在语音生成方面,我们采用了多码本表示,其更大的容量支持对各种声音、副语言线索和声学现象进行忠实建模;(4)Talker 从单轨编解码器建模转向多轨编解码器建模,通过 MTP 模块自回归预测多个码本层,而波形阶段(Code2Wav)则用轻量级卷积网络(ConvNet)替换了分块 DiT; (5) 输入和输出音频码率降低至 12.5 Hz,输出编解码器支持单帧即时语音合成。这些改进共同实现了工业级部署中高并发下的低延迟语音交互。

与 Qwen2.5-Omni 相比,Qwen3-Omni 引入了四项主要改进:(1)支持对超过 40 分钟的输入进行音频理解;(2)扩展了语言覆盖范围,分别支持 119 种书面语言、19 种和 10 种口语语言的理解和生成;(3)Think 模型支持全模态推理,包括音视频和纯音频场景;(4)提高了流处理性能,端到端延迟低至 234 毫秒。

至关重要的是,Qwen3-Omni 在文本和视觉模态方面保持了最先进的性能,与同等尺寸的单模型 Qwen 相比,性能没有下降。在 36 项音频和视听基准测试中,它在 32 项测试中达到了开源软件的最高水平,并在 22 项测试中创造了新的最高水平,超越了 Gemini 2.5 Pro、Seed-ASR 和 GPT-4o-Transcribe 等强大的闭源系统。

本文余下部分组织如下:第 2 节介绍 Qwen3-Omni 的算法和架构;第 3 节和第 4 节分别描述预训练和后训练数据集及流程;第 5 节报告实验结果;第 6 节将 Qwen3-Omni 与参数规模相近的最新 Qwen 模型进行比较,结果表明其在多模态下性能优异,且未出现模态引起的性能下降。

2.Architecture

2.1 Overview

如图 2 所示,Qwen3-Omni 采用 Thinker-Talker 架构。与 Qwen2.5-Omni 相比,Qwen3-Omni 引入了以下改进,以提高可扩展性和控制力:

  • Thinker 和 Talker 都采用了混合专家 (MoE) 架构,以支持高并发性和快速推理。
  • Talker 不再使用 Thinker 的高级文本表示,而仅基于音频和视觉多模态特征进行处理。这种设计基于以下两点:(i) 对于文本内容而言,离散的 token 和嵌入在信息上是等价的;(ii) 多模态处理对于音视频协调的语音生成至关重要,例如在语音转换中保留韵律/音色。此外,这种解耦允许外部模块(例如,RAG、函数调用、安全过滤器)干预 Thinker 的文本输出,并在需要时通过受控预处理将文本提供给 Talker,以进行流式合成。
  • 由于文本表示是分离的,Thinker 和 Talker 可以使用不同的系统提示,分别独立控制 Thinker 的回应方式和 Talker 的音频风格。
  • Talker 采用多码本自回归方案:Talker 每步生成一个编解码器帧,而 MTP 模块生成剩余的残差码本。
  • Code2Wav 采用轻量级因果卷积神经网络实现,简化了音频合成的最后阶段。

在训练和推理过程中,Talker 直接从 Thinker 获取高维多模态特征,并共享完整的对话历史记录。因此,该系统作为一个统一的单一模型运行,实现了端到端的训练和统一的推理。

在接下来的章节中,我们首先介绍我们新提出的 AuT 编码器及其训练方法。然后,描述 Thinker 如何处理各种输入。接下来,我们详细介绍 Talker 的多码本流式语音生成。最后,我们重点介绍一系列针对理解和生成模块的改进,旨在实现超低延迟的端到端流式音频推理。

2.2 Audio Transformer (AuT)

如图 3 所示,音频 Transformer (AuT) 是一个注意力编码器-解码器模型,它基于 2000 万小时的监督音频数据从头开始训练。在训练过程中,音频的滤波器 fbank 特征在注意力层之前使用 Conv2D 模块进行 8 倍下采样,将采样率降低至 12.5 Hz。为了学习更强、更通用的音频表示,AuT 在包含语音识别和音频理解任务的大规模音频数据集上进行训练。具体来说,训练数据包括 80% 的中英文伪标签 ASR 数据、10% 的其他语言 ASR 数据以及 10% 的音频理解数据。为了平衡实时预填充缓存的效率和离线音频任务的性能,AuT 采用了具有动态注意力窗口大小的 Flash 注意力机制,覆盖 1 到 8 秒的注意力查询模式。在 Qwen3-Omni 中,我们使用 AuT 编码器作为音频编码器,该编码器包含约 0.6B 个参数。

2.3 Perceivation

Text, Audio, Image and Video (w/o Audio)。Thinker 将文本、音频、图像和视频(不含音频)转换为一系列输入表示。对于文本输入,我们使用 Qwen 的 tokenizer,它采用字节级字节对编码,词表包含 151,643 个常规 token。对于音频输入和从视频中提取的音频,我们将其重采样至 16 kHz,并将原始波形转换为 128 通道梅尔频谱图,窗口大小为 25 毫秒,跳频为 10 毫秒。我们采用 AuT 编码器作为音频编码器,该编码器基于 2000 万小时的音频数据从头开始训练,音频表示的每一帧对应于原始音频信号中约 80 毫秒的片段。此外,我们还使用了 Qwen3-VL 的视觉编码器,该编码器基于 SigLIP2-So400m 初始化,拥有约 543M 参数,能够处理图像和视频输入。该视觉编码器基于图像和视频数据的混合数据进行训练,确保了对图像和视频的良好理解。为了在与音频采样率保持一致的同时尽可能完整地保留视频信息,我们以动态帧速率对视频帧进行采样。

Video and Multimodal Position Embedding (TM-RoPE) 。受 Qwen2.5-Omni 的启发,我们采用了一种时间对齐的多模态旋转位置嵌入(TM-RoPE),它通过引入绝对时间信息扩展了多模态旋转位置嵌入(M-RoPE)。TM-RoPE 将传统的旋转位置嵌入分解为三个不同的维度:时间、高度和宽度。在原始的 M-RoPE 公式中,时间依赖性使用初始的 16 个旋转角度进行建模,这些角度对应于更高的频率并表现出更强的振荡模式。虽然这种设计能够有效地捕捉细粒度的局部时间变化,但它会阻碍模型对扩展序列的外推能力。为了解决这一限制,我们引入了一种改进的旋转角度分配方式。具体来说,时间、高度和宽度维度交错排列,并分别分配 24、20 和 20 个旋转角度。这种重新分配促进了对局部语义和长程依赖性的更均衡表示,从而提高了模型的整体性能。 TM-RoPE 的应用根据输入数据的具体模态进行了定制。对于文本输入,三个组件共享相同的位置标识符,使得 TM-RoPE 在功能上等同于一维 RoPE。类似地,音频输入也使用共享的位置 ID,但进一步添加了绝对时间编码,其中每个时间 ID 对应于 80 毫秒的持续时间。对于图像数据,所有视觉 token 都被分配一个恒定的时间 ID,而它们不同的行和列位置则决定了高度和宽度 ID。

在多模态视听流的上下文中,音频分量以每 80 毫秒一个时间 ID 进行编码。视频被视为一系列帧,其时间 ID 单调递增,并根据实际时间戳动态调整,以确保每个 ID 的时间分辨率始终为 80 毫秒。视频帧的高度和宽度 ID 的分配方式与静态图像相同。为了防止处理多种模态时出现位置冲突,位置编号采用连续编号,每个后续模态的编号都从 1 加上前一个模态的最大位置 ID 开始。这种改进的位置编码方法使模型能够有效地整合和联合建模来自不同模态的信息。与将视听表示分割成固定 2 秒片段的 Qwen2.5-Omni 不同,Qwen3-Omni 直接使用与绝对时间显式锚定的时间 ID 来对齐这些表示。这种设计选择使模型能够灵活地支持任意持续时间的流式输入。

2.4 Speech Generation

对于多轮对话中的语音合成,我们的 Talker 模块依赖于从 Thinker 组件继承的丰富上下文信息,该上下文包含历史文本 token、多模态表示以及当前回合的文本流。这种对长上下文信息的依赖至关重要,因为高保真语音合成必须根据正在进行的对话调整韵律、响度和情感等声学属性,这一原则在上下文感知生成模型中已得到充分验证。

在架构上,我们的方法与 Xu et al. (2025) 的方法不同,它直接处理 RVQ 标记。Talker 采用分层预测方案:主干网络接收当前帧的聚合码本特征,并使用线性头预测第零个码本,之后多 token 预测 (MTP) 模块生成所有残差码本。这种策略使模型能够学习完整的声学细节表示,从而增强语音表现力。因此,波形重建被简化为一个轻量级的因果卷积神经网络 (Code2Wav),与更复杂的基于 DiT 的声码器相比,这显著降低了推理延迟和计算成本(FLOPs),同时实现了更高的音频保真度。

2.5 Designs for Streaming and Concurrency

在流式音视频交互场景中,首包延迟是影响用户体验的关键因素,而模型的并发能力是降低服务成本和提高响应速度的关键。本节将探讨 Qwen3-Omni 如何通过算法和架构优化来增强并发能力并降低首包延迟。

Chunked Prefilling and MoE Architecture。在 Qwen3-Omni 中,我们保留了 Qwen2.5-Omni 中实现的块预填充机制,其音频和视觉编码器能够沿时间维度输出块。在实时交互过程中,Thinker 和 Talker 模块执行异步预填充:当 Thinker 完成当前块的预填充后,其输出的高级表示会立即异步地用于预填充 Talker 的当前块,同时 Thinker 预填充其下一个块。这种方法显著降低了 Thinker 和Talker 的首 token 生成时间 (Time-To-First-Token, TTFT)。在架构方面,Qwen3-Omni 中的 Thinker 和 Talker 均采用了 MoE 设计,这对于提高服务吞吐量非常有效。与密集模型相比,MoE 架构显著降低了处理长序列时键值缓存产生的 I/O 消耗,从而提高了生成过程中的每秒 token 数 (TPS) 并增强了并发性。

Streaming Multi-Codebook Codec Generation。为了最大限度地缩短用户接收首个生成数据包的等待时间,我们提出了一种仅基于左上下文的多码本生成机制。如图 2 所示,当 Talker 生成第一个 token 后,MTP 模块会预测当前帧的剩余 token。然后,这些 token 由一个仅关注左上下文的流式多码本编解码器解码成波形。与 Qwen2.5-Omni 需要等待 Talker 提供足够的块上下文才能进行合成不同,Qwen3-Omni 可以在 Talker 生成每个 token 后立即输出波形,从而显著降低首包延迟。

Lightweight MTP module and ConvNet。MTP 模块和编解码器均为轻量级模块,计算浮点运算次数低,并支持批量推理,因此非常适合高并发场景。MTP 模块是一个超轻量级的固定步长自回归密集 Transformer 模型,对推理硬件的内存带宽要求低,从而能够高效地批量处理高吞吐量请求。其固定步长自回归推理机制使其能够有效利用固定的 KV 缓存空间进行加速,从而实现低推理延迟。同时,基于卷积神经网络(ConvNet)的编解码器也实现了高吞吐量和低延迟,因为其卷积架构在各种推理平台上都得到了广泛的硬件加速支持,并且能够高效地进行批量推理。

表 2 展示了 Qwen3-Omni 在典型计算资源和不同并发场景下的理论首包延迟。实验在 vLLM 框架上进行,用于处理并发的音视频流,并通过 torch.compile 和 CUDA 图加速对 MTP 模块和编解码器进行了优化。多个因素会影响总首包延迟。首先,Thinker 和 Talker 模型的大小会影响其尾包预处理延迟(音频和视觉编码器的多模态数据预处理和推理)以及首 token 到达时间 (TTPT)。其次,MTP 模块和编解码器的架构和大小会影响其推理延迟。由于这些组件之间存在顺序依赖关系,总首包延迟是这些单独延迟的总和。结果显示,Thinker 和 Talker 的 MoE 架构确保了其预填充延迟和 TTPT 在高并发情况下基本不受影响。同时,MTP 模块和编解码器的轻量级设计最大限度地降低了其计算开销,从而降低了对首包延迟的影响。此外,在输出初始数据包并开始音频合成后,12.5Hz 的 token 速率的 Talker 仅需一个 token 即可合成 80 毫秒的音频。因此,生成实时因子 (RTF) 的计算方法是将以下两项之和除以 80 毫秒:(1) 思考者和说话者生成一个词元所需的时间;(2) MTP 模块和编解码器处理每个词元所需的时间。如实验所示,在不同的并发级别下,RTF 始终低于 1,从而确保用户能够持续接收音频流。

3.Pretraining

Qwen3-Omni 的预训练数据集涵盖多种语言和方言(如表 3 所示)以及多种模态,包括图像-文本、视频-文本、音频-文本、视频-音频、视频-音频-文本和纯文本语料库。与 Qwen2.5-Omni 每个任务仅使用单一 prompt 不同,我们采用了更广泛的自然语言提示,以增强模型的泛化能力和指令遵循能力。为了在所有模态上实现稳健的性能,我们的训练策略在早期预训练阶段就融合了单模态和跨模态数据。

Qwen3-Omni 的预训练分为三个不同的阶段。在第一阶段,我们锁定 LLM 的参数,并专注于训练视觉和音频编码器,利用大量的音频-文本和图像-文本对语料库来增强 LLM 的语义理解能力。在第二阶段,我们解冻所有参数,并使用更广泛的多模态数据进行训练,以实现更全面的学习。在最后阶段,我们使用序列长度为 32768 的数据来增强模型理解复杂长序列数据的能力。

  1. Encoder Alignment Stage (S1)。在初始预训练阶段,Qwen3-Omni 的 LLM 组件使用 Qwen3 的参数进行初始化,视觉编码器采用 Qwen3-VL 的参数,音频编码器则使用 AuT 的参数进行初始化。这两个编码器在固定的 LLM 上分别进行训练,并且都首先专注于训练各自的 adapter,然后再训练编码器。我们放弃了 Bai et al. (2025); Xu et al. (2025) 中使用的阶段,即在保持 LLM 固定的情况下联合训练编码器和适配器,因为这种方法可能会导致编码器补偿固定 LLM 的局限性,从而降低感知能力。
  2. General Stage (S2)。预训练的第二阶段使用了一个包含约 2T token 的大规模数据集,其模态分布如下:文本(0.57T)、音频(0.77T)、图像(0.82T)、视频(0.05T)和音视频(0.05T)。在此阶段,引入更多样化的多模态数据和任务,增强了模型对听觉、视觉、文本和视听信息的理解和交互能力。
  3. Long Context Stage (S3)。在最终预训练阶段,我们将最大 token 长度从 8192 增加到 32768,并提高了训练数据中长音频和长视频的比例。实验结果表明,这些调整显著提升了模型理解长序列数据的能力。

4.Post-training

4.1 Thinker

后训练阶段包括针对 Thinker 的三阶段训练过程,使 Qwen3-Omni 具备指令遵循能力。该数据集采用 ChatML 格式设计,包含纯文本对话数据、视觉模态对话数据、音频模态对话数据和混合模态对话数据。

在第一阶段,我们引入了一种轻量级的有监督微调(SFT)方法,通过有针对性的指令微调来弥合预训练表征与下游任务需求之间的差距。SFT 刻意偏离预训练数据模式,同时保持与预训练模型架构的一致性,从而实现高效的知识迁移并保留预训练特征的完整性。

第二阶段采用 Qwen3 中描述的强到弱蒸馏流程,以进一步提高模型性能。该蒸馏过程包含两个主要阶段:

  • Off-policy Distillation:在初始阶段,teacher 模型生成的输出会被整合起来,以实现响应蒸馏。这有助于轻量级 stduent 模型获得基本的推理能力,为后续的 on-policy 训练奠定坚实的基础。
  • On-policy Distillation:在第二阶段,student 模型根据采样提示生成响应。然后使用这些 on-policy 序列进行微调,通过最小化 KL 散度,使 student 的预测 logits 与 teacher 模型(Qwen3-32B 或 Qwen3-235B-A22B)的预测 logits 保持一致。

最后,我们利用 GS​​PO 全面提升模型在文本、图像、视频和音频等多种模态下的能力和稳定性。为了针对上述模态提供反馈,我们采用了两种不同类型的奖励:

  • Rule-based Reward:对于可验证的多模态任务(例如数学、编程、指令执行),奖赏信号源自一组预定义的规则。精心设计的基于规则的奖赏能够高精度地评估模型输出的正确性,从而防止诸如奖赏作弊之类的问题。
  • Model-based Reward:为了评估缺乏客观、预定义评估指标的多模态任务的性能,我们采用了一种基于 LLM 的评判协议。对于一般任务,我们使用 Qwen3 作为自动评估器;而对于视觉相关的任务,则使用专门的视觉语言模型 Qwen2.5-VL。为了确保评估更加稳健可靠,我们会为 LLM 评估器提供给定 query 的相应真实值或参考答案(如适用)。

4.2 Talker

我们为 Talker 引入了四阶段训练流程,使 Qwen3-Omni 能够同时生成语音和文本回复。所有训练数据均采用 ChatML 格式,以确保与 Thinker 的一致性。

在第一阶段,我们利用数亿条包含多模态上下文的语音数据训练 Talker 模型,建立从多模态表征到语音的单调映射。在第二阶段,我们使用高质量数据进行持续预训练(CPT),这可以缓解第一阶段噪声数据造成的干扰,并显著提高生成语音的质量。同时,我们进行长上下文训练,增强 Talker 处理扩展复杂输入并生成符合上下文的语音响应的能力。在第三阶段,为了提高多语言语音生成的泛化能力和系统稳定性,我们从多种多语言语音样本中构建偏好对,并使用直接偏好优化(DPO)优化模型。最后,我们对上述基础模型进行说话人微调,使 Talker 能够适应特定语音,同时提升其语音响应的自然度、表现力和可控性。

4.3 Captioner

字幕生成是多模态理解的基础任务,也是大型多模态模型训练和评估不可或缺的一部分。然而,现有的大部分研究都集中在视觉字幕生成上,而很大程度上忽略了音频模态。这种疏忽意义重大,因为听觉感知是人类感官体验和与世界互动的重要组成部分。为了弥补这一空白,并促进对多模态感知的更全面研究,我们提出了 Qwen3-Omni-30B-A3B-Captioner 模型。该模型是在大规模详细音频描述数据集上对 Qwen3-Omni-30B-A3B 模型进行微调而开发的。最终的系统能够为任意音频输入生成详细且低幻觉的字幕。附录 9.2 提供了定性结果,展示了我们的模型在各种声学场景下的字幕生成能力。

5.Evaluation

Last updated on